Instella-MoE 开源混合专家大模型系统工具源码

Instella-MoE 开源混合专家大模型系统工具源码

  • 全站源码免费
  • 日/微信/10次解锁
  • 日/IP/100次解锁
资源下载
免费资源
立即下载

项目封面图

源码系统概览

文章正文

Instella-MoE 是 AMD-AGI 开源的完全开放混合专家(MoE)大语言模型,总参数 160 亿、激活参数 28 亿,从预训练到强化学习端到端全程开放。

它在总参数较大的情况下只激活其中一小部分,从而在保持能力的同时控制推理成本,是一套从零训练到强化学习都开放的参考实现。

源码简介

Instella-MoE 由 AMD-AGI 团队在 AMD Instinct MI300X 与 MI325X GPU 上从零训练,基于自研 Primus 框架。

它在稀疏激活的 MoE 设计中引入门控多头潜在注意力(Gated MLA)与 FarSkip-Collective 等架构创新。

仓库包含完整的训练(Megatron/Primus)、强化学习(miles)与推理(sglang、transformers)代码,并提供了 HuggingFace 与 Megatron checkpoint 互转脚本。

项目遵循 MIT 协议,权重在 Hugging Face 上以模型集合形式发布。

除了模型权重,仓库还开放了数据准备、训练、RL 与推理脚本,研究者可以据此复现或改进整套流程。

适用场景

该项目面向大模型研究与应用团队,适合作为 MoE 架构学习、从零训练实验、AMD ROCm 平台推理部署的参考实现。

对于希望在 AMD GPU 上复现或改进开放大模型的开发者,Instella-MoE 提供了从数据准备、训练、RL 到推理的较完整链路。

它对于希望深入理解开放大模型训练细节、并在 AMD 硬件上做工程化落地的团队,具有较高的参考与实践价值。

功能亮点

完全开放,覆盖从预训练、后训练到 RL 的全流程代码与配置。

采用稀疏激活 MoE,在总参数较大的情况下保持较低激活成本。

引入 Gated MLA 与 FarSkip-Collective 等创新以提升训练效率与通信表现。

提供 HF 与 Megatron 权重互转工具,并支持 sglang 与 transformers 两条推理路径,便于二次开发与部署。

技术架构与部署指南

维度 本套源码 同类通用方案
技术栈 前端:无独立前端,主要提供训练、推理脚本与 YAML 配置。 依具体方案选型,需自行搭建与维护
部署方式 准备 rocm/megatron-lm 官方 Docker 镜像并启动容器,挂载数据目录后运行 training/exa 多托管于第三方平台或订阅云服务
功能侧重 完全开放,覆盖从预训练、后训练到 RL 的全流程代码与配置。 功能通用,定制深度有限
数据归属 数据自持,部署在自有服务器,不出站 数据通常留存于服务商侧
成本模式 获取后自主部署,无持续授权费用 通常按订阅或调用量计费

技术栈与运行环境

前端:无独立前端,主要提供训练、推理脚本与 YAML 配置。

后端:Python 训练框架 Primus(基于 Megatron)、RL 框架 miles 与推理框架 sglang/transformers。

数据库:训练中间产物存于本地或对象存储,无业务数据库。

运行环境:AMD Instinct MI300X/MI325X 等 GPU,ROCm,Docker 镜像 rocm/megatron-lm。

其他依赖:PyTorch、Megatron-LM、sglang、yaml 配置与 shell 脚本。

安装与部署提示

准备 rocm/megatron-lm 官方 Docker 镜像并启动容器,挂载数据目录后运行 training/examples 下的数据准备与训练脚本。

强化学习阶段使用 rl 目录中的 miles 示例。

推理可通过 sglang 或 transformers 加载权重,checkpoint 转换脚本支持 HF 与 Megatron 格式互转。

由于对硬件与集群依赖较强,建议在具备相应 GPU 的环境按 docs 指引逐步执行。

截图与演示说明

仓库 docs 目录给出了模型性能与训练流程的示意图。

下图对比了 Instella-MoE 预训练与后训练阶段相对于同规模前沿模型的表现。

Instella-MoE 项目截图

另一张训练流水线图展示了从数据准备、预训练、RL 到推理的整体环节。

Instella-MoE 项目截图

两张图均来自官方文档,能帮助理解这一开放 MoE 模型的训练与评测方式。

常见问题

问:需要什么硬件?

主要在 AMD Instinct MI300X/MI325X 等 GPU 上训练与推理,并依赖 ROCm 软件栈与对应 Docker 镜像。

问:如何做推理?

提供 sglang 与 transformers 两条推理路径,并配套 HF 与 Megatron 权重互转脚本。

问:是否可以直接用现成权重?

权重在 Hugging Face 以模型集合形式发布,可下载后配合本仓库推理代码使用。

安全风险提示

特别提示:本源码未检测安全风险文件,下载后请务必进行安全审计,删除恶意代码后再部署使用!

下载说明

源码仅供学习研究、测试部署和二次开发参考,商用前请自行确认授权、版权和安全风险。

本项目为 MIT 协议,可自由使用但须保留版权与许可声明。

由于训练与推理对 GPU 集群资源要求较高,普通环境仅建议阅读代码与复现推理部分,完整训练请在具备相应硬件的受控环境中进行。

GitHub项目开源地址:https://github.com/AMD-AGI/Instella-MoE

资源下载
下载价格免费
本文章资源https://www.aosen.cc/mianfei8046.html来源于互联网,如存在侵权,请联系我们立马删除!
0
显示验证码