
源码系统概览
文章正文
Instella-MoE 是 AMD-AGI 开源的完全开放混合专家(MoE)大语言模型,总参数 160 亿、激活参数 28 亿,从预训练到强化学习端到端全程开放。
它在总参数较大的情况下只激活其中一小部分,从而在保持能力的同时控制推理成本,是一套从零训练到强化学习都开放的参考实现。
源码简介
Instella-MoE 由 AMD-AGI 团队在 AMD Instinct MI300X 与 MI325X GPU 上从零训练,基于自研 Primus 框架。
它在稀疏激活的 MoE 设计中引入门控多头潜在注意力(Gated MLA)与 FarSkip-Collective 等架构创新。
仓库包含完整的训练(Megatron/Primus)、强化学习(miles)与推理(sglang、transformers)代码,并提供了 HuggingFace 与 Megatron checkpoint 互转脚本。
项目遵循 MIT 协议,权重在 Hugging Face 上以模型集合形式发布。
除了模型权重,仓库还开放了数据准备、训练、RL 与推理脚本,研究者可以据此复现或改进整套流程。
适用场景
该项目面向大模型研究与应用团队,适合作为 MoE 架构学习、从零训练实验、AMD ROCm 平台推理部署的参考实现。
对于希望在 AMD GPU 上复现或改进开放大模型的开发者,Instella-MoE 提供了从数据准备、训练、RL 到推理的较完整链路。
它对于希望深入理解开放大模型训练细节、并在 AMD 硬件上做工程化落地的团队,具有较高的参考与实践价值。
功能亮点
完全开放,覆盖从预训练、后训练到 RL 的全流程代码与配置。
采用稀疏激活 MoE,在总参数较大的情况下保持较低激活成本。
引入 Gated MLA 与 FarSkip-Collective 等创新以提升训练效率与通信表现。
提供 HF 与 Megatron 权重互转工具,并支持 sglang 与 transformers 两条推理路径,便于二次开发与部署。
技术架构与部署指南
| 维度 | 本套源码 | 同类通用方案 |
|---|---|---|
| 技术栈 | 前端:无独立前端,主要提供训练、推理脚本与 YAML 配置。 | 依具体方案选型,需自行搭建与维护 |
| 部署方式 | 准备 rocm/megatron-lm 官方 Docker 镜像并启动容器,挂载数据目录后运行 training/exa | 多托管于第三方平台或订阅云服务 |
| 功能侧重 | 完全开放,覆盖从预训练、后训练到 RL 的全流程代码与配置。 | 功能通用,定制深度有限 |
| 数据归属 | 数据自持,部署在自有服务器,不出站 | 数据通常留存于服务商侧 |
| 成本模式 | 获取后自主部署,无持续授权费用 | 通常按订阅或调用量计费 |
技术栈与运行环境
前端:无独立前端,主要提供训练、推理脚本与 YAML 配置。
后端:Python 训练框架 Primus(基于 Megatron)、RL 框架 miles 与推理框架 sglang/transformers。
数据库:训练中间产物存于本地或对象存储,无业务数据库。
运行环境:AMD Instinct MI300X/MI325X 等 GPU,ROCm,Docker 镜像 rocm/megatron-lm。
其他依赖:PyTorch、Megatron-LM、sglang、yaml 配置与 shell 脚本。
安装与部署提示
准备 rocm/megatron-lm 官方 Docker 镜像并启动容器,挂载数据目录后运行 training/examples 下的数据准备与训练脚本。
强化学习阶段使用 rl 目录中的 miles 示例。
推理可通过 sglang 或 transformers 加载权重,checkpoint 转换脚本支持 HF 与 Megatron 格式互转。
由于对硬件与集群依赖较强,建议在具备相应 GPU 的环境按 docs 指引逐步执行。
截图与演示说明
仓库 docs 目录给出了模型性能与训练流程的示意图。
下图对比了 Instella-MoE 预训练与后训练阶段相对于同规模前沿模型的表现。

另一张训练流水线图展示了从数据准备、预训练、RL 到推理的整体环节。

两张图均来自官方文档,能帮助理解这一开放 MoE 模型的训练与评测方式。
常见问题
问:需要什么硬件?
主要在 AMD Instinct MI300X/MI325X 等 GPU 上训练与推理,并依赖 ROCm 软件栈与对应 Docker 镜像。
问:如何做推理?
提供 sglang 与 transformers 两条推理路径,并配套 HF 与 Megatron 权重互转脚本。
问:是否可以直接用现成权重?
权重在 Hugging Face 以模型集合形式发布,可下载后配合本仓库推理代码使用。
安全风险提示
特别提示:本源码未检测安全风险文件,下载后请务必进行安全审计,删除恶意代码后再部署使用!
下载说明
源码仅供学习研究、测试部署和二次开发参考,商用前请自行确认授权、版权和安全风险。
本项目为 MIT 协议,可自由使用但须保留版权与许可声明。
由于训练与推理对 GPU 集群资源要求较高,普通环境仅建议阅读代码与复现推理部分,完整训练请在具备相应硬件的受控环境中进行。
GitHub项目开源地址:https://github.com/AMD-AGI/Instella-MoE