大语言模型6 天前·MarkTechPost
AMD Instella-MoE-16B-A3B:全开放权重 MoE 模型,ResearchRAIL 许可
MarkTechPost 报道,AMD 发布 Instella-MoE-16B-A3B,16B 总参数、2.8B 激活参数的全开放权重 MoE 模型。在 AMD Instinct MI300X/MI325X 上使用 ROCm、Primus、Miles 训练。权重采用 ResearchRAIL 许可(限学术研究),训练代码 MIT 许可。通过 Gated MLA 和 FarSkip-Collective 实现 12.7% 训练加速和 39.2% TTFT 降低。
AMD Instella-MoE-16B-A3B
2026 年 8 月 1 日,MarkTechPost / AMD。
模型规格
| 指标 | 数据 |
|---|---|
| 总参数 | 16B |
| 激活参数 | 2.8B (2 共享 + 6/64 路由专家) |
| 训练硬件 | AMD Instinct MI300X/MI325X |
| 软件栈 | ROCm + Primus + Miles |
许可模式
| 组件 | 许可 |
|---|---|
| 模型权重 | ResearchRAIL(限学术研究) |
| 训练代码 | MIT(可商用) |
技术优化
- Gated MLA:12.7% 训练加速
- FarSkip-Collective:39.2% TTFT 降低
- Base 平均 76.7,Think 平均 73.22
AI Master 解读
核心事件
AMD 发布全开放权重 MoE 模型。
行业影响
为什么重要: 在 AMD GPU 上端到端训练,展示 ROCm 生态成熟度。
影响分析:
| 维度 | 影响 |
|---|---|
| 总参数 | 16B |
| 激活参数 | 2.8B |
| 训练加速 | 12.7% |
| TTFT 降低 | 39.2% |
AI Master 建议
关注 ResearchRAIL 许可对商业使用的限制。
