模型 / Instella-MoE-16B-A3B-Think (AMD)

Instella-MoE-16B-A3B-Think (AMD)

全开源 MoE 语言模型,16B 总参/2.8B 激活,面向研究

作者 amd

仓库标识amd/Instella-MoE-16B-A3B-Think

~9.5GB 4-bit许可 限制商用任务 文本生成最近核对 2026-08-05
格式
4-bit
文件
~8.3GB
运行内存
~9.5GB–12GB
运行时
transformers
下载
730

仅 safetensors · 无 pickle 加载风险

Hugging Face 源仓库 ↗

适合与不适合

入选理由
全流程开放的 MoE 模型,含 Gated MLA 等架构创新,适合研究者深入分析训练阶段;需自行编写推理代码,且仅限研究用途。
对位
对位 DeepSeekMoE-16B(2.8B 激活)
适合
研究实验与训练流程复现 / MoE 架构与系统创新研究
不适合
生产部署或安全关键应用

独立证据与社区反馈

4 个独立来源 · 另 1 官方/转载最近验证 2026-08-05

「完全开放」标签有水分——授权仅限学术/研究用途,且 2.8B 活跃参数仍需 16B 量级的显存规划,离实用部署还有距离。

  • 全流程检查点公开(预训练→中期训练→长上下文扩展→SFT→DPO→RL),便于研究复现和分阶段分析
  • 使用开源 Primus 和 Miles 框架在 AMD MI300X/MI325X 上完成端到端训练,验证了 AMD 软硬件栈的可行性
  • 在 AMD 自有 GPU 上从头训练出与 Gemma-4-E4B 可比的性能,为非 NVIDIA 生态提供了参考案例
  • 授权协议限制仅用于学术和研究活动,任何商业用途均构成违规
  • 2.8B 活跃参数仍需 16B 模型的显存规划,推理成本并不低
  • 加载模型需要 trust_remote_code=True,存在安全和使用门槛
  • 首选部署路径为 Linux,Windows 支持存在但非优先

可信度AMD 官方发布,提供预训练至 RL 全流程检查点,HuggingFace 57 点赞

完整规格

规模
16B · 下载 ~8.3GB · 显存最低 ~9.5GB · 推荐 ~12GB · 4-bit(估算)
授权
ResearchRAIL · 限制商用
框架
transformers / sglang
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 4.2k → 3k · likes +16

观测时间线