模型 / Kimi-K3-0.40B (moonshotai)

Kimi-K3-0.40B (moonshotai)

轻量级Kimi-K3测试版,保留混合注意力MoE,用于特征提取开发

作者 inference-optimization

仓库标识inference-optimization/Kimi-K3-0.40B

~0.2GB 4-bit许可 可商用任务 向量嵌入最近核对 2026-08-05
格式
4-bit
文件
~0.2GB
运行内存
~0.2GB–0.3GB
运行时
llm-compressor
下载
17,253

Hugging Face 源仓库 ↗

适合与不适合

入选理由
Kimi-K3 的 0.4B 微型复刻,保留 KDA/MLA 混合注意力,适合快速验证 KimiK3 推理流程;需依赖 llmcompressor 自定义代码,适合开发者调试。
适合
轻量级文本嵌入与特征提取 / 原型开发与架构实验
不适合
生产环境对话或高精度生成任务

独立证据与社区反馈

9 个独立来源最近验证 2026-08-05

K3 在多项基准测试中成绩亮眼,社区普遍认可其前沿水平,但 2.8T 参数规模使本地运行几乎不现实,实际可用途径以 API 为主。OpenRouter 上多供应商竞争带来有竞争力的定价,但同价位下实测输出速度偏慢。

  • 基准测试成绩跻身前沿,可对标 OpenAI 与 Anthropic 旗舰模型
  • 支持 1M token 上下文窗口,适合长文档处理
  • 提供 OpenAI 兼容 API,接入门槛低,无需自行部署
  • OpenRouter 上 9 家供应商接入,可用性较高
  • 开放权重(Modified MIT 许可),允许二次开发与自由部署
  • 在独立基准排名中位列前茅(BenchLM #5/215, Artificial Analysis #4/189)
  • 具备自主芯片设计能力,48 小时内从零完成芯片设计验证
  • 2.8T 参数规模超出个人硬件承载能力,本地推理不可行
  • 实测输出速度约 62 tok/s,低于同价位中位数 72.7 tok/s
  • 在 UK AISI/CAISI 网络攻防评估中显著落后于前沿模型
  • 训练依赖出口级 Nvidia 芯片及未公开的替代 GPU,算力受限
  • 实际可行访问方式仅限于 API,本地推理不现实

可信度HuggingFace 17k下载,基于moonshotai/Kimi-K3缩小,架构参数公开可复现

完整规格

规模
0.40B · 下载 ~0.2GB · 显存最低 ~0.2GB · 推荐 ~0.3GB · 4-bit(估算)
授权
MIT · 可商用
框架
llm-compressor
血统
微调自 Kimi-K3
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 84k → 59.7k · likes +6

观测时间线