SummFlow 2026-06-20 Hugging Face

Kimi K2.7 Code

万亿参数 MoE 编码智能体,长周期复杂任务更省 token、工具调用更强

对位
对标 GPT-5.5、Claude Opus 4.8 等前沿编码/智能体模型
适合
复杂长周期软件工程任务(多语言、全栈、基础设施等) / 需要工具调用/代码智能体的生产环境(如 MCP 工具链、自动化 Coworking)
不适合
不适合本地部署(1T 参数,仅限云端推理),也不适合纯粹的休闲闲聊等非工具性任务
规模
1.1T · 未公开 · Q4 ~699GB / FP16 ~2541GB
授权
other · 需自查
可信度
Moonshot AI 推出的编码智能体模型,在 Kimi Code Bench、Program Bench 等基准中整体接近或超越 GPT-5.5 与 Claude Opus 4.8,且思考 token 消耗较前代减少约 30%。

仅 safetensors · 无 pickle 加载风险

社区实测

社区普遍认可其推理速度快(日常约 180 tps)、token 效率提升明显(思考 token 减少约 30%),作为开源编码模型性价比突出,但付费计划周限额吃紧、部分实测不及官方基准,与 GPT-5.5/Opus 仍有差距。

  • 推理速度极快,日常编码约 180 tps,短上下文可达 260 tps,代理工作流不再被速度卡脖子
  • 思考 token 用量相比 K2.6 减少约 30%,直接降低代理工作流的推理成本
  • 提供 OpenAI 兼容 API,已部署 K2.6 的团队可无缝切换
  • 可通过 Unsloth 动态 2-bit 量化在本地运行
  • 开源/开放权重,社区可自行部署和二次开发
  • 相比 Claude Opus 4.8、GPT-5.5 等闭源模型,API 定价更低,适合作为默认编码工人
  • 万亿参数 MoE 架构(每 token 仅激活 32B),兼顾能力与效率
  • 在编码基准上与 GPT-5.5/Opus 仍有实质差距,尚不能全面替代前沿闭源模型
  • 有开发者公开质疑官方基准选择,认为实测表现与宣称不符
  • Vivace $39/月付费计划周限额紧张,有用户 3 小时用掉 12%、两天用掉 37%
  • 部分场景下 K2.6 执行更经济,有用户倾向用 K2.7 思考模式搭配 K2.6 干活
  • 采用 Modified MIT License,对商业使用有限制
  • 仅支持思考模式(thinking model only),无普通模式可选
  • 实际使用中可能 token 消耗大、速度变慢
  • 代码审查中曾将已有模式误标为阻断性严重问题,判断不够准确
  • 在同一次代码审查对比中,GLM 5.2 审查质量更好且 token 消耗不到一半

截至 2026-06-22