SummFlow 2026-07-07 Hugging Face

Grug-12B (kai-os)

紧凑推理微调,减少冗余推理轨迹,降低推理token消耗

入选理由
基于Gemma 4的紧凑推理微调,能大幅减少推理token数,适合追求推理效率的开发者,但需自行编写transformers代码,无现成API或Space试用。
对位
对位 Qwen2.5-14B, Gemma 2 9B
适合
低成本推理服务 / 数学与代码紧凑推理
不适合
需要长推导的复杂推理
规模
12B · 未知 · Q4 ~7.9GB / FP16 ~29GB
授权
other · 需自查
框架
transformers / vllm / ollama
血统
微调自 gemma-4-12B-it
可信度
本地36题数学代理评估:准确率100%,总生成token 2482 vs 基础模型8227

仅 safetensors · 无 pickle 加载风险

社区实测

社区对 KaiOS 评价两极:部分用户认为它够用、契合轻量需求,但更多人指出生态衰退、安全不足

  • 提供轻量级系统,满足特定场景和明确任务的需求
  • 为翻盖手机用户带来「够用即治愈」的极简体验
  • 当前状态不佳,业务挣扎导致技术侧妥协
  • 几乎无人为平台开发应用,生态萎缩
  • 安全方面存在明显短板

截至 2026-07-12

快速上手

ollama run hf.co/kai-os/Grug-12B