SummFlow 2026-06-17 Hugging Face

VibeThinker-3B (WeiboAI)

面向数学/代码/STEM的可验证推理3B小模型

入选理由
该模型在数学/代码推理任务上表现突出,需自行写transformers代码运行,适合研究小模型推理极限的开发者。
对位
对位 Qwen2.5-Coder-3B
适合
数学/编程竞赛解题 / STEM可验证推理任务
不适合
工具调用/Agent编程
规模
3B · 64k · Q4 ~2GB / FP16 ~7.4GB
授权
MIT · 可商用
框架
transformers / vllm / sglang
血统
微调自 Qwen2.5-Coder-3B
可信度
IMO-AnswerBench 76.4,LeetCode周赛通过率96.1%

仅 safetensors · 无 pickle 加载风险

社区实测

基准分数亮眼但实际编程体验分化明显,有用户认为存在过度拟合基准的问题

  • 以 3B 参数量在可验证推理基准上达到大模型水平,适合竞赛数学与编程
  • 支持通过 GGUF 在 LM Studio 等本地环境低资源部署
  • 不支持工具调用
  • 实际编程任务(如线性代数代码生成)表现远不如基准分数,有用户实测远逊于 Qwen 3.5 4B
  • 存在过度拟合基准(benchmaxing)的嫌疑

截至 2026-06-19

快速上手

vllm serve WeiboAI/VibeThinker-3B