ThinkingCap-Qwen3.6-27B (bottlecapai)
视觉语言模型,思考令牌减半,GGUF量化,适合本地运行
社区实测
社区普遍认可其将思考 token 减半的同时保持准确率,在推理成本控制上有实际价值;27B 规模在本地部署场景中性价比突出,被部分用户视为前沿模型的替代方案;编程和 agentic 工作流表现受到关注,但复杂非编程任务是否够用仍存分歧。
- 思考 token 开销过大:平均减少约 50% 思考 token,GPQA-Diamond 等重推理基准上减少超 60%
- 推理速度慢:官方宣传中提到个别示例可实现最高 10x 生成加速
- 大模型推理成本高:被社区评价为相对其他模型「dirt cheap」
- 开源模型缺乏高效推理变体:Apache 2.0 许可,HuggingFace 公开发布,支持 Transformers/vLLM/SGLang/Docker 多种部署
- 编程和 agentic 工作流需要大模型:其指标显示编码和 agentic 工作流表现优于 397B 模型
- 效率优化常伴随准确率下降的顾虑:MMLU-Pro、SuperGPQA 等十二个基准上准确率几乎与基础模型一致
- 复杂非编程任务(研究、深度分析、信息密集型文档)可能仍不够用
- 特定编程场景对部分用户无效
- Qwen 系列存在训练数据来源争议,社区有用户质疑其涉嫌使用 Claude 模型训练数据
- 目前仅覆盖 27B 规模,系列中更大参数量的变体尚未发布
Introducing efficiency focused "ThinkingCap" model seriessame accuracy as base Qwen3.6 with ~50% fewer thinkingThey are actually quite a bit better than you might think. Qwen3.6 27B is pretty... | Hacker NewsWow, Qwen3.6-27B is good : r/LocalLLMInstagramIs Qwen3.6 still the best for coding and are newer, better ...bottlecapai/ThinkingCap-Qwen3.6-27B · Hugging FaceThinkingCap-Qwen3.6-27B: Text-to-Text modelThinkingCap-Qwen3.6-27B Capability ...Efficiency Focused ThinkingCap AI Model Released on ...
截至 2026-07-15
本形态 ~16GB 4-bit · 国内 需代理 · 298,790 下载
快速上手
llama-server -hf bottlecapai/ThinkingCap-Qwen3.6-27B-GGUF:Q4_K_M --mmproj bottlecapai/ThinkingCap-Qwen3.6-27B-GGUF:mmproj-ThinkingCap-Qwen3.6-27B-f16.gguf