指南 / 视觉理解模型
视觉理解模型
共 16 个 · 数据更新于 2026-07-19
显存档为包含式:更低显存也能跑的模型一并计入。数值取 Q4 量化后估算。
| 模型 | 参数量 | 显存门槛 | 上下文 | 许可证 | 商用 | 语言 | 国内可达 | 部署 |
|---|---|---|---|---|---|---|---|---|
| Qwen3.6-27B-Fable-Fusion (DavidAU) | 27B | Q4 ~18GB / FP16 ~65GB | 256k | Apache 2.0 | 需自查 | — | 需代理 | ollama run hf.co/DavidAU/Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF |
| FrickFritz-4B-GGUF (fattis) 量化自 FrickFritz-4B | 4B | Q4 ~2.6GB / FP16 ~9.6GB | — | apache-2.0 | 需自查 | — | 需代理 | ollama run hf.co/fattis/FrickFritz-4B-GGUF |
| ThinkingCap-Qwen3.6-27B (bottlecapai) 量化自 ThinkingCap-Qwen3.6-27B | 27B | Q4 ~18GB / FP16 ~65GB | — | — | 需自查 | — | 需代理 | llama-server -hf bottlecapai/ThinkingCap-Qwen3.6-27B-GGUF:Q4_K_M --mmproj bottlecapai/ThinkingCap-Qwen3.6-27B-GGUF:mmproj-ThinkingCap-Qwen3.6-27B-f16.gguf |
| Unlimited-OCR (Baidu) 量化自 Unlimited-OCR | 3B | — | — | MIT | 需自查 | — | 需代理 | huggingface-cli download sahilchachra/Unlimited-OCR-GGUF --include Unlimited-OCR-Q4_K_M.gguf mmproj-Unlimited-OCR-F16.gguf --local-dir ./uocr |
| PP-OCRv6_medium_det (PaddlePaddle) | 15.5M | Q4 ~0GB / FP16 ~0.1GB | 不适用 | Apache-2.0 | 可商用 | — | 需代理 | python -c 'from paddleocr import TextDetection; TextDetection(model_name="PP-OCRv6_medium_det", engine="transformers").predict("image.png")' (需 paddleocr 库) 等 2 种 |
| DiffusionGemma-26B-A4B-it (Google) 量化自 diffusiongemma-26B-A4B-it | 25.2B (3.8B active) | — | 256k | Apache 2.0 | 可商用 | — | 需代理 | DiffusionGemmaForBlockDiffusion.from_pretrained("google/diffusiongemma-26B-A4B-it", device_map="auto") |
| Gemma-4-31B-QAT-GGUF (unsloth) 量化自 gemma-4-31B-it-qat-q4_0-unquantized GGUF·unsloth · GGUF·google · GGUF·lmstudio | 31B | — | 256k | apache-2.0 | 可商用 | — | 需代理 | llama-server -hf unsloth/gemma-4-31B-it-qat-GGUF:UD-Q4_K_XL --spec-type draft-mtp --spec-draft-n-max 4 -ngl 999 |
| Gemma-4-26B-A4B-QAT-GGUF (Unsloth) 量化自 gemma-4-26B-A4B-it-qat-q4_0-unquantized GGUF·unsloth · GGUF·lmstudio | 25.2B (3.8B active) | — | 256K | Apache-2.0 (Gemma) | 可商用 | — | 需代理 | ollama run unsloth/gemma-4-26B-A4B-it-qat-GGUF 等 3 种 |
| NuExtract3 (NuMind) 微调自 Qwen3.5-4B | 4B | Q4 ~3GB / FP16 ~11GB | 131k | Apache-2.0 | 可商用 | — | 需代理 | vllm serve numind/NuExtract3 --trust-remote-code --limit-mm-per-prompt '{"image": 99, "video": 0}' 等 2 种 |
| Qwen3.5-9B-MTP-GGUF (unsloth) 量化自 Qwen3.5-9B | 9B | — | 262k (可扩展至1M) | apache-2.0 | 可商用 | — | 需代理 | git clone https://github.com/ggml-org/llama.cpp && cd llama.cpp && cmake -B build -DGGML_CUDA=ON && cmake --build build --target llama-server 等 2 种 |
| Qwen3.6-27B-GGUF (unsloth) 量化自 Qwen3.6-27B GGUF·unsloth · GGUF·lmstudio · GGUF·unsloth·MTP | 27B | — | 262k (可扩展至1M) | apache-2.0 | 可商用 | — | 需代理 | llama.cpp: ./main -m Qwen3.6-27B-Q4_K_M.gguf |
| Qwen3.6-35B-A3B-GGUF (Unsloth) 量化自 Qwen3.6-35B-A3B GGUF·unsloth · GGUF·lmstudio · GGUF·unsloth·MTP | 35B (3B 激活) | — | 262k (可扩展至1M) | apache-2.0 | 可商用 | — | 需代理 | ollama run hf.co/unsloth/Qwen3.6-35B-A3B-GGUF 等 2 种 |
| Gemma-4-E4B-Aggressive (HauhauCS) 量化自 gemma-4-e4b-it | 4B | — | 131k | Gemma | 限制商用 | — | 需代理 | llama-cli -m ./gemma4-unc/Gemma-4-E4B-Uncensored-HauhauCS-Aggressive-Q4_K_M.gguf --mmproj ./gemma4-unc/mmproj-Gemma-4-E4B-Uncensored-HauhauCS-Aggressive-f16.gguf --jinja -c 8192 -ngl 99 等 2 种 |
| Qwen3.6-27B-Heretic-Uncensored-FINETUNE-NEO-CODE-Di-IMatrix-MAX-GGUF (DavidAU) 量化自 Qwen3.6-27B-Heretic2-Uncensored-Finetune-Thinking | 27B | — | 256k | apache-2.0 | 可商用 | — | 需代理 | llama-server -hf DavidAU/Qwen3.6-27B-Heretic-Uncensored-FINETUNE-NEO-CODE-Di-IMatrix-MAX-GGUF |
| Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive 量化自 Qwen3.6-35B-A3B | 35B | — | — | apache-2.0 | 可商用 | — | 需代理 | ollama run fredrezones55/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive:Q4_K_P 等 4 种 |
| Qwen3.6-40B (DavidAU) 量化自 Qwen3.6-40B-Claude-4.6-Opus-Deckard-Heretic-Uncensored-Thinking | 40B | — | — | apache-2.0 | 可商用 | — | 需代理 | llama-cli -m <gguf-file> -p '你的提示' 等 2 种 |
没有同时满足所选条件的模型,试着去掉一个筛选。
常见坑
- DavidAU 的 Fable/Claude 蒸馏版仅约 4000 样本训练,不足以转移能力,可能反而降低质量 —— DavidAU/Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF
- 蒸馏版实测出现连贯性问题和细微错误,标准基础模型没有这些毛病 —— DavidAU/Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF
- 类似 Qwopus 蒸馏版存在幻觉问题且耗时翻倍 —— DavidAU/Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF
- 复杂多文件架构级编程仍不如 Claude —— DavidAU/Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF
- 配置 opencode 等 CLI 代理工具比 Claude Code 开箱体验更费劲 —— DavidAU/Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF
- 部分基准测试中表现不如 Qwen3.5 和 Gemma 4 —— DavidAU/Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF
- API 输出速度(55 t/s)低于 Qwen3.5(76 t/s) —— DavidAU/Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF
- API 价格高于 Qwen3.5 —— DavidAU/Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF
展开其余 63 条
- 复杂非编程任务(研究、深度分析、信息密集型文档)可能仍不够用 —— bottlecapai/ThinkingCap-Qwen3.6-27B-GGUF
- 特定编程场景对部分用户无效 —— bottlecapai/ThinkingCap-Qwen3.6-27B-GGUF
- Qwen 系列存在训练数据来源争议,社区有用户质疑其涉嫌使用 Claude 模型训练数据 —— bottlecapai/ThinkingCap-Qwen3.6-27B-GGUF
- 目前仅覆盖 27B 规模,系列中更大参数量的变体尚未发布 —— bottlecapai/ThinkingCap-Qwen3.6-27B-GGUF
- 架构设计被质疑像是在 Transformer 里加 LSTM,存在争议 —— sahilchachra/Unlimited-OCR-GGUF
- 对长对话场景的适用性尚不明确 —— sahilchachra/Unlimited-OCR-GGUF
- HN 讨论量有限,缺乏大规模实际使用反馈 —— sahilchachra/Unlimited-OCR-GGUF
- PaddlePaddle 安装过程繁琐,CUDA 版本兼容性要求严格,上手门槛高 —— PaddlePaddle/PP-OCRv6_medium_det_safetensors
- 精度不如同规模的 Gemma 4 26B 自回归模型,Google 官方建议质量优先时用 Gemma 4 —— unsloth/diffusiongemma-26B-A4B-it-GGUF
- 预填充(prefill)性能未改善,是网页搜索/工具调用场景的瓶颈 —— unsloth/diffusiongemma-26B-A4B-it-GGUF
- 高 QPS 云服务场景下并行解码优势递减,可能导致更高的服务成本 —— unsloth/diffusiongemma-26B-A4B-it-GGUF
- 内容审查比 Gemma 4 31B 更严格,无法处理 NSFL 内容 —— unsloth/diffusiongemma-26B-A4B-it-GGUF
- llama.cpp 支持在社区讨论时尚未就绪,本地部署选项受限 —— unsloth/diffusiongemma-26B-A4B-it-GGUF
- QAT Q4 与标准 Q4 的基准对比并非同类比较(参考模型不同),不能直接解读为 QAT 优于标准量化 —— unsloth/gemma-4-31B-it-qat-GGUF
- KL 散度仅衡量量化损伤抵抗程度,不代表 QAT Q4 模型的绝对智能水平等同于原始 bf16 模型 —— unsloth/gemma-4-31B-it-qat-GGUF
- 长文档和非拉丁文字在所有量化级别下退化最快,即使 Q8_0 也有明显 KL 散度 —— unsloth/gemma-4-31B-it-qat-GGUF
- 滑动窗口注意力加 KV cache 复用架构可能在低精度长上下文下累积误差 —— unsloth/gemma-4-31B-it-qat-GGUF
- 有用户主观认为 QAT Q4 比之前用的 Q5/Q6 非 QAT 略差 —— unsloth/gemma-4-31B-it-qat-GGUF
- Google 官方直接转换的 QAT Q4_0 GGUF 精度反而不如 Unsloth 动态处理版本 —— unsloth/gemma-4-31B-it-qat-GGUF
- MTP 与 QAT 的整合仍在演进,社区期待 QAT Q4_K_XL MTP GGUF 搭配可用的 .mmproj 在 LM Studio 中运行 —— unsloth/gemma-4-31B-it-qat-GGUF
- 编程任务在默认 temperature=1.0 下输出充满低级错误,需降至 0.3 或更低 —— unsloth/gemma-4-26B-A4B-it-qat-GGUF
- 有用户称其为'最差的模型',在代码分析任务中给出大量错误建议 —— unsloth/gemma-4-26B-A4B-it-qat-GGUF
- QAT 技术来自 Google,Unsloth 仅做格式转换,非独立改进 —— unsloth/gemma-4-26B-A4B-it-qat-GGUF
- 非 QAT 版 Unsloth Q4_K_XL 中大量 tensor 使用了 q5/q6/q8 精度,可能影响量化一致性 —— unsloth/gemma-4-26B-A4B-it-qat-GGUF
- MMLU Pro 上退化最明显,世界知识有所损失 —— unsloth/Qwen3.5-9B-MTP-GGUF
- 量化后模型与原始 16 位版本不完全等同 —— unsloth/Qwen3.5-9B-MTP-GGUF
- 复杂多文件架构级重构仍需要 Claude 等云端模型 —— unsloth/Qwen3.6-27B-GGUF
- CLI 代理工具(如 opencode)的配置调优门槛明显高于 Claude Code 开箱体验 —— unsloth/Qwen3.6-27B-GGUF
- 部分用户实测 Coder-Next 在编码任务上表现更优,与社区主流评价不一致 —— unsloth/Qwen3.6-27B-GGUF
- 部分基准测试中落后于 Qwen3.5 和 Gemma 4 —— unsloth/Qwen3.6-27B-GGUF
- 部分开发者仍不放心完全脱离云端主力模型 —— unsloth/Qwen3.6-27B-GGUF
- 在笔记本上跑严肃编码不推荐,建议使用专用机器 —— unsloth/Qwen3.6-27B-GGUF
- 27B 密集模型生成速度显著慢于 35B MoE 变体(24 vs 65 tok/s) —— unsloth/Qwen3.6-27B-GGUF
- Qwen 3.6 Max 在 agentic 基准上明显领先(Terminal-Bench 65.4% vs 59.3%) —— unsloth/Qwen3.6-27B-GGUF
- 在 agentic coding 中会出现无限循环重复同一操作(如反复以空字符串调用写文件函数) —— unsloth/Qwen3.6-35B-A3B-GGUF
- 代码生成质量不稳定,输出可能松散凌乱,不如密集 27B 版本干净一致 —— unsloth/Qwen3.6-35B-A3B-GGUF
- Power Ranking 编程任务仅解决 11/98,相比 Qwen3.5 35B(10/98)提升极小 —— unsloth/Qwen3.6-35B-A3B-GGUF
- 知识类 benchmark 表现明显弱于预期,存在「刷榜」嫌疑 —— unsloth/Qwen3.6-35B-A3B-GGUF
- 对 harness 和推理参数(temperature 等)敏感,配置不当严重影响效果 —— unsloth/Qwen3.6-35B-A3B-GGUF
- 密集 27B 版本在需要规划和结构的任务上明显更优,社区多人中途切换回 27B —— unsloth/Qwen3.6-35B-A3B-GGUF
- 与 Claude Opus 4.7 等前沿闭源模型在编程 benchmark 上差距仍大(Opus 95/98 vs 11/98) —— unsloth/Qwen3.6-35B-A3B-GGUF
- 使用超出推荐数量的 expert 会导致输出质量下降 —— unsloth/Qwen3.6-35B-A3B-GGUF
- 本质是官方 google/gemma-4-E4B-it 的衍生品,并非全新基础模型 —— HauhauCS/Gemma-4-E4B-Uncensored-HauhauCS-Aggressive
- Ollama 用户可能需要自行调整才能正常使用 —— HauhauCS/Gemma-4-E4B-Uncensored-HauhauCS-Aggressive
- 精简版变体(仅视觉或仅听觉)在调用不支持的多模态功能时会崩溃 —— HauhauCS/Gemma-4-E4B-Uncensored-HauhauCS-Aggressive
- 有社区成员质疑其是否真正实现了“原生多模态” —— HauhauCS/Gemma-4-E4B-Uncensored-HauhauCS-Aggressive
- 26B 和 31B 的 Aggressive 版本在发帖时尚未发布,大尺寸版本缺位 —— HauhauCS/Gemma-4-E4B-Uncensored-HauhauCS-Aggressive
- 基准测试图表显示相比原版存在一定性能退化 —— HauhauCS/Gemma-4-E4B-Uncensored-HauhauCS-Aggressive
- Heretic v2版本已推出且声称拒绝率更低,此版本可能已被迭代 —— DavidAU/Qwen3.6-27B-Heretic-Uncensored-FINETUNE-NEO-CODE-Di-IMatrix-MAX-GGUF
- MoE稀疏变体(如35B A3B)的Heretic版本尚未可用,调优稀疏MoE需大量VRAM和时间 —— DavidAU/Qwen3.6-27B-Heretic-Uncensored-FINETUNE-NEO-CODE-Di-IMatrix-MAX-GGUF
- 无Discord等社区支持渠道 —— DavidAU/Qwen3.6-27B-Heretic-Uncensored-FINETUNE-NEO-CODE-Di-IMatrix-MAX-GGUF
- MTP(多令牌预测)支持状态不明 —— DavidAU/Qwen3.6-27B-Heretic-Uncensored-FINETUNE-NEO-CODE-Di-IMatrix-MAX-GGUF
- IQ2_M级别量化仍有约17%性能损失 —— DavidAU/Qwen3.6-27B-Heretic-Uncensored-FINETUNE-NEO-CODE-Di-IMatrix-MAX-GGUF
- 即使经过Heretic处理,仍有4%拒绝率残留 —— DavidAU/Qwen3.6-27B-Heretic-Uncensored-FINETUNE-NEO-CODE-Di-IMatrix-MAX-GGUF
- 显存需求高:Q4_K_P约20GB,Q6_K_P 31GB,Q8_K_P 44GB;多模态需额外加载mmproj(899MB)。 —— HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive
- 某些推理框架(如llama.cpp)需手动设置`--jinja`或`enable_thinking:false`以关闭思维链。 —— HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive
- Aggressive变体虽无拒绝但可能输出简短免责声明(基座训练固有),并非完全空白。 —— HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive
- 量化版本众多(含K_P自定义量化),需注意HF硬件兼容性组件不识别K_P,需手动查看文件列表。 —— HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive
- 需手动禁用思考模式(编辑 jinja 模板或传参 enable_thinking=false) —— HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive
- 无独立社区评测,仅有作者自述无智能退化 —— HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive
- 模型名过长,社区以调侃方式表达不满 —— DavidAU/Qwen3.6-40B-Claude-4.6-Opus-Deckard-Heretic-Uncensored-Thinking-NEO-CODE-Di-IMatrix-MAX-GGUF
- "Opus"标签被质疑更多是命名营销而非实质提升 —— DavidAU/Qwen3.6-40B-Claude-4.6-Opus-Deckard-Heretic-Uncensored-Thinking-NEO-CODE-Di-IMatrix-MAX-GGUF
- 性能对比仅止于"不更差",缺乏明确的优势证据 —— DavidAU/Qwen3.6-40B-Claude-4.6-Opus-Deckard-Heretic-Uncensored-Thinking-NEO-CODE-Di-IMatrix-MAX-GGUF