指南 / 视觉理解模型

视觉理解模型

共 16 个 · 数据更新于 2026-07-19

显存档为包含式:更低显存也能跑的模型一并计入。数值取 Q4 量化后估算。

模型参数量显存门槛上下文许可证商用语言国内可达部署
Qwen3.6-27B-Fable-Fusion (DavidAU) 27BQ4 ~18GB / FP16 ~65GB256kApache 2.0需自查需代理ollama run hf.co/DavidAU/Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF
FrickFritz-4B-GGUF (fattis)
量化自 FrickFritz-4B
4BQ4 ~2.6GB / FP16 ~9.6GBapache-2.0需自查需代理ollama run hf.co/fattis/FrickFritz-4B-GGUF
ThinkingCap-Qwen3.6-27B (bottlecapai)
量化自 ThinkingCap-Qwen3.6-27B
27BQ4 ~18GB / FP16 ~65GB需自查需代理llama-server -hf bottlecapai/ThinkingCap-Qwen3.6-27B-GGUF:Q4_K_M --mmproj bottlecapai/ThinkingCap-Qwen3.6-27B-GGUF:mmproj-ThinkingCap-Qwen3.6-27B-f16.gguf
Unlimited-OCR (Baidu)
量化自 Unlimited-OCR
3BMIT需自查需代理huggingface-cli download sahilchachra/Unlimited-OCR-GGUF --include Unlimited-OCR-Q4_K_M.gguf mmproj-Unlimited-OCR-F16.gguf --local-dir ./uocr
PP-OCRv6_medium_det (PaddlePaddle) 15.5MQ4 ~0GB / FP16 ~0.1GB不适用Apache-2.0可商用需代理python -c 'from paddleocr import TextDetection; TextDetection(model_name="PP-OCRv6_medium_det", engine="transformers").predict("image.png")' (需 paddleocr 库) 等 2 种
DiffusionGemma-26B-A4B-it (Google)
量化自 diffusiongemma-26B-A4B-it
25.2B (3.8B active)256kApache 2.0可商用需代理DiffusionGemmaForBlockDiffusion.from_pretrained("google/diffusiongemma-26B-A4B-it", device_map="auto")
Gemma-4-31B-QAT-GGUF (unsloth)
量化自 gemma-4-31B-it-qat-q4_0-unquantized
GGUF·unsloth · GGUF·google · GGUF·lmstudio
31B256kapache-2.0可商用需代理llama-server -hf unsloth/gemma-4-31B-it-qat-GGUF:UD-Q4_K_XL --spec-type draft-mtp --spec-draft-n-max 4 -ngl 999
Gemma-4-26B-A4B-QAT-GGUF (Unsloth)
量化自 gemma-4-26B-A4B-it-qat-q4_0-unquantized
GGUF·unsloth · GGUF·lmstudio
25.2B (3.8B active)256KApache-2.0 (Gemma)可商用需代理ollama run unsloth/gemma-4-26B-A4B-it-qat-GGUF 等 3 种
NuExtract3 (NuMind)
微调自 Qwen3.5-4B
4BQ4 ~3GB / FP16 ~11GB131kApache-2.0可商用需代理vllm serve numind/NuExtract3 --trust-remote-code --limit-mm-per-prompt '{"image": 99, "video": 0}' 等 2 种
Qwen3.5-9B-MTP-GGUF (unsloth)
量化自 Qwen3.5-9B
9B262k (可扩展至1M)apache-2.0可商用需代理git clone https://github.com/ggml-org/llama.cpp && cd llama.cpp && cmake -B build -DGGML_CUDA=ON && cmake --build build --target llama-server 等 2 种
Qwen3.6-27B-GGUF (unsloth)
量化自 Qwen3.6-27B
GGUF·unsloth · GGUF·lmstudio · GGUF·unsloth·MTP
27B262k (可扩展至1M)apache-2.0可商用需代理llama.cpp: ./main -m Qwen3.6-27B-Q4_K_M.gguf
Qwen3.6-35B-A3B-GGUF (Unsloth)
量化自 Qwen3.6-35B-A3B
GGUF·unsloth · GGUF·lmstudio · GGUF·unsloth·MTP
35B (3B 激活)262k (可扩展至1M)apache-2.0可商用需代理ollama run hf.co/unsloth/Qwen3.6-35B-A3B-GGUF 等 2 种
Gemma-4-E4B-Aggressive (HauhauCS)
量化自 gemma-4-e4b-it
4B131kGemma限制商用需代理llama-cli -m ./gemma4-unc/Gemma-4-E4B-Uncensored-HauhauCS-Aggressive-Q4_K_M.gguf --mmproj ./gemma4-unc/mmproj-Gemma-4-E4B-Uncensored-HauhauCS-Aggressive-f16.gguf --jinja -c 8192 -ngl 99 等 2 种
Qwen3.6-27B-Heretic-Uncensored-FINETUNE-NEO-CODE-Di-IMatrix-MAX-GGUF (DavidAU)
量化自 Qwen3.6-27B-Heretic2-Uncensored-Finetune-Thinking
27B256kapache-2.0可商用需代理llama-server -hf DavidAU/Qwen3.6-27B-Heretic-Uncensored-FINETUNE-NEO-CODE-Di-IMatrix-MAX-GGUF
Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive
量化自 Qwen3.6-35B-A3B
35Bapache-2.0可商用需代理ollama run fredrezones55/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive:Q4_K_P 等 4 种
Qwen3.6-40B (DavidAU)
量化自 Qwen3.6-40B-Claude-4.6-Opus-Deckard-Heretic-Uncensored-Thinking
40Bapache-2.0可商用需代理llama-cli -m <gguf-file> -p '你的提示' 等 2 种

常见坑

  • DavidAU 的 Fable/Claude 蒸馏版仅约 4000 样本训练,不足以转移能力,可能反而降低质量 —— DavidAU/Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF
  • 蒸馏版实测出现连贯性问题和细微错误,标准基础模型没有这些毛病 —— DavidAU/Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF
  • 类似 Qwopus 蒸馏版存在幻觉问题且耗时翻倍 —— DavidAU/Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF
  • 复杂多文件架构级编程仍不如 Claude —— DavidAU/Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF
  • 配置 opencode 等 CLI 代理工具比 Claude Code 开箱体验更费劲 —— DavidAU/Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF
  • 部分基准测试中表现不如 Qwen3.5 和 Gemma 4 —— DavidAU/Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF
  • API 输出速度(55 t/s)低于 Qwen3.5(76 t/s) —— DavidAU/Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF
  • API 价格高于 Qwen3.5 —— DavidAU/Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF
展开其余 63 条
  • 复杂非编程任务(研究、深度分析、信息密集型文档)可能仍不够用 —— bottlecapai/ThinkingCap-Qwen3.6-27B-GGUF
  • 特定编程场景对部分用户无效 —— bottlecapai/ThinkingCap-Qwen3.6-27B-GGUF
  • Qwen 系列存在训练数据来源争议,社区有用户质疑其涉嫌使用 Claude 模型训练数据 —— bottlecapai/ThinkingCap-Qwen3.6-27B-GGUF
  • 目前仅覆盖 27B 规模,系列中更大参数量的变体尚未发布 —— bottlecapai/ThinkingCap-Qwen3.6-27B-GGUF
  • 架构设计被质疑像是在 Transformer 里加 LSTM,存在争议 —— sahilchachra/Unlimited-OCR-GGUF
  • 对长对话场景的适用性尚不明确 —— sahilchachra/Unlimited-OCR-GGUF
  • HN 讨论量有限,缺乏大规模实际使用反馈 —— sahilchachra/Unlimited-OCR-GGUF
  • PaddlePaddle 安装过程繁琐,CUDA 版本兼容性要求严格,上手门槛高 —— PaddlePaddle/PP-OCRv6_medium_det_safetensors
  • 精度不如同规模的 Gemma 4 26B 自回归模型,Google 官方建议质量优先时用 Gemma 4 —— unsloth/diffusiongemma-26B-A4B-it-GGUF
  • 预填充(prefill)性能未改善,是网页搜索/工具调用场景的瓶颈 —— unsloth/diffusiongemma-26B-A4B-it-GGUF
  • 高 QPS 云服务场景下并行解码优势递减,可能导致更高的服务成本 —— unsloth/diffusiongemma-26B-A4B-it-GGUF
  • 内容审查比 Gemma 4 31B 更严格,无法处理 NSFL 内容 —— unsloth/diffusiongemma-26B-A4B-it-GGUF
  • llama.cpp 支持在社区讨论时尚未就绪,本地部署选项受限 —— unsloth/diffusiongemma-26B-A4B-it-GGUF
  • QAT Q4 与标准 Q4 的基准对比并非同类比较(参考模型不同),不能直接解读为 QAT 优于标准量化 —— unsloth/gemma-4-31B-it-qat-GGUF
  • KL 散度仅衡量量化损伤抵抗程度,不代表 QAT Q4 模型的绝对智能水平等同于原始 bf16 模型 —— unsloth/gemma-4-31B-it-qat-GGUF
  • 长文档和非拉丁文字在所有量化级别下退化最快,即使 Q8_0 也有明显 KL 散度 —— unsloth/gemma-4-31B-it-qat-GGUF
  • 滑动窗口注意力加 KV cache 复用架构可能在低精度长上下文下累积误差 —— unsloth/gemma-4-31B-it-qat-GGUF
  • 有用户主观认为 QAT Q4 比之前用的 Q5/Q6 非 QAT 略差 —— unsloth/gemma-4-31B-it-qat-GGUF
  • Google 官方直接转换的 QAT Q4_0 GGUF 精度反而不如 Unsloth 动态处理版本 —— unsloth/gemma-4-31B-it-qat-GGUF
  • MTP 与 QAT 的整合仍在演进,社区期待 QAT Q4_K_XL MTP GGUF 搭配可用的 .mmproj 在 LM Studio 中运行 —— unsloth/gemma-4-31B-it-qat-GGUF
  • 编程任务在默认 temperature=1.0 下输出充满低级错误,需降至 0.3 或更低 —— unsloth/gemma-4-26B-A4B-it-qat-GGUF
  • 有用户称其为'最差的模型',在代码分析任务中给出大量错误建议 —— unsloth/gemma-4-26B-A4B-it-qat-GGUF
  • QAT 技术来自 Google,Unsloth 仅做格式转换,非独立改进 —— unsloth/gemma-4-26B-A4B-it-qat-GGUF
  • 非 QAT 版 Unsloth Q4_K_XL 中大量 tensor 使用了 q5/q6/q8 精度,可能影响量化一致性 —— unsloth/gemma-4-26B-A4B-it-qat-GGUF
  • MMLU Pro 上退化最明显,世界知识有所损失 —— unsloth/Qwen3.5-9B-MTP-GGUF
  • 量化后模型与原始 16 位版本不完全等同 —— unsloth/Qwen3.5-9B-MTP-GGUF
  • 复杂多文件架构级重构仍需要 Claude 等云端模型 —— unsloth/Qwen3.6-27B-GGUF
  • CLI 代理工具(如 opencode)的配置调优门槛明显高于 Claude Code 开箱体验 —— unsloth/Qwen3.6-27B-GGUF
  • 部分用户实测 Coder-Next 在编码任务上表现更优,与社区主流评价不一致 —— unsloth/Qwen3.6-27B-GGUF
  • 部分基准测试中落后于 Qwen3.5 和 Gemma 4 —— unsloth/Qwen3.6-27B-GGUF
  • 部分开发者仍不放心完全脱离云端主力模型 —— unsloth/Qwen3.6-27B-GGUF
  • 在笔记本上跑严肃编码不推荐,建议使用专用机器 —— unsloth/Qwen3.6-27B-GGUF
  • 27B 密集模型生成速度显著慢于 35B MoE 变体(24 vs 65 tok/s) —— unsloth/Qwen3.6-27B-GGUF
  • Qwen 3.6 Max 在 agentic 基准上明显领先(Terminal-Bench 65.4% vs 59.3%) —— unsloth/Qwen3.6-27B-GGUF
  • 在 agentic coding 中会出现无限循环重复同一操作(如反复以空字符串调用写文件函数) —— unsloth/Qwen3.6-35B-A3B-GGUF
  • 代码生成质量不稳定,输出可能松散凌乱,不如密集 27B 版本干净一致 —— unsloth/Qwen3.6-35B-A3B-GGUF
  • Power Ranking 编程任务仅解决 11/98,相比 Qwen3.5 35B(10/98)提升极小 —— unsloth/Qwen3.6-35B-A3B-GGUF
  • 知识类 benchmark 表现明显弱于预期,存在「刷榜」嫌疑 —— unsloth/Qwen3.6-35B-A3B-GGUF
  • 对 harness 和推理参数(temperature 等)敏感,配置不当严重影响效果 —— unsloth/Qwen3.6-35B-A3B-GGUF
  • 密集 27B 版本在需要规划和结构的任务上明显更优,社区多人中途切换回 27B —— unsloth/Qwen3.6-35B-A3B-GGUF
  • 与 Claude Opus 4.7 等前沿闭源模型在编程 benchmark 上差距仍大(Opus 95/98 vs 11/98) —— unsloth/Qwen3.6-35B-A3B-GGUF
  • 使用超出推荐数量的 expert 会导致输出质量下降 —— unsloth/Qwen3.6-35B-A3B-GGUF
  • 本质是官方 google/gemma-4-E4B-it 的衍生品,并非全新基础模型 —— HauhauCS/Gemma-4-E4B-Uncensored-HauhauCS-Aggressive
  • Ollama 用户可能需要自行调整才能正常使用 —— HauhauCS/Gemma-4-E4B-Uncensored-HauhauCS-Aggressive
  • 精简版变体(仅视觉或仅听觉)在调用不支持的多模态功能时会崩溃 —— HauhauCS/Gemma-4-E4B-Uncensored-HauhauCS-Aggressive
  • 有社区成员质疑其是否真正实现了“原生多模态” —— HauhauCS/Gemma-4-E4B-Uncensored-HauhauCS-Aggressive
  • 26B 和 31B 的 Aggressive 版本在发帖时尚未发布,大尺寸版本缺位 —— HauhauCS/Gemma-4-E4B-Uncensored-HauhauCS-Aggressive
  • 基准测试图表显示相比原版存在一定性能退化 —— HauhauCS/Gemma-4-E4B-Uncensored-HauhauCS-Aggressive
  • Heretic v2版本已推出且声称拒绝率更低,此版本可能已被迭代 —— DavidAU/Qwen3.6-27B-Heretic-Uncensored-FINETUNE-NEO-CODE-Di-IMatrix-MAX-GGUF
  • MoE稀疏变体(如35B A3B)的Heretic版本尚未可用,调优稀疏MoE需大量VRAM和时间 —— DavidAU/Qwen3.6-27B-Heretic-Uncensored-FINETUNE-NEO-CODE-Di-IMatrix-MAX-GGUF
  • 无Discord等社区支持渠道 —— DavidAU/Qwen3.6-27B-Heretic-Uncensored-FINETUNE-NEO-CODE-Di-IMatrix-MAX-GGUF
  • MTP(多令牌预测)支持状态不明 —— DavidAU/Qwen3.6-27B-Heretic-Uncensored-FINETUNE-NEO-CODE-Di-IMatrix-MAX-GGUF
  • IQ2_M级别量化仍有约17%性能损失 —— DavidAU/Qwen3.6-27B-Heretic-Uncensored-FINETUNE-NEO-CODE-Di-IMatrix-MAX-GGUF
  • 即使经过Heretic处理,仍有4%拒绝率残留 —— DavidAU/Qwen3.6-27B-Heretic-Uncensored-FINETUNE-NEO-CODE-Di-IMatrix-MAX-GGUF
  • 显存需求高:Q4_K_P约20GB,Q6_K_P 31GB,Q8_K_P 44GB;多模态需额外加载mmproj(899MB)。 —— HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive
  • 某些推理框架(如llama.cpp)需手动设置`--jinja`或`enable_thinking:false`以关闭思维链。 —— HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive
  • Aggressive变体虽无拒绝但可能输出简短免责声明(基座训练固有),并非完全空白。 —— HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive
  • 量化版本众多(含K_P自定义量化),需注意HF硬件兼容性组件不识别K_P,需手动查看文件列表。 —— HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive
  • 需手动禁用思考模式(编辑 jinja 模板或传参 enable_thinking=false) —— HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive
  • 无独立社区评测,仅有作者自述无智能退化 —— HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive
  • 模型名过长,社区以调侃方式表达不满 —— DavidAU/Qwen3.6-40B-Claude-4.6-Opus-Deckard-Heretic-Uncensored-Thinking-NEO-CODE-Di-IMatrix-MAX-GGUF
  • "Opus"标签被质疑更多是命名营销而非实质提升 —— DavidAU/Qwen3.6-40B-Claude-4.6-Opus-Deckard-Heretic-Uncensored-Thinking-NEO-CODE-Di-IMatrix-MAX-GGUF
  • 性能对比仅止于"不更差",缺乏明确的优势证据 —— DavidAU/Qwen3.6-40B-Claude-4.6-Opus-Deckard-Heretic-Uncensored-Thinking-NEO-CODE-Di-IMatrix-MAX-GGUF

收藏本页,或 订阅 RSS 追踪每日更新。