指南 / 视觉理解模型
视觉理解模型
共 34 个 · 数据更新于 2026-09-15
显存档为包含式:更低显存也能跑的模型一并计入。数值取 Q4 量化后估算。
Qwen3.8-27B-TWIN-TURBO (DavidAU)
量化自 Qwen3.8-27B-TWIN-TURBO-Fable-Cold-Fusion-709-L-Uncensored
27B图像文本微调GGUF,面向本地硬件推理
- 参数量
- 27B
- 商用
- 可商用
当前运行配置
DavidAU/Qwen3.8-27B-TWIN-TURBO-Fable-Cold-Fusion-709-L-Uncensored-NM-DAU-NEO-MTP-GGUF- 显存
- ~57GB BF16(估算)
查看详情查看运行方式
llama-server -hf DavidAU/Qwen3.8-27B-TWIN-TURBO-Fable-Cold-Fusion-709-L-Uncensored-NM-DAU-NEO-MTP-GGUF- 许可证
- Apache-2.0
- 上下文
- 256k
- 国内可达
- 需代理
当前运行配置
ukisai/Swift-Qwen3.8-27B-GGUF- 显存
- 暂无估算
查看详情查看运行方式
llama-server -hf ukisai/Swift-Qwen3.8-27B-GGUF:Q4_K_M --jinja -fa on -ngl 99 -c 262144 --temp 1.0 --top-p 0.95 --top-k 20 --min-p 0 --presence-penalty 0 --repeat-penalty 1.0- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- Swift Open License v1.0 (gated)
- 上下文
- 262k
- 国内可达
- 需代理
当前运行配置
ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF- 显存
- 暂无估算
查看详情查看运行方式
ollama run hf.co/ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- apache-2.0
- 国内可达
- 需代理
Qwen3.8-27B-TURBO-Fable-Cold-Fusion (DavidAU)
量化自 Qwen3.8-27B-TURBO-Fable-Cold-Fusion-735-882-Heretic-Uncensored-NM-DAU
图像文本多模态 GGUF,面向本地消费级硬件部署
- 参数量
- 27B
- 商用
- 可商用
当前运行配置
DavidAU/Qwen3.8-27B-TURBO-Fable-Cold-Fusion-735-882-Heretic-Uncensored-NEO-CODER-MAX-MTP-GGUF- 显存
- ~57GB BF16(估算)
查看详情暂无收录命令
本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。
- 许可证
- apache-2.0
- 上下文
- 256k
- 国内可达
- 需代理
Tiel-Coder-35B-A3B-GGUF (peculiar-ragdoll)
量化自 Ornith-1.5-35B-A3B
35B-A3B 编程模型,本地 Agent 编码
- 参数量
- 35B-A3B
- 商用
- 可商用
当前运行配置
peculiar-ragdoll/Tiel-Coder-35B-A3B-GGUF- 显存
- 暂无估算
查看详情查看运行方式
llama-server -hf peculiar-ragdoll/Tiel-Coder-35B-A3B-GGUF --hf-file Tiel-Coder-35B-A3B-UD-Q4_K_XL.gguf -ngl 99 --jinja- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- MIT
- 国内可达
- 需代理
当前运行配置
peculiar-ragdoll/Dirk-Qwen3.8-27B-GGUF- 显存
- 暂无估算
查看详情查看运行方式
llama-server -hf peculiar-ragdoll/Dirk-Qwen3.8-27B-GGUF:Q4_K_XL -ngl 99- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- Apache-2.0
- 国内可达
- 需代理
Huihui-Qwen3.8-27B-abliterated-GGUF (huihui-ai)
量化自 Qwen3.8-27B
去拒绝版 Qwen3.8-27B GGUF,多模态本地推理
- 参数量
- 27B
- 商用
- 可商用
当前运行配置
huihui-ai/Huihui-Qwen3.8-27B-abliterated-GGUF- 显存
- 暂无估算
查看详情查看运行方式
ollama run huihui_ai/Qwen3.8-abliterated- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- apache-2.0
- 上下文
- 262k
- 国内可达
- 需代理
Qwen3.8-27B-Cold-Fusion-GAIN-V1.1 (DavidAU)
量化自 Qwen3.8-27B-Cold-Fusion-GAIN-V1.1
Qwen3.8-27B 微调 GGUF,减思考 token 支持视觉
- 参数量
- 27B
- 商用
- 可商用
当前运行配置
DavidAU/Qwen3.8-27B-Cold-Fusion-GAIN-V1.1-NM-DAU-NEO-MAX-MTP-GGUF- 显存
- ~57GB BF16(估算)
查看详情查看运行方式
llama-server -hf DavidAU/Qwen3.8-27B-Cold-Fusion-GAIN-V1.1-NM-DAU-NEO-MAX-MTP-GGUF- 许可证
- Apache-2.0
- 上下文
- 256k
- 国内可达
- 需代理
27B 未审查 GGUF,带视觉与 FastMTP
- 参数量
- 27B
- 商用
- 可商用
当前运行配置
HauhauCS/Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-MTP-GGUF- 显存
- 暂无估算
查看详情查看运行方式
llama-server -hf HauhauCS/Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-MTP-GGUF --jinja- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- Apache-2.0
- 上下文
- 262k 原生
- 国内可达
- 需代理
当前运行配置
lmstudio-community/Qwen3.8-27B-GGUF- 显存
- 暂无估算
查看详情查看运行方式
llama-server -hf lmstudio-community/Qwen3.8-27B-GGUF- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- apache-2.0
- 上下文
- 262k
- 国内可达
- 需代理
- 其它形态
- GGUF·lmstudio · GGUF·atomicchat · GGUF·unsloth
当前运行配置
empero-ai/Qwen3.8-27B-Ridge-GGUF- 显存
- 暂无估算
查看详情查看运行方式
ollama run hf.co/empero-ai/Qwen3.8-27B-Ridge-GGUF- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- Apache-2.0
- 上下文
- 262k / YaRN 1M
- 国内可达
- 需代理
当前运行配置
HauhauCS/Qwen3.6-27B-Uncensored-HauhauCS-Aggressive- 显存
- 暂无估算
查看详情查看运行方式
llama-server -hf HauhauCS/Qwen3.6-27B-Uncensored-HauhauCS-Aggressive --jinja -c 131072 -ngl 99- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- Apache-2.0
- 上下文
- 262k(可扩展至 ~1M)
- 国内可达
- 需代理
当前运行配置
lmstudio-community/Muse-Glimmer-30B-GGUF- 显存
- 暂无估算
查看详情查看运行方式
llama-server -hf lmstudio-community/Muse-Glimmer-30B-GGUF- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- Apache 2.0
- 上下文
- 128k+
- 国内可达
- 需代理
- 其它形态
- GGUF·lmstudio · GGUF·meta-models · GGUF·unsloth
当前运行配置
unsloth/Inkling-Small-GGUF- 显存
- 暂无估算
查看详情查看运行方式
ollama run hf.co/unsloth/Inkling-Small-GGUF- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- apache-2.0
- 国内可达
- 需代理
当前运行配置
Nanthasit/sakthai-vision-7b- 显存
- 暂无估算
查看详情暂无收录命令
本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。
- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- LLaMA 2 Community
- 上下文
- 4k
- 国内可达
- 需代理
当前运行配置
DavidAU/Qwen3.5-9B-The-Defiant-Fable-Uncensored-Heretic-NEO-IMATRIX-MAX-MTP-GGUF- 显存
- ~19GB BF16(估算)
查看详情查看运行方式
llama-server -hf DavidAU/Qwen3.5-9B-The-Defiant-Fable-Uncensored-Heretic-NEO-IMATRIX-MAX-MTP-GGUF- 许可证
- Apache 2.0
- 上下文
- 256k
- 国内可达
- 需代理
当前运行配置
neureps/warmly-qwen35-08b-enko-gguf- 显存
- 暂无估算
查看详情查看运行方式
ollama run hf.co/neureps/warmly-qwen35-08b-enko-gguf- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- Apache-2.0
- 国内可达
- 需代理
当前运行配置
DavidAU/Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF- 显存
- ~57GB BF16(估算)
查看详情查看运行方式
ollama run hf.co/DavidAU/Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF- 许可证
- Apache 2.0
- 上下文
- 256k
- 国内可达
- 需代理
当前运行配置
fattis/FrickFritz-4B-GGUF- 显存
- 暂无估算
查看详情查看运行方式
ollama run hf.co/fattis/FrickFritz-4B-GGUF- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- apache-2.0
- 国内可达
- 需代理
ThinkingCap-Qwen3.6-27B (bottlecapai)
量化自 ThinkingCap-Qwen3.6-27B
视觉语言模型,思考令牌减半,GGUF量化,适合本地运行
- 参数量
- 27B
- 商用
- 需自查
当前运行配置
bottlecapai/ThinkingCap-Qwen3.6-27B-GGUF- 显存
- 暂无估算
查看详情查看运行方式
llama-server -hf bottlecapai/ThinkingCap-Qwen3.6-27B-GGUF:Q4_K_M --mmproj bottlecapai/ThinkingCap-Qwen3.6-27B-GGUF:mmproj-ThinkingCap-Qwen3.6-27B-f16.gguf- 为何暂无估算
- 权重格式未知,无法估算显存
- 国内可达
- 需代理
当前运行配置
sahilchachra/Unlimited-OCR-GGUF- 显存
- 暂无估算
查看详情查看运行方式
huggingface-cli download sahilchachra/Unlimited-OCR-GGUF --include Unlimited-OCR-Q4_K_M.gguf mmproj-Unlimited-OCR-F16.gguf --local-dir ./uocr- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- MIT
- 国内可达
- 需代理
当前运行配置
PaddlePaddle/PP-OCRv6_medium_det_safetensors- 显存
- 暂无估算
DiffusionGemma-26B-A4B-it (Google)
量化自 diffusiongemma-26B-A4B-it
离散扩散文本生成,支持图像/视频输入,低延迟
- 参数量
- 25.2B (3.8B active)
- 商用
- 可商用
当前运行配置
unsloth/diffusiongemma-26B-A4B-it-GGUF- 显存
- 暂无估算
查看详情查看运行方式
DiffusionGemmaForBlockDiffusion.from_pretrained("google/diffusiongemma-26B-A4B-it", device_map="auto")- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- Apache 2.0
- 上下文
- 256k
- 国内可达
- 需代理
Gemma-4-31B-QAT-GGUF (unsloth)
量化自 gemma-4-31B-it-qat-q4_0-unquantized
Gemma 4 31B 量化图文模型,支持工具调用,本地部署
- 参数量
- 31B
- 商用
- 可商用
当前运行配置
unsloth/gemma-4-31B-it-qat-GGUF- 显存
- 暂无估算
查看详情查看运行方式
llama-server -hf unsloth/gemma-4-31B-it-qat-GGUF:UD-Q4_K_XL --spec-type draft-mtp --spec-draft-n-max 4 -ngl 999- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- apache-2.0
- 上下文
- 256k
- 国内可达
- 需代理
- 其它形态
- GGUF·unsloth · GGUF·google · GGUF·lmstudio
Gemma-4-26B-A4B-QAT-GGUF (Unsloth)
量化自 gemma-4-26B-A4B-it-qat-q4_0-unquantized
Gemma 4 26B MoE 量化版,用于本地图像与文本推理
- 参数量
- 25.2B (3.8B active)
- 商用
- 可商用
当前运行配置
lmstudio-community/gemma-4-12B-it-GGUF- 显存
- 暂无估算
查看详情查看运行方式
ollama: ollama run hf.co/lmstudio-community/gemma-4-12B-it-GGUF:Q4_K_M- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- Apache 2.0
- 上下文
- 256k
- 国内可达
- 需代理
- 其它形态
- GGUF·lmstudio · GGUF·unsloth
当前运行配置
unsloth/Qwen3.6-27B-GGUF- 显存
- 暂无估算
查看详情查看运行方式
llama.cpp: ./main -m Qwen3.6-27B-Q4_K_M.gguf- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- apache-2.0
- 上下文
- 262k (可扩展至1M)
- 国内可达
- 需代理
- 其它形态
- GGUF·unsloth · GGUF·lmstudio · GGUF·unsloth·MTP
当前运行配置
HauhauCS/Gemma-4-E4B-Uncensored-HauhauCS-Aggressive- 显存
- 暂无估算
Qwen3.6-27B-Heretic-Uncensored-FINETUNE-NEO-CODE-Di-IMatrix-MAX-GGUF (DavidAU)
量化自 Qwen3.6-27B-Heretic2-Uncensored-Finetune-Thinking
解禁版Qwen3.6-27B量化模型,为创意写作与代码而生
- 参数量
- 27B
- 商用
- 可商用
当前运行配置
DavidAU/Qwen3.6-27B-Heretic-Uncensored-FINETUNE-NEO-CODE-Di-IMatrix-MAX-GGUF- 显存
- ~57GB BF16(估算)
查看详情查看运行方式
llama-server -hf DavidAU/Qwen3.6-27B-Heretic-Uncensored-FINETUNE-NEO-CODE-Di-IMatrix-MAX-GGUF- 许可证
- apache-2.0
- 上下文
- 256k
- 国内可达
- 需代理
Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive
量化自 Qwen3.6-35B-A3B
35B MoE多模态去审查模型,适合本地无限制输出
- 参数量
- 35B
- 商用
- 可商用
Qwen3.6-40B (DavidAU)
量化自 Qwen3.6-40B-Claude-4.6-Opus-Deckard-Heretic-Uncensored-Thinking
多模态无审查推理模型,面向代码与视觉应用
- 参数量
- 40B
- 商用
- 可商用
没有同时满足所选条件的模型,试着去掉一个筛选。
常见坑
- 276B 总参数使权重内存成为家庭实验室的实际瓶颈 —— unsloth/Inkling-Small-GGUF
- 需使用 add-inkling 分支的 llama.cpp 才能加载 Unsloth 量化版,mainline 无法直接加载 —— unsloth/Inkling-Small-GGUF
- 有社区用户对 Unsloth 的量化模型(如 GLM-4.6、Step-Flash)表示失望 —— unsloth/Inkling-Small-GGUF
- 代码生成幻觉严重,会编造不存在的API —— DavidAU/Qwen3.5-9B-The-Defiant-Fable-Uncensored-Heretic-NEO-IMATRIX-MAX-MTP-GGUF
- 推理链偶尔失控,思维token出现不可控状态 —— DavidAU/Qwen3.5-9B-The-Defiant-Fable-Uncensored-Heretic-NEO-IMATRIX-MAX-MTP-GGUF
- 在agentic coding方面仍落后于Claude —— DavidAU/Qwen3.5-9B-The-Defiant-Fable-Uncensored-Heretic-NEO-IMATRIX-MAX-MTP-GGUF
- MTP量化需温度<1且关闭重复惩罚,否则性能下降 —— DavidAU/Qwen3.5-9B-The-Defiant-Fable-Uncensored-Heretic-NEO-IMATRIX-MAX-MTP-GGUF
- 长时间运行可能感觉慢且不稳定 —— DavidAU/Qwen3.5-9B-The-Defiant-Fable-Uncensored-Heretic-NEO-IMATRIX-MAX-MTP-GGUF
展开其余 95 条
- DavidAU过往模型口碑参差,部分用户对其持保留态度 —— DavidAU/Qwen3.5-9B-The-Defiant-Fable-Uncensored-Heretic-NEO-IMATRIX-MAX-MTP-GGUF
- 基准测试分数与实际表现存在差距,不可全信榜单 —— DavidAU/Qwen3.5-9B-The-Defiant-Fable-Uncensored-Heretic-NEO-IMATRIX-MAX-MTP-GGUF
- 无法通过 strawberry 测试(字母计数),即使提示逐字符思考也失败 —— neureps/warmly-qwen35-08b-enko-gguf
- 存在 tokenization 导致的自身缺陷不自知问题,字符级推理能力弱 —— neureps/warmly-qwen35-08b-enko-gguf
- 在 Orange Pi Zero 2W 等超低功耗设备上运行速度极低 —— neureps/warmly-qwen35-08b-enko-gguf
- 编程基准得分仅 1.0,远低于同系列大尺寸模型(27B 得分 33.4,122B 得分 31.6) —— neureps/warmly-qwen35-08b-enko-gguf
- 不支持视觉(vision)输入 —— neureps/warmly-qwen35-08b-enko-gguf
- 与 opencode/ollama 的集成存在连接问题,可能让初次使用者觉得「完全不能用」 —— neureps/warmly-qwen35-08b-enko-gguf
- 部分 agentic 基准上基础模型表现略优于 ThinkingCap —— bottlecapai/ThinkingCap-Qwen3.6-27B-GGUF
- 训练分布外任务的性能未经评估,真实表现未知 —— bottlecapai/ThinkingCap-Qwen3.6-27B-GGUF
- FP16 全精度部署需约 60GB VRAM,本地部署门槛不低 —— bottlecapai/ThinkingCap-Qwen3.6-27B-GGUF
- 部分基准准确率有轻微波动,如 GPQA-Diamond 从 85.5 降至 83.8,MMLU-Pro 从 85.9 降至 85.4 —— bottlecapai/ThinkingCap-Qwen3.6-27B-GGUF
- 架构设计被质疑像是在 Transformer 里加 LSTM,存在争议 —— sahilchachra/Unlimited-OCR-GGUF
- 对长对话场景的适用性尚不明确 —— sahilchachra/Unlimited-OCR-GGUF
- HN 讨论量有限,缺乏大规模实际使用反馈 —— sahilchachra/Unlimited-OCR-GGUF
- 高精度仅限medium版本,tiny版本检测仅80.6%,差距明显 —— PaddlePaddle/PP-OCRv6_medium_det_safetensors
- 与VLM的对比基于PaddleOCR自有基准测试,并非独立评测 —— PaddlePaddle/PP-OCRv6_medium_det_safetensors
- 论文未提供独立第三方验证及手写或退化场景下的表现数据 —— PaddlePaddle/PP-OCRv6_medium_det_safetensors
- 各项基准上全面弱于 Gemma 4 26B A4B,Google 官方亦承认 —— unsloth/diffusiongemma-26B-A4B-it-GGUF
- 扩散式加速对 MoE 架构的增益属中等水平(社区对比单步并行 16 token、类 MTP 方案),并非无差别 4 倍 —— unsloth/diffusiongemma-26B-A4B-it-GGUF
- 速度优势依赖专用 GPU(独显/H100 级),普通硬件上难以发挥,自部署门槛不低 —— unsloth/diffusiongemma-26B-A4B-it-GGUF
- 官方定位实验性架构,社区口碑仍不及同门 Gemma 4 26B A4B,多属技术尝鲜而非日常主力 —— unsloth/diffusiongemma-26B-A4B-it-GGUF
- 个别实测 31B QAT 数学能力明显不如 Q8 —— unsloth/gemma-4-31B-it-qat-GGUF
- 同样实测反馈忽略系统提示、不调用工具 —— unsloth/gemma-4-31B-it-qat-GGUF
- 部分用户质疑专门选用 Unsloth GGUF 的必要性,认为自量化即可 —— unsloth/gemma-4-31B-it-qat-GGUF
- 社区对 QAT 与标准量化的对比基准数据存疑,认为需要更严谨验证或挑错 —— unsloth/gemma-4-31B-it-qat-GGUF
- 对比结果常被压成单一数字,易导致误读 —— unsloth/gemma-4-31B-it-qat-GGUF
- 追求速度时,NVFP4 等方案质量已接近 unsloth Q3 且快得多(如 GB10 等带宽受限设备) —— unsloth/gemma-4-31B-it-qat-GGUF
- 与 Qwen3.6-27B 等主流竞品的选择之争仍缺社区实证结论 —— unsloth/gemma-4-31B-it-qat-GGUF
- 编程输出简单粗暴:常给出非常基础、缺失小细节的代码,问题会随时间累积放大,即使给很具体的指令也一样(2) —— unsloth/gemma-4-26B-A4B-it-qat-GGUF
- 在线实时场景速度不够:1.63s TTFT 与 46.7 t/s 对 live、面向用户的应用没有竞争力,更偏原型用途(8) —— unsloth/gemma-4-26B-A4B-it-qat-GGUF
- 48k 有效上下文在一些后端支持仍较粗糙(4) —— unsloth/gemma-4-26B-A4B-it-qat-GGUF
- vLLM 明显慢于 llama.cpp:约 30 t/s 对 51.57 t/s,选对推理后端很重要(14) —— unsloth/gemma-4-26B-A4B-it-qat-GGUF
- 内存不足的机器(如低配 M3 Max)无法把上下文扩到实用程度(6) —— unsloth/gemma-4-26B-A4B-it-qat-GGUF
- 智能/编程/智能体榜单排名中游:整体智能 #112/393、编程 #60/157、智能体 #139/300(10) —— unsloth/gemma-4-26B-A4B-it-qat-GGUF
- 量化版本口碑两极:有用户在特定 Q4_K_M 上体验极差并称「最差模型」,社区建议换用 Bartowski 的量化(1)(3) —— unsloth/gemma-4-26B-A4B-it-qat-GGUF
- 共享 GPU 环境下并发扩展的实际效率必然低于理想线性扩展(11) —— unsloth/gemma-4-26B-A4B-it-qat-GGUF
- 多轮对话后会出现奇怪的循环(looping)现象,影响长对话体验。 —— lmstudio-community/gemma-4-12B-it-GGUF
- 官方 naive Q4_0 GGUF 被指丢失原始 safetensors 中的质量,需换用 Dynamic 量化版本。 —— lmstudio-community/gemma-4-12B-it-GGUF
- Ollama 生态只提供官方少量量化,社区认为用 Hugging Face 上的量化更优化、选择更自由。 —— lmstudio-community/gemma-4-12B-it-GGUF
- 本地默认推理设置可能反而拉低表现,需要手动调优才能发挥模型实力。 —— lmstudio-community/gemma-4-12B-it-GGUF
- 多模态输入有限制:音频最长 30 秒,视频最长 60 秒(按 1fps 处理)。 —— lmstudio-community/gemma-4-12B-it-GGUF
- 进一步微调可能覆盖模型已有的专用抽取能力,二进制权重发布方式不利于需要持续重训的生产管道 —— numind/NuExtract3
- 0.8B–9B 尺寸模型在 2–3 轮对话后输出乱码,可靠性存疑 —— unsloth/Qwen3.5-9B-MTP-GGUF
- MTP 对通用叙事/闲聊对话的加速效果不明显 —— unsloth/Qwen3.5-9B-MTP-GGUF
- Unsloth GGUF 比同类量化慢约 30%,且后续回复处理时间更长 —— unsloth/Qwen3.5-9B-MTP-GGUF
- Unsloth Studio 更新后可能导致 MTP 功能突然失效 —— unsloth/Qwen3.5-9B-MTP-GGUF
- Bartowski 量化在输出质量/「聪明程度」上优于 Unsloth 量化 —— unsloth/Qwen3.5-9B-MTP-GGUF
- q4_0 量化质量较差,不推荐使用 —— unsloth/Qwen3.5-9B-MTP-GGUF
- 长上下文会显著降低工具调用性能 —— unsloth/Qwen3.5-9B-MTP-GGUF
- 未启用 MTP 的旧版 GGUF/MLX 中 MTP 层闲置浪费 VRAM —— unsloth/Qwen3.5-9B-MTP-GGUF
- MLX 模型质量明显不如 GGUF,不推荐使用 —— unsloth/Qwen3.5-9B-MTP-GGUF
- Imatrix 量化虽降低 KLD/PPL,但推理速度会降低 5–10% —— unsloth/Qwen3.5-9B-MTP-GGUF
- 基准测试表现可能高于实际使用体验,部分场景实测不如 Gemma 4 —— unsloth/Qwen3.6-27B-GGUF
- 部分编程工具 (如 qwencode) 实际体验不佳 —— unsloth/Qwen3.6-27B-GGUF
- 与 DeepSeek Flash 相比仍有明显差距 —— unsloth/Qwen3.6-27B-GGUF
- 低量化版本 (IQ2_M) 仅保留全精度约 83% 的质量 —— unsloth/Qwen3.6-27B-GGUF
- 社区微调变体改变了原始模型行为,非纯原版 Qwen3.6 —— unsloth/Qwen3.6-27B-GGUF
- 缺乏 27B 版本的 tool-eval-bench 可比得分数据 —— unsloth/Qwen3.6-27B-GGUF
- thinking 模式下配合代码解释器时经常只写完代码就停止、不出最终输出(非 thinking 模式正常) —— unsloth/Qwen3.6-35B-A3B-GGUF
- Q8_K_XL 档在基准上表现令人失望:解出的测试更少、报错更多,反不如 Qwen3.5 —— unsloth/Qwen3.6-35B-A3B-GGUF
- Q3 档位被用户认为不够可靠 —— unsloth/Qwen3.6-35B-A3B-GGUF
- 同硬件下速度弱于部分第三方量化(实测 23 TK/sec vs 30 TK/sec) —— unsloth/Qwen3.6-35B-A3B-GGUF
- 推理速度仍明显慢于 Claude Sonnet 4.6 —— unsloth/Qwen3.6-35B-A3B-GGUF
- 知识储备不如更大的 Qwen3 Next 80B,做离线知识库时差距明显 —— unsloth/Qwen3.6-35B-A3B-GGUF
- 不同厂商量化的质量/速度差异大,ByteShape 声称其量化更快更小且保留更多基准分 —— unsloth/Qwen3.6-35B-A3B-GGUF
- 在相同设置下不同量化的失败表现各不相同,质量以观感为准 —— unsloth/Qwen3.6-35B-A3B-GGUF
- 实际编程体验明显落后于 Qwen3.5 —— HauhauCS/Gemma-4-E4B-Uncensored-HauhauCS-Aggressive
- OpenRouter 上推理速度极慢,几乎不可用 —— HauhauCS/Gemma-4-E4B-Uncensored-HauhauCS-Aggressive
- 长距离约束跟踪能力不如更大模型 —— HauhauCS/Gemma-4-E4B-Uncensored-HauhauCS-Aggressive
- 部分用户认为 DavidAU 模型比基础模型"less intelligent" —— DavidAU/Qwen3.6-27B-Heretic-Uncensored-FINETUNE-NEO-CODE-Di-IMatrix-MAX-GGUF
- Heretic 模型有时会丢失非英语语言能力 —— DavidAU/Qwen3.6-27B-Heretic-Uncensored-FINETUNE-NEO-CODE-Di-IMatrix-MAX-GGUF
- Ollama 需手动添加模型,无法直接拉取使用 —— DavidAU/Qwen3.6-27B-Heretic-Uncensored-FINETUNE-NEO-CODE-Di-IMatrix-MAX-GGUF
- Q8_0 量化高负载下约 18.71 tok/s,速度有限 —— DavidAU/Qwen3.6-27B-Heretic-Uncensored-FINETUNE-NEO-CODE-Di-IMatrix-MAX-GGUF
- 没有 MLX 版本 —— DavidAU/Qwen3.6-27B-Heretic-Uncensored-FINETUNE-NEO-CODE-Di-IMatrix-MAX-GGUF
- 40B 版本(基于 27B)速度太慢不宜实用 —— DavidAU/Qwen3.6-27B-Heretic-Uncensored-FINETUNE-NEO-CODE-Di-IMatrix-MAX-GGUF
- 有用户建议如果只需要 uncensored 可以用 llmfan46 的版本作为替代 —— DavidAU/Qwen3.6-27B-Heretic-Uncensored-FINETUNE-NEO-CODE-Di-IMatrix-MAX-GGUF
- 显存需求高:Q4_K_P约20GB,Q6_K_P 31GB,Q8_K_P 44GB;多模态需额外加载mmproj(899MB)。 —— HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive
- 某些推理框架(如llama.cpp)需手动设置`--jinja`或`enable_thinking:false`以关闭思维链。 —— HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive
- Aggressive变体虽无拒绝但可能输出简短免责声明(基座训练固有),并非完全空白。 —— HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive
- 量化版本众多(含K_P自定义量化),需注意HF硬件兼容性组件不识别K_P,需手动查看文件列表。 —— HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive
- 对提示词更敏感,含糊或欠约束的输入容易漂移,需明确写出格式、约束、范围 —— HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive
- 官方未提供与基座的独立对比基准,去审查对推理、编码、事实准确性的影响未经验证 —— HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive
- 基座本身在多数评测中并不优于 3.5 基座 —— HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive
- 表现高度依赖硬件配置与运行时优化 —— HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive
- 复杂场景下可能产生不正确、不完整或不一致的输出 —— HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive
- 量化 GGUF 变体的能力受量化影响,作者报告的零拒绝结果未经独立复测 —— HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive
- AWQ 版本系社区多次请求后才放出,作者曾计划在额度获批后补充 BF16 —— HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive
- 不同去审查技术在边缘用例上的行为可能不同,选型需实测 —— HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive
- 质量存在争议,有用户认为「好坏难说」 —— DavidAU/Qwen3.6-40B-Claude-4.6-Opus-Deckard-Heretic-Uncensored-Thinking-NEO-CODE-Di-IMatrix-MAX-GGUF
- 相比 27B 基座模型提升不明显,有用户认为 40B 未表现出更强能力 —— DavidAU/Qwen3.6-40B-Claude-4.6-Opus-Deckard-Heretic-Uncensored-Thinking-NEO-CODE-Di-IMatrix-MAX-GGUF
- 基准测试数据为开发者团队自测,未经第三方独立验证 —— DavidAU/Qwen3.6-40B-Claude-4.6-Opus-Deckard-Heretic-Uncensored-Thinking-NEO-CODE-Di-IMatrix-MAX-GGUF
- MTP 量化模式需严格控制温度 < 1 且 repetition penalty = 1,否则性能下降 —— DavidAU/Qwen3.6-40B-Claude-4.6-Opus-Deckard-Heretic-Uncensored-Thinking-NEO-CODE-Di-IMatrix-MAX-GGUF
- 40B 参数规模需要服务器级 GPU,不适用于消费级硬件 —— DavidAU/Qwen3.6-40B-Claude-4.6-Opus-Deckard-Heretic-Uncensored-Thinking-NEO-CODE-Di-IMatrix-MAX-GGUF
- 视频实测中 40B 未能完成提示设定的核心功能,速度也慢于 27B+MTP —— DavidAU/Qwen3.6-40B-Claude-4.6-Opus-Deckard-Heretic-Uncensored-Thinking-NEO-CODE-Di-IMatrix-MAX-GGUF