指南 / 智能体模型
智能体模型
共 25 个 · 数据更新于 2026-07-19
显存档为包含式:更低显存也能跑的模型一并计入。数值取 Q4 量化后估算。
| 模型 | 参数量 | 显存门槛 | 上下文 | 许可证 | 商用 | 语言 | 国内可达 | 部署 |
|---|---|---|---|---|---|---|---|---|
| Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V3 (LuffyTheFox) | 35B (3B 激活) | Q4 ~23GB / FP16 ~84GB | 262K (可扩展至 1M) | Apache-2.0 | 需自查 | — | 需代理 | llama-server -hf LuffyTheFox/Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V3-GGUF --jinja |
| MiniCPM5-1B-Claude-Opus-Fable5-V2-Thinking (GnLOLot) 量化自 MiniCPM5-1B-Claude-Opus-Fable5-V2-Thinking | 1B | Q4 ~0.7GB / FP16 ~2.4GB | 128k | Apache-2.0 | 需自查 | — | 需代理 | ollama run hf.co/GnLOLot/MiniCPM5-1B-Claude-Opus-Fable5-V2-Thinking-GGUF 等 2 种 |
| MaralGPT-Mythos-9B (MaralGPT) 量化自 Qwen3.5-9B | 9B | Q4 ~5.9GB / FP16 ~22GB | 1M | apache-2.0 | 需自查 | — | 需代理 | ollama run hf.co/MaralGPT/MaralGPT-Mythos-9B-2606-GGUF |
| Gemma-4-12B Agentic v2 (yuxinlu1) 微调自 gemma-4-12B-it 原生 · GGUF | 12B | Q4 ~7.9GB / FP16 ~29GB | 16k(示例命令) | Apache-2.0 | 需自查 | — | 需代理 | llama-server -hf yuxinlu1/gemma-4-12B-agentic-fable5-composer2.5-v2-3.5x-tau2-GGUF -ngl 99 --jinja |
| Gemma4-26B-A4B (HauhauCS) | 26B-A4B | — | 256k | gemma | 需自查 | — | 需代理 | llama-server -m Gemma4-26B-A4B-QAT-Uncensored-HauhauCS-Balanced-Q4_K_M.gguf --mmproj mmproj-Gemma4-26B-A4B-QAT-Uncensored-HauhauCS-Balanced-BF16.gguf -md mtp-gemma-4-26B-A4B-it.gguf --spec-type draft-mtp -ngl 99 -fa on (需下载3个文件) |
| Huihui-Qwythos-9B-1M (huihui-ai) | 9B | — | 1M | apache-2.0 | 需自查 | — | 需代理 | llama-cli -hf huihui-ai/Huihui-Qwythos-9B-Claude-Mythos-5-1M-abliterated-GGUF --model Huihui-Qwythos-9B-Claude-Mythos-5-1M-abliterated-Q4_K.gguf -ngl 99 -c 262144 -fa on -np 1 --spec-type draft-mtp --spec-draft-n-max 2 |
| Qwopus-3.6-35B-A3B-Coder (Jackrong) LoRA · 基于 Qwopus3.6-35B-A3B-v1 | 35B (3B 激活) | — | — | Apache-2.0 | 需自查 | — | 需代理 | llama-server -hf Jackrong/Qwopus3.6-35B-A3B-Coder-MTP-GGUF -m qwopus-35b-a3b-coder-q5_k_m.gguf 等 2 种 |
| Qwen-AgentWorld-35B-A3B (Qwen) 量化自 Qwen-AgentWorld-35B-A3B 原生 · GGUF | 35B (3B激活) | Q4 ~23GB / FP16 ~83GB | 262k | Apache-2.0 | 需自查 | — | 魔搭可用 | vllm serve Qwen/Qwen-AgentWorld-35B-A3B --port 8000 --tensor-parallel-size 4 --max-model-len 262144 --reasoning-parser qwen3 --trust-remote-code 等 2 种 |
| Gemma-4-31B-it (Google) 量化自 gemma-4-31B-it | 31B | — | — | gemma | 需自查 | — | 需代理 | ollama run hf.co/pearsonkyle/gemma-4-31b-imatrix-GGUF:IQ2_M 等 2 种 |
| Qwen3.6-27B-AEON-Uncensored (AEON-7) 量化自 Qwen3.6-27B-AEON-Ultimate-Uncensored-BF16 | 27B | — | — | apache-2.0 | 需自查 | — | 需代理 | ollama run hf.co/mradermacher/Qwen3.6-27B-AEON-Ultimate-Uncensored-BF16-GGUF:Q4_K_M 等 2 种 |
| Qwen3.6-27B-Uncensored (AEON-7/mradermacher) 量化自 Qwen3.6-27B-AEON-Ultimate-Uncensored-BF16 | 27B | — | — | apache-2.0 | 需自查 | — | 需代理 | llama-server -hf mradermacher/Qwen3.6-27B-AEON-Ultimate-Uncensored-BF16-GGUF 等 2 种 |
| Gemma4-12B-Uncensored (HauhauCS) 量化自 gemma-4-12B-it | 12B | — | 256K | gemma | 需自查 | — | 需代理 | llama-server -m Gemma4-12B-QAT-Uncensored-HauhauCS-Balanced-Q4_K_M.gguf -md mtp-gemma-4-12B-it.gguf --spec-type draft-mtp --mmproj mmproj-Gemma4-12B-QAT-Uncensored-HauhauCS-Balanced-BF16.gguf -ngl 99 -fa on (需先下载gguf及mmproj文件) |
| Qwopus3.6-27B-Coder (Jackrong) 量化自 Qwopus3.6-27B-Coder | 27B | — | 32K | apache-2.0 | 需自查 | — | 需代理 | llama-server -hf Jackrong/Qwopus3.6-27B-Coder-Compat-MTP-GGUF (需代理下载) |
| Qwythos-9B (Empero) 微调自 Qwen3.5-9B 原生 · GGUF | 9B | Q4 ~6.2GB / FP16 ~23GB | 1M | Apache 2.0 | 需自查 | — | 需代理 | vllm serve empero-ai/Qwythos-9B-Claude-Mythos-5-1M --max-model-len 1010000 等 2 种 |
| SIQ-1-35B (AlexWortega) | 35B (3B激活) | — | 131k | Apache-2.0 | 需自查 | — | 需代理 | python -m sglang.launch_server --model-path AlexWortega/SIQ-1-35B --tp 2 --context-length 131072 --reasoning-parser qwen3 --tool-call-parser qwen3 --port 8080 等 3 种 |
| Qwen3.6-27B-MTP-pi-tune (bytkim) 量化自 Qwen3.6-27B | 27B | — | 256k | Apache-2.0 | 可商用 | — | 需代理 | ollama run hf.co/bytkim/Qwen3.6-27B-MTP-pi-tune-GGUF 等 3 种 |
| Qwopus-3.6-27B-Coder (Jackrong) LoRA · 基于 Qwopus3.6-27B-v2 GGUF·jackrong · GGUF·jackrong·MTP | 27B | — | 32K | Apache-2.0 | 可商用 | — | 需代理 | llama-server -hf Jackrong/Qwopus3.6-27B-Coder-GGUF |
| Qwable-v1 (lordx64) 微调自 Qwen3.6-35B-A3B-Claude-4.7-Opus-Reasoning-Distilled | 35B (3B 激活) | Q4 ~24GB / FP16 ~86GB | — | AGPL-3.0 | 可商用 | — | 需代理 | llama-cli -hf lordx64/Qwable-v1-GGUF:IQ4_XS -p "Hello"(需代理) 等 2 种 |
| North-Mini-Code-1.0 (CohereLabs) 量化自 North-Mini-Code-1.0 原生 · GGUF | 30B总 / 3B激活 | Q4 ~20GB / FP16 ~73GB | 256K | Apache-2.0 | 可商用 | — | 需代理 | vllm serve CohereLabs/North-Mini-Code-1.0 等 2 种 |
| MiniCPM5-1B (OpenBMB) 原生 · GGUF | 1B | Q4 ~0.7GB / FP16 ~2.6GB | 128k | apache-2.0 | 可商用 | — | 魔搭可用 | vllm serve openbmb/MiniCPM5-1B --port 8000 等 3 种 |
| Qwopus3.6-27B-v2-MTP-GGUF (Jackrong) LoRA · 基于 Qwen3.6-27B GGUF·jackrong·MTP · GGUF·jackrong | 27B | — | 128k | Apache 2.0 | 可商用 | — | 需代理 | llama.cpp server -m qwopus3.6-27b-v2-mtp.Q4_K_M.gguf -ngl 99 等 2 种 |
| Qwopus3.5-9B-Coder-MTP (Jackrong) LoRA · 基于 Qwopus3.5-9B-v3.5 GGUF·jackrong·MTP · GGUF·jackrong | 9B | — | 128k | apache-2.0 | 可商用 | — | 需代理 | ollama run hf.co/Jackrong/Qwopus3.5-9B-Coder-MTP-GGUF:Q4_K_M 等 3 种 |
| SuperGemma4-26B (Jiunsong) 量化自 gemma-4-26B-A4B-it | 26B (4-bit) | Q4 ~17GB / FP16 ~61GB | — | gemma | 限制商用 | — | 需代理 | mlx_lm.server --model Jiunsong/supergemma4-26b-uncensored-mlx-4bit-v2 等 2 种 |
| Gemma4-26B-A4B-Uncensored-Balanced (HauhauCS) 量化自 gemma-4-26B-A4B-it | 26B (25.2B total, 3.8B active) | — | 256K | Apache-2.0 | 可商用 | — | 需代理 | llama-server -m Gemma4-26B-A4B-Uncensored-HauhauCS-Balanced-Q4_K_P.gguf --mmproj mmproj-Gemma4-26B-A4B-Uncensored-HauhauCS-Balanced-f16.gguf --jinja -c 32768 -ngl 99 |
| SuperGemma4-26B-Uncensored (Jiunsong) 量化自 gemma-4-26B-A4B-it | 26B | — | — | gemma | 限制商用 | — | 需代理 | ollama run hf.co/Jiunsong/supergemma4-26b-uncensored-gguf-v2 等 3 种 |
没有同时满足所选条件的模型,试着去掉一个筛选。
常见坑
- 系统提示词必须以特定首行开头,否则模型表现可能下降 —— LuffyTheFox/Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V3-GGUF
- 量化低于 Q4_K_P 时编程能力显著下降 —— LuffyTheFox/Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V3-GGUF
- Plus 版本因一致性基准测试失败已被作者撤回 —— LuffyTheFox/Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V3-GGUF
- Wasserstein(非 Plus)版本仅修复 SSM 层漂移,未修复死神经元 —— LuffyTheFox/Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V3-GGUF
- 不同版本的推荐量化格式不同(Genesis 推荐 MXFP4_MOE,Wasserstein 推荐 Q4_K_P) —— LuffyTheFox/Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V3-GGUF
- 量化低于 Q4 时模型性能严重退化 —— yuxinlu1/gemma-4-12B-agentic-fable5-composer2.5-v2-3.5x-tau2
- 实际 agentic 工具调用场景中简单工具调用仍不可靠 —— yuxinlu1/gemma-4-12B-agentic-fable5-composer2.5-v2-3.5x-tau2
- 同尺寸竞品 Qwen 3.5 9B 在 5/8 项基准测试中胜出,且参数量更小 —— yuxinlu1/gemma-4-12B-agentic-fable5-composer2.5-v2-3.5x-tau2
展开其余 66 条
- encoder-free 架构较新,社区适配和调试存在一定门槛 —— yuxinlu1/gemma-4-12B-agentic-fable5-composer2.5-v2-3.5x-tau2
- 该微调为社区实验性产物,非官方发布 —— yuxinlu1/gemma-4-12B-agentic-fable5-composer2.5-v2-3.5x-tau2
- 定性/创意类任务的实际表现可能不同于基准分数 —— yuxinlu1/gemma-4-12B-agentic-fable5-composer2.5-v2-3.5x-tau2
- 在工具调用/自定义 harness 编码评测中表现显著弱于其单次编码成绩,实际 agent 场景可靠性存疑 —— HauhauCS/Gemma4-26B-A4B-QAT-Uncensored-HauhauCS-Balanced-MTP
- HauhauCS 作者在社区中拒绝与用户讨论和对话,引发部分用户不满 —— HauhauCS/Gemma4-26B-A4B-QAT-Uncensored-HauhauCS-Balanced-MTP
- 去审查版本有时需要先「说服自己」才能输出,并非所有场景都立即响应 —— HauhauCS/Gemma4-26B-A4B-QAT-Uncensored-HauhauCS-Balanced-MTP
- HauhauCS 的 31B 版本已宣布但尚未发布,目前仅有 26B 和更小的 E4B/E2B 可用 —— HauhauCS/Gemma4-26B-A4B-QAT-Uncensored-HauhauCS-Balanced-MTP
- 不同 API 提供商之间性能差异巨大,TTFT 从 0.68s 到 5.51s 不等,输出速度相差近 5 倍 —— HauhauCS/Gemma4-26B-A4B-QAT-Uncensored-HauhauCS-Balanced-MTP
- 在编码/agent 任务上明显落后于 Qwen3.6-35B-A3B(Terminal-Bench 2.0 差距 +8.6 分) —— HauhauCS/Gemma4-26B-A4B-QAT-Uncensored-HauhauCS-Balanced-MTP
- 社区有反馈称其实际表现与模型卡上的全面提升描述存在落差,有时甚至弱于前代 —— HauhauCS/Gemma4-26B-A4B-QAT-Uncensored-HauhauCS-Balanced-MTP
- 首批样本生成存在部分错误,官方已对两个失败模式进行复测 —— huihui-ai/Huihui-Qwythos-9B-Claude-Mythos-5-1M-abliterated-GGUF
- 训练数据来自 Claude 会话日志合成的 CoT,非原生人类标注数据 —— huihui-ai/Huihui-Qwythos-9B-Claude-Mythos-5-1M-abliterated-GGUF
- 部分用户反映社区微调版本在实际使用中无法正常工作 —— Jackrong/Qwopus3.6-35B-A3B-Coder-MTP-GGUF
- 3.6 基础模型本身已减少过度思考,使得思考关闭微调的必要性降低 —— Jackrong/Qwopus3.6-35B-A3B-Coder-MTP-GGUF
- 定位模糊,官方未清晰说明其与通用聊天/指令模型的区别,导致社区困惑 —— Qwen/Qwen-AgentWorld-35B-A3B
- 从专家级难度起频繁输出空白,复杂任务上崩溃 —— Qwen/Qwen-AgentWorld-35B-A3B
- 不适合作为代码生成器使用 —— Qwen/Qwen-AgentWorld-35B-A3B
- 非标准聊天/指令模型,不能当作通用对话助手 —— Qwen/Qwen-AgentWorld-35B-A3B
- 推理过程较长 —— Qwen/Qwen-AgentWorld-35B-A3B
- 深度推理仍无法触及前沿闭源模型水平 —— pearsonkyle/gemma-4-31b-imatrix-GGUF
- 有用户表示 90% 的场景更偏好 Qwen 3.6 —— pearsonkyle/gemma-4-31b-imatrix-GGUF
- 在手机上运行速度偏慢 —— pearsonkyle/gemma-4-31b-imatrix-GGUF
- 有用户认为 Qwen 3.6 完全碾压 Gemma 4 —— pearsonkyle/gemma-4-31b-imatrix-GGUF
- DGX Spark 容器为 ARM64 + sm_121a 专用构建,不可移植到其他硬件 —— mradermacher/Qwen3.6-27B-AEON-Ultimate-Uncensored-BF16-i1-GGUF
- BF16 全精度权重需 52 GB 显存,消费级单卡难以承载 —— mradermacher/Qwen3.6-27B-AEON-Ultimate-Uncensored-BF16-i1-GGUF
- 作为 CLI 编程 agent(opencode)需较多调校,开箱体验不如 Claude Code —— mradermacher/Qwen3.6-27B-AEON-Ultimate-Uncensored-BF16-i1-GGUF
- M1 Mac(8 核/16GB)2bit 量化下生成速度仅约 5.9 tok/s —— mradermacher/Qwen3.6-27B-AEON-Ultimate-Uncensored-BF16-i1-GGUF
- DGX Spark 单流推理约 30–36 tok/s,远低于高端 Blackwell 的表现 —— mradermacher/Qwen3.6-27B-AEON-Ultimate-Uncensored-BF16-i1-GGUF
- 并非 Claude 替代品,社区认为这样比较的人要么没用过 Claude 要么在妄想 —— mradermacher/Qwen3.6-27B-AEON-Ultimate-Uncensored-BF16-GGUF
- BF16 全精度需 52GB 显存,单卡消费级跑不了 —— mradermacher/Qwen3.6-27B-AEON-Ultimate-Uncensored-BF16-GGUF
- DGX Spark 专用容器不可移植到其他硬件 —— mradermacher/Qwen3.6-27B-AEON-Ultimate-Uncensored-BF16-GGUF
- Aggressive 无审查变体被指「毫无个性」 —— mradermacher/Qwen3.6-27B-AEON-Ultimate-Uncensored-BF16-GGUF
- SVG 生成质量不稳定,曾出现「放飞自我」的输出 —— mradermacher/Qwen3.6-27B-AEON-Ultimate-Uncensored-BF16-GGUF
- 编码任务表现与 non-QAT 版本各有优劣,需按具体任务选择 —— HauhauCS/Gemma4-12B-QAT-Uncensored-HauhauCS-Balanced
- 仅 Q5_K_M 量化达到满分,其他量化级别(Q4/Q6/Q8)在特定解析器题目上存在差异 —— Jackrong/Qwopus3.6-27B-Coder-Compat-MTP-GGUF
- 与基础模型 Qwen3.6-27B 的全面对比评测仍在进行中,尚未完成 —— Jackrong/Qwopus3.6-27B-Coder-Compat-MTP-GGUF
- 上下文窗口增大后出现循环和错误操作,可能与采样参数设置有关 —— empero-ai/Qwythos-9B-Claude-Mythos-5-1M
- 非通用聊天模型,是推理模型,需严格按模型卡指定采样参数使用 —— empero-ai/Qwythos-9B-Claude-Mythos-5-1M
- MTP 在 max-token 设置较低时,代码质量可能不如搭配 Qwen3.5-0.8B 做 draft model 的方案 —— bytkim/Qwen3.6-27B-MTP-pi-tune-GGUF
- 在部分基准测试上仍落后于 Qwen3.5 27B 和 Gemma 4 31B,并非全面领先 —— bytkim/Qwen3.6-27B-MTP-pi-tune-GGUF
- SVG/图像生成质量不稳定,社区测试中与 GLM 5.1 等模型对比有明显差距 —— bytkim/Qwen3.6-27B-MTP-pi-tune-GGUF
- 日常快速响应场景下比 35B-A3B MoE 慢,不适合追求即时速度的轻量任务 —— bytkim/Qwen3.6-27B-MTP-pi-tune-GGUF
- FP8 精度下消费级 GPU 吞吐仍受限,缺乏 NVFP4 支持时理论速度约 38 tok/s —— bytkim/Qwen3.6-27B-MTP-pi-tune-GGUF
- 开启 thinking/reasoning 模式会增加延迟和 token 消耗 —— bytkim/Qwen3.6-27B-MTP-pi-tune-GGUF
- v2 前身版本出现过陷入循环的问题 —— Jackrong/Qwopus3.6-27B-Coder-GGUF
- 22K token 上下文下首 token 延迟约 115 秒,长上下文下实际可用性差 —— CohereLabs/North-Mini-Code-1.0
- 综合 benchmark 得分(28)明显弱于 Qwen 3.6 35B(43),非编码任务表现一般 —— CohereLabs/North-Mini-Code-1.0
- 有用户报告模型在测试中不到20分钟即陷入循环,输出重复内容 —— Jackrong/Qwopus3.6-27B-v2-MTP-GGUF
- 社区独立评测数据有限,缺乏大规模验证 —— Jackrong/Qwopus3.6-27B-v2-MTP-GGUF
- 工具调用不可靠,4-bit 变体经常漏掉工具调用并陷入参数猜测循环 —— Jiunsong/supergemma4-26b-uncensored-mlx-4bit-v2
- 使用工具和自定义 harness 写代码时表现反而比一次性生成更差 —— Jiunsong/supergemma4-26b-uncensored-mlx-4bit-v2
- 部分用户按模型卡推荐设置运行仍遇到模型输出异常或「坏掉」的情况 —— Jiunsong/supergemma4-26b-uncensored-mlx-4bit-v2
- 编程任务需将 temperature 降至 0.3 或更低,默认高温下容易产生大量低级错误 —— Jiunsong/supergemma4-26b-uncensored-mlx-4bit-v2
- 24GB 统一内存是最低舒适门槛,推荐 32GB 及以上 —— Jiunsong/supergemma4-26b-uncensored-mlx-4bit-v2
- 同家族的 31B 模型在同等量化下被认为明显更强 —— Jiunsong/supergemma4-26b-uncensored-mlx-4bit-v2
- 代码分析任务可能产生大量琐碎错误,有用户称之为「用过最差的模型」 —— Jiunsong/supergemma4-26b-uncensored-mlx-4bit-v2
- 2B-4B 等更小尺寸版本不支持工具调用 —— Jiunsong/supergemma4-26b-uncensored-mlx-4bit-v2
- 极端边缘提示首次仍可能回避(需重新提问才通过) —— HauhauCS/Gemma4-26B-A4B-Uncensored-HauhauCS-Balanced
- 编程/Agent 多轮任务显著落后于 Qwen3.6-35B-A3B(Terminal-Bench 2.0 差距约 8.6 分) —— HauhauCS/Gemma4-26B-A4B-Uncensored-HauhauCS-Balanced
- 使用工具/自定义 harness 进行代码评估时表现反而比单轮更差 —— HauhauCS/Gemma4-26B-A4B-Uncensored-HauhauCS-Balanced
- 创作者 HauhauCS 被社区批评拒绝与不同意见者对话、存在抄袭争议 —— HauhauCS/Gemma4-26B-A4B-Uncensored-HauhauCS-Balanced
- 模型卡显示全面提升但实际使用体验好坏参半 —— HauhauCS/Gemma4-26B-A4B-Uncensored-HauhauCS-Balanced
- 同硬件上推理速度慢于 Qwen3.6-35B-A3B(73.2 vs 81.6 tok/s) —— HauhauCS/Gemma4-26B-A4B-Uncensored-HauhauCS-Balanced
- 至少需要 24GB 统一内存,推荐 32GB 以上,部署门槛较高 —— Jiunsong/supergemma4-26b-uncensored-gguf-v2
- 暂无 2B-4B 小参数版本支持工具调用,社区有此类需求 —— Jiunsong/supergemma4-26b-uncensored-gguf-v2
- 工具调用功能在 v2 之前存在问题(v2 已修复) —— Jiunsong/supergemma4-26b-uncensored-gguf-v2