指南 / 智能体模型

智能体模型

共 25 个 · 数据更新于 2026-07-19

显存档为包含式:更低显存也能跑的模型一并计入。数值取 Q4 量化后估算。

模型参数量显存门槛上下文许可证商用语言国内可达部署
Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V3 (LuffyTheFox) 35B (3B 激活)Q4 ~23GB / FP16 ~84GB262K (可扩展至 1M)Apache-2.0需自查需代理llama-server -hf LuffyTheFox/Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V3-GGUF --jinja
MiniCPM5-1B-Claude-Opus-Fable5-V2-Thinking (GnLOLot)
量化自 MiniCPM5-1B-Claude-Opus-Fable5-V2-Thinking
1BQ4 ~0.7GB / FP16 ~2.4GB128kApache-2.0需自查需代理ollama run hf.co/GnLOLot/MiniCPM5-1B-Claude-Opus-Fable5-V2-Thinking-GGUF 等 2 种
MaralGPT-Mythos-9B (MaralGPT)
量化自 Qwen3.5-9B
9BQ4 ~5.9GB / FP16 ~22GB1Mapache-2.0需自查需代理ollama run hf.co/MaralGPT/MaralGPT-Mythos-9B-2606-GGUF
Gemma-4-12B Agentic v2 (yuxinlu1)
微调自 gemma-4-12B-it
原生 · GGUF
12BQ4 ~7.9GB / FP16 ~29GB16k(示例命令)Apache-2.0需自查需代理llama-server -hf yuxinlu1/gemma-4-12B-agentic-fable5-composer2.5-v2-3.5x-tau2-GGUF -ngl 99 --jinja
Gemma4-26B-A4B (HauhauCS) 26B-A4B256kgemma需自查需代理llama-server -m Gemma4-26B-A4B-QAT-Uncensored-HauhauCS-Balanced-Q4_K_M.gguf --mmproj mmproj-Gemma4-26B-A4B-QAT-Uncensored-HauhauCS-Balanced-BF16.gguf -md mtp-gemma-4-26B-A4B-it.gguf --spec-type draft-mtp -ngl 99 -fa on (需下载3个文件)
Huihui-Qwythos-9B-1M (huihui-ai) 9B1Mapache-2.0需自查需代理llama-cli -hf huihui-ai/Huihui-Qwythos-9B-Claude-Mythos-5-1M-abliterated-GGUF --model Huihui-Qwythos-9B-Claude-Mythos-5-1M-abliterated-Q4_K.gguf -ngl 99 -c 262144 -fa on -np 1 --spec-type draft-mtp --spec-draft-n-max 2
Qwopus-3.6-35B-A3B-Coder (Jackrong)
LoRA · 基于 Qwopus3.6-35B-A3B-v1
35B (3B 激活)Apache-2.0需自查需代理llama-server -hf Jackrong/Qwopus3.6-35B-A3B-Coder-MTP-GGUF -m qwopus-35b-a3b-coder-q5_k_m.gguf 等 2 种
Qwen-AgentWorld-35B-A3B (Qwen)
量化自 Qwen-AgentWorld-35B-A3B
原生 · GGUF
35B (3B激活)Q4 ~23GB / FP16 ~83GB262kApache-2.0需自查魔搭可用vllm serve Qwen/Qwen-AgentWorld-35B-A3B --port 8000 --tensor-parallel-size 4 --max-model-len 262144 --reasoning-parser qwen3 --trust-remote-code 等 2 种
Gemma-4-31B-it (Google)
量化自 gemma-4-31B-it
31Bgemma需自查需代理ollama run hf.co/pearsonkyle/gemma-4-31b-imatrix-GGUF:IQ2_M 等 2 种
Qwen3.6-27B-AEON-Uncensored (AEON-7)
量化自 Qwen3.6-27B-AEON-Ultimate-Uncensored-BF16
27Bapache-2.0需自查需代理ollama run hf.co/mradermacher/Qwen3.6-27B-AEON-Ultimate-Uncensored-BF16-GGUF:Q4_K_M 等 2 种
Qwen3.6-27B-Uncensored (AEON-7/mradermacher)
量化自 Qwen3.6-27B-AEON-Ultimate-Uncensored-BF16
27Bapache-2.0需自查需代理llama-server -hf mradermacher/Qwen3.6-27B-AEON-Ultimate-Uncensored-BF16-GGUF 等 2 种
Gemma4-12B-Uncensored (HauhauCS)
量化自 gemma-4-12B-it
12B256Kgemma需自查需代理llama-server -m Gemma4-12B-QAT-Uncensored-HauhauCS-Balanced-Q4_K_M.gguf -md mtp-gemma-4-12B-it.gguf --spec-type draft-mtp --mmproj mmproj-Gemma4-12B-QAT-Uncensored-HauhauCS-Balanced-BF16.gguf -ngl 99 -fa on (需先下载gguf及mmproj文件)
Qwopus3.6-27B-Coder (Jackrong)
量化自 Qwopus3.6-27B-Coder
27B32Kapache-2.0需自查需代理llama-server -hf Jackrong/Qwopus3.6-27B-Coder-Compat-MTP-GGUF (需代理下载)
Qwythos-9B (Empero)
微调自 Qwen3.5-9B
原生 · GGUF
9BQ4 ~6.2GB / FP16 ~23GB1MApache 2.0需自查需代理vllm serve empero-ai/Qwythos-9B-Claude-Mythos-5-1M --max-model-len 1010000 等 2 种
SIQ-1-35B (AlexWortega) 35B (3B激活)131kApache-2.0需自查需代理python -m sglang.launch_server --model-path AlexWortega/SIQ-1-35B --tp 2 --context-length 131072 --reasoning-parser qwen3 --tool-call-parser qwen3 --port 8080 等 3 种
Qwen3.6-27B-MTP-pi-tune (bytkim)
量化自 Qwen3.6-27B
27B256kApache-2.0可商用需代理ollama run hf.co/bytkim/Qwen3.6-27B-MTP-pi-tune-GGUF 等 3 种
Qwopus-3.6-27B-Coder (Jackrong)
LoRA · 基于 Qwopus3.6-27B-v2
GGUF·jackrong · GGUF·jackrong·MTP
27B32KApache-2.0可商用需代理llama-server -hf Jackrong/Qwopus3.6-27B-Coder-GGUF
Qwable-v1 (lordx64)
微调自 Qwen3.6-35B-A3B-Claude-4.7-Opus-Reasoning-Distilled
35B (3B 激活)Q4 ~24GB / FP16 ~86GBAGPL-3.0可商用需代理llama-cli -hf lordx64/Qwable-v1-GGUF:IQ4_XS -p "Hello"(需代理) 等 2 种
North-Mini-Code-1.0 (CohereLabs)
量化自 North-Mini-Code-1.0
原生 · GGUF
30B总 / 3B激活Q4 ~20GB / FP16 ~73GB256KApache-2.0可商用需代理vllm serve CohereLabs/North-Mini-Code-1.0 等 2 种
MiniCPM5-1B (OpenBMB)
原生 · GGUF
1BQ4 ~0.7GB / FP16 ~2.6GB128kapache-2.0可商用魔搭可用vllm serve openbmb/MiniCPM5-1B --port 8000 等 3 种
Qwopus3.6-27B-v2-MTP-GGUF (Jackrong)
LoRA · 基于 Qwen3.6-27B
GGUF·jackrong·MTP · GGUF·jackrong
27B128kApache 2.0可商用需代理llama.cpp server -m qwopus3.6-27b-v2-mtp.Q4_K_M.gguf -ngl 99 等 2 种
Qwopus3.5-9B-Coder-MTP (Jackrong)
LoRA · 基于 Qwopus3.5-9B-v3.5
GGUF·jackrong·MTP · GGUF·jackrong
9B128kapache-2.0可商用需代理ollama run hf.co/Jackrong/Qwopus3.5-9B-Coder-MTP-GGUF:Q4_K_M 等 3 种
SuperGemma4-26B (Jiunsong)
量化自 gemma-4-26B-A4B-it
26B (4-bit)Q4 ~17GB / FP16 ~61GBgemma限制商用需代理mlx_lm.server --model Jiunsong/supergemma4-26b-uncensored-mlx-4bit-v2 等 2 种
Gemma4-26B-A4B-Uncensored-Balanced (HauhauCS)
量化自 gemma-4-26B-A4B-it
26B (25.2B total, 3.8B active)256KApache-2.0可商用需代理llama-server -m Gemma4-26B-A4B-Uncensored-HauhauCS-Balanced-Q4_K_P.gguf --mmproj mmproj-Gemma4-26B-A4B-Uncensored-HauhauCS-Balanced-f16.gguf --jinja -c 32768 -ngl 99
SuperGemma4-26B-Uncensored (Jiunsong)
量化自 gemma-4-26B-A4B-it
26Bgemma限制商用需代理ollama run hf.co/Jiunsong/supergemma4-26b-uncensored-gguf-v2 等 3 种

常见坑

  • 系统提示词必须以特定首行开头,否则模型表现可能下降 —— LuffyTheFox/Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V3-GGUF
  • 量化低于 Q4_K_P 时编程能力显著下降 —— LuffyTheFox/Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V3-GGUF
  • Plus 版本因一致性基准测试失败已被作者撤回 —— LuffyTheFox/Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V3-GGUF
  • Wasserstein(非 Plus)版本仅修复 SSM 层漂移,未修复死神经元 —— LuffyTheFox/Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V3-GGUF
  • 不同版本的推荐量化格式不同(Genesis 推荐 MXFP4_MOE,Wasserstein 推荐 Q4_K_P) —— LuffyTheFox/Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V3-GGUF
  • 量化低于 Q4 时模型性能严重退化 —— yuxinlu1/gemma-4-12B-agentic-fable5-composer2.5-v2-3.5x-tau2
  • 实际 agentic 工具调用场景中简单工具调用仍不可靠 —— yuxinlu1/gemma-4-12B-agentic-fable5-composer2.5-v2-3.5x-tau2
  • 同尺寸竞品 Qwen 3.5 9B 在 5/8 项基准测试中胜出,且参数量更小 —— yuxinlu1/gemma-4-12B-agentic-fable5-composer2.5-v2-3.5x-tau2
展开其余 66 条
  • encoder-free 架构较新,社区适配和调试存在一定门槛 —— yuxinlu1/gemma-4-12B-agentic-fable5-composer2.5-v2-3.5x-tau2
  • 该微调为社区实验性产物,非官方发布 —— yuxinlu1/gemma-4-12B-agentic-fable5-composer2.5-v2-3.5x-tau2
  • 定性/创意类任务的实际表现可能不同于基准分数 —— yuxinlu1/gemma-4-12B-agentic-fable5-composer2.5-v2-3.5x-tau2
  • 在工具调用/自定义 harness 编码评测中表现显著弱于其单次编码成绩,实际 agent 场景可靠性存疑 —— HauhauCS/Gemma4-26B-A4B-QAT-Uncensored-HauhauCS-Balanced-MTP
  • HauhauCS 作者在社区中拒绝与用户讨论和对话,引发部分用户不满 —— HauhauCS/Gemma4-26B-A4B-QAT-Uncensored-HauhauCS-Balanced-MTP
  • 去审查版本有时需要先「说服自己」才能输出,并非所有场景都立即响应 —— HauhauCS/Gemma4-26B-A4B-QAT-Uncensored-HauhauCS-Balanced-MTP
  • HauhauCS 的 31B 版本已宣布但尚未发布,目前仅有 26B 和更小的 E4B/E2B 可用 —— HauhauCS/Gemma4-26B-A4B-QAT-Uncensored-HauhauCS-Balanced-MTP
  • 不同 API 提供商之间性能差异巨大,TTFT 从 0.68s 到 5.51s 不等,输出速度相差近 5 倍 —— HauhauCS/Gemma4-26B-A4B-QAT-Uncensored-HauhauCS-Balanced-MTP
  • 在编码/agent 任务上明显落后于 Qwen3.6-35B-A3B(Terminal-Bench 2.0 差距 +8.6 分) —— HauhauCS/Gemma4-26B-A4B-QAT-Uncensored-HauhauCS-Balanced-MTP
  • 社区有反馈称其实际表现与模型卡上的全面提升描述存在落差,有时甚至弱于前代 —— HauhauCS/Gemma4-26B-A4B-QAT-Uncensored-HauhauCS-Balanced-MTP
  • 首批样本生成存在部分错误,官方已对两个失败模式进行复测 —— huihui-ai/Huihui-Qwythos-9B-Claude-Mythos-5-1M-abliterated-GGUF
  • 训练数据来自 Claude 会话日志合成的 CoT,非原生人类标注数据 —— huihui-ai/Huihui-Qwythos-9B-Claude-Mythos-5-1M-abliterated-GGUF
  • 部分用户反映社区微调版本在实际使用中无法正常工作 —— Jackrong/Qwopus3.6-35B-A3B-Coder-MTP-GGUF
  • 3.6 基础模型本身已减少过度思考,使得思考关闭微调的必要性降低 —— Jackrong/Qwopus3.6-35B-A3B-Coder-MTP-GGUF
  • 定位模糊,官方未清晰说明其与通用聊天/指令模型的区别,导致社区困惑 —— Qwen/Qwen-AgentWorld-35B-A3B
  • 从专家级难度起频繁输出空白,复杂任务上崩溃 —— Qwen/Qwen-AgentWorld-35B-A3B
  • 不适合作为代码生成器使用 —— Qwen/Qwen-AgentWorld-35B-A3B
  • 非标准聊天/指令模型,不能当作通用对话助手 —— Qwen/Qwen-AgentWorld-35B-A3B
  • 推理过程较长 —— Qwen/Qwen-AgentWorld-35B-A3B
  • 深度推理仍无法触及前沿闭源模型水平 —— pearsonkyle/gemma-4-31b-imatrix-GGUF
  • 有用户表示 90% 的场景更偏好 Qwen 3.6 —— pearsonkyle/gemma-4-31b-imatrix-GGUF
  • 在手机上运行速度偏慢 —— pearsonkyle/gemma-4-31b-imatrix-GGUF
  • 有用户认为 Qwen 3.6 完全碾压 Gemma 4 —— pearsonkyle/gemma-4-31b-imatrix-GGUF
  • DGX Spark 容器为 ARM64 + sm_121a 专用构建,不可移植到其他硬件 —— mradermacher/Qwen3.6-27B-AEON-Ultimate-Uncensored-BF16-i1-GGUF
  • BF16 全精度权重需 52 GB 显存,消费级单卡难以承载 —— mradermacher/Qwen3.6-27B-AEON-Ultimate-Uncensored-BF16-i1-GGUF
  • 作为 CLI 编程 agent(opencode)需较多调校,开箱体验不如 Claude Code —— mradermacher/Qwen3.6-27B-AEON-Ultimate-Uncensored-BF16-i1-GGUF
  • M1 Mac(8 核/16GB)2bit 量化下生成速度仅约 5.9 tok/s —— mradermacher/Qwen3.6-27B-AEON-Ultimate-Uncensored-BF16-i1-GGUF
  • DGX Spark 单流推理约 30–36 tok/s,远低于高端 Blackwell 的表现 —— mradermacher/Qwen3.6-27B-AEON-Ultimate-Uncensored-BF16-i1-GGUF
  • 并非 Claude 替代品,社区认为这样比较的人要么没用过 Claude 要么在妄想 —— mradermacher/Qwen3.6-27B-AEON-Ultimate-Uncensored-BF16-GGUF
  • BF16 全精度需 52GB 显存,单卡消费级跑不了 —— mradermacher/Qwen3.6-27B-AEON-Ultimate-Uncensored-BF16-GGUF
  • DGX Spark 专用容器不可移植到其他硬件 —— mradermacher/Qwen3.6-27B-AEON-Ultimate-Uncensored-BF16-GGUF
  • Aggressive 无审查变体被指「毫无个性」 —— mradermacher/Qwen3.6-27B-AEON-Ultimate-Uncensored-BF16-GGUF
  • SVG 生成质量不稳定,曾出现「放飞自我」的输出 —— mradermacher/Qwen3.6-27B-AEON-Ultimate-Uncensored-BF16-GGUF
  • 编码任务表现与 non-QAT 版本各有优劣,需按具体任务选择 —— HauhauCS/Gemma4-12B-QAT-Uncensored-HauhauCS-Balanced
  • 仅 Q5_K_M 量化达到满分,其他量化级别(Q4/Q6/Q8)在特定解析器题目上存在差异 —— Jackrong/Qwopus3.6-27B-Coder-Compat-MTP-GGUF
  • 与基础模型 Qwen3.6-27B 的全面对比评测仍在进行中,尚未完成 —— Jackrong/Qwopus3.6-27B-Coder-Compat-MTP-GGUF
  • 上下文窗口增大后出现循环和错误操作,可能与采样参数设置有关 —— empero-ai/Qwythos-9B-Claude-Mythos-5-1M
  • 非通用聊天模型,是推理模型,需严格按模型卡指定采样参数使用 —— empero-ai/Qwythos-9B-Claude-Mythos-5-1M
  • MTP 在 max-token 设置较低时,代码质量可能不如搭配 Qwen3.5-0.8B 做 draft model 的方案 —— bytkim/Qwen3.6-27B-MTP-pi-tune-GGUF
  • 在部分基准测试上仍落后于 Qwen3.5 27B 和 Gemma 4 31B,并非全面领先 —— bytkim/Qwen3.6-27B-MTP-pi-tune-GGUF
  • SVG/图像生成质量不稳定,社区测试中与 GLM 5.1 等模型对比有明显差距 —— bytkim/Qwen3.6-27B-MTP-pi-tune-GGUF
  • 日常快速响应场景下比 35B-A3B MoE 慢,不适合追求即时速度的轻量任务 —— bytkim/Qwen3.6-27B-MTP-pi-tune-GGUF
  • FP8 精度下消费级 GPU 吞吐仍受限,缺乏 NVFP4 支持时理论速度约 38 tok/s —— bytkim/Qwen3.6-27B-MTP-pi-tune-GGUF
  • 开启 thinking/reasoning 模式会增加延迟和 token 消耗 —— bytkim/Qwen3.6-27B-MTP-pi-tune-GGUF
  • v2 前身版本出现过陷入循环的问题 —— Jackrong/Qwopus3.6-27B-Coder-GGUF
  • 22K token 上下文下首 token 延迟约 115 秒,长上下文下实际可用性差 —— CohereLabs/North-Mini-Code-1.0
  • 综合 benchmark 得分(28)明显弱于 Qwen 3.6 35B(43),非编码任务表现一般 —— CohereLabs/North-Mini-Code-1.0
  • 有用户报告模型在测试中不到20分钟即陷入循环,输出重复内容 —— Jackrong/Qwopus3.6-27B-v2-MTP-GGUF
  • 社区独立评测数据有限,缺乏大规模验证 —— Jackrong/Qwopus3.6-27B-v2-MTP-GGUF
  • 工具调用不可靠,4-bit 变体经常漏掉工具调用并陷入参数猜测循环 —— Jiunsong/supergemma4-26b-uncensored-mlx-4bit-v2
  • 使用工具和自定义 harness 写代码时表现反而比一次性生成更差 —— Jiunsong/supergemma4-26b-uncensored-mlx-4bit-v2
  • 部分用户按模型卡推荐设置运行仍遇到模型输出异常或「坏掉」的情况 —— Jiunsong/supergemma4-26b-uncensored-mlx-4bit-v2
  • 编程任务需将 temperature 降至 0.3 或更低,默认高温下容易产生大量低级错误 —— Jiunsong/supergemma4-26b-uncensored-mlx-4bit-v2
  • 24GB 统一内存是最低舒适门槛,推荐 32GB 及以上 —— Jiunsong/supergemma4-26b-uncensored-mlx-4bit-v2
  • 同家族的 31B 模型在同等量化下被认为明显更强 —— Jiunsong/supergemma4-26b-uncensored-mlx-4bit-v2
  • 代码分析任务可能产生大量琐碎错误,有用户称之为「用过最差的模型」 —— Jiunsong/supergemma4-26b-uncensored-mlx-4bit-v2
  • 2B-4B 等更小尺寸版本不支持工具调用 —— Jiunsong/supergemma4-26b-uncensored-mlx-4bit-v2
  • 极端边缘提示首次仍可能回避(需重新提问才通过) —— HauhauCS/Gemma4-26B-A4B-Uncensored-HauhauCS-Balanced
  • 编程/Agent 多轮任务显著落后于 Qwen3.6-35B-A3B(Terminal-Bench 2.0 差距约 8.6 分) —— HauhauCS/Gemma4-26B-A4B-Uncensored-HauhauCS-Balanced
  • 使用工具/自定义 harness 进行代码评估时表现反而比单轮更差 —— HauhauCS/Gemma4-26B-A4B-Uncensored-HauhauCS-Balanced
  • 创作者 HauhauCS 被社区批评拒绝与不同意见者对话、存在抄袭争议 —— HauhauCS/Gemma4-26B-A4B-Uncensored-HauhauCS-Balanced
  • 模型卡显示全面提升但实际使用体验好坏参半 —— HauhauCS/Gemma4-26B-A4B-Uncensored-HauhauCS-Balanced
  • 同硬件上推理速度慢于 Qwen3.6-35B-A3B(73.2 vs 81.6 tok/s) —— HauhauCS/Gemma4-26B-A4B-Uncensored-HauhauCS-Balanced
  • 至少需要 24GB 统一内存,推荐 32GB 以上,部署门槛较高 —— Jiunsong/supergemma4-26b-uncensored-gguf-v2
  • 暂无 2B-4B 小参数版本支持工具调用,社区有此类需求 —— Jiunsong/supergemma4-26b-uncensored-gguf-v2
  • 工具调用功能在 v2 之前存在问题(v2 已修复) —— Jiunsong/supergemma4-26b-uncensored-gguf-v2

收藏本页,或 订阅 RSS 追踪每日更新。