指南 / 智能体模型
智能体模型
共 57 个 · 数据更新于 2026-09-12
显存档为包含式:更低显存也能跑的模型一并计入。数值取 Q4 量化后估算。
当前运行配置
TokenRhythm/NeoHorse-1-4B- 显存
- 暂无估算
查看详情查看运行方式
vllm serve TokenRhythm/NeoHorse-1-4B --reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- Apache-2.0
- 上下文
- 262k (可扩至 1.01M)
- 国内可达
- 魔搭可用
当前运行配置
openbmb/MiniCPM5-2B- 显存
- 暂无估算
查看详情查看运行方式
llama-server -hf openbmb/MiniCPM5-2B-GGUF- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- Apache-2.0
- 上下文
- 131k
- 国内可达
- 魔搭可用
- 其它形态
- 原生 · GGUF
当前运行配置
Jackrong/Qwopus3.8-27B-Flash-GGUF- 显存
- 暂无估算
查看详情查看运行方式
llama-server -hf Jackrong/Qwopus3.8-27B-Flash-GGUF- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- apache-2.0
- 国内可达
- 需代理
当前运行配置
lmstudio-community/granite-4.2-3b-MLX-6bit- 显存
- 暂无估算
查看详情查看运行方式
mlx_lm.generate --model lmstudio-community/granite-4.2-3b-MLX-6bit- 为何暂无估算
- 已有格式线索,但估算映射未支持,无法估算显存
- 许可证
- apache-2.0
- 国内可达
- 需代理
当前运行配置
lmstudio-community/granite-4.2-8b-MLX-6bit- 显存
- 暂无估算
查看详情查看运行方式
mlx_lm.generate --model lmstudio-community/granite-4.2-8b-MLX-6bit- 为何暂无估算
- 已有格式线索,但估算映射未支持,无法估算显存
- 许可证
- apache-2.0
- 国内可达
- 需代理
当前运行配置
lmstudio-community/granite-4.2-30b-MLX-6bit- 显存
- 暂无估算
查看详情查看运行方式
mlx_lm.generate --model lmstudio-community/granite-4.2-30b-MLX-6bit --prompt "Hello"- 为何暂无估算
- 已有格式线索,但估算映射未支持,无法估算显存
- 许可证
- apache-2.0
- 国内可达
- 需代理
当前运行配置
lmstudio-community/granite-4.2-3b-MLX-8bit- 显存
- ~3.3GB 8-bit(估算)
查看详情查看运行方式
mlx_lm.generate --model lmstudio-community/granite-4.2-3b-MLX-8bit- 许可证
- apache-2.0
- 国内可达
- 需代理
- 其它形态
- 8bit · GGUF · 4bit
PhoneLLM Alpha 1 (Pipecat)
微调自 NVIDIA-Nemotron-3-Nano-30B-A3B-BF16
面向电话语音代理的 30B-A3B 微调模型
- 参数量
- 30B (3.5B 激活)
- 商用
- 需自查
当前运行配置
pipecat-ai/phonellm-alpha-1- 显存
- 暂无估算
查看详情查看运行方式
vllm serve pipecat-ai/phonellm-alpha-1 --trust-remote-code- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- BSD-2-Clause(含 NVIDIA Nemotron Open Model License)
- 上下文
- 262k
- 国内可达
- 需代理
当前运行配置
orcarouter/Qwen3.8-Flash-Next-Uncensored-GGUF- 显存
- 暂无估算
查看详情查看运行方式
llama-server -hf orcarouter/Qwen3.8-Flash-Next-Uncensored-GGUF- 为何暂无估算
- 权重格式未知,无法估算显存
- 国内可达
- 需代理
当前运行配置
apodex/Apodex-1.1-mini- 显存
- 暂无估算
查看详情查看运行方式
vllm serve apodex/Apodex-1.1-mini --max-model-len 262144 --enable-auto-tool-choice --tool-call-parser qwen3_coder --reasoning-parser qwen3- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- Apache-2.0
- 上下文
- 262144
- 国内可达
- 需代理
当前运行配置
ibm-granite/granite-4.2-30b- 显存
- 暂无估算
查看详情查看运行方式
vllm serve ibm-granite/granite-4.2-30b- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- Apache-2.0
- 上下文
- 128K (可扩展 512K)
- 国内可达
- 需代理
- 其它形态
- 原生 · GGUF · 4bit · 8bit
当前运行配置
lmstudio-community/granite-4.2-8b-GGUF- 显存
- 暂无估算
查看详情查看运行方式
llama-server -hf lmstudio-community/granite-4.2-8b-GGUF- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- apache-2.0
- 国内可达
- 需代理
- 其它形态
- GGUF · 4bit · 8bit
当前运行配置
orcarouter/Qwen3.8-27B-Uncensored-GGUF- 显存
- 暂无估算
查看详情查看运行方式
llama-server -hf orcarouter/Qwen3.8-27B-Uncensored-GGUF- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- Apache-2.0
- 上下文
- 262k
- 国内可达
- 需代理
- 其它形态
- GGUF·orcarouter · GGUF·jonathancoletti
当前运行配置
empero-ai/Qwen3.8-9B-Distill- 显存
- 暂无估算
查看详情查看运行方式
vllm serve empero-ai/Qwen3.8-9B-Distill- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- Apache-2.0
- 上下文
- 262k
- 国内可达
- 需代理
- 其它形态
- 原生 · GGUF
当前运行配置
empero-ai/Qwen3.8-9B- 显存
- 暂无估算
查看详情查看运行方式
vllm serve empero-ai/Qwen3.8-9B- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- Apache-2.0
- 上下文
- 262k
- 国内可达
- 需代理
Qwen3.8-27B-ABLITERATED (Blackfrost)
量化自 Qwen3.8-27B-ABLITERATED-BF16
GGUF 量化 27B 图文模型,供 llama.cpp 本地部署
- 参数量
- 27B
- 商用
- 可商用
当前运行配置
Blackfrost-AI/Qwen3.8-27B-ABLITERATED-GGUF- 显存
- 暂无估算
查看详情查看运行方式
llama-server -hf Blackfrost-AI/Qwen3.8-27B-ABLITERATED-GGUF:Q4_K_M -ngl 999 --jinja -c 16384- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- Apache-2.0
- 上下文
- 262k
- 国内可达
- 需代理
当前运行配置
Cactus-Compute/needle2- 显存
- 暂无估算
查看详情暂无收录命令
本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。
- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- apache-2.0
- 上下文
- 256 tokens
- 国内可达
- 需代理
当前运行配置
badtheorylabs/BTL-4- 显存
- 暂无估算
查看详情查看运行方式
vllm serve badtheorylabs/BTL-4 --max-model-len 131072 --enable-auto-tool-choice --tool-call-parser qwen3_xml --reasoning-parser qwen3 --trust-remote-code- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- Apache 2.0
- 上下文
- 262k
- 国内可达
- 需代理
当前运行配置
Akahsizrr/fuse-1-Lite- 显存
- 暂无估算
查看详情查看运行方式
mlx_lm.generate --model Akahsizrr/fuse-1-Lite-MLX --trust-remote-code- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- Apache 2.0
- 国内可达
- 需代理
Qwen3.6-35B-A3B (Qwen)
量化自 Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive
35B MoE多模态GGUF,无审查角色扮演与函数调用代理
- 参数量
- 35B (3B激活)
- 商用
- 可商用
当前运行配置
LuffyTheFox/Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V7-GGUF- 显存
- 暂无估算
查看详情暂无收录命令
本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。
- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- apache-2.0
- 上下文
- 262K (可扩至1M)
- 国内可达
- 需代理
当前运行配置
mindlab-research/Macaron-V1-Tall- 显存
- 暂无估算
查看详情暂无收录命令
本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。
- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- MIT
- 上下文
- 262k
- 国内可达
- 需代理
sakthai-context-0.5b-merged (Nanthasit)
量化自 Qwen2.5-0.5B-Instruct
边缘工具调用模型,基于 Qwen2.5-0.5B,可在树莓派运行
- 参数量
- 0.5B
- 商用
- 可商用
Qwen3.6-35B-A3B (LuffyTheFox)
量化自 Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive
无审查多模态MoE,经Genesis去噪,适合角色扮演和代理
- 参数量
- 35B (3B active)
- 商用
- 可商用
当前运行配置
LuffyTheFox/Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V6-GGUF- 显存
- 暂无估算
查看详情查看运行方式
llama-server -hf LuffyTheFox/Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V6-GGUF --jinja -ngl 99- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- apache-2.0
- 上下文
- 262K
- 国内可达
- 需代理
当前运行配置
fdtn-ai/antares-1b- 显存
- 暂无估算
查看详情暂无收录命令
本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。
- 为何暂无估算
- 权重格式未知,无法估算显存
- 国内可达
- 需代理
当前运行配置
ProCreations/grug-27b- 显存
- 暂无估算
查看详情查看运行方式
vllm serve ProCreations/grug-27b --reasoning-parser qwen3 --max-model-len 32768- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- Apache-2.0
- 国内可达
- 需代理
当前运行配置
badtheorylabs/BTL-3- 显存
- 暂无估算
查看详情查看运行方式
vllm serve Qwen/Qwen3.6-27B --revision 6a9e13bd6fc8f0983b9b99948120bc37f49c13e9 --served-model-name BTL-3 --enable-lora --max-lora-rank 32 --lora-modules BTL-3=badtheorylabs/BTL-3 --lora-target-modules q_proj k_proj v_proj o_proj in_proj_qkv in_proj_z in_proj_b in_proj_a out_proj gate_proj up_proj down_proj --reasoning-parser qwen3 --language-model-only --max-model-len 32768- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- Apache-2.0
- 上下文
- 262k
- 国内可达
- 需代理
当前运行配置
Kwaipilot/KAT-Coder-V2.5-Dev- 显存
- 暂无估算
查看详情查看运行方式
vllm serve Kwaipilot/KAT-Coder-V2.5-Dev --language-model-only --reasoning-parser qwen3- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- apache-2.0
- 上下文
- 256k
- 国内可达
- 需代理
Qwen3.6-35B-A3B-Genesis-Hermes-V5-GGUF (LuffyTheFox)
量化自 Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive
无审查多模态 MoE,支持 Hermes 工具调用,为创作者
- 参数量
- 35B (激活 3B)
- 商用
- 可商用
当前运行配置
LuffyTheFox/Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V5-GGUF- 显存
- 暂无估算
查看详情查看运行方式
llama-server -hf LuffyTheFox/Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V5-GGUF --jinja- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- apache-2.0
- 上下文
- 262K (可扩展至 1M)
- 国内可达
- 需代理
无审查视觉 MoE 模型,Hermes 工具调用,GGUF 本地推理
- 参数量
- 35B (3B 激活)
- 商用
- 可商用
当前运行配置
LuffyTheFox/Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V3-GGUF- 显存
- 暂无估算
查看详情查看运行方式
llama-server -hf LuffyTheFox/Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V3-GGUF --jinja- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- Apache-2.0
- 上下文
- 262K (可扩展至 1M)
- 国内可达
- 需代理
MiniCPM5-1B-Claude-Opus-Fable5-V2-Thinking (GnLOLot)
量化自 MiniCPM5-1B-Claude-Opus-Fable5-V2-Thinking
1B 工具调用思考模型 GGUF 量化,本地运行
- 参数量
- 1B
- 商用
- 可商用
当前运行配置
MaralGPT/MaralGPT-Mythos-9B-2606-GGUF- 显存
- 暂无估算
查看详情查看运行方式
ollama run hf.co/MaralGPT/MaralGPT-Mythos-9B-2606-GGUF- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- apache-2.0
- 上下文
- 1M
- 国内可达
- 需代理
当前运行配置
yuxinlu1/gemma-4-12B-agentic-fable5-composer2.5-v2-3.5x-tau2- 显存
- 暂无估算
查看详情查看运行方式
llama-server -hf yuxinlu1/gemma-4-12B-agentic-fable5-composer2.5-v2-3.5x-tau2-GGUF -ngl 99 --jinja- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- Apache-2.0
- 上下文
- 16k(示例命令)
- 国内可达
- 需代理
- 其它形态
- 原生 · GGUF
当前运行配置
HauhauCS/Gemma4-26B-A4B-QAT-Uncensored-HauhauCS-Balanced-MTP- 显存
- 暂无估算
查看详情查看运行方式
llama-server -m Gemma4-26B-A4B-QAT-Uncensored-HauhauCS-Balanced-Q4_K_M.gguf --mmproj mmproj-Gemma4-26B-A4B-QAT-Uncensored-HauhauCS-Balanced-BF16.gguf -md mtp-gemma-4-26B-A4B-it.gguf --spec-type draft-mtp -ngl 99 -fa on (需下载3个文件)- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- gemma
- 上下文
- 256k
- 国内可达
- 需代理
当前运行配置
huihui-ai/Huihui-Qwythos-9B-Claude-Mythos-5-1M-abliterated-GGUF- 显存
- 暂无估算
查看详情查看运行方式
llama-cli -hf huihui-ai/Huihui-Qwythos-9B-Claude-Mythos-5-1M-abliterated-GGUF --model Huihui-Qwythos-9B-Claude-Mythos-5-1M-abliterated-Q4_K.gguf -ngl 99 -c 262144 -fa on -np 1 --spec-type draft-mtp --spec-draft-n-max 2- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- apache-2.0
- 上下文
- 1M
- 国内可达
- 需代理
Qwopus-3.6-35B-A3B-Coder (Jackrong)
LoRA · 基于 Qwopus3.6-35B-A3B-v1
关闭思考的编码代理模型,降低 token 延迟,适合本地工作流
- 参数量
- 35B (3B 激活)
- 商用
- 可商用
Qwen3.6-27B-AEON-Uncensored (AEON-7)
量化自 Qwen3.6-27B-AEON-Ultimate-Uncensored-BF16
无审查的27B视觉语言模型,用于多模态对话与图像理解
- 参数量
- 27B
- 商用
- 可商用
Qwen3.6-27B-Uncensored (AEON-7/mradermacher)
量化自 Qwen3.6-27B-AEON-Ultimate-Uncensored-BF16
27B 无审查多模态混合模型,本地创作者使用
- 参数量
- 27B
- 商用
- 可商用
当前运行配置
HauhauCS/Gemma4-12B-QAT-Uncensored-HauhauCS-Balanced- 显存
- 暂无估算
查看详情查看运行方式
llama-server -m Gemma4-12B-QAT-Uncensored-HauhauCS-Balanced-Q4_K_M.gguf -md mtp-gemma-4-12B-it.gguf --spec-type draft-mtp --mmproj mmproj-Gemma4-12B-QAT-Uncensored-HauhauCS-Balanced-BF16.gguf -ngl 99 -fa on (需先下载gguf及mmproj文件)- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- gemma
- 上下文
- 256K
- 国内可达
- 需代理
当前运行配置
Jackrong/Qwopus3.6-27B-Coder-Compat-MTP-GGUF- 显存
- 暂无估算
查看详情查看运行方式
llama-server -hf Jackrong/Qwopus3.6-27B-Coder-Compat-MTP-GGUF (需代理下载)- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- apache-2.0
- 上下文
- 32K
- 国内可达
- 需代理
当前运行配置
moonshotai/Kimi-K2.7-Code- 显存
- 暂无估算
查看详情暂无收录命令
本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。
- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- other
- 国内可达
- 魔搭可用
当前运行配置
poolside/Laguna-M.1- 显存
- 暂无估算
查看详情暂无收录命令
本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。
- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- apache-2.0
- 国内可达
- 需代理
当前运行配置
MiniMaxAI/MiniMax-M3- 显存
- 暂无估算
查看详情暂无收录命令
本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。
- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- other
- 国内可达
- 魔搭可用
当前运行配置
nex-agi/Nex-N2-Pro- 显存
- 暂无估算
查看详情暂无收录命令
本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。
- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- apache-2.0
- 国内可达
- 魔搭可用
当前运行配置
Jackrong/Qwopus3.6-27B-Coder-GGUF- 显存
- 暂无估算
查看详情查看运行方式
llama-server -hf Jackrong/Qwopus3.6-27B-Coder-GGUF- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- Apache-2.0
- 上下文
- 32K
- 国内可达
- 需代理
- 其它形态
- GGUF·jackrong · GGUF·jackrong·MTP
Qwable-v1 (lordx64)
微调自 Qwen3.6-35B-A3B-Claude-4.7-Opus-Reasoning-Distilled
Qwen3.6基MoE代理编码模型(3B激活)
- 参数量
- 35B (3B 激活)
- 商用
- 可商用
North-Mini-Code-1.0 (CohereLabs)
量化自 North-Mini-Code-1.0
30B总/3B激活的MoE代码代理模型,专注代码生成与终端任务
- 参数量
- 30B总 / 3B激活
- 商用
- 可商用
Gemma4-26B-A4B-Uncensored-Balanced (HauhauCS)
量化自 gemma-4-26B-A4B-it
Gemma4 无审查多模态 MoE,面向创意写作与角色扮演
- 参数量
- 26B (25.2B total, 3.8B active)
- 商用
- 可商用
当前运行配置
HauhauCS/Gemma4-26B-A4B-Uncensored-HauhauCS-Balanced- 显存
- 暂无估算
查看详情查看运行方式
llama-server -m Gemma4-26B-A4B-Uncensored-HauhauCS-Balanced-Q4_K_P.gguf --mmproj mmproj-Gemma4-26B-A4B-Uncensored-HauhauCS-Balanced-f16.gguf --jinja -c 32768 -ngl 99- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- Apache-2.0
- 上下文
- 256K
- 国内可达
- 需代理
SuperGemma4-26B-Uncensored (Jiunsong)
量化自 gemma-4-26B-A4B-it
无审查Gemma 4 26B GGUF,适合苹果硅本地快速推理
- 参数量
- 26B
- 商用
- 限制商用
没有同时满足所选条件的模型,试着去掉一个筛选。
常见坑
- 授权后仍无法访问模型(gated 模型流程问题) —— fdtn-ai/antares-1b
- 存在拒绝边界模糊的问题("It can't say no?") —— fdtn-ai/antares-1b
- 复现结果有备注(caveats),无法完全复现声称效果 —— fdtn-ai/antares-1b
- 基准测试声称介于 GLM 5.2 与 Opus 4.8 之间,但实际表现远逊于 GLM 5.2 —— Kwaipilot/KAT-Coder-V2.5-Dev
- Q4_K_P 及以下量化等级编程能力显著下降,高量化或全精度才能保持编程质量 —— LuffyTheFox/Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V5-GGUF
- Plus 版本因用户反馈基准一致性测试失败已被删除 —— LuffyTheFox/Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V5-GGUF
- 编程能力不如同系列 27B Genesis 版本 —— LuffyTheFox/Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V5-GGUF
- Q4KM 量化在复杂真实任务上质量衰减明显,与全精度版本差距大 —— LuffyTheFox/Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V5-GGUF
展开其余 132 条
- 系统提示必须以 'You are Qwen, created by Alibaba Cloud. You are a helpful assistant.' 开头,否则性能下降 —— LuffyTheFox/Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V5-GGUF
- NL2Repo 编程基准仅 29.4%,与最佳模型差距 26.5 个百分点 —— LuffyTheFox/Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V5-GGUF
- 公开排行榜排名 #114/215,综合得分 50.44/100 —— LuffyTheFox/Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V5-GGUF
- Q8_K_P 量化需约 43.6 GB 显存,硬件门槛较高 —— LuffyTheFox/Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V5-GGUF
- 训练数据集被社区称为'简单秘密数据集'(simple secret dataset),蒸馏自 Claude、GPT 等商用模型,数据来源与可复现性存疑 —— MaralGPT/MaralGPT-Mythos-9B-2606-GGUF
- 发布时个人网站因访问量过大宕机,无法正常访问 —— MaralGPT/MaralGPT-Mythos-9B-2606-GGUF
- 生成代码偶有低级语法错误:会多打括号/括号不配对、用逗号分隔函数定义,需手工修正 —— yuxinlu1/gemma-4-12B-agentic-fable5-composer2.5-v2-3.5x-tau2
- 低量化有损:Q4 以下质量明显下滑(serious degradation),用低量化需有预期 —— yuxinlu1/gemma-4-12B-agentic-fable5-composer2.5-v2-3.5x-tau2
- 多模态语音在长上下文(约 4k-8k)下会不回指令/失效,纯文本模式才正常,agent 场景建议纯文本 —— yuxinlu1/gemma-4-12B-agentic-fable5-composer2.5-v2-3.5x-tau2
- 本地设置容易搞坏体验:社区普遍反馈「卡是好卡,但你的本地配置可能在毁它」 —— yuxinlu1/gemma-4-12B-agentic-fable5-composer2.5-v2-3.5x-tau2
- 技术向口碑有分歧:不少用户仍认为纯问答、写码、agent 类活儿 Qwen 更稳 —— yuxinlu1/gemma-4-12B-agentic-fable5-composer2.5-v2-3.5x-tau2
- 工具调用与 agentic 需要调参:社区常在求教开启 tool calling 与 agentic 的参数与思路,默认配置不一定好用 —— yuxinlu1/gemma-4-12B-agentic-fable5-composer2.5-v2-3.5x-tau2
- v2 微调偏科:通用知识(MMLU-Pro)比基础卡略低,是聚焦 coding+agentic 的取舍 —— yuxinlu1/gemma-4-12B-agentic-fable5-composer2.5-v2-3.5x-tau2
- 综合榜单排名一般:综合榜 218 款里排第 147,公开分 47.32/100(标注为估算,仅 12 行基准) —— yuxinlu1/gemma-4-12B-agentic-fable5-composer2.5-v2-3.5x-tau2
- 在工具调用/自定义 harness 编码评测中表现显著弱于其单次编码成绩,实际 agent 场景可靠性存疑 —— HauhauCS/Gemma4-26B-A4B-QAT-Uncensored-HauhauCS-Balanced-MTP
- HauhauCS 作者在社区中拒绝与用户讨论和对话,引发部分用户不满 —— HauhauCS/Gemma4-26B-A4B-QAT-Uncensored-HauhauCS-Balanced-MTP
- 去审查版本有时需要先「说服自己」才能输出,并非所有场景都立即响应 —— HauhauCS/Gemma4-26B-A4B-QAT-Uncensored-HauhauCS-Balanced-MTP
- HauhauCS 的 31B 版本已宣布但尚未发布,目前仅有 26B 和更小的 E4B/E2B 可用 —— HauhauCS/Gemma4-26B-A4B-QAT-Uncensored-HauhauCS-Balanced-MTP
- 不同 API 提供商之间性能差异巨大,TTFT 从 0.68s 到 5.51s 不等,输出速度相差近 5 倍 —— HauhauCS/Gemma4-26B-A4B-QAT-Uncensored-HauhauCS-Balanced-MTP
- 在编码/agent 任务上明显落后于 Qwen3.6-35B-A3B(Terminal-Bench 2.0 差距 +8.6 分) —— HauhauCS/Gemma4-26B-A4B-QAT-Uncensored-HauhauCS-Balanced-MTP
- 社区有反馈称其实际表现与模型卡上的全面提升描述存在落差,有时甚至弱于前代 —— HauhauCS/Gemma4-26B-A4B-QAT-Uncensored-HauhauCS-Balanced-MTP
- 1M 上下文窗口在实际个人配置中无法达到,实际可用窗口受 RAM 和 Ollama 设置限制 —— huihui-ai/Huihui-Qwythos-9B-Claude-Mythos-5-1M-abliterated-GGUF
- 9B 参数规模决定了它不是前沿模型,推理能力有上限 —— huihui-ai/Huihui-Qwythos-9B-Claude-Mythos-5-1M-abliterated-GGUF
- 加载速度可能偏慢 —— huihui-ai/Huihui-Qwythos-9B-Claude-Mythos-5-1M-abliterated-GGUF
- 没有内置记忆等附加功能,仅是一个纯推理模型 —— huihui-ai/Huihui-Qwythos-9B-Claude-Mythos-5-1M-abliterated-GGUF
- 部分用户反映社区微调版本在实际使用中无法正常工作 —— Jackrong/Qwopus3.6-35B-A3B-Coder-MTP-GGUF
- 3.6 基础模型本身已减少过度思考,使得思考关闭微调的必要性降低 —— Jackrong/Qwopus3.6-35B-A3B-Coder-MTP-GGUF
- Qwen 团队对该模型的定位说明不清,导致社区普遍困惑其实际用途 —— Qwen/Qwen-AgentWorld-35B-A3B
- 模型训练目标为环境模拟/世界建模,并非直接作为 agent 使用;社区反馈明确指出'用它当 agent 并不是设计初衷' —— Qwen/Qwen-AgentWorld-35B-A3B
- 在代码任务上弱于 Qwen3.6-27B,差距明显 —— Qwen/Qwen-AgentWorld-35B-A3B
- 在代码挑战中有时需要额外几轮 prompt 才能产出可用结果 —— Qwen/Qwen-AgentWorld-35B-A3B
- 个人测试中难以评估其世界建模能力,缺乏实用的评估方法 —— Qwen/Qwen-AgentWorld-35B-A3B
- 深度推理仍无法触及前沿闭源模型水平 —— pearsonkyle/gemma-4-31b-imatrix-GGUF
- 有用户表示 90% 的场景更偏好 Qwen 3.6 —— pearsonkyle/gemma-4-31b-imatrix-GGUF
- 在手机上运行速度偏慢 —— pearsonkyle/gemma-4-31b-imatrix-GGUF
- 有用户认为 Qwen 3.6 完全碾压 Gemma 4 —— pearsonkyle/gemma-4-31b-imatrix-GGUF
- 编码速度远慢于35B-A3B,fp8版本仅7 tok/s(35B-A3B为25 tok/s),MacBook上24 tok/s(35B-A3B为65 tok/s) —— mradermacher/Qwen3.6-27B-AEON-Ultimate-Uncensored-BF16-i1-GGUF
- 代码输出可能需要更多review和实现轮次,成本高于预期 —— mradermacher/Qwen3.6-27B-AEON-Ultimate-Uncensored-BF16-i1-GGUF
- AEON版本在部分用户那失败率过高 —— mradermacher/Qwen3.6-27B-AEON-Ultimate-Uncensored-BF16-i1-GGUF
- GGUF格式无法在vllm中使用 —— mradermacher/Qwen3.6-27B-AEON-Ultimate-Uncensored-BF16-i1-GGUF
- NVFP4量化在agent模式下不如高精度量化彻底,Copilot工作流中出现循环问题 —— mradermacher/Qwen3.6-27B-AEON-Ultimate-Uncensored-BF16-i1-GGUF
- 编码工作推荐FP8而非NVFP4,尽管解码更慢 —— mradermacher/Qwen3.6-27B-AEON-Ultimate-Uncensored-BF16-i1-GGUF
- 不适合高并发或agentic为主的工作流,35B-A3B更优 —— mradermacher/Qwen3.6-27B-AEON-Ultimate-Uncensored-BF16-i1-GGUF
- MTP是专用VRAM Blackwell变体,非通用升级,DGX Spark上DFlash反超MTP 26%-52% —— mradermacher/Qwen3.6-27B-AEON-Ultimate-Uncensored-BF16-i1-GGUF
- 部分用户反馈 AEON abliteration 变体失败率偏高,不如 prismascout 的量化质量 —— mradermacher/Qwen3.6-27B-AEON-Ultimate-Uncensored-BF16-GGUF
- GGUF 格式无法在 vLLM 中使用,对生态兼容性构成限制 —— mradermacher/Qwen3.6-27B-AEON-Ultimate-Uncensored-BF16-GGUF
- 在 DGX Spark 上运行 MTP 或在专用 VRAM 上运行 DFlash 均为实测损失,不应混用 —— mradermacher/Qwen3.6-27B-AEON-Ultimate-Uncensored-BF16-GGUF
- n=12 投机令牌在 DGX Spark 上与 CUDA device-side assert 崩溃相关,建议 n=10 —— mradermacher/Qwen3.6-27B-AEON-Ultimate-Uncensored-BF16-GGUF
- 质量与速度的权衡高度依赖具体工作负载,同一模型在不同任务上表现差异显著 —— mradermacher/Qwen3.6-27B-AEON-Ultimate-Uncensored-BF16-GGUF
- 4090 上 TG512 生码速度仅约 45.81 tok/s,生成速度在部分场景下仍显不足 —— mradermacher/Qwen3.6-27B-AEON-Ultimate-Uncensored-BF16-GGUF
- 35B-A3B 的 NVFP4 量化在 Agent 工作流中已知损坏,选型时需避开 —— mradermacher/Qwen3.6-27B-AEON-Ultimate-Uncensored-BF16-GGUF
- 编程能力普遍不如同尺寸竞品(如 Qwen 3.6 35B A3B),尤其智能体编程场景差距明显 —— HauhauCS/Gemma4-12B-QAT-Uncensored-HauhauCS-Balanced
- QAT 版在长上下文实战中 compaction 后容易迷失,需要大量人工推动 —— HauhauCS/Gemma4-12B-QAT-Uncensored-HauhauCS-Balanced
- 部分边缘 prompt 首次会回避,需重新提问或策略性措辞才能获得完整输出 —— HauhauCS/Gemma4-12B-QAT-Uncensored-HauhauCS-Balanced
- "优于两倍大模型"说法仅限同家族内比较(对比 Gemma 3 27B),不代表超越其他实验室同尺寸模型 —— HauhauCS/Gemma4-12B-QAT-Uncensored-HauhauCS-Balanced
- 非 QAT 版在工具调用上存在问题,实际对比中输出代码但功能未实现 —— HauhauCS/Gemma4-12B-QAT-Uncensored-HauhauCS-Balanced
- E2B 版本音频处理存在问题,作者标注后续需要修复 —— HauhauCS/Gemma4-12B-QAT-Uncensored-HauhauCS-Balanced
- MMLU-Pro 数学和医学类得分低于原版 Qwen3.6-27B —— Jackrong/Qwopus3.6-27B-Coder-Compat-MTP-GGUF
- Dense Q5 版本满上下文显存约 31 GB,24GB 显卡需更低量化 —— Jackrong/Qwopus3.6-27B-Coder-Compat-MTP-GGUF
- Dense 版本推理速度仅 43.9 tok/s,远低于同系列 MoE 版本的 161.9 tok/s —— Jackrong/Qwopus3.6-27B-Coder-Compat-MTP-GGUF
- 多模态视觉功能依赖 Ollama 运行时和客户端支持,非所有 UI 可直接使用 —— Jackrong/Qwopus3.6-27B-Coder-Compat-MTP-GGUF
- 模型总大小约 30 GB(含视觉投影器),下载和存储成本高 —— Jackrong/Qwopus3.6-27B-Coder-Compat-MTP-GGUF
- 初版 v3 之前的对话模板存在 bug,需重新下载 GGUF/Safetensor —— empero-ai/Qwythos-9B-Claude-Mythos-5-1M
- 模型卡疑似过度刷榜,无第三方独立评测佐证实际效果 —— empero-ai/Qwythos-9B-Claude-Mythos-5-1M
- 在编码基准上与 GPT-5.5/Opus 仍有实质差距,尚不能全面替代前沿闭源模型 —— moonshotai/Kimi-K2.7-Code
- 有开发者公开质疑官方基准选择,认为实测表现与宣称不符 —— moonshotai/Kimi-K2.7-Code
- Vivace $39/月付费计划周限额紧张,有用户 3 小时用掉 12%、两天用掉 37% —— moonshotai/Kimi-K2.7-Code
- 部分场景下 K2.6 执行更经济,有用户倾向用 K2.7 思考模式搭配 K2.6 干活 —— moonshotai/Kimi-K2.7-Code
- 采用 Modified MIT License,对商业使用有限制 —— moonshotai/Kimi-K2.7-Code
- 仅支持思考模式(thinking model only),无普通模式可选 —— moonshotai/Kimi-K2.7-Code
- 实际使用中可能 token 消耗大、速度变慢 —— moonshotai/Kimi-K2.7-Code
- 代码审查中曾将已有模式误标为阻断性严重问题,判断不够准确 —— moonshotai/Kimi-K2.7-Code
- 在同一次代码审查对比中,GLM 5.2 审查质量更好且 token 消耗不到一半 —— moonshotai/Kimi-K2.7-Code
- 通过 OpenRouter 调用推理速度慢 —— poolside/Laguna-M.1
- 225B 总参数却在部分基准上被 Qwen 3.6 35B 反超 —— poolside/Laguna-M.1
- 官方基准被社区质疑与 Qwen-3.6 35B 过于相似 —— poolside/Laguna-M.1
- 相较同门 Laguna XS.2 已落后一代 —— poolside/Laguna-M.1
- 免费使用仅为限时提供,后续可能收费 —— poolside/Laguna-M.1
- 有用户反馈实际体感上下文窗口偏小 —— poolside/Laguna-M.1
- 实际使用中性能并不总能匹配基准成绩 —— MiniMaxAI/MiniMax-M3
- 速度很慢且表现不稳定 —— MiniMaxAI/MiniMax-M3
- 宣称开源但权重尚未可见,参数规模也未披露 —— MiniMaxAI/MiniMax-M3
- 模型较新,长期可靠性数据不足 —— MiniMaxAI/MiniMax-M3
- 相比 M2.7 提升幅度有限 —— MiniMaxAI/MiniMax-M3
- 速度慢 —— nex-agi/Nex-N2-Pro
- 部分场景输出不稳定、不一致 —— nex-agi/Nex-N2-Pro
- 实际表现不如基准跑分所暗示的那样能替代闭源模型 —— nex-agi/Nex-N2-Pro
- GGUF 内嵌聊天模板有 bug,需切换模板才能正常工作 —— nex-agi/Nex-N2-Pro
- 默认温度下容易出现重复/循环输出问题 —— nex-agi/Nex-N2-Pro
- 目前 OpenRouter 似乎是唯一提供 API 服务的平台 —— nex-agi/Nex-N2-Pro
- 第三方基准工具给出的排名低于官方宣称 —— nex-agi/Nex-N2-Pro
- 存在生成失败的情况 —— nex-agi/Nex-N2-Pro
- 低比特不可靠:Q3 档位被反馈『too unreliable』,建议 Q4 起跳(1) —— bytkim/Qwen3.6-27B-MTP-pi-tune-GGUF
- 量化敏感:INT4 vs BF16 在重复工具调用(83.7% vs 90.7%)与严格结构化输出(64% vs 100%)上差距明显,求稳需上高精度(4) —— bytkim/Qwen3.6-27B-MTP-pi-tune-GGUF
- 资源门槛:dense 27B 吃内存/显存,有用户称『needs more RAM than I have』,16GB 级平台即便开 MTP 也难跑顺(1,3) —— bytkim/Qwen3.6-27B-MTP-pi-tune-GGUF
- 吞吐靠调参:需手动配 --spec-type draft-mtp、--spec-draft-n-max 等(乃至叠加 ngram-mod)才能拿到最佳 tok/s(6) —— bytkim/Qwen3.6-27B-MTP-pi-tune-GGUF
- 换代压力:与 Qwen3.8-27B 直接对比时后者 10 项真实任务 9 胜 1 负(8.838 vs 6.862),社区已有迁移势头(10) —— bytkim/Qwen3.6-27B-MTP-pi-tune-GGUF
- 量化试错成本:不同量化档位体验差异大(如 q4 k xl 有时反而更快更好),逐档下载试错耗时(1) —— bytkim/Qwen3.6-27B-MTP-pi-tune-GGUF
- 微调选择分歧:哪个微调最好没有共识,有人推 ff711/Qwopus,有人直接转投 35B-A3B 或 Qwen3.8,选择成本高(0,1,2,10) —— bytkim/Qwen3.6-27B-MTP-pi-tune-GGUF
- 部分用户实测中频繁遇到错误,需要反复修正,最终退回使用 Gemma 4 —— Jackrong/Qwopus3.6-27B-Coder-GGUF
- 有用户反馈该系列模型均未成功运行,且认为基于 3.6 的微调说服力不如 3.5 时代 —— Jackrong/Qwopus3.6-27B-Coder-GGUF
- 与 Qwen3.6 27B 相比,社区对 Qwopus 的实际提升争议较大 —— Jackrong/Qwopus3.6-27B-Coder-GGUF
- 属实验性社区发布版本,未进行完整安全评估 —— Jackrong/Qwopus3.6-27B-Coder-GGUF
- 非官方发布,无 Qwen 或 Anthropic 参与或背书,训练来源与能力声明均为发布者个人主张 —— lordx64/Qwable-v1
- 编码基准测试尚未完成,编码能力无可靠量化结论 —— lordx64/Qwable-v1
- AGPL 许可 + Anthropic 衍生训练数据带来合规不确定性 —— lordx64/Qwable-v1
- FP16 推理需约 78GB 显存,消费级卡无法跑全精度 —— lordx64/Qwable-v1
- 不支持 Ollama,Mac 上需用 MLX 运行 —— lordx64/Qwable-v1
- 实测在 Mac Studio M4 Max 36GB 上运行偏慢 —— lordx64/Qwable-v1
- 22K token 上下文下首 token 延迟约 115 秒,prefill 阶段极慢 —— CohereLabs/North-Mini-Code-1.0
- 在 SWE/OpenCode 等预期 harness 之外表现异常 —— CohereLabs/North-Mini-Code-1.0
- 产品命名体系引起社区困惑,存在 MiniCPM5-2B 与 1B 之间的混淆 —— openbmb/MiniCPM5-1B
- 输出可能陷入循环,稳定性有待改善 —— Jackrong/Qwopus3.6-27B-v2-MTP-GGUF
- 在社区综合对比中排序不及 DavidAU 的 Heretic 变体 —— Jackrong/Qwopus3.6-27B-v2-MTP-GGUF
- 同场对比被更新的小模型反超:有评论称 Gemma 4 E4B 评分高于 Qwopus 9B。 —— Jackrong/Qwopus3.5-9B-Coder-MTP-GGUF
- MTP 相关认知门槛:社区讨论中有用户不清楚模型是否内置 MTP、以为需要自行转换,且普通 GGUF 加载会报错,需选对专门版本。 —— Jackrong/Qwopus3.5-9B-Coder-MTP-GGUF
- 非 Google 官方发布,为个人社区微调,无官方维护承诺 —— Jiunsong/supergemma4-26b-uncensored-mlx-4bit-v2
- 24GB 统一内存为最低舒适门槛,推荐 32GB+ —— Jiunsong/supergemma4-26b-uncensored-mlx-4bit-v2
- 基准测试数据来自创作者自己的模型卡,需独立验证,不宜全信 —— Jiunsong/supergemma4-26b-uncensored-mlx-4bit-v2
- 仅支持文本任务,不具备多模态能力 —— Jiunsong/supergemma4-26b-uncensored-mlx-4bit-v2
- 需要自行配置 MLX-LM 或 llama.cpp 等本地推理框架 —— Jiunsong/supergemma4-26b-uncensored-mlx-4bit-v2
- 开启推理时偶尔陷入思考循环,反复输出如「Rebuilding Gemma 4 31b...」等中间内容 —— HauhauCS/Gemma4-26B-A4B-Uncensored-HauhauCS-Balanced
- 对非指令文本困惑度异常:在 llama-perplexity 上处理非 instruct 文本困惑度可达数千,非 Gemma 自身生成的指令文本困惑度也在 70 上下 —— HauhauCS/Gemma4-26B-A4B-Uncensored-HauhauCS-Balanced
- 官方 API 端性能中等:TTFT 1.63s、输出 46.7 t/s,适合原型验证、不适合实时面向用户的场景 —— HauhauCS/Gemma4-26B-A4B-Uncensored-HauhauCS-Balanced
- 与 12B 的公开分数差(57.04 vs 46.25)90% 置信区间重叠,不宜凭单一分数断言明显更强 —— HauhauCS/Gemma4-26B-A4B-Uncensored-HauhauCS-Balanced
- 作者自述 Gemma 4 是其做过去审查难度最大的模型,这一版打磨超过 1 个月才放出 RC —— HauhauCS/Gemma4-26B-A4B-Uncensored-HauhauCS-Balanced
- 部分社区成员认为原版本身已相当开放,只是过度避讳粗俗词——对不需要这类内容的用户,去审查的增量可能有限。 —— Jiunsong/supergemma4-26b-uncensored-gguf-v2
- 主打文本,多模态不在其强项。 —— Jiunsong/supergemma4-26b-uncensored-gguf-v2
- 需按运行时与硬件选择合适的打包,对新手有一定门槛。 —— Jiunsong/supergemma4-26b-uncensored-gguf-v2
- 基准分随评估方法与硬件配置变化,横向比较需谨慎。 —— Jiunsong/supergemma4-26b-uncensored-gguf-v2
- 同类去审查产物已有多个(Balanced、abliterated 等),定位与行为不同需甄别。 —— Jiunsong/supergemma4-26b-uncensored-gguf-v2
- Balanced 一类做法对最边缘内容会先给简短 reasoning preamble 再输出完整答案,不同做法在边缘内容处理上差异明显。 —— Jiunsong/supergemma4-26b-uncensored-gguf-v2