指南 / 文本生成模型
文本生成模型
共 159 个 · 数据更新于 2026-09-14
显存档为包含式:更低显存也能跑的模型一并计入。数值取 Q4 量化后估算。
16GB 设备选本地大模型:独显与 Mac 怎么选
面向 16GB 独显或 16GB 内存 Mac 的人:表中配置通过本站的 16GB 估算筛选,并非运行保证;先分清自己是哪种 16GB,再按运行配置挑。
- 编码代理;通过筛选的是 MLX 4-bit 包,只在 Apple Silicon 上跑 Ornith-1.0-9B (DeepReinforce)
当前运行配置
ReliquaryForge/qwen3-4b-base-dapo-v4- 显存
- 暂无估算
查看详情查看运行方式
vllm serve ReliquaryForge/qwen3-4b-base-dapo-v4- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- apache-2.0
- 上下文
- 32k
- 国内可达
- 需代理
当前运行配置
thesysdev/OUI-1- 显存
- 暂无估算
查看详情查看运行方式
vllm serve thesysdev/OUI-1 --trust-remote-code --max-model-len 16384 --served-model-name OUI-1 --enable-auto-tool-choice --tool-call-parser gemma4- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- Apache 2.0
- 上下文
- 16k
- 国内可达
- 需代理
Qwen3.5-9B-Atlassian-Q4-mlx (LeanZero)
LoRA · 基于 Qwen3.5-9B
面向 Atlassian Forge 的 6-bit MLX 模型
- 参数量
- 9B
- 商用
- 可商用
当前运行配置
Mihai-LeanZero/Qwen3.5-9B-Atlassian-Q4-mlx- 显存
- ~5.4GB 4-bit(估算)
查看详情查看运行方式
mlx_lm.generate --model Mihai-LeanZero/Qwen3.5-9B-Atlassian-Q4-mlx --prompt "Which Forge module adds a panel to the Jira issue view?"- 许可证
- Apache-2.0
- 上下文
- 32k
- 国内可达
- 需代理
- 其它形态
- MLX·mihai-leanzero · MLX·mihai-leanzero
当前运行配置
Mihai-LeanZero/Qwen3.8-27B-Atlassian-Q8-mlx- 显存
- ~30GB 8-bit(估算)
查看详情查看运行方式
mlx_lm.generate --model Mihai-LeanZero/Qwen3.8-27B-Atlassian-Q8-mlx- 许可证
- Apache-2.0
- 上下文
- 128k
- 国内可达
- 需代理
- 其它形态
- MLX·mihai-leanzero · MLX·mihai-leanzero
Edge0-35B-A3B-preview (Edge0)
LoRA · 基于 Qwen3.5-MoE-35B-A3B
35B 稀疏 MoE,3 GiB 内存可跑,面向设备端推理
- 参数量
- 35B (3B 激活)
- 商用
- 可商用
当前运行配置
Edge0/Edge0-35B-A3B-preview- 显存
- ~21GB 4-bit(估算)
查看详情暂无收录命令
本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。
- 许可证
- Apache-2.0
- 国内可达
- 需代理
当前运行配置
nex-agi/Nex-N2.5-Pro- 显存
- 暂无估算
查看详情暂无收录命令
本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。
- 为何暂无估算
- 缺少可用的参数量依据,无法估算显存
- 许可证
- apache-2.0
- 国内可达
- 魔搭可用
当前运行配置
nex-agi/Nex-N2.5-mini- 显存
- 暂无估算
查看详情暂无收录命令
本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。
- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- apache-2.0
- 国内可达
- 魔搭可用
Qwen3.6-35B-A3B-VQ-3.4bpw (TheDrainFlorist)
量化自 Qwen3.6-35B-A3B
Apple 芯片 13.8GiB VQ 量化,24GB 可跑
- 参数量
- 35B-A3B
- 商用
- 可商用
当前运行配置
TheDrainFlorist/Qwen3.6-35B-A3B-VQ-3.4bpw- 显存
- 暂无估算
查看详情查看运行方式
python -m mlx_lm generate --model TheDrainFlorist/Qwen3.6-35B-A3B-VQ-3.4bpw --prompt 'Explain the difference between a mutex and a semaphore.' --max-tokens 512- 为何暂无估算
- 格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
- 许可证
- apache-2.0
- 国内可达
- 需代理
当前运行配置
XHToken/Spark-X2.5-4B- 显存
- 暂无估算
查看详情查看运行方式
vllm serve XHToken/Spark-X2.5-4B --trust-remote-code- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- Apache-2.0
- 上下文
- 1M
- 国内可达
- 需代理
- 其它形态
- 原生 · GGUF
Qwen3.6-35B-A3B-VQ-3.8bpw (TheDrainFlorist)
量化自 Qwen3.6-35B-A3B
Apple Silicon VQ量化 Qwen3.6-35B-A3B
- 参数量
- 35B-A3B
- 商用
- 可商用
当前运行配置
TheDrainFlorist/Qwen3.6-35B-A3B-VQ-3.8bpw- 显存
- 暂无估算
查看详情查看运行方式
python -m mlx_lm generate --model TheDrainFlorist/Qwen3.6-35B-A3B-VQ-3.8bpw- 为何暂无估算
- 格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
- 许可证
- Apache-2.0
- 国内可达
- 需代理
Qwen3.6-35B-A3B-VQ-4.6bpw (TheDrainFlorist)
量化自 Qwen3.6-35B-A3B
Mac 可跑的 Qwen3.6-35B VQ 量化
- 参数量
- 35B-A3B
- 商用
- 可商用
当前运行配置
TheDrainFlorist/Qwen3.6-35B-A3B-VQ-4.6bpw- 显存
- 暂无估算
查看详情查看运行方式
python -m mlx_lm generate --model TheDrainFlorist/Qwen3.6-35B-A3B-VQ-4.6bpw --prompt "Hello"- 为何暂无估算
- 格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
- 许可证
- apache-2.0
- 国内可达
- 需代理
Qwen3.6-35B-A3B-VQ-5.4bpw (TheDrainFlorist)
量化自 Qwen3.6-35B-A3B
MLX 向量量化,Apple Silicon 本地推理
- 参数量
- 35B-A3B
- 商用
- 可商用
当前运行配置
TheDrainFlorist/Qwen3.6-35B-A3B-VQ-5.4bpw- 显存
- 暂无估算
查看详情查看运行方式
python -m mlx_lm generate --model TheDrainFlorist/Qwen3.6-35B-A3B-VQ-5.4bpw --prompt "Hello" --max-tokens 32- 为何暂无估算
- 格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
- 许可证
- Apache-2.0
- 国内可达
- 需代理
当前运行配置
IFM/K2-Horizon-7B- 显存
- 暂无估算
查看详情查看运行方式
vllm serve IFM/K2-Horizon-7B --trust-remote-code --dtype bfloat16 --max-model-len 131072 --reasoning-parser k2_horizon --enable-auto-tool-choice --tool-call-parser k2_horizon- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- apache-2.0
- 上下文
- 512k
- 国内可达
- 需代理
K2-Horizon-MoVA-36B-A4B (IFM)
量化自 K2-Horizon-MoVA-36B-A4B
36B/4B 激活 MoE+MoVA,面向 agent 与长上下文
- 参数量
- 36B (4B 激活)
- 商用
- 可商用
当前运行配置
IFM/K2-Horizon-MoVA-36B-A4B- 显存
- 暂无估算
查看详情查看运行方式
vllm serve IFM/K2-Horizon-MoVA-36B-A4B --trust-remote-code --reasoning-parser k2_horizon --tool-call-parser k2_horizon --enable-auto-tool-choice- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- Apache-2.0
- 上下文
- 512k
- 国内可达
- 需代理
- 其它形态
- 原生 · GGUF
当前运行配置
TheDrainFlorist/Qwen3.8-27B-VQ-3.9bpw- 显存
- 暂无估算
查看详情查看运行方式
python -m mlx_lm generate --model TheDrainFlorist/Qwen3.8-27B-VQ-3.9bpw --prompt "Explain vector quantization briefly." --max-tokens 512- 为何暂无估算
- 格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
- 许可证
- Apache-2.0
- 国内可达
- 需代理
当前运行配置
TheDrainFlorist/Qwen3.8-27B-VQ-4.5bpw- 显存
- 暂无估算
查看详情查看运行方式
python -m mlx_lm generate --model TheDrainFlorist/Qwen3.8-27B-VQ-4.5bpw --prompt "Explain vector quantization briefly." --max-tokens 512- 为何暂无估算
- 格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
- 许可证
- apache-2.0
- 国内可达
- 需代理
当前运行配置
TheDrainFlorist/Qwen3.8-27B-VQ-4.8bpw- 显存
- 暂无估算
查看详情查看运行方式
python -m mlx_lm generate --model TheDrainFlorist/Qwen3.8-27B-VQ-4.8bpw --prompt "Explain vector quantization briefly." --max-tokens 512- 为何暂无估算
- 格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
- 许可证
- Apache-2.0
- 国内可达
- 需代理
当前运行配置
XHToken/Spark-X2.5-1.7B- 显存
- 暂无估算
查看详情查看运行方式
vllm serve XHToken/Spark-X2.5-1.7B --trust-remote-code- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- apache-2.0
- 上下文
- 1M
- 国内可达
- 需代理
当前运行配置
openai-community/gpt2- 显存
- 暂无估算
查看详情查看运行方式
vllm serve openai-community/gpt2- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- MIT
- 上下文
- 1024
- 国内可达
- 需代理
当前运行配置
Youssofal/Qwen3.8-27B-MTPLX-Bare-Speed- 显存
- ~16GB 4-bit(估算)
查看详情查看运行方式
mlx_lm.generate --model Youssofal/Qwen3.8-27B-MTPLX-Bare-Speed- 许可证
- Apache-2.0
- 上下文
- 262k
- 国内可达
- 需代理
当前运行配置
Youssofal/Qwen3.8-27B-MTPLX-Optimized-Quality- 显存
- ~30GB 8-bit(估算)
查看详情查看运行方式
mtplx serve --model Youssofal/Qwen3.8-27B-MTPLX-Optimized-Quality- 许可证
- Apache-2.0
- 上下文
- 262k
- 国内可达
- 需代理
Qwen3.8-Flash-Next Optimized Speed (MTPLX)
量化自 Qwen3.8-Flash-Next
Mac 上 MTPLX 4-bit 量化,MTP 投机加速
- 参数量
- 125B-A6B
- 商用
- 需自查
当前运行配置
Youssofal/Qwen3.8-Flash-Next-MTPLX-Optimized-Speed- 显存
- ~75GB 4-bit(估算)
查看详情查看运行方式
mtplx serve --model Youssofal/Qwen3.8-Flash-Next-MTPLX-Optimized-Speed- 许可证
- qwen-community-1.0
- 上下文
- 262k
- 国内可达
- 需代理
当前运行配置
incoai/GLM-5.3-Flash-DFlash2- 显存
- 暂无估算
查看详情查看运行方式
sglang serve --model-path zai-org/GLM-5.3-Flash --trust-remote-code --speculative-algorithm DFLASH --speculative-draft-model-path incoai/GLM-5.3-Flash-DFlash2 --speculative-draft-attention-backend fa4- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- CC BY-NC-ND 4.0
- 国内可达
- 需代理
当前运行配置
Youssofal/Qwen3.8-27B-MTPLX-Optimized-Speed- 显存
- ~16GB 4-bit(估算)
查看详情查看运行方式
mtplx serve --model Youssofal/Qwen3.8-27B-MTPLX-Optimized-Speed- 许可证
- apache-2.0
- 上下文
- 262k
- 国内可达
- 需代理
当前运行配置
z-lab/Qwen3.8-27B-DFlash2- 显存
- 暂无估算
查看详情查看运行方式
vllm serve Qwen/Qwen3.8-27B --speculative-config '{"method":"dflash","model":"z-lab/Qwen3.8-27B-DFlash2","num_speculative_tokens":7}'- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- apache-2.0
- 上下文
- 128k
- 国内可达
- 需代理
- 其它形态
- 原生·z-lab · 原生·incoai · GGUF·incoai · GGUF·z-lab
当前运行配置
EschaLabs/Qwen3.8-27B-Escha-W2- 显存
- ~9.2GB 2-bit(估算)
查看详情暂无收录命令
本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。
- 许可证
- Apache-2.0
- 上下文
- 128k
- 国内可达
- 需代理
Qwen3.8-27B-Unleashed (outsourc-e)
量化自 Qwen3.8-27B-Uncensored
无审查 Qwen3.8-27B 动态量化 GGUF,本地推理
- 参数量
- 27B
- 商用
- 可商用
当前运行配置
ornith-ai/Ornith-1.5-35B-A3B- 显存
- 暂无估算
查看详情查看运行方式
vllm serve ornith-ai/Ornith-1.5-35B-A3B --trust-remote-code --reasoning-parser qwen3 --tool-call-parser qwen3_xml --enable-auto-tool-choice- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- MIT
- 上下文
- 262k
- 国内可达
- 需代理
- 其它形态
- 原生 · GGUF
当前运行配置
superwhisper/s1-mini- 显存
- 暂无估算
查看详情查看运行方式
llama-server -hf superwhisper/s1-mini-GGUF:Q4_K_M --jinja --chat-template-kwargs '{"enable_thinking":false}' --temp 0- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- Apache 2.0 + 命名条款
- 国内可达
- 需代理
Dagger-Qwen3.6-27B (peculiar-ragdoll)
量化自 ThinkingCap-Qwen3.6-27B
Mac 用 Qwen3.6-27B MLX 量化,低冗余输出
- 参数量
- 27B
- 商用
- 可商用
当前运行配置
peculiar-ragdoll/Dagger-Qwen3.6-27B-MLX- 显存
- 暂无估算
查看详情查看运行方式
mlx_lm.generate --model peculiar-ragdoll/Dagger-Qwen3.6-27B-MLX- 为何暂无估算
- 已有格式线索,但估算映射未支持,无法估算显存
- 许可证
- Apache-2.0
- 上下文
- 256k
- 国内可达
- 需代理
LFM2.5-8B-A1B-DSpark-GGUF (LiquidAI)
量化自 LFM2.5-8B-A1B-DSpark-Draft-v1
8B-A1B 投机解码草稿侧车,配 llama.cpp 加速
- 参数量
- 8B
- 商用
- 需自查
当前运行配置
LiquidAI/LFM2.5-8B-A1B-DSpark-GGUF- 显存
- 暂无估算
查看详情查看运行方式
ollama run hf.co/LiquidAI/LFM2.5-8B-A1B-DSpark-GGUF- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- other (lfm1.0)
- 国内可达
- 需代理
当前运行配置
ornith-ai/Ornith-1.5-9B- 显存
- 暂无估算
查看详情查看运行方式
vllm serve ornith-ai/Ornith-1.5-9B --served-model-name Ornith-1.5-9B --max-model-len 262144 --enable-auto-tool-choice --tool-call-parser qwen3_xml --reasoning-parser qwen3 --trust-remote-code- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- MIT
- 上下文
- 262k(YaRN 可扩展至约 1M)
- 国内可达
- 需代理
- 其它形态
- 原生 · GGUF
当前运行配置
OBLITERATUS/Qwen3.8-27B-OBLITERATED- 显存
- 暂无估算
查看详情查看运行方式
ollama run hf.co/OBLITERATUS/Qwen3.8-27B-OBLITERATED- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- Apache-2.0
- 国内可达
- 需代理
Qwen3.8-27B Heretic Abliterated GGUF (0bserverx)
量化自 Qwen3.8-27B
Qwen3.8-27B 去安全限制 GGUF,供角色扮演与创作
- 参数量
- 27B
- 商用
- 可商用
当前运行配置
HamoAI/hamo-score-0.6b- 显存
- 暂无估算
查看详情查看运行方式
ollama run hf.co/HamoAI/hamo-score-0.6b- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- HAMO-RAIL-S 1.0
- 国内可达
- 需代理
当前运行配置
VertexAIco/amethyst-1-mini- 显存
- 暂无估算
查看详情查看运行方式
llama-server -hf VertexAIco/amethyst-1-mini- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- Gemma Terms of Use
- 上下文
- 1024
- 国内可达
- 需代理
当前运行配置
lmstudio-community/LFM2.5-2.6B-MLX-5bit- 显存
- 暂无估算
查看详情查看运行方式
mlx_lm.generate --model lmstudio-community/LFM2.5-2.6B-MLX-5bit- 为何暂无估算
- 已有格式线索,但估算映射未支持,无法估算显存
- 许可证
- LFM Open License v1.0
- 国内可达
- 需代理
当前运行配置
nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16- 显存
- ~63GB BF16(估算)
查看详情查看运行方式
vllm serve nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16- 许可证
- OpenMDW-1.1
- 上下文
- 1M
- 国内可达
- 需代理
- 其它形态
- 原生 · GGUF
当前运行配置
nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4- 显存
- 暂无估算
查看详情查看运行方式
vllm serve nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4- 为何暂无估算
- 格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
- 许可证
- OpenMDW-1.1
- 上下文
- 1M
- 国内可达
- 需代理
当前运行配置
lmstudio-community/LFM2.5-2.6B-MLX-6bit- 显存
- 暂无估算
查看详情查看运行方式
mlx_lm.generate --model lmstudio-community/LFM2.5-2.6B-MLX-6bit- 为何暂无估算
- 已有格式线索,但估算映射未支持,无法估算显存
- 许可证
- LFM-1.0
- 国内可达
- 需代理
当前运行配置
Scrappy-Doo/GLM-5.2- 显存
- 暂无估算
查看详情查看运行方式
vllm serve Scrappy-Doo/GLM-5.2 --trust-remote-code- 为何暂无估算
- 缺少可用的参数量依据,无法估算显存
- 许可证
- MIT
- 上下文
- 1M
- 国内可达
- 需代理
- 其它形态
- 原生·scrappy-doo · GGUF · 原生·zai-org
当前运行配置
Nanbeige/Nanbeige4.2-3B- 显存
- 暂无估算
查看详情查看运行方式
ollama run nanbeige/nanbeige4.2:3b-Q4_K_M- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- Apache 2.0
- 上下文
- 131k
- 国内可达
- 需代理
- 其它形态
- 原生 · GGUF
当前运行配置
LiquidAI/LFM2.5-2.6B- 显存
- 暂无估算
查看详情查看运行方式
llama-server -hf LiquidAI/LFM2.5-2.6B-GGUF- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- LFM Open License v1.0
- 上下文
- 128k
- 国内可达
- 需代理
- 其它形态
- 原生 · GGUF·liquidai · GGUF·lmstudio · 4bit · 8bit
当前运行配置
AutomatosX/AX-Qwen3.6-35B-A3B-MLX-AXQ-6bit-MTP- 显存
- 暂无估算
查看详情查看运行方式
mlx_lm.generate --model AutomatosX/AX-Qwen3.6-35B-A3B-MLX-AXQ-6bit-MTP- 为何暂无估算
- 格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
- 许可证
- Apache-2.0
- 上下文
- 262k
- 国内可达
- 需代理
当前运行配置
deepgrove/maple-preview- 显存
- ~5.4GB ternary(估算)
查看详情暂无收录命令
本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。
- 许可证
- MIT
- 上下文
- 131k
- 国内可达
- 需代理
当前运行配置
lmstudio-community/Ornith-1.0-9B-MLX-5bit- 显存
- 暂无估算
查看详情查看运行方式
mlx_lm.generate --model lmstudio-community/Ornith-1.0-9B-MLX-5bit- 为何暂无估算
- 已有格式线索,但估算映射未支持,无法估算显存
- 许可证
- MIT
- 国内可达
- 需代理
当前运行配置
meta-llama/Llama-3.1-8B-Instruct- 显存
- 暂无估算
查看详情查看运行方式
ollama run hf.co/meta-llama/Llama-3.1-8B-Instruct- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- Llama 3.1 Community License
- 上下文
- 128k
- 国内可达
- 需代理
当前运行配置
Qwen/Qwen2.5-7B-Instruct- 显存
- 暂无估算
查看详情查看运行方式
vllm serve Qwen/Qwen2.5-7B-Instruct- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- Apache-2.0
- 上下文
- 128k
- 国内可达
- 需代理
当前运行配置
antirez/deepseek-v4-gguf- 显存
- 暂无估算
查看详情查看运行方式
ollama run hf.co/antirez/deepseek-v4-gguf- 为何暂无估算
- 缺少可用的参数量依据,无法估算显存
- 许可证
- MIT
- 上下文
- 100k
- 国内可达
- 需代理
Koleslaw-Nemotron-30B (ThunkAboutIt)
LoRA · 基于 NVIDIA-Nemotron-3-Nano-30B-A3B-BF16
把粗糙提示变成结构化详细提示,方便交给任意模型
- 参数量
- 31.6B
- 商用
- 需自查
当前运行配置
thunkaboutit/Koleslaw-Nemotron-30B-A3B-PromptEnhance- 显存
- 暂无估算
查看详情查看运行方式
ollama run hf.co/thunkaboutit/Koleslaw-Nemotron-30B-A3B-PromptEnhance- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- NVIDIA Nemotron Open Model License
- 上下文
- 8K
- 国内可达
- 需代理
当前运行配置
lmstudio-community/Ornith-1.0-35B-MLX-6bit- 显存
- 暂无估算
查看详情查看运行方式
mlx_lm.generate --model lmstudio-community/Ornith-1.0-35B-MLX-6bit- 为何暂无估算
- 已有格式线索,但估算映射未支持,无法估算显存
- 许可证
- MIT
- 国内可达
- 需代理
当前运行配置
lmstudio-community/Ornith-1.0-9B-MLX-6bit- 显存
- 暂无估算
查看详情查看运行方式
mlx_lm.generate --model lmstudio-community/Ornith-1.0-9B-MLX-6bit- 为何暂无估算
- 已有格式线索,但估算映射未支持,无法估算显存
- 许可证
- MIT
- 国内可达
- 需代理
当前运行配置
meituan-longcat/LongCat-Flash-Lite-Sparse- 显存
- 暂无估算
查看详情查看运行方式
python3 -m sglang.launch_server --model meituan-longcat/LongCat-Flash-Lite-Sparse --trust-remote-code --chunked-prefill-size 2048 --nsa-prefill-backend fa3 --kv-cache-dtype bfloat16- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- MIT
- 上下文
- 1M
- 国内可达
- 需代理
当前运行配置
lmstudio-community/Ornith-1.0-35B-MLX-5bit- 显存
- 暂无估算
查看详情查看运行方式
mlx_lm.generate --model lmstudio-community/Ornith-1.0-35B-MLX-5bit- 为何暂无估算
- 已有格式线索,但估算映射未支持,无法估算显存
- 许可证
- mit
- 国内可达
- 需代理
当前运行配置
lmstudio-community/DeepSeek-V4-Flash-0731-GGUF- 显存
- 暂无估算
查看详情查看运行方式
ollama run hf.co/lmstudio-community/DeepSeek-V4-Flash-0731-GGUF- 为何暂无估算
- 缺少可用的参数量依据,无法估算显存
- 许可证
- MIT
- 国内可达
- 需代理
- 其它形态
- GGUF·lmstudio · GGUF·unsloth
Qwen3.6-35B-A3B-Escha-W2 (EschaLabs)
量化自 Qwen3.6-35B-A3B
2-bit Qwen3.6-35B-A3B,12.3GB,单卡本地推理
- 参数量
- 35B (3B active)
- 商用
- 可商用
当前运行配置
EschaLabs/Qwen3.6-35B-A3B-Escha-W2- 显存
- ~12GB 2-bit(估算)
查看详情暂无收录命令
本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。
- 许可证
- Apache-2.0
- 上下文
- 128k
- 国内可达
- 需代理
当前运行配置
XYZAILab/XYZ-Aquila-mini- 显存
- 暂无估算
查看详情查看运行方式
python -m sglang.launch_server --model-path XYZAILab/XYZ-Aquila-mini --reasoning-parser qwen3 --tool-call-parser qwen3_coder- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- Apache 2.0
- 上下文
- 256k
- 国内可达
- 魔搭可用
当前运行配置
amd/Instella-MoE-16B-A3B-Think- 显存
- 暂无估算
查看详情暂无收录命令
本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。
- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- ResearchRAIL
- 国内可达
- 需代理
当前运行配置
Goekdeniz-Guelmez/JOSIE-2-4B-Preview- 显存
- 暂无估算
查看详情查看运行方式
mlx_lm.generate --model Goekdeniz-Guelmez/JOSIE-2-4B-Preview- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- MIT
- 国内可达
- 需代理
当前运行配置
gokhanturhan/CLINAMEN-Chat- 显存
- 暂无估算
查看详情暂无收录命令
本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。
- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- MIT
- 国内可达
- 需代理
当前运行配置
poolside/Laguna-XS-2.1- 显存
- 暂无估算
查看详情查看运行方式
ollama run laguna-xs-2.1- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- openmdw-1.1
- 上下文
- 262k
- 国内可达
- 需代理
- 其它形态
- 原生 · GGUF
当前运行配置
ThingAI/Quak-50m-v2- 显存
- 暂无估算
查看详情暂无收录命令
本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。
- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- Apache-2.0
- 上下文
- 2048
- 国内可达
- 需代理
gemma-4-E2B-it-crap-gguf (matthewhaynesonline)
量化自 gemma-4-E2B-it-crap
直接生成可执行ELF hex的文本模型
- 参数量
- 约4.3B (基于F16.gguf 8.6GiB推断)
- 商用
- 可商用
Grok-3-reasoning-gemma3-4B-GGUF (mradermacher)
量化自 Grok-3-reasoning-gemma3-4B-distilled-HF
Grok-3推理蒸馏Gemma3-4B的GGUF量化版
- 参数量
- 4B
- 商用
- 可商用
当前运行配置
mradermacher/Grok-3-reasoning-gemma3-4B-distilled-HF-GGUF- 显存
- 暂无估算
查看详情查看运行方式
ollama run hf.co/mradermacher/Grok-3-reasoning-gemma3-4B-distilled-HF-GGUF- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- Apache-2.0
- 国内可达
- 需代理
当前运行配置
poolside/Laguna-S-2.1-GGUF- 显存
- 暂无估算
查看详情查看运行方式
llama-server -hf poolside/Laguna-S-2.1-GGUF -m laguna-s-2.1-Q4_K_M.gguf --jinja- 为何暂无估算
- 缺少可用的参数量依据,无法估算显存
- 许可证
- openmdw-1.1
- 上下文
- 256K
- 国内可达
- 需代理
- 其它形态
- GGUF·poolside · GGUF·lmstudio
当前运行配置
FINAL-Bench/POCKET-KR-MLX- 显存
- ~12GB 2-bit(估算)
查看详情查看运行方式
mlx_lm.generate --model FINAL-Bench/POCKET-KR-MLX- 许可证
- Apache-2.0
- 国内可达
- 需代理
Laguna-S-2.1-NVFP4 (poolside)
量化自 Laguna-S-2.1
117.6B MoE (8.5B 激活) 代理编码模型,本地设备可运行
- 参数量
- 117.6B (8.5B 激活)
- 商用
- 需自查
当前运行配置
poolside/Laguna-S-2.1-NVFP4- 显存
- 暂无估算
查看详情查看运行方式
vllm serve poolside/Laguna-S-2.1-NVFP4- 为何暂无估算
- 格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
- 许可证
- OpenMDW-1.1
- 上下文
- 256K
- 国内可达
- 需代理
当前运行配置
AtomicChat/ornith-35b-MLX-8bit- 显存
- ~39GB 8-bit(估算)
查看详情查看运行方式
mlx_lm.generate --model AtomicChat/ornith-35b-MLX-8bit --prompt Hello- 许可证
- MIT
- 上下文
- 256K
- 国内可达
- 需代理
当前运行配置
AtomicChat/ornith-35b-MLX-6bit- 显存
- 暂无估算
查看详情查看运行方式
mlx_lm.generate --model AtomicChat/ornith-35b-MLX-6bit --prompt 'Hello'- 为何暂无估算
- 已有格式线索,但估算映射未支持,无法估算显存
- 许可证
- MIT
- 上下文
- 256K
- 国内可达
- 需代理
当前运行配置
majentik/gpt-oss-20b-TurboQuant-MLX-2bit- 显存
- 暂无估算
查看详情查看运行方式
mlx_lm.generate --model majentik/gpt-oss-20b-TurboQuant-MLX-2bit --prompt '你的提示'- 为何暂无估算
- 格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
- 许可证
- Apache 2.0
- 国内可达
- 需代理
当前运行配置
zak-raindog/gear-manual-qwen3-4b- 显存
- ~2.4GB 4-bit(估算)
查看详情查看运行方式
mlx_lm.generate --model zak-raindog/gear-manual-qwen3-4b --prompt "如何使用EP-133?"- 许可证
- cc-by-nc-4.0
- 国内可达
- 需代理
当前运行配置
prism-ml/Bonsai-27B-mlx-1bit- 显存
- ~4.1GB 1-bit(估算)
查看详情查看运行方式
mlx_lm.generate --model prism-ml/Bonsai-27B-mlx-1bit- 许可证
- apache-2.0
- 上下文
- 262K
- 国内可达
- 需代理
Dolphin3-Cyber-8B (RavichandranJ)
量化自 Dolphin3.0-Llama3.1-8B-abliterated
网络安全领域8B微调模型, 本地离线运行红蓝队工具
- 参数量
- 8B
- 商用
- 限制商用
当前运行配置
RavichandranJ/Dolphin3-Cyber-8B-GGUF- 显存
- 暂无估算
查看详情查看运行方式
ollama run hf.co/RavichandranJ/Dolphin3-Cyber-8B-GGUF- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- llama3.1
- 上下文
- 2k
- 国内可达
- 需代理
当前运行配置
alphaZimuth/Hy-MT2-30B-A3B-APEX-GGUF- 显存
- 暂无估算
查看详情查看运行方式
ollama run hf.co/alphaZimuth/Hy-MT2-30B-A3B-APEX-GGUF- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- Apache-2.0
- 国内可达
- 需代理
当前运行配置
AngelSlim/Hy3-GGUF- 显存
- 暂无估算
查看详情查看运行方式
ollama run hf.co/AngelSlim/Hy3-GGUF- 为何暂无估算
- 缺少可用的参数量依据,无法估算显存
- 许可证
- apache-2.0
- 上下文
- 65536
- 国内可达
- 魔搭可用
当前运行配置
GnLOLot/MiniCPM5-1B-Claude-Opus-Fable5-Thinking- 显存
- 暂无估算
查看详情查看运行方式
ollama run hf.co/GnLOLot/MiniCPM5-1B-Claude-Opus-Fable5-Thinking-GGUF- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- Apache-2.0
- 上下文
- 128k
- 国内可达
- 需代理
- 其它形态
- 原生 · GGUF
当前运行配置
mlx-community/NVIDIA-Nemotron-3-Nano-30B-A3B-OptiQ-4bit- 显存
- 暂无估算
查看详情查看运行方式
mlx_lm.generate --model mlx-community/NVIDIA-Nemotron-3-Nano-30B-A3B-OptiQ-4bit- 为何暂无估算
- 格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
- 许可证
- nvidia-open-model-license
- 国内可达
- 需代理
当前运行配置
mlx-community/Qwen3.5-35B-A3B-OptiQ-4bit- 显存
- 暂无估算
查看详情查看运行方式
mlx_lm.generate --model mlx-community/Qwen3.5-35B-A3B-OptiQ-4bit --prompt 'Explain quantum computing.' --max-tokens 200- 为何暂无估算
- 格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
- 许可证
- apache-2.0
- 上下文
- 128k
- 国内可达
- 需代理
当前运行配置
prism-ml/Ternary-Bonsai-27B-mlx-2bit- 显存
- 暂无估算
查看详情查看运行方式
llama-server -hf prism-ml/Ternary-Bonsai-27B-gguf- 为何暂无估算
- 格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
- 许可证
- apache-2.0
- 上下文
- 262k
- 国内可达
- 需代理
Qwen3.6-35B-A3B-VQ (aquaman164)
量化自 Qwen3.6-35B-A3B
MLX VQ量化35B MoE,适合Apple Silicon本地推理
- 参数量
- 35B (3B激活)
- 商用
- 可商用
当前运行配置
aquaman164/Qwen3.6-35B-A3B-MLX-VQ-2.6bpw- 显存
- 暂无估算
查看详情查看运行方式
huggingface-cli download aquaman164/Qwen3.6-35B-A3B-MLX-VQ-2.6bpw --local-dir qwen-vq && python qwen-vq/code/vq_serve.py --model qwen-vq- 为何暂无估算
- 格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
- 许可证
- Apache-2.0
- 上下文
- 128k
- 国内可达
- 需代理
Ornith-1.0-35B-MLX (deepreinforce-ai)
量化自 Ornith-1.0-35B
Apple Silicon 上 Claude-Code 式本地编码代理
- 参数量
- 35B (3B 活跃)
- 商用
- 需自查
当前运行配置
nathansutton/Ornith-1.0-35B-UD-Q2_K_XL-MLX- 显存
- ~12GB 2-bit(估算)
查看详情查看运行方式
uvx --from git+https://github.com/nathansutton/mlxcc chad- 国内可达
- 需代理
当前运行配置
mlx-community/Qwen3.5-9B-OptiQ-4bit- 显存
- 暂无估算
查看详情查看运行方式
mlx_lm.generate --model mlx-community/Qwen3.5-9B-OptiQ-4bit- 为何暂无估算
- 格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
- 许可证
- apache-2.0
- 上下文
- 128k
- 国内可达
- 需代理
当前运行配置
empero-ai/Qwythos-9B-v2- 显存
- 暂无估算
查看详情查看运行方式
vllm serve empero-ai/Qwythos-9B-v2 --trust-remote-code- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- Apache-2.0
- 上下文
- 1048k
- 国内可达
- 需代理
- 其它形态
- 原生 · GGUF
当前运行配置
nvidia/Nemotron-Labs-Audex-2B- 显存
- 暂无估算
查看详情查看运行方式
python -c "from transformers import AutoModel; AutoModel.from_pretrained('nvidia/Nemotron-Labs-Audex-2B', trust_remote_code=True)"- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- NVIDIA OneWay Noncommercial License
- 上下文
- 128k
- 国内可达
- 需代理
NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B (NVIDIA)
量化自 NVIDIA-Nemotron-3-Super-120B-A12B-BF16
面向高吞吐推理的压缩 MoE 模型,用于交互式推理与高并发部署
- 参数量
- 75B (9.3B active)
- 商用
- 需自查
当前运行配置
nvidia/NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B-NVFP4- 显存
- 暂无估算
查看详情查看运行方式
vllm serve nvidia/NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B-NVFP4 --trust-remote-code --mamba-backend flashinfer- 为何暂无估算
- 格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
- 许可证
- OpenMDW-1.1
- 上下文
- 1M
- 国内可达
- 需代理
当前运行配置
nvidia/Nemotron-Labs-Audex-30B-A3B- 显存
- 暂无估算
查看详情查看运行方式
python -c "from transformers import AutoModelForCausalLM; AutoModelForCausalLM.from_pretrained('nvidia/Nemotron-Labs-Audex-30B-A3B', trust_remote_code=True)"- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- NVIDIA Oneway Noncommercial License
- 上下文
- 1M
- 国内可达
- 需代理
当前运行配置
SupraLabs/Supra-Router-51M- 显存
- 暂无估算
查看详情查看运行方式
AutoModelForCausalLM.from_pretrained('SupraLabs/Supra-Router-51M')- 为何暂无估算
- 权重格式未知,无法估算显存
- 上下文
- 3840
- 国内可达
- 需代理
当前运行配置
kai-os/Grug-12B- 显存
- 暂无估算
查看详情查看运行方式
ollama run hf.co/kai-os/Grug-12B- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- other
- 国内可达
- 需代理
当前运行配置
Smilyai-labs/Nova-1-Standard-1.3B-Preview- 显存
- 暂无估算
查看详情查看运行方式
pipeline('text-generation', model='Smilyai-labs/Nova-1-Standard-1.3B-Preview', trust_remote_code=True, device_map='auto')- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- apache-2.0
- 上下文
- 2048
- 国内可达
- 需代理
当前运行配置
manjunathshiva/Qwen3.6-35B-A3B-tq3a-tqTe-g64- 显存
- 暂无估算
查看详情查看运行方式
pip install 'turboquant-mlx-full>=0.12.3' && python -m turboquant_mlx.generate --model manjunathshiva/Qwen3.6-35B-A3B-tq3a-tqTe-g64- 为何暂无估算
- 格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
- 许可证
- Apache-2.0
- 国内可达
- 需代理
Gemma4-Gutenberg-31B-Heretic-mlx-8Bit (ailexleon)
量化自 Gemma4-Gutenberg-31B-Heretic
MLX 8-bit 量化英文创意写作模型,适合故事小说生成
- 参数量
- 31B
- 商用
- 可商用
当前运行配置
ailexleon/Gemma4-Gutenberg-31B-Heretic-mlx-8Bit- 显存
- ~34GB 8-bit(估算)
查看详情查看运行方式
mlx_lm.generate --model ailexleon/Gemma4-Gutenberg-31B-Heretic-mlx-8Bit --prompt 'hello'- 许可证
- apache-2.0
- 国内可达
- 需代理
当前运行配置
nvidia/Nemotron-Labs-TwoTower-30B-A3B-Base-BF16- 显存
- ~63GB BF16(估算)
查看详情查看运行方式(还有 1 种)
python3 -c "from transformers import AutoModelForCausalLM; AutoModelForCausalLM.from_pretrained('nvidia/Nemotron-Labs-TwoTower-30B-A3B-Base-BF16',trust_remote_code=True,torch_dtype='bfloat16').cuda()" (单GPU AR模式,约59GB显存)其它 1 种运行方式见详情页。
- 许可证
- NVIDIA Nemotron Open Model License
- 上下文
- 128k
- 国内可达
- 需代理
当前运行配置
nvidia/Qwen3.6-27B-NVFP4- 显存
- 暂无估算
查看详情查看运行方式
vllm serve nvidia/Qwen3.6-27B-NVFP4 --port 8000 --quantization modelopt --max-model-len 262144 --reasoning-parser qwen3- 为何暂无估算
- 格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
- 许可证
- Apache-2.0
- 上下文
- 262k
- 国内可达
- 需代理
LFM2.5-8B-A1B-APEX (LiquidAI / LocalAI)
量化自 LFM2.5-8B-A1B
8B参数1B激活MoE,消费级GPU可运行的APEX量化
- 参数量
- 8B (激活1B)
- 商用
- 需自查
BugTraceAI-CORE-Ultra-27B (BugTraceAI)
量化自 Qwen3.6-27B-Heretic2-Uncensored-Finetune-Thinking
生成漏洞利用与安全工具,面向攻防研究者
- 参数量
- 27B
- 商用
- 可商用
当前运行配置
BugTraceAI/BugTraceAI-CORE-Ultra-27B-Q6- 显存
- 暂无估算
Qwen3.6-27b-Fable5 (hotdogs)
LoRA · 基于 Qwen3.6-27B
Qwen3.6-27B的LoRA微调,用于故事与寓言生成
- 参数量
- 27B (基座) + LoRA
- 商用
- 需自查
当前运行配置
hotdogs/qwen3.6-27b-fable5-lora- 显存
- 暂无估算
查看详情查看运行方式
vllm serve Qwen/Qwen3.6-27B --enable-lora --lora-modules fable=hotdogs/qwen3.6-27b-fable5-lora- 为何暂无估算
- 权重格式未知,无法估算显存
- 国内可达
- 需代理
当前运行配置
microsoft/FastContext-1.0-4B-RL- 显存
- 暂无估算
查看详情查看运行方式(还有 1 种)
python3 -m sglang.launch_server --model-path microsoft/FastContext-1.0-4B-RL --tool-call-parser qwen --context-length 262144 --trust-remote-code --dtype bfloat16 --host 0.0.0.0 --port 30000 --tp-size 1 --mem-fraction-static 0.8其它 1 种运行方式见详情页。
- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- MIT
- 上下文
- 262k
- 国内可达
- 需代理
Huihui-gemma-4-12B-coder-abliterated (huihui-ai)
微调自 gemma-4-12B-coder-fable5-composer2.5-v1
未审查版 Gemma 代码模型,用于编程与推理,已去除拒答
- 参数量
- 12B
- 商用
- 可商用
当前运行配置
deepseek-ai/DeepSeek-V4-Flash- 显存
- 暂无估算
查看详情暂无收录命令
本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。
- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- mit
- 国内可达
- 魔搭可用
当前运行配置
deepseek-ai/DeepSeek-V4-Pro- 显存
- 暂无估算
查看详情暂无收录命令
本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。
- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- mit
- 国内可达
- 魔搭可用
当前运行配置
Gryphe/Gemma-4-31B-StyleTune- 显存
- 暂无估算
查看详情查看运行方式
python -c "from transformers import AutoModelForCausalLM; model = AutoModelForCausalLM.from_pretrained('Gryphe/Gemma-4-31B-StyleTune')"- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- apache-2.0
- 国内可达
- 需代理
FastContext-1.0-4B-SFT (Microsoft)
微调自 Qwen3-4B-Instruct-2507
轻量仓库探索子代理,供编码代理按需调用,减少 token 消耗
- 参数量
- 4B
- 商用
- 可商用
当前运行配置
microsoft/FastContext-1.0-4B-SFT- 显存
- 暂无估算
查看详情查看运行方式(还有 1 种)
python3 -m sglang.launch_server --model-path microsoft/FastContext-1.0-4B-SFT --tool-call-parser qwen --context-length 262144 --trust-remote-code --dtype bfloat16 --host 0.0.0.0 --port 30000 --tp-size 1 --mem-fraction-static 0.8其它 1 种运行方式见详情页。
- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- MIT
- 上下文
- 262k
- 国内可达
- 需代理
DiffusionGemma-26B-A4B-it-NVFP4 (NVIDIA)
量化自 diffusiongemma-26B-A4B-it
扩散多模态文本生成,3.8B活跃参数,NVFP4量化
- 参数量
- 25.2B (3.8B活跃)
- 商用
- 可商用
当前运行配置
nvidia/diffusiongemma-26B-A4B-it-NVFP4- 显存
- 暂无估算
查看详情查看运行方式
VLLM_USE_V2_MODEL_RUNNER=1 vllm serve nvidia/diffusiongemma-26B-A4B-IT-NVFP4 --trust-remote-code --max-num-seqs 4 --attention-backend TRITON_ATTN --enable-auto-tool-choice --tool-call-parser gemma4 --reasoning-parser gemma4 --override-generation-config '{"max_new_tokens": null}' --default-chat-template-kwargs '{"enable_thinking":true}' (需H100/B100)- 为何暂无估算
- 格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
- 许可证
- Apache 2.0 (Gemma Terms)
- 上下文
- 256k
- 国内可达
- 需代理
当前运行配置
silx-ai/Quasar-Preview- 显存
- 暂无估算
查看详情查看运行方式
python -c "from transformers import AutoModelForCausalLM; AutoModelForCausalLM.from_pretrained('silx-ai/Quasar-Preview', trust_remote_code=True)"- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- MIT
- 上下文
- 5M (实验性配置)
- 国内可达
- 需代理
当前运行配置
marin-community/delphi-1e23-25Bparams-628Btokens- 显存
- 暂无估算
查看详情查看运行方式
transformers.from_pretrained('marin-community/delphi-1e23-25Bparams-628Btokens')- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- apache-2.0
- 上下文
- 4k
- 国内可达
- 需代理
当前运行配置
pat-jj/harness-1- 显存
- 暂无估算
查看详情查看运行方式
transformers from_pretrained('pat-jj/harness-1')- 为何暂无估算
- 权重格式未知,无法估算显存
- 国内可达
- 需代理
Qwen3.6-35B-A3B-OptiQ-4bit (mlx-community)
量化自 Qwen3.6-35B-A3B
Apple Silicon 4-bit MLX混精量化+MTP投机解码
- 参数量
- 35B-A3B
- 商用
- 可商用
当前运行配置
LiquidAI/LFM2.5-8B-A1B- 显存
- 暂无估算
查看详情查看运行方式
transformers >= 5.0.0: AutoModelForCausalLM.from_pretrained('LiquidAI/LFM2.5-8B-A1B')- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- LFM1.0
- 上下文
- 128k
- 国内可达
- 需代理
- 其它形态
- 原生 · GGUF·liquidai · GGUF·unsloth
Qwen3.6-35B-A3B-NVFP4 (NVIDIA)
量化自 Qwen3.6-35B-A3B
Qwen3.6-35B-A3B FP4量化版,面向vLLM高效推理
- 参数量
- 35B (激活3B)
- 商用
- 可商用
当前运行配置
nvidia/Qwen3.6-35B-A3B-NVFP4- 显存
- 暂无估算
查看详情查看运行方式
vllm serve nvidia/Qwen3.6-35B-A3B-NVFP4 --quantization modelopt- 为何暂无估算
- 格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
- 许可证
- Apache 2.0
- 上下文
- 262k
- 国内可达
- 需代理
aro-coder-4bit (ARO-Lang)
LoRA · 基于 Qwen3-Coder-30B-A3B-Instruct-4bit
为ARO语言微调的代码生成器,4bit量化,供ARO DSL开发者使用
- 参数量
- 30B (3B active)
- 商用
- 可商用
当前运行配置
tencent/Hy-MT2-1.8B-GGUF- 显存
- 暂无估算
查看详情查看运行方式
llama-server -hf tencent/Hy-MT2-1.8B-GGUF- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- apache-2.0
- 国内可达
- 魔搭可用
当前运行配置
lmstudio-community/granite-4.1-30b-GGUF- 显存
- 暂无估算
查看详情查看运行方式
llama.cpp: huggingface-cli download lmstudio-community/granite-4.1-30b-GGUF --include '*.gguf' --local-dir . && ./llama-cli -m <file>- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- Apache 2.0
- 国内可达
- 需代理
当前运行配置
lmstudio-community/granite-4.1-3b-GGUF- 显存
- 暂无估算
查看详情查看运行方式
llama.cpp -m granite-4.1-3b-Q4_K_M.gguf- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- Apache-2.0
- 国内可达
- 需代理
当前运行配置
lmstudio-community/granite-4.1-8b-GGUF- 显存
- 暂无估算
查看详情查看运行方式
llama.cpp -m granite-4.1-8b.gguf- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- apache-2.0
- 国内可达
- 需代理
当前运行配置
nvidia/Nemotron-Labs-Diffusion-14B- 显存
- 暂无估算
查看详情查看运行方式
transformers from_pretrained()- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- NVIDIA Nemotron Open Model License
- 国内可达
- 需代理
当前运行配置
prism-ml/Bonsai-8B-mlx-1bit- 显存
- ~1.2GB 1-bit(估算)
查看详情查看运行方式
pip install mlx-lm; pip install mlx@git+https://github.com/PrismML-Eng/mlx.git@prism; from mlx_lm import load; load('prism-ml/Bonsai-8B-mlx-1bit')- 许可证
- Apache-2.0
- 上下文
- 65k
- 国内可达
- 需代理
当前运行配置
jackxinning/Leanly_AI- 显存
- 暂无估算
查看详情查看运行方式
transformers: AutoModel.from_pretrained('jackxinning/Leanly_AI')- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- apache-2.0
- 国内可达
- 需代理
当前运行配置
FrontiersMind/Nandi-Mini-600M-Early-Checkpoint- 显存
- 暂无估算
查看详情查看运行方式
transformers.from_pretrained('FrontiersMind/Nandi-Mini-600M-Early-Checkpoint')- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- apache-2.0
- 上下文
- 2048
- 国内可达
- 需代理
没有同时满足所选条件的模型,试着去掉一个筛选。
常见坑
- 硬件门槛仍高:仅 2-bit 就需要 238GB,官方示例直接指向 256GB 内存机器或大显存环境,消费级显卡基本跑不动 —— Scrappy-Doo/GLM-5.2
- 1-bit 精度损失明显:top-1 准确率约 76.2%,明显低于 2-bit 的约 82%,高准确度任务不建议用 1-bit —— Scrappy-Doo/GLM-5.2
- 与闭源旗舰'持平'多为官方口径,社区同题 1v1 对比并未明确分出胜负,实际期望不宜拉满 —— Scrappy-Doo/GLM-5.2
- 默认版本审查较强,社区在四处寻找 abliterated 去审查文件,而这类文件有的要求公司邮箱申请、有的甚至收费 —— Scrappy-Doo/GLM-5.2
- 即使 1-bit 版本在 Mac Studio M3 Ultra 256GB 上也只有约 21.6 tok/s,实时对话体感一般 —— Scrappy-Doo/GLM-5.2
- GGUF 与去审查文件在社区里来源混杂,有第三方借机收费或设门槛,下载时需要甄别渠道 —— Scrappy-Doo/GLM-5.2
- llama.cpp 下推理速度低于 15 tok/s,远不如专用引擎 —— antirez/deepseek-v4-gguf
- 双 RTX 3060 + 96GB RAM 配置下 IQ2_M 量化仅约 3.5 tok/s —— antirez/deepseek-v4-gguf
展开其余 355 条
- 0731 版本相比原版 V4 Flash 出现约 10 倍成本增加的问题 —— antirez/deepseek-v4-gguf
- benchmark 表现强但实际使用稳定性不足,存在「benchmark maxed」现象 —— antirez/deepseek-v4-gguf
- 社区量化版本种类有限,Bartowski/unsloth 等主流量化作者尚未发布多种量化 —— antirez/deepseek-v4-gguf
- 独立评测覆盖不足,尚无足够非生成式评测以支撑公开排名 —— antirez/deepseek-v4-gguf
- 0731 版本无架构变更,此前 GGUF 的显存占用数据仍适用 —— antirez/deepseek-v4-gguf
- 30B 版本稳定性不足,存在较多错误 —— thunkaboutit/Koleslaw-Nemotron-30B-A3B-PromptEnhance
- 一致性不如 qwen3-coder 30B-A3B —— thunkaboutit/Koleslaw-Nemotron-30B-A3B-PromptEnhance
- 部分用户更倾向于使用 qwen3.6 或 gemma-4 —— thunkaboutit/Koleslaw-Nemotron-30B-A3B-PromptEnhance
- 因无 MTP 支持,推理速度明显慢于 Qwen —— lmstudio-community/Ornith-1.0-35B-MLX-6bit
- 在复杂 PHP 项目上表现不如 Qwen,代码审查时频繁误判代码变更 —— lmstudio-community/Ornith-1.0-35B-MLX-6bit
- 在重叠基准上弱于 Qwen 3.6 27B —— lmstudio-community/Ornith-1.0-35B-MLX-6bit
- 在部分任务中仅发现一个几乎所有模型都能发现的 bug,表现不佳 —— lmstudio-community/Ornith-1.0-35B-MLX-6bit
- 无工具对话场景下幻觉问题严重 —— lmstudio-community/Ornith-1.0-35B-MLX-6bit
- 9B 模型在无工具聊天中幻觉倾向明显,漏洞发现能力有限,仅能找到多数模型都能发现的常见问题 —— lmstudio-community/Ornith-1.0-9B-MLX-6bit
- 9B 模型推理速度不理想,实际任务完成度不佳 —— lmstudio-community/Ornith-1.0-9B-MLX-6bit
- 自称 self-improving 的说法引发社区质疑 —— lmstudio-community/Ornith-1.0-9B-MLX-6bit
- 本地部署困难,Hugging Face 上仅有 MLX 版本 —— meituan-longcat/LongCat-Flash-Lite-Sparse
- 在现有代码库上修改时容易破坏代码且无法自行修复 —— deepreinforce-ai/Ornith-1.0-35B
- 无原生 MTP,推理速度偏慢 —— deepreinforce-ai/Ornith-1.0-35B
- 在代码评测中仅发现多数模型都能发现的 bug,实际表现与 benchmark 排名不匹配 —— deepreinforce-ai/Ornith-1.0-35B
- 在无工具对话中倾向产生幻觉 —— deepreinforce-ai/Ornith-1.0-35B
- 在已有代码库上工作容易出错、难以修复 —— lmstudio-community/Ornith-1.0-35B-MLX-5bit
- 因无原生 MTP 支持,速度比 Qwen 慢 —— lmstudio-community/Ornith-1.0-35B-MLX-5bit
- 移植 MTP head 可提速约 5 tok/s,但非官方支持 —— lmstudio-community/Ornith-1.0-35B-MLX-5bit
- 独立编码任务稳定性不如 Qwen 3.5/3.6,容易出现 flaky 行为 —— deepreinforce-ai/Ornith-1.0-9B
- 实际 bug 发现能力弱于同等规模模型,与基准评测表现有落差 —— deepreinforce-ai/Ornith-1.0-9B
- 无工具支持的纯对话场景下幻觉倾向明显 —— deepreinforce-ai/Ornith-1.0-9B
- 实际使用一致性不如基准表现,存在'benchmark maxed'嫌疑 —— lmstudio-community/DeepSeek-V4-Flash-0731-GGUF
- 本地部署速度有限,IQ2_M 量化在双 3060 平台上仅约 3.5 tok/s —— lmstudio-community/DeepSeek-V4-Flash-0731-GGUF
- 部分社区用户认为实际价值被高估,不认可其热度 —— lmstudio-community/DeepSeek-V4-Flash-0731-GGUF
- 规则与提示词跟随能力在 Preview 阶段已存在问题,社区反馈可能延续至 0731 —— lmstudio-community/DeepSeek-V4-Flash-0731-GGUF
- 日常对话质量不及同内存占用的 Qwen 3.6 27B 和 Gemma 4 —— prism-ml/Bonsai-27B-gguf
- 在某些配置下会无限重复输出,难以正常完成代码编辑 —— EschaLabs/Qwen3.6-35B-A3B-Escha-W2
- 遇到不熟悉的代码容易出 eager error,几次调用就能破坏企业级代码库 —— EschaLabs/Qwen3.6-35B-A3B-Escha-W2
- 不擅长探索代码库和制定计划,需搭配能消化全量上下文的模型 —— EschaLabs/Qwen3.6-35B-A3B-Escha-W2
- 比 Claude 更挑剔/不稳定,需要较多人工引导 —— EschaLabs/Qwen3.6-35B-A3B-Escha-W2
- 输出非常冗长(very verbose) —— EschaLabs/Qwen3.6-35B-A3B-Escha-W2
- 在同尺寸开源模型中价格偏高 —— EschaLabs/Qwen3.6-35B-A3B-Escha-W2
- 存在使用错误版本(未固定 layers)导致体验差的情况 —— EschaLabs/Qwen3.6-35B-A3B-Escha-W2
- benchmark 在知识和技能维度上明显弱于部分竞品 —— EschaLabs/Qwen3.6-35B-A3B-Escha-W2
- 社区口碑分歧大,同一用户在不同测试中感知不到与原始 Qwen3.6 27B 的差异 —— KyleHessling1/Qwopus3.6-27B-Fusion-GGUF
- 有用户试用后最终转向了其他社区变体(如 Heretic-Uncensored) —— KyleHessling1/Qwopus3.6-27B-Fusion-GGUF
- 授权协议限制仅用于学术和研究活动,任何商业用途均构成违规 —— amd/Instella-MoE-16B-A3B-Think
- 2.8B 活跃参数仍需 16B 模型的显存规划,推理成本并不低 —— amd/Instella-MoE-16B-A3B-Think
- 加载模型需要 trust_remote_code=True,存在安全和使用门槛 —— amd/Instella-MoE-16B-A3B-Think
- 首选部署路径为 Linux,Windows 支持存在但非优先 —— amd/Instella-MoE-16B-A3B-Think
- 推理速度约 9-13 tokens/秒,不适合交互式使用 —— poolside/Laguna-XS-2.1
- 首次生成的代码可能需要调整才能运行 —— poolside/Laguna-XS-2.1
- 实际表现参差不齐,仍落后于 OpenAI 的最优模型 —— mradermacher/Grok-3-reasoning-gemma3-4B-distilled-HF-GGUF
- 暂无加权/imatrix 量化版本可用 —— mradermacher/Grok-3-reasoning-gemma3-4B-distilled-HF-GGUF
- Q3_K_M 量化被标注为 lower quality —— mradermacher/Grok-3-reasoning-gemma3-4B-distilled-HF-GGUF
- f16 量化体积 7.9GB,对 4B 模型而言被标注为 overkill —— mradermacher/Grok-3-reasoning-gemma3-4B-distilled-HF-GGUF
- Gemma 3 4B 基座在 GPQA Diamond(30.8)和 MMLU Pro(40.5)等推理基准上得分较低 —— mradermacher/Grok-3-reasoning-gemma3-4B-distilled-HF-GGUF
- 初期存在循环推理 bug(FP8 版本更新后已修复) —— poolside/Laguna-S-2.1-GGUF
- 新模型发布初期可能存在未发现的稳定性问题,社区建议等待 1-2 周再使用 —— poolside/Laguna-S-2.1-GGUF
- 在压力下会自信地'发明'事实,不宜用于处理真实数据的自主代理 —— poolside/Laguna-S-2.1-NVFP4
- 存在已知的循环输出问题,会陷入无限重复或过度思考(20分钟以上) —— poolside/Laguna-S-2.1-NVFP4
- 工具使用偶有故障,会忘记如何读取文件等 —— poolside/Laguna-S-2.1-NVFP4
- 一致性和智能程度不如DeepSeek V4 Flash,不在同一级别 —— poolside/Laguna-S-2.1-NVFP4
- RTX6000上存在已知bug(poolside正在修复) —— poolside/Laguna-S-2.1-NVFP4
- 通用闲聊明显不是强项 —— AtomicChat/ornith-35b-MLX-8bit
- 对已有代码的精确阅读和按提示定向修改能力较弱 —— AtomicChat/ornith-35b-MLX-8bit
- 复杂任务仍可能跑不通(如完整游戏模拟器未成功运行) —— AtomicChat/ornith-35b-MLX-8bit
- 不适合一般闲聊对话 —— AtomicChat/ornith-35b-MLX-6bit
- 对已有代码库的精读与精准增量修改能力偏弱 —— AtomicChat/ornith-35b-MLX-6bit
- 复杂项目(如 elevator simulator)存在生成失败的情况 —— AtomicChat/ornith-35b-MLX-6bit
- 需正确配置推理运行时才能正确处理 reasoning tag 和 tool call,否则表现会明显变差 —— AtomicChat/ornith-35b-MLX-6bit
- 安全过滤极为严格,频繁拒答 —— majentik/gpt-oss-20b-TurboQuant-MLX-2bit
- 输出中过度重复'alternatively'等固定词汇,日常使用体验不佳 —— majentik/gpt-oss-20b-TurboQuant-MLX-2bit
- 部分用户评价极低,称其为'最愚蠢的 COT MOE 模型' —— majentik/gpt-oss-20b-TurboQuant-MLX-2bit
- 量化版本(如 Q4KM)在复杂任务上质量下降明显,全精度版本更可靠 —— andreaborio/Qwen3.6-35B-A3B-DS4-ExpertMajor-v1-GGUF
- chat_template 配置不当会导致 thinking/reasoning/tool calling 异常 —— andreaborio/Qwen3.6-35B-A3B-DS4-ExpertMajor-v1-GGUF
- JSON 输出在特定场景下不可靠 —— andreaborio/Qwen3.6-35B-A3B-DS4-ExpertMajor-v1-GGUF
- 上下文增长后速度明显变慢 —— andreaborio/Qwen3.6-35B-A3B-DS4-ExpertMajor-v1-GGUF
- 量化版本的速度比 Gemma 4 26B A4B 略慢 —— andreaborio/Qwen3.6-35B-A3B-DS4-ExpertMajor-v1-GGUF
- 手机端实际运行速度偏慢 —— prism-ml/Bonsai-27B-mlx-1bit
- 底模是 Qwen,核心创新在压缩效率而非模型本身 —— prism-ml/Bonsai-27B-mlx-1bit
- 三元版本在质量对比中不敌同体量传统量化 Q2_K_XL —— prism-ml/Bonsai-27B-mlx-1bit
- 综合基准测试得分明显低于近期主流同规模模型 —— RavichandranJ/Dolphin3-Cyber-8B-GGUF
- 通用系统提示下表现不稳定,需针对性调整提示词才能发挥领域优势 —— RavichandranJ/Dolphin3-Cyber-8B-GGUF
- 领域高度专精,通用对话和泛化能力受限 —— RavichandranJ/Dolphin3-Cyber-8B-GGUF
- 直接替换现有翻译方案存在风险,需自行评估输出质量、数据隔离和合规性 —— alphaZimuth/Hy-MT2-30B-A3B-APEX-GGUF
- 缺少大规模第三方社区实测,现有基准主要来自官方论文和少量自媒体评测 —— alphaZimuth/Hy-MT2-30B-A3B-APEX-GGUF
- 非前沿级智能,整体生成质量与更大的旗舰模型存在差距,落后于 GLM-5.2 等当前开源 SOTA —— AngelSlim/Hy3-GGUF
- 复杂任务中存在用近似代替精确物理计算的情况,偶有边缘情况 bug —— AngelSlim/Hy3-GGUF
- 可能产出不准确、有偏见或不安全的输出 —— GnLOLot/MiniCPM5-1B-Claude-Opus-Fable5-Thinking
- 高风险场景使用前需人工审核验证 —— GnLOLot/MiniCPM5-1B-Claude-Opus-Fable5-Thinking
- 代码分析任务中容易产生幻觉,无法替代专用编码 agent —— mlx-community/NVIDIA-Nemotron-3-Nano-30B-A3B-OptiQ-4bit
- 部分用户认为 Qwen 3 Coder 30B A3B 更快且更优 —— mlx-community/NVIDIA-Nemotron-3-Nano-30B-A3B-OptiQ-4bit
- 9.6% 幻觉率,与 qwen3-next-80b-a3b-thinking(9.3%)接近但模型小得多 —— mlx-community/NVIDIA-Nemotron-3-Nano-30B-A3B-OptiQ-4bit
- 30B 参数却叫 Nano 有误导性 —— mlx-community/NVIDIA-Nemotron-3-Nano-30B-A3B-OptiQ-4bit
- 实际质量不如4bit量化(Q4),困惑度显著更高(PPL 13.8 vs 7.3) —— prism-ml/Ternary-Bonsai-27B-mlx-2bit
- CPU上三元推理尚未优化,速度极低(0.7-0.8 tok/s),目前仅在GPU上有实用价值 —— prism-ml/Ternary-Bonsai-27B-mlx-2bit
- 质量明显不如 Q4 量化,PPL(13.8)接近 Q4(7.3)的两倍 —— prism-ml/Ternary-Bonsai-27B-gguf
- 在 KB 问答场景下,传统 Q2_K_XL 在指令遵循和内容理解上表现更好 —— prism-ml/Ternary-Bonsai-27B-gguf
- 量化版在困难任务上质量退化严重,Q4_K_M 级别会暴露明显局限,不适合生产环境 —— aquaman164/Qwen3.6-35B-A3B-MLX-VQ-2.6bpw
- chat_template 配置极为敏感,沿用 Qwen3.5 的模板会出现 timeout、thinking 失效等大量错误,须用默认配置 —— aquaman164/Qwen3.6-35B-A3B-MLX-VQ-2.6bpw
- 部分自测显示 HumanEval / HumanEval+ 得分不及 Qwen3.5,Gemma 4 31B 和 26B-A4B 在该基准上反而更高 —— aquaman164/Qwen3.6-35B-A3B-MLX-VQ-2.6bpw
- 低量化版本(q5)在 opencode 中会无限重复输出,基本不可用 —— aquaman164/Qwen3.6-35B-A3B-MLX-VQ-2.6bpw
- 量化版 kv cache 在某些配置下性能极差,即使全部可放入 VRAM 也会强制走 CPU 处理 —— aquaman164/Qwen3.6-35B-A3B-MLX-VQ-2.6bpw
- 视觉 benchmark 对比数据为厂商自报,第三方独立评测尚未复现,RealWorldQA 差距可疑 —— aquaman164/Qwen3.6-35B-A3B-MLX-VQ-2.6bpw
- 上下文增长后推理速度明显变慢 —— aquaman164/Qwen3.6-35B-A3B-MLX-VQ-2.6bpw
- 偶有循环输出,需手动停止并重新提示才能继续 —— aquaman164/Qwen3.6-35B-A3B-MLX-VQ-2.6bpw
- 不擅长精确理解和修改已有代码,容易偏离预期改动 —— nathansutton/Ornith-1.0-35B-UD-Q2_K_XL-MLX
- 在代码移植/对齐场景下可能出现幻觉式修改,把正确的代码改坏 —— nathansutton/Ornith-1.0-35B-UD-Q2_K_XL-MLX
- 部分用户反馈其调试能力(找 bug)表现一般,虽然基准评测分数高 —— nathansutton/Ornith-1.0-35B-UD-Q2_K_XL-MLX
- 下载量仅67次,缺少真实用户社区的广泛验证 —— empero-ai/Qwythos-9B-v2
- 评测分数来自实验室内部框架而非标准Open LLM Leaderboard,与其他模型横向对比困难 —— empero-ai/Qwythos-9B-v2
- 社区反馈与已知失效模式信息稀少 —— empero-ai/Qwythos-9B-v2
- 文本推理容易产生幻觉,在代码分析任务中表现不佳 —— nvidia/Nemotron-Labs-Audex-2B
- 发布首日部分资源链接(SFT 数据集)404 失效 —— nvidia/Nemotron-Labs-Audex-2B
- 使用 XCodec2 解码音频可获得更好质量但无法流式输出 —— nvidia/Nemotron-Labs-Audex-2B
- 推测解码在不同任务上浪费率 22%-40%,code 类任务浪费最高达 40% —— nvidia/NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B-NVFP4
- 131K 上下文长度下需将 GPU 内存利用率降至 0.5 才能保证 4 并发序列 —— nvidia/NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B-NVFP4
- 代码分析任务幻觉严重,给定代码库后立即开始编造信息,无法替代真正的编码 agent —— nvidia/Nemotron-Labs-Audex-30B-A3B
- 30B 参数却命名为 'Nano',社区普遍认为名称具有误导性 —— nvidia/Nemotron-Labs-Audex-30B-A3B
- 社区讨论度和实际采用率远低于 Qwen / Gemma 等同期竞品 —— nvidia/Nemotron-Labs-Audex-30B-A3B
- 无法装入 RTX 5090,对高端消费级显卡的部署仍有门槛 —— nvidia/Nemotron-Labs-Audex-30B-A3B
- 当前状态不佳,业务挣扎导致技术侧妥协 —— kai-os/Grug-12B
- 几乎无人为平台开发应用,生态萎缩 —— kai-os/Grug-12B
- 安全方面存在明显短板 —— kai-os/Grug-12B
- 性能声明主要来自团队自身评测,缺乏第三方独立验证 —— InternScience/Agents-A1
- 项目较新(2026年7月),社区生态和长期稳定性尚未验证 —— InternScience/Agents-A1
- 35B MoE 模型对本地部署硬件要求较高,需 A6000/A5000 等企业级 GPU —— InternScience/Agents-A1
- 仍处于早期预训练阶段,仅为checkpoint而非成品模型 —— Smilyai-labs/Nova-1-Standard-1.3B-Preview
- 合规性与行为表现评级为F- —— Smilyai-labs/Nova-1-Standard-1.3B-Preview
- 无特定功能特性 —— Smilyai-labs/Nova-1-Standard-1.3B-Preview
- 对量化精度和推理参数极其敏感,参数不对时表现明显下降 —— manjunathshiva/Qwen3.6-35B-A3B-tq3a-tqTe-g64
- MoE 的专家激活机制并不像社区预期那样能「解锁」更多模型能力 —— manjunathshiva/Qwen3.6-35B-A3B-tq3a-tqTe-g64
- Power Ranking 编码任务仅比上代 Qwen 3.5 同尺寸略好(11/98 vs 10/98),提升有限 —— manjunathshiva/Qwen3.6-35B-A3B-tq3a-tqTe-g64
- 在编码任务上被 Qwen 3.5 27B 密集模型大幅超越(26/98 vs 11/98),不属同一级别 —— manjunathshiva/Qwen3.6-35B-A3B-tq3a-tqTe-g64
- 知识和技能类基准表现明显弱于其他维度,存在「刷榜」嫌疑 —— manjunathshiva/Qwen3.6-35B-A3B-tq3a-tqTe-g64
- SVG 生成在物理合理性/遵循约束方面不如 Claude Opus 4.7 —— manjunathshiva/Qwen3.6-35B-A3B-tq3a-tqTe-g64
- 表现不稳定,属于「碰对了参数就很好用」的类型 —— manjunathshiva/Qwen3.6-35B-A3B-tq3a-tqTe-g64
- 标准 mlx-lm 不支持 gemma4 架构,必须使用 mlx-vlm >= 0.4.3 —— ailexleon/Gemma4-Gutenberg-31B-Heretic-mlx-8Bit
- 加载时出现 mel filter warning,虽无害但可能引起困惑 —— ailexleon/Gemma4-Gutenberg-31B-Heretic-mlx-8Bit
- DDR4 内存上生成速度仅 3-8 tok/s,低于人类阅读速度(~4-5 tok/s) —— ailexleon/Gemma4-Gutenberg-31B-Heretic-mlx-8Bit
- 密集模型每 token 激活全部 31B 参数,FLOP 成本高于同等能力的 MoE 模型 —— ailexleon/Gemma4-Gutenberg-31B-Heretic-mlx-8Bit
- 多 GPU 纵向扩展效率低,在大多数情况下添加更多 GPU 是浪费钱 —— ailexleon/Gemma4-Gutenberg-31B-Heretic-mlx-8Bit
- HLE 得分仅 26.5,远低于 GLM-5 (50.4) 和 Kimi K2.5 (50.2) —— ailexleon/Gemma4-Gutenberg-31B-Heretic-mlx-8Bit
- 完整下载约需 150GB 磁盘空间 —— ailexleon/Gemma4-Gutenberg-31B-Heretic-mlx-8Bit
- 26B A4B MoE 版本仅落后 2-3% 但快 2-4 倍,性价比更高 —— ailexleon/Gemma4-Gutenberg-31B-Heretic-mlx-8Bit
- GLM-5.2 原版 Willingness 评分仅 28%,常静默审查,合规意愿低(证据 4) —— huihui-ai/Huihui-GLM-5.2-abliterated-GGUF
- 有用户认为 abliteration 不值得以性能/质量损失为代价(证据 6) —— huihui-ai/Huihui-GLM-5.2-abliterated-GGUF
- 整体能力不及 Opus 4.8(证据 0) —— huihui-ai/Huihui-GLM-5.2-abliterated-GGUF
- 无优化时推理速度仅约 2.5 tok/s,需额外优化才能实用(证据 2) —— huihui-ai/Huihui-GLM-5.2-abliterated-GGUF
- 官方建议仅用于研究/实验,不推荐直接用于生产环境(证据 12) —— huihui-ai/Huihui-GLM-5.2-abliterated-GGUF
- 社区实测反馈极少,除个别用户外缺乏广泛真实使用验证 —— nvidia/Nemotron-Labs-TwoTower-30B-A3B-Base-BF16
- NVFP4 相比 FP8 的质量损失尚未被充分验证 —— nvidia/Qwen3.6-27B-NVFP4
- 需要约 40 GB VRAM,最低需 L40S 48GB 或双卡方案 —— nvidia/Qwen3.6-27B-NVFP4
- 双 3090 方案占用空间大、发热高 —— nvidia/Qwen3.6-27B-NVFP4
- DGX Spark 上 35B MoE NVFP4 加推测解码实际仅约 50 tok/s,远低于宣传的 110 tok/s —— nvidia/Qwen3.6-27B-NVFP4
- NVFP4 在 Blackwell (SM120) 上并不比 FP8 更快 —— nvidia/Qwen3.6-27B-NVFP4
- 作为 CLI 编码代理配置(opencode)需要额外调校,不如 Claude Code 开箱即用 —— nvidia/Qwen3.6-27B-NVFP4
- NVIDIA 版本的 NVFP4 部分不使用 NVFP4 激活,仅做权重量化 —— nvidia/Qwen3.6-27B-NVFP4
- vLLM 在 16GB 消费卡上内存上限为 16K,长上下文受限 —— nvidia/Qwen3.6-27B-NVFP4
- 代码审查准确度差,经 Claude/ChatGPT 交叉评估后评价很低 —— mudler/LFM2.5-8B-A1B-APEX-GGUF
- Liquid 前代模型长期被 Gemma/Gwen 压着打,声誉透支 —— mudler/LFM2.5-8B-A1B-APEX-GGUF
- 官方明确声明不适用于所有工作负载 —— mudler/LFM2.5-8B-A1B-APEX-GGUF
- Hacker News 社区仍有「顺势疗法 AI」的嘲讽 —— mudler/LFM2.5-8B-A1B-APEX-GGUF
- 官方声明模型输出需经人工验证后方可用于实际安全操作 —— BugTraceAI/BugTraceAI-CORE-Ultra-27B-Q6
- 代码审查不准确——被 Claude 和 ChatGPT 评估后给出负面评价 —— LiquidAI/LFM2.5-230M
- 主要面向基准测试优化,非基准场景表现可能不及预期 —— squ11z1/Mythos-nano
- 在复杂分析任务中可能遗漏关键问题 —— squ11z1/Mythos-nano
- 存在 cherry-picking 选择性展示最佳结果的嫌疑 —— squ11z1/Mythos-nano
- 超强能力声称受社区广泛质疑 —— squ11z1/Mythos-nano
- 存在为基准榜单优化的嫌疑,实际通用能力存疑 —— mradermacher/Mythos-nano-i1-GGUF
- 可能通过 cherry-picking 选择性展示结果 —— mradermacher/Mythos-nano-i1-GGUF
- 相对于前沿模型的实际提升幅度被社区质疑 —— mradermacher/Mythos-nano-i1-GGUF
- 并非 Claude 替代品,声称能平替 Claude 的说法被社区认为夸大 —— hotdogs/qwen3.6-27b-fable5-lora
- 将 opencode 调通为 CLI agent 需要大量调参,远不如 Claude Code 开箱即用 —— hotdogs/qwen3.6-27b-fable5-lora
- 在部分基准上 Qwen3.6 反而不如 Qwen3.5 和 Gemma 4 —— hotdogs/qwen3.6-27b-fable5-lora
- 因内置思考与规划机制,响应速度比 35B-A3B 慢 —— hotdogs/qwen3.6-27b-fable5-lora
- hotdogs LoRA 仓库要求同意联系方式共享才能访问模型文件 —— hotdogs/qwen3.6-27b-fable5-lora
- 模型已被微软从 HuggingFace 和 GitHub 全面下架,无法获取 —— microsoft/FastContext-1.0-4B-RL
- 社区实测中文件路径返回存在不准确/幻觉问题 —— microsoft/FastContext-1.0-4B-RL
- 有用户明确反馈效果差(Because it's trash apparently) —— microsoft/FastContext-1.0-4B-RL
- 函数级 F1 仅 38.45,细粒度定位能力有限 —— microsoft/FastContext-1.0-4B-RL
- 社区讨论度极低(HN 仅 3 points, 1 条评论),缺乏广泛验证 —— microsoft/FastContext-1.0-4B-RL
- 社区指出更应关注子 agent 行为本身,而非仅端到端结果 —— microsoft/FastContext-1.0-4B-RL
- 最早发布的 google/gemma-4-12B-it 权重有问题,已重新 ablation 并上传,已下载用户需重新下载 —— huihui-ai/Huihui-gemma-4-12B-coder-fable5-composer2.5-v1-abliterated
- Gemma 12B 是唯一没有视觉编码器的版本,图像理解可能受限 —— huihui-ai/Huihui-gemma-4-12B-coder-fable5-composer2.5-v1-abliterated
- abliteration 是「粗略的概念验证」实现,并非精细优化的安全方案 —— huihui-ai/Huihui-gemma-4-12B-coder-fable5-composer2.5-v1-abliterated
- 官方明确警告安全过滤大幅降低,可能生成敏感或不当内容,不适合所有受众 —— huihui-ai/Huihui-gemma-4-12B-coder-fable5-composer2.5-v1-abliterated
- coder 变体在 Spheron 估算的 VRAM 需求约 26 GB,对部分消费级 GPU 仍偏高 —— huihui-ai/Huihui-gemma-4-12B-coder-fable5-composer2.5-v1-abliterated
- 思考/规划阶段耗时较长,可能等待数分钟才开始执行 —— deepseek-ai/DeepSeek-V4-Flash
- 有时会忽略用户给出的具体指令 —— deepseek-ai/DeepSeek-V4-Flash
- 一次生成往往不够,需要多轮 review/refactor 才能达到满意结果 —— deepseek-ai/DeepSeek-V4-Flash
- 存在 expired-lease 完成 bug:原 worker 已释放租约但仍可能继续完成步骤 —— deepseek-ai/DeepSeek-V4-Flash
- 长上下文检索任务(800K token 仓库中定位函数调用图)表现明显弱于 Pro-Max(1/3 vs 3/3) —— deepseek-ai/DeepSeek-V4-Flash
- 复杂推理、长链条调试和分析型任务不如 V4 Pro 稳定 —— deepseek-ai/DeepSeek-V4-Flash
- 在扩展思考(extended thinking)和真实场景中,Qwen 3.6 Plus、Minimax M2.7、GLM 5.1 等国产模型表现更优 —— deepseek-ai/DeepSeek-V4-Flash
- 部分场景下 token 生成速度偏慢 —— deepseek-ai/DeepSeek-V4-Flash
- 对系统指令极为字面化且敏感,容易因提示措辞产生意外行为 —— deepseek-ai/DeepSeek-V4-Pro
- 细节丰富程度不如 Claude Opus —— deepseek-ai/DeepSeek-V4-Pro
- 代码库规模和复杂度增大后,对模糊提示的容错性显著下降,要求精确描述 —— deepseek-ai/DeepSeek-V4-Pro
- 在 Arena 众包用户偏好基准上表现不佳,用户主观偏好低于能力基准得分 —— deepseek-ai/DeepSeek-V4-Pro
- 在编码工具链中存在低效的随机搜索和 grep 行为,部分归因于 harness —— deepseek-ai/DeepSeek-V4-Pro
- 基准测试中输出 token 消耗远高于同类开源模型中位数(190M vs 47M),运行成本达 $1,071 —— deepseek-ai/DeepSeek-V4-Pro
- 编码能力存在分歧,部分用户认为 Kimi K2.6 编码更强 —— deepseek-ai/DeepSeek-V4-Pro
- 量化质量参差不齐,早期 Unsloth 量化存在严重循环和低质量问题 —— wepiqx/gemma-4-12B-it-SHQ6-GGUF
- 编码能力社区争议大,多名用户认为 Qwen 在编程尤其是 agentic coding 上远优于 Gemma —— wepiqx/gemma-4-12B-it-SHQ6-GGUF
- 与 opencode 等工具的兼容性存在问题,工具调用和文件写入不可靠 —— wepiqx/gemma-4-12B-it-SHQ6-GGUF
- Q4 量化下质量明显下降,几乎所有任务都出错 —— wepiqx/gemma-4-12B-it-SHQ6-GGUF
- 难度较高的技术问题上不如 Qwen 3.5 —— wepiqx/gemma-4-12B-it-SHQ6-GGUF
- 多语言尤其是亚洲语言覆盖不如 Qwen2.5-14B —— wepiqx/gemma-4-12B-it-SHQ6-GGUF
- 早期 Unsloth 量化需要约 4 小时调试才能正常工作 —— wepiqx/gemma-4-12B-it-SHQ6-GGUF
- 工具调用和指令遵循能力极弱,忽略指令的情况比竞品更多 —— Gryphe/Gemma-4-31B-StyleTune
- 在深度推理方面仍无法触及前沿闭源模型 —— Gryphe/Gemma-4-31B-StyleTune
- 31B Dense 需全部加载,24GB 显存的 RTX 4090 成为瓶颈,需借助系统内存卸载 —— Gryphe/Gemma-4-31B-StyleTune
- 对硬件配置敏感,部分用户报告模型表现偏执且不适合其硬件 —— Gryphe/Gemma-4-31B-StyleTune
- 在带宽受限条件下,26B MoE 的解码吞吐量显著高于 31B Dense —— Gryphe/Gemma-4-31B-StyleTune
- 不支持工具调用(tool use),官方定位仅限竞赛编程/可验证编码任务 —— WeiboAI/VibeThinker-3B
- 实际编码任务(如根据论文 PDF 实现线性代数)表现远不如 Qwen3.5-4B —— WeiboAI/VibeThinker-3B
- 社区怀疑存在严重的 benchmark 过拟合(benchmaxing),跑分与实际体验落差大 —— WeiboAI/VibeThinker-3B
- 量化推理行为文档不足,量化后表现不稳定 —— WeiboAI/VibeThinker-3B
- 微软已删除原始模型仓库及 GitHub 页面,官方分发渠道已不可用 —— microsoft/FastContext-1.0-4B-SFT
- 检索结果存在准确性缺陷,社区实测中出现返回不存在文件路径的情况 —— microsoft/FastContext-1.0-4B-SFT
- 社区反馈综合体验不佳,有用户直接评价为'trash' —— microsoft/FastContext-1.0-4B-SFT
- 论文自述部分基准任务可能与预训练数据有重叠,结果需谨慎解读 —— microsoft/FastContext-1.0-4B-SFT
- vLLM 部署时需使用 hermes 解析器,不能直接使用通用 OpenAI tools schema —— microsoft/FastContext-1.0-4B-SFT
- 模型使用 tie_word_embeddings=true,lm_head 权重可能与常规 checkpoint 结构不同 —— microsoft/FastContext-1.0-4B-SFT
- NVFP4 格式的 KV cache 在主流部署栈上不可用,需使用 fp8 KV —— microsoft/FastContext-1.0-4B-SFT
- 仅在单一工具调用路由基准上验证,缺乏通用编码任务或实际项目中的实测数据 —— mradermacher/prism-coder-14b-GGUF
- 事实准确性差,实测错误率是常规 Gemma 4 的约 6 倍(33 正确 vs 28 错误),官方明确质量低于常规版 —— nvidia/diffusiongemma-26B-A4B-it-NVFP4
- 易编造人名、日期、数字等细节(如虚构 Steve Jobs 母亲的名字、虚构同事名字、编造产品价格) —— nvidia/diffusiongemma-26B-A4B-it-NVFP4
- 冷门话题准确性更差(Jobs 4 错,Tetris 12 错,BeOS 12 错) —— nvidia/diffusiongemma-26B-A4B-it-NVFP4
- Tool calling 精度不足,社区反馈需要更高精确度的场景表现不佳 —— nvidia/diffusiongemma-26B-A4B-it-NVFP4
- 非数据中心 GPU 上 NVFP4 支持存在兼容性问题 —— nvidia/diffusiongemma-26B-A4B-it-NVFP4
- 多 GPU 配置存在问题 —— nvidia/diffusiongemma-26B-A4B-it-NVFP4
- JSON 输出存在 delimiter 拆分 bug 和引号重复问题(BF16 版本同样存在) —— nvidia/diffusiongemma-26B-A4B-it-NVFP4
- Google 官方将其定位为实验性模型,明确建议事实敏感场景使用常规 Gemma 4 —— nvidia/diffusiongemma-26B-A4B-it-NVFP4
- 官方说明不够直白,有用户追问『具体做什么』,描述难让人快速理解 —— BennyDaBall/Z-Image-Engineer-V6
- 同族代号/命名相近(V6、Qwen3-4b-Z-Image-Engineer-V2.5 等),该选哪个容易困惑 —— BennyDaBall/Z-Image-Engineer-V6
- 不走自定义节点时需要手动搭配 CLIPLoaderGGUF(lumina2 类型)与相应采样参数,配置步骤偏多 —— BennyDaBall/Z-Image-Engineer-V6
- 代码偶尔出现低级语法错误(多出括号、逗号分隔函数定义),需手工修补 —— yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUF
- 多数社区观点认为 35B 以下的本地权重做编程不值,直接上云端更划算 —— yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUF
- 编码能力不如 Qwen —— yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUF
- 思考过程 token 消耗很大 —— yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUF
- 微调宣称的收益没有放出评测链接,质疑者难以自行核验 —— yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUF
- 体量效率被吐槽:参数不到一半的 26B MoE 反而赢它 —— yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUF
- 本地参数设置不当会明显拖累实际效果 —— yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUF
- Artificial Analysis 智能指数低于 GPT-4o Mini 与 Claude 3.5 Haiku —— yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUF
- 官方明确声明不是 SOTA 最终模型,仅为基础预训练阶段产物 —— silx-ai/Quasar-Preview
- 训练来源与数据出处受到社区质疑 —— silx-ai/Quasar-Preview
- 关联代币 SN24 alpha token 因质疑单日暴跌约 70%-75% —— silx-ai/Quasar-Preview
- 模型性能依赖后续 Bittensor 子网迭代蒸馏周期,当前独立使用价值有限 —— silx-ai/Quasar-Preview
- 证据仅涉及缩放定律预测精度,无社区讨论涉及模型实际生成质量、推理吞吐或日常使用体验 —— marin-community/delphi-1e23-25Bparams-628Btokens
- 当前讨论集中在训练效率与损失预测,缺乏下游任务评估(benchmark 表现、人类偏好等)的证据 —— marin-community/delphi-1e23-25Bparams-628Btokens
- Ollama 更新 llama.cpp 依赖较慢,最新版本可能无法及时通过 Ollama 使用 —— LiquidAI/LFM2.5-1.2B-JP-202606
- 作为辅助模型使用时需通过 JIT 加载/卸载,增加使用复杂度 —— LiquidAI/LFM2.5-1.2B-JP-202606
- Harness-1 仅返回策展文档集,不直接回答问题,需搭配下游回答模型 —— pat-jj/harness-1
- 移除 harness 机制后召回率相对下降 12.2%,性能高度依赖该基础设施 —— pat-jj/harness-1
- 代码输出偶发琐碎语法错误:多余的闭合括号/括号、用逗号分隔函数定义,需手动修正 —— OBLITERATUS/Gemma-4-12B-OBLITERATED
- 代码准确率被认为低于略大的 Qwen —— OBLITERATUS/Gemma-4-12B-OBLITERATED
- KV cache 行为异常、内存占用偏大:约 7GB 仅能容纳 20k tokens,疑似滑动窗口注意力在 oMLX 等运行时未生效 —— OBLITERATUS/Gemma-4-12B-OBLITERATED
- 角色扮演场景明显较弱,16GB VRAM 用户用紧量化跑 31B dense 反而效果更好 —— OBLITERATUS/Gemma-4-12B-OBLITERATED
- 能力上限仍低于 27B/31B,只是「相当接近」而非真正比肩 —— OBLITERATUS/Gemma-4-12B-OBLITERATED
- 在 Artificial Analysis 智能指数上仅 9 分,明显低于 GPT-4o Mini(13)与 Claude 3.5 Haiku(19) —— OBLITERATUS/Gemma-4-12B-OBLITERATED
- abliteration 会引入 KL 散度等退化,且跨架构直接对比此类指标意义有限 —— OBLITERATUS/Gemma-4-12B-OBLITERATED
- 基于Qwen3.5-35B-A3B-Base微调,非自研基座模型 —— nex-agi/Nex-N2-mini
- Toolathlon仅33.3分,工具调用/Agent能力与Pro版差距显著 —— nex-agi/Nex-N2-mini
- 社区实际使用反馈极少,大部分讨论集中在Pro版 —— nex-agi/Nex-N2-mini
- MLX 4bit 出现不稳定报告(无限循环、逻辑异常),有用户改用更小的 8bit 反而更可靠。 —— mlx-community/Qwen3.5-0.8B-OptiQ-4bit
- MLX 内存占用高、频繁崩溃,部分用户因此转向 GGUF。 —— mlx-community/Qwen3.5-0.8B-OptiQ-4bit
- 位宽分配基于 KL 散度敏感度校准,最终质量依赖校准集的构成。 —— mlx-community/Qwen3.5-0.8B-OptiQ-4bit
- 复杂/长计算任务上尺寸差距明显,小尺寸更容易暴露短板(家族对比中 27B 与 122B 差距大)。 —— mlx-community/Qwen3.5-0.8B-OptiQ-4bit
- 实际体验与硬件平台相关:有用户反映 M1 Max 上 MLX 不稳定、占满内存,也有人几分钟内就在 RTX 5090 上跑起同系列。 —— mlx-community/Qwen3.5-0.8B-OptiQ-4bit
- 4bit 是否够用在社区仍有分歧:有人觉得最优 4bit 就够,有人宁选更小尺寸的 8bit 保证稳定性。 —— mlx-community/Qwen3.5-0.8B-OptiQ-4bit
- MLX 稳定性不佳:有 m1 max 32GB 用户反映 MLX 量化会占满内存、频繁崩溃,最终改用 gguf。 —— mlx-community/Qwen3.5-2B-OptiQ-4bit
- mxfp4 被部分人认为更快更好:评论称其优于 q4 且速度更快,因为 Apple Silicon 的 MLX 内核针对均匀 fp4 数学优化。 —— mlx-community/Qwen3.5-2B-OptiQ-4bit
- 2B 只适合当辅助:社区把它定位成「lighter and faster」的补充,复杂推理仍依赖主力。 —— mlx-community/Qwen3.5-2B-OptiQ-4bit
- 4bit 与 8bit 取舍仍有讨论:虽有人认为最优 4-bit 已足够,但该话题仍是社区常议。 —— mlx-community/Qwen3.5-2B-OptiQ-4bit
- 受 llama.cpp MTP 机制限制:不支持 -np > 1 并行,不支持 --mmproj —— Youssofal/Qwen3.6-27B-MTPLX-Optimized-Speed
- 依赖 llama.cpp PR #22673,对推理框架版本有硬性要求 —— Youssofal/Qwen3.6-27B-MTPLX-Optimized-Speed
- agentic 编码强但探索/理解整个代码库、制定计划偏弱,这类任务需要搭配能吞下全上下文的模型 —— Youssofal/Qwen3.6-27B-MTPLX-Optimized-Speed
- 使用体验比 Claude 更「较劲」,需要逐步人工引导才出彩 —— Youssofal/Qwen3.6-27B-MTPLX-Optimized-Speed
- 多模态与 grounded 任务排名靠后:34 个候选模型里排第 24,54.1/100 —— Youssofal/Qwen3.6-27B-MTPLX-Optimized-Speed
- IQ4_XS 量化有已知坑:此前 llama.cpp 的 bug 让 IQ4_XS 量化体积偏大,16GB 显存场景建议用 llama-quantize 默认参数、不要加 --pure —— Youssofal/Qwen3.6-27B-MTPLX-Optimized-Speed
- 内存门槛约 20GB 起步,并非任意配置都能跑;双 16GB 卡也不一定够 —— mlx-community/Qwen3.6-27B-OptiQ-4bit
- MLX 不总是最快的推理后端,llama.cpp 在部分场景反而更快 —— mlx-community/Qwen3.6-27B-OptiQ-4bit
- 密集 27B 生成速度明显低于稀疏 35B-A3B(约 17-18 vs 52 token/s),速度敏感者应选 MoE 形态 —— mlx-community/Qwen3.6-27B-OptiQ-4bit
- 配套的 oMLX 客户端 UI 在下载或改设置时容易崩溃 —— mlx-community/Qwen3.6-27B-OptiQ-4bit
- 想用 MTP 功能时需转 llama.cpp/GGUF,MLX 侧缺 16bit 支持 —— mlx-community/Qwen3.6-27B-OptiQ-4bit
- 针对 Qwen3.6-27B-OptiQ-4bit 的独立第三方基准仍偏少,口碑多来自相邻量化与官方数据 —— mlx-community/Qwen3.6-27B-OptiQ-4bit
- 不熟悉的代码上容易出低级错误,有用户称 A3B 能在 3-4 次调用内搞坏企业代码库 —— mlx-community/Qwen3.6-35B-A3B-OptiQ-4bit
- 相对 27B 是质量降级:更快、世界知识更多,但质量「a step down」,多人明确表示更偏好 27B —— mlx-community/Qwen3.6-35B-A3B-OptiQ-4bit
- 4-bit MLX 版有死循环/逻辑异常问题,有用户因此换回更小的 qwen3.5-9b(8bit)反而更顺手 —— mlx-community/Qwen3.6-35B-A3B-OptiQ-4bit
- 基准上知识/技能类指标明显偏弱,虽然社区实际感受与基准常有出入 —— mlx-community/Qwen3.6-35B-A3B-OptiQ-4bit
- 有用户抱怨 35B 干活耗时太久(「why it does code for so long」),体感偏慢 —— mlx-community/Qwen3.6-35B-A3B-OptiQ-4bit
- 消费级 NVIDIA 显存上需要激进量化才能跑,或需多卡并加 --cpu-moe 之类配置 —— mlx-community/Qwen3.6-35B-A3B-OptiQ-4bit
- Ollama 尚不支持,Modelfile 加载报 unknown model architecture 'mellum' —— JetBrains/Mellum2-12B-A2.5B-Instruct
- 不是推理模型,遇到 bat-and-ball 类逻辑题会跑偏,视觉生成类任务输出错误 —— JetBrains/Mellum2-12B-A2.5B-Instruct
- 代码能力官方对标约 Qwen 3.5 9B 级别,并非顶尖 —— JetBrains/Mellum2-12B-A2.5B-Instruct
- 代码 bug 修复偏弱:某用户实测其修复率仅约 12%,明显低于 Qwen2.5-Coder-3B 的约 50% —— LiquidAI/LFM2.5-8B-A1B
- 同系列更小尺寸的 LFM2 2.6B 被指连贯性不如同级 2B 稠密产品(Granite/Gemma) —— LiquidAI/LFM2.5-8B-A1B
- 部分社区用户希望有 15-20B 的更大尺寸版本,当前 12B 规模在某些场景下仍有局限 —— JetBrains/Mellum2-12B-A2.5B-Thinking
- 同一模型无法同时擅长编码和知识库处理,需按具体场景分别选型 —— JetBrains/Mellum2-12B-A2.5B-Thinking
- 平均吞吐低于同类同尺寸开源款——72.9 t/s 对中位 98.4 t/s,别默认「小就快」 —— w-ahmad/Qwen3.5-9B-GGUF-MoQ-MTP
- 默认 ollama 跑容易觉得性能差/慢——换 Llama.cpp 自编译或 Llama app 可提速 30-40%,再配精调量化实测可到 3 倍以上 t/s —— w-ahmad/Qwen3.5-9B-GGUF-MoQ-MTP
- 工具链兼容性不如更大尺寸——9B/12B 这类中间尺寸工具兼容性弱于重号,重型工具任务会想换更大的 —— w-ahmad/Qwen3.5-9B-GGUF-MoQ-MTP
- 不是全能手——选型讨论里社区提醒小尺寸未必全面赢过 gpt,自家基准里 Qwen 系有不少翻车项,榜单第一不等于全方位好用 —— w-ahmad/Qwen3.5-9B-GGUF-MoQ-MTP
- 同款同速在不同 CPU(Intel 与 AMD)上实测结果差异大,体验看硬件与运行环境 —— w-ahmad/Qwen3.5-9B-GGUF-MoQ-MTP
- 已被更新的 3.6 系压过——社区认为 3.6/35B 解题能力优于它,AA 分数 3.6-27B(37)高于 3.5(29),追新玩家直接看 3.6 —— w-ahmad/Qwen3.5-9B-GGUF-MoQ-MTP
- 自报基准需存疑——社区提醒自报数字要打折扣,务必按自己的具体场景做独立验证 —— w-ahmad/Qwen3.5-9B-GGUF-MoQ-MTP
- 4-bit NVFP4 相对官方 FP8 质量下降明显,用户提醒不要仅凭 NVFP4 量化表现下结论,至少 27B 建议跑 FP8 —— nvidia/Qwen3.6-35B-A3B-NVFP4
- 35B-A3B 被部分用户反馈指令跟随弱、容易忘记指令,社区对 27B 的整体口碑更好 —— nvidia/Qwen3.6-35B-A3B-NVFP4
- 有用户认为 35B 及其衍生模型(Nex N2、Ornith 1.0)质量达不到其工作需求 —— nvidia/Qwen3.6-35B-A3B-NVFP4
- 35B 基础模型本身偏慢,是该用户眼中的主要问题 —— nvidia/Qwen3.6-35B-A3B-NVFP4
- 基准与部署存在坑:需要 nightly vLLM 和特定后端,会碰到报错与崩溃,有人花了三天排错 —— nvidia/Qwen3.6-35B-A3B-NVFP4
- 编码场景仍被多数人认为明显不如 Opus 4.7;122B 更接近但速度太慢 —— nvidia/Qwen3.6-35B-A3B-NVFP4
- 低显存机型可能遇到内存不足(如 M4 Max 64GB) —— nvidia/Qwen3.6-35B-A3B-NVFP4
- 在翻译、法语文案、新闻深度分析等质量敏感负载上,同系列 27B 被认为更强 —— nvidia/Qwen3.6-35B-A3B-NVFP4
- 基准测试分数随模型规模或量化位宽降低而递减,1.58bit量化在部分任务上相比全精度仍有能力损失 —— openbmb/BitCPM-CANN-8B
- 4-bit GGUF 量化版本性能普遍不如 NVFP4/INT4 官方量化格式 —— tencent/Hy-MT2-1.8B-GGUF
- 16GB 显存只能上 3bit 量化,留给思考的上下文空间紧张,低配显卡体验受限 —— OBLITERATUS/Qwen3.6-27B-OBLITERATED
- 同硬件下推理速度比 35B-A3B 慢约 5 倍 —— OBLITERATUS/Qwen3.6-27B-OBLITERATED
- Rust 编程被 Step3.7 超越,社区建议按任务自行跑评估 —— OBLITERATUS/Qwen3.6-27B-OBLITERATED
- 基础版被质疑存在事实错误,有用户转投 Qwopus 微调版并实测其错误更少 —— OBLITERATUS/Qwen3.6-27B-OBLITERATED
- Q8 量化舒适使用约需 36GB 内存,消费级硬件仍难满足 —— OBLITERATUS/Qwen3.6-27B-OBLITERATED
- 编码场景精度优先于速度,重吞吐场景并非最优 —— OBLITERATUS/Qwen3.6-27B-OBLITERATED
- 选型不能只看排行,社区强调要跑自己的评测验证 —— OBLITERATUS/Qwen3.6-27B-OBLITERATED
- LM Studio 的 MLX 后端在反复加载/卸载模型后可能出现性能下降,需重启解决 (1) —— mlx-community/Meta-Llama-3-8B-Instruct-4bit
- LM Studio 的 MLX 后端偶有生成时进入无限循环的问题 (1) —— mlx-community/Meta-Llama-3-8B-Instruct-4bit
- 实际质量远不如同体量竞品 Gemma-4-E2B —— prism-ml/Ternary-Bonsai-8B-mlx-2bit
- 三元版本答案比 1-bit 版本错误更多 —— prism-ml/Ternary-Bonsai-8B-mlx-2bit
- 实际表现明显差于营销宣传 —— prism-ml/Ternary-Bonsai-8B-mlx-2bit
- 基准测试成绩弱,30B 的 AA Index 仅 15,与 Gemma 4 E4B 及 Qwen 3.5 2B 等小得多的模型持平 —— lmstudio-community/granite-4.1-30b-GGUF
- IBM 官方基准测试有意避开了 Qwen 3.6-35b-a3b 和 Qwen 3.6-27b,后者在该规模明显更强 —— lmstudio-community/granite-4.1-30b-GGUF
- 上一代 Granite 4 小模型推理速度偏慢且逻辑题表现不佳,部分用户快速失去兴趣 —— lmstudio-community/granite-4.1-30b-GGUF
- 在综合体验上仍不如 Qwen3.6 35B A3B 等更大的本地模型 —— lmstudio-community/granite-4.1-3b-GGUF
- 若其他小模型跟进更新训练数据,其差异化优势可能被削弱 —— lmstudio-community/granite-4.1-3b-GGUF
- 综合能力不如 Qwen3.6 等同期的社区冠军模型,仅适合作为辅助而非主力 —— lmstudio-community/granite-4.1-8b-GGUF
- 定位为轻量 fallback,不适合复杂任务 —— lmstudio-community/granite-4.1-8b-GGUF
- MLX 运行时比 llama.cpp 占用更多内存 —— mlx-community/Llama-2-7b-chat-mlx
- Llama 2 Chat 7B 智力低于平均水平 —— mlx-community/Llama-2-7b-chat-mlx
- MLX 量化后 token 生成速度可能只有 llama.cpp 的一半 —— mlx-community/Llama-2-7b-chat-mlx
- MLX 模型加载速度明显慢于 llama.cpp —— mlx-community/Llama-2-7b-chat-mlx
- GGUF K-quant 在敏感层分配更多比特,MLX 均匀量化可能导致输出质量差异 —— mlx-community/Llama-2-7b-chat-mlx
- 对于 FIM/代码补全不如 Qwen2.5-Coder 7B —— mlx-community/Llama-2-7b-chat-mlx
- tokens/s 不代表实际有效吞吐,需按真实场景评估 —— mlx-community/Llama-2-7b-chat-mlx
- Ollama 未开启 MLX 后端时性能显著低于原生 llama.cpp(Metal) —— mlx-community/Llama-2-7b-chat-mlx
- Reddit 社区有用户反馈在 Claude Code 中实际使用体验不如 M2.5,M2.5 更稳定地完成任务 [14] —— lmstudio-community/MiniMax-M2.7-GGUF
- 输出速度 53.5 tokens/s,慢于 M2.1 的 73.3 tokens/s [11] —— lmstudio-community/MiniMax-M2.7-GGUF
- 首 token 延迟 1.75s,高于 M2.1 的 1.67s [11] —— lmstudio-community/MiniMax-M2.7-GGUF
- 社区几乎无人提及,缺乏实际使用反馈与口碑积累 —— nvidia/Nemotron-Labs-Diffusion-14B
- 部分用户实测认为其回答质量明显不如 Gemma-4-E2B 等传统精度的 8B 模型 —— prism-ml/Bonsai-8B-mlx-1bit
- MLX 版本的每权重实际比特数为 1.25 bits,高于官方宣称的 1.125 bits,存在额外打包开销 —— prism-ml/Bonsai-8B-mlx-1bit
- 官方声称的「end-to-end 1-bit,无高精度 escape hatch」表述容易引起误解 —— prism-ml/Bonsai-8B-mlx-1bit
- 「新 SOTA 1B 模型」的说法被社区打问号,基准成绩尚未被独立复现,能否真正超越更大规模模型仍是开放问题 —— sapientinc/HRM-Text-1B
- HRM 是否真的是超越 LLM 的实质一步,社区(如 r/learnmachinelearning)仍在争论、未有定论 —— sapientinc/HRM-Text-1B
- 完全极简主义生活依赖外部服务,成本较高 —— salakash/Minimalism
- 极简主义社交平台主题范围有限,主要覆盖科技和编程领域 —— salakash/Minimalism
- 600M 版本目前为早期检查点(Early Checkpoint),非正式发布 —— FrontiersMind/Nandi-Mini-600M-Early-Checkpoint
- 150M 版本在 HellaSwag (37.20)、GSM8K (2.58)、HumanEval (4.27) 等基准上得分偏低,推理与代码能力有限 —— FrontiersMind/Nandi-Mini-600M-Early-Checkpoint