指南 / 文本生成模型

文本生成模型

共 159 个 · 数据更新于 2026-09-14

显存档为包含式:更低显存也能跑的模型一并计入。数值取 Q4 量化后估算。

16GB 设备选本地大模型:独显与 Mac 怎么选

面向 16GB 独显或 16GB 内存 Mac 的人:表中配置通过本站的 16GB 估算筛选,并非运行保证;先分清自己是哪种 16GB,再按运行配置挑。

阅读完整指南 →

  • Qwen3-4B-Base-DAPO-v4 文本生成模型

    参数量
    4B
    商用
    可商用

    当前运行配置 ReliquaryForge/qwen3-4b-base-dapo-v4

    显存
    暂无估算
    查看详情
    查看运行方式
    vllm serve ReliquaryForge/qwen3-4b-base-dapo-v4
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    apache-2.0
    上下文
    32k
    国内可达
    需代理
  • OUI-1 (Thesys)

    微调自 diffusiongemma-26B-A4B-it

    生成式 UI 扩散模型,面向 OpenUI 应用开发者

    参数量
    26B (4B active)
    商用
    需自查

    当前运行配置 thesysdev/OUI-1

    显存
    暂无估算
    查看详情
    查看运行方式
    vllm serve thesysdev/OUI-1 --trust-remote-code --max-model-len 16384 --served-model-name OUI-1 --enable-auto-tool-choice --tool-call-parser gemma4
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Apache 2.0
    上下文
    16k
    国内可达
    需代理
  • 面向 Atlassian Forge 的 6-bit MLX 模型

    参数量
    9B
    商用
    可商用

    当前运行配置 Mihai-LeanZero/Qwen3.5-9B-Atlassian-Q4-mlx

    显存
    ~5.4GB 4-bit(估算)
    查看详情
    查看运行方式
    mlx_lm.generate --model Mihai-LeanZero/Qwen3.5-9B-Atlassian-Q4-mlx --prompt "Which Forge module adds a panel to the Jira issue view?"
    许可证
    Apache-2.0
    上下文
    32k
    国内可达
    需代理
    其它形态
    MLX·mihai-leanzero · MLX·mihai-leanzero
  • Qwen3.8-27B-Atlassian-Q8-mlx (LeanZero)

    LoRA · 基于 Qwen3.8-27B

    Atlassian 开发专用 27B MLX 模型

    参数量
    27B
    商用
    可商用

    当前运行配置 Mihai-LeanZero/Qwen3.8-27B-Atlassian-Q8-mlx

    显存
    ~30GB 8-bit(估算)
    查看详情
    查看运行方式
    mlx_lm.generate --model Mihai-LeanZero/Qwen3.8-27B-Atlassian-Q8-mlx
    许可证
    Apache-2.0
    上下文
    128k
    国内可达
    需代理
    其它形态
    MLX·mihai-leanzero · MLX·mihai-leanzero
  • Edge0-35B-A3B-preview (Edge0)

    LoRA · 基于 Qwen3.5-MoE-35B-A3B

    35B 稀疏 MoE,3 GiB 内存可跑,面向设备端推理

    参数量
    35B (3B 激活)
    商用
    可商用

    当前运行配置 Edge0/Edge0-35B-A3B-preview

    显存
    ~21GB 4-bit(估算)
    查看详情
    暂无收录命令

    本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。

    许可证
    Apache-2.0
    国内可达
    需代理
  • 长时程agent模型,面向电脑操作与网页浏览

    商用
    可商用

    当前运行配置 nex-agi/Nex-N2.5-Pro

    显存
    暂无估算
    查看详情
    暂无收录命令

    本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。

    为何暂无估算
    缺少可用的参数量依据,无法估算显存
    许可证
    apache-2.0
    国内可达
    魔搭可用
  • 开源 agent 模型,面向长程电脑操作与网页任务

    参数量
    35.1B
    商用
    可商用

    当前运行配置 nex-agi/Nex-N2.5-mini

    显存
    暂无估算
    查看详情
    暂无收录命令

    本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    apache-2.0
    国内可达
    魔搭可用
  • Apple 芯片 13.8GiB VQ 量化,24GB 可跑

    参数量
    35B-A3B
    商用
    可商用

    当前运行配置 TheDrainFlorist/Qwen3.6-35B-A3B-VQ-3.4bpw

    显存
    暂无估算
    查看详情
    查看运行方式
    python -m mlx_lm generate --model TheDrainFlorist/Qwen3.6-35B-A3B-VQ-3.4bpw --prompt 'Explain the difference between a mutex and a semaphore.' --max-tokens 512
    为何暂无估算
    格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
    许可证
    apache-2.0
    国内可达
    需代理
  • Spark-X2.5-4B (XHToken)

    量化自 Spark-X2.5-4B

    4B 通用文本模型 GGUF,可本地跑对话、编码与 agent

    参数量
    4B
    商用
    可商用

    当前运行配置 XHToken/Spark-X2.5-4B

    显存
    暂无估算
    查看详情
    查看运行方式
    vllm serve XHToken/Spark-X2.5-4B --trust-remote-code
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Apache-2.0
    上下文
    1M
    国内可达
    需代理
    其它形态
    原生 · GGUF
  • Apple Silicon VQ量化 Qwen3.6-35B-A3B

    参数量
    35B-A3B
    商用
    可商用

    当前运行配置 TheDrainFlorist/Qwen3.6-35B-A3B-VQ-3.8bpw

    显存
    暂无估算
    查看详情
    查看运行方式
    python -m mlx_lm generate --model TheDrainFlorist/Qwen3.6-35B-A3B-VQ-3.8bpw
    为何暂无估算
    格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
    许可证
    Apache-2.0
    国内可达
    需代理
  • Mac 可跑的 Qwen3.6-35B VQ 量化

    参数量
    35B-A3B
    商用
    可商用

    当前运行配置 TheDrainFlorist/Qwen3.6-35B-A3B-VQ-4.6bpw

    显存
    暂无估算
    查看详情
    查看运行方式
    python -m mlx_lm generate --model TheDrainFlorist/Qwen3.6-35B-A3B-VQ-4.6bpw --prompt "Hello"
    为何暂无估算
    格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
    许可证
    apache-2.0
    国内可达
    需代理
  • MLX 向量量化,Apple Silicon 本地推理

    参数量
    35B-A3B
    商用
    可商用

    当前运行配置 TheDrainFlorist/Qwen3.6-35B-A3B-VQ-5.4bpw

    显存
    暂无估算
    查看详情
    查看运行方式
    python -m mlx_lm generate --model TheDrainFlorist/Qwen3.6-35B-A3B-VQ-5.4bpw --prompt "Hello" --max-tokens 32
    为何暂无估算
    格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
    许可证
    Apache-2.0
    国内可达
    需代理
  • 7B 密集解码器,512K 上下文,面向推理/代码/长上下文

    参数量
    7B
    商用
    可商用

    当前运行配置 IFM/K2-Horizon-7B

    显存
    暂无估算
    查看详情
    查看运行方式
    vllm serve IFM/K2-Horizon-7B --trust-remote-code --dtype bfloat16 --max-model-len 131072 --reasoning-parser k2_horizon --enable-auto-tool-choice --tool-call-parser k2_horizon
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    apache-2.0
    上下文
    512k
    国内可达
    需代理
  • K2-Horizon-MoVA-36B-A4B (IFM)

    量化自 K2-Horizon-MoVA-36B-A4B

    36B/4B 激活 MoE+MoVA,面向 agent 与长上下文

    参数量
    36B (4B 激活)
    商用
    可商用

    当前运行配置 IFM/K2-Horizon-MoVA-36B-A4B

    显存
    暂无估算
    查看详情
    查看运行方式
    vllm serve IFM/K2-Horizon-MoVA-36B-A4B --trust-remote-code --reasoning-parser k2_horizon --tool-call-parser k2_horizon --enable-auto-tool-choice
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Apache-2.0
    上下文
    512k
    国内可达
    需代理
    其它形态
    原生 · GGUF
  • Apple Silicon 用 Qwen3.8-27B 量化版

    参数量
    27B
    商用
    可商用

    当前运行配置 TheDrainFlorist/Qwen3.8-27B-VQ-3.9bpw

    显存
    暂无估算
    查看详情
    查看运行方式
    python -m mlx_lm generate --model TheDrainFlorist/Qwen3.8-27B-VQ-3.9bpw --prompt "Explain vector quantization briefly." --max-tokens 512
    为何暂无估算
    格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
    许可证
    Apache-2.0
    国内可达
    需代理
  • Qwen3.8-27B-VQ-4.5bpw (Qwen)

    量化自 Qwen3.8-27B

    Qwen3.8-27B MLX 向量量化版

    参数量
    27B
    商用
    可商用

    当前运行配置 TheDrainFlorist/Qwen3.8-27B-VQ-4.5bpw

    显存
    暂无估算
    查看详情
    查看运行方式
    python -m mlx_lm generate --model TheDrainFlorist/Qwen3.8-27B-VQ-4.5bpw --prompt "Explain vector quantization briefly." --max-tokens 512
    为何暂无估算
    格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
    许可证
    apache-2.0
    国内可达
    需代理
  • Qwen3.8-27B-VQ-4.8bpw (Qwen)

    量化自 Qwen3.8-27B

    Apple Silicon 本地运行的 27B 向量量化文本生成模型

    参数量
    27B
    商用
    可商用

    当前运行配置 TheDrainFlorist/Qwen3.8-27B-VQ-4.8bpw

    显存
    暂无估算
    查看详情
    查看运行方式
    python -m mlx_lm generate --model TheDrainFlorist/Qwen3.8-27B-VQ-4.8bpw --prompt "Explain vector quantization briefly." --max-tokens 512
    为何暂无估算
    格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
    许可证
    Apache-2.0
    国内可达
    需代理
  • Spark-X2.5-1.7B (XHToken)

    微调自 Spark-X2.5-1.7B-Base

    1.7B 通用语言模型,支持 1M 上下文与工具调用

    参数量
    1.7B
    商用
    可商用

    当前运行配置 XHToken/Spark-X2.5-1.7B

    显存
    暂无估算
    查看详情
    查看运行方式
    vllm serve XHToken/Spark-X2.5-1.7B --trust-remote-code
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    apache-2.0
    上下文
    1M
    国内可达
    需代理
  • GLM-5.3-GGUF (unsloth)

    量化自 GLM-5.3

    开源 MoE 代码与智能体模型 GGUF 量化版

    商用
    需自查

    当前运行配置 unsloth/GLM-5.3-GGUF

    显存
    暂无估算
    查看详情
    查看运行方式(还有 1 种)
    ollama run hf.co/unsloth/GLM-5.3-GGUF

    其它 1 种运行方式见详情页

    为何暂无估算
    缺少可用的参数量依据,无法估算显存
    许可证
    GLM-5.3 自定义许可证
    上下文
    1M
    国内可达
    需代理
  • 英文因果语言模型,用于文本生成与下游微调

    参数量
    124M
    商用
    可商用

    当前运行配置 openai-community/gpt2

    显存
    暂无估算
    查看详情
    查看运行方式
    vllm serve openai-community/gpt2
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    MIT
    上下文
    1024
    国内可达
    需代理
  • Qwen3.8-27B (Qwen)

    量化自 Qwen3.8-27B

    Mac本地Qwen3.8-27B-4bit量化

    参数量
    27B
    商用
    可商用

    当前运行配置 Youssofal/Qwen3.8-27B-MTPLX-Bare-Speed

    显存
    ~16GB 4-bit(估算)
    查看详情
    查看运行方式
    mlx_lm.generate --model Youssofal/Qwen3.8-27B-MTPLX-Bare-Speed
    许可证
    Apache-2.0
    上下文
    262k
    国内可达
    需代理
  • Qwen3.8-27B MTPLX (Youssofal)

    量化自 Qwen3.8-27B

    Mac 上 8-bit 量化 Qwen3.8 27B(MTP 加速)

    参数量
    27B
    商用
    可商用

    当前运行配置 Youssofal/Qwen3.8-27B-MTPLX-Optimized-Quality

    显存
    ~30GB 8-bit(估算)
    查看详情
    查看运行方式
    mtplx serve --model Youssofal/Qwen3.8-27B-MTPLX-Optimized-Quality
    许可证
    Apache-2.0
    上下文
    262k
    国内可达
    需代理
  • Qwen3.8-Flash-Next Optimized Speed (MTPLX)

    量化自 Qwen3.8-Flash-Next

    Mac 上 MTPLX 4-bit 量化,MTP 投机加速

    参数量
    125B-A6B
    商用
    需自查

    当前运行配置 Youssofal/Qwen3.8-Flash-Next-MTPLX-Optimized-Speed

    显存
    ~75GB 4-bit(估算)
    查看详情
    查看运行方式
    mtplx serve --model Youssofal/Qwen3.8-Flash-Next-MTPLX-Optimized-Speed
    许可证
    qwen-community-1.0
    上下文
    262k
    国内可达
    需代理
  • GLM-5.3-Flash-DFlash2 (incoai)

    微调自 GLM-5.3-Flash

    为 GLM-5.3-Flash 推理加速的 DFlash2 草稿模型

    参数量
    1.2B
    商用
    不可商用

    当前运行配置 incoai/GLM-5.3-Flash-DFlash2

    显存
    暂无估算
    查看详情
    查看运行方式
    sglang serve --model-path zai-org/GLM-5.3-Flash --trust-remote-code --speculative-algorithm DFLASH --speculative-draft-model-path incoai/GLM-5.3-Flash-DFlash2 --speculative-draft-attention-backend fa4
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    CC BY-NC-ND 4.0
    国内可达
    需代理
  • SemanticRepair-270M (Gramscii)

    量化自 gemma-3-270m

    面向 RAG 路由的查询重写小模型

    参数量
    270M
    商用
    限制商用

    当前运行配置 Gramscii/SemanticRepair-270M

    显存
    暂无估算
    查看详情
    查看运行方式(还有 1 种)
    ollama run hf.co/Gramscii/SemanticRepair-270M

    其它 1 种运行方式见详情页

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Gemma
    上下文
    2048
    国内可达
    需代理
  • Mac 上 Qwen3.8-27B 4-bit量化

    参数量
    27B
    商用
    可商用

    当前运行配置 Youssofal/Qwen3.8-27B-MTPLX-Optimized-Speed

    显存
    ~16GB 4-bit(估算)
    查看详情
    查看运行方式
    mtplx serve --model Youssofal/Qwen3.8-27B-MTPLX-Optimized-Speed
    许可证
    apache-2.0
    上下文
    262k
    国内可达
    需代理
  • Qwen3.8-27B-DFlash2 (z-lab)

    微调自 Qwen3.8-27B

    为 Qwen3.8-27B 提供投机解码加速的草案模型

    参数量
    1.9B
    商用
    可商用

    当前运行配置 z-lab/Qwen3.8-27B-DFlash2

    显存
    暂无估算
    查看详情
    查看运行方式
    vllm serve Qwen/Qwen3.8-27B --speculative-config '{"method":"dflash","model":"z-lab/Qwen3.8-27B-DFlash2","num_speculative_tokens":7}'
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    apache-2.0
    上下文
    128k
    国内可达
    需代理
    其它形态
    原生·z-lab · 原生·incoai · GGUF·incoai · GGUF·z-lab
  • Qwen3.8-27B-Escha-W2 (Escha)

    量化自 Qwen3.8-27B

    2-bit 量化 27B 模型,24GB 显卡 64k 上下文

    参数量
    27B
    商用
    可商用

    当前运行配置 EschaLabs/Qwen3.8-27B-Escha-W2

    显存
    ~9.2GB 2-bit(估算)
    查看详情
    暂无收录命令

    本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。

    许可证
    Apache-2.0
    上下文
    128k
    国内可达
    需代理
  • Qwen3.8-27B-Unleashed (outsourc-e)

    量化自 Qwen3.8-27B-Uncensored

    无审查 Qwen3.8-27B 动态量化 GGUF,本地推理

    参数量
    27B
    商用
    可商用

    当前运行配置 outsourc-e/Qwen3.8-27B-Unleashed-GGUF

    显存
    暂无估算
    查看详情
    查看运行方式(还有 1 种)
    ollama run hf.co/outsourc-e/Qwen3.8-27B-Unleashed-GGUF

    其它 1 种运行方式见详情页

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Apache-2.0
    上下文
    262k
    国内可达
    需代理
  • 35B MoE 激活 3B,面向工具调用与长上下文推理

    参数量
    35B MoE / 激活 3B
    商用
    可商用

    当前运行配置 ornith-ai/Ornith-1.5-35B-A3B

    显存
    暂无估算
    查看详情
    查看运行方式
    vllm serve ornith-ai/Ornith-1.5-35B-A3B --trust-remote-code --reasoning-parser qwen3 --tool-call-parser qwen3_xml --enable-auto-tool-choice
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    MIT
    上下文
    262k
    国内可达
    需代理
    其它形态
    原生 · GGUF
  • S1-mini (Superwhisper)

    微调自 Qwen3-0.6B

    ASR 后处理文本规范化器,英文听写与字幕管道用

    参数量
    0.6B
    商用
    需自查

    当前运行配置 superwhisper/s1-mini

    显存
    暂无估算
    查看详情
    查看运行方式
    llama-server -hf superwhisper/s1-mini-GGUF:Q4_K_M --jinja --chat-template-kwargs '{"enable_thinking":false}' --temp 0
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Apache 2.0 + 命名条款
    国内可达
    需代理
  • Dagger-Qwen3.6-27B (peculiar-ragdoll)

    量化自 ThinkingCap-Qwen3.6-27B

    Mac 用 Qwen3.6-27B MLX 量化,低冗余输出

    参数量
    27B
    商用
    可商用

    当前运行配置 peculiar-ragdoll/Dagger-Qwen3.6-27B-MLX

    显存
    暂无估算
    查看详情
    查看运行方式
    mlx_lm.generate --model peculiar-ragdoll/Dagger-Qwen3.6-27B-MLX
    为何暂无估算
    已有格式线索,但估算映射未支持,无法估算显存
    许可证
    Apache-2.0
    上下文
    256k
    国内可达
    需代理
  • LFM2.5-8B-A1B-DSpark-GGUF (LiquidAI)

    量化自 LFM2.5-8B-A1B-DSpark-Draft-v1

    8B-A1B 投机解码草稿侧车,配 llama.cpp 加速

    参数量
    8B
    商用
    需自查

    当前运行配置 LiquidAI/LFM2.5-8B-A1B-DSpark-GGUF

    显存
    暂无估算
    查看详情
    查看运行方式
    ollama run hf.co/LiquidAI/LFM2.5-8B-A1B-DSpark-GGUF
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    other (lfm1.0)
    国内可达
    需代理
  • 9B 稠密推理模型,单卡部署与终端编程

    参数量
    9B
    商用
    可商用

    当前运行配置 ornith-ai/Ornith-1.5-9B

    显存
    暂无估算
    查看详情
    查看运行方式
    vllm serve ornith-ai/Ornith-1.5-9B --served-model-name Ornith-1.5-9B --max-model-len 262144 --enable-auto-tool-choice --tool-call-parser qwen3_xml --reasoning-parser qwen3 --trust-remote-code
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    MIT
    上下文
    262k(YaRN 可扩展至约 1M)
    国内可达
    需代理
    其它形态
    原生 · GGUF
  • 无审查 Qwen3.8-27B,供红队与对齐研究

    参数量
    27B
    商用
    可商用

    当前运行配置 OBLITERATUS/Qwen3.8-27B-OBLITERATED

    显存
    暂无估算
    查看详情
    查看运行方式
    ollama run hf.co/OBLITERATUS/Qwen3.8-27B-OBLITERATED
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Apache-2.0
    国内可达
    需代理
  • Qwen3.8-27B 去安全限制 GGUF,供角色扮演与创作

    参数量
    27B
    商用
    可商用

    当前运行配置 0bserverx/Qwen3.8-27B-Heretic-Abliterated-Uncensored-GGUF

    显存
    暂无估算
    查看详情
    查看运行方式(还有 1 种)
    ollama run hf.co/0bserverx/Qwen3.8-27B-Heretic-Abliterated-Uncensored-GGUF

    其它 1 种运行方式见详情页

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Apache-2.0
    上下文
    262k
    国内可达
    需代理
  • hamo-score-0.6b (HamoAI)

    量化自 Qwen3-0.6B

    给心理支持对话逐句打五维评分,供本地部署

    参数量
    0.6B
    商用
    限制商用

    当前运行配置 HamoAI/hamo-score-0.6b

    显存
    暂无估算
    查看详情
    查看运行方式
    ollama run hf.co/HamoAI/hamo-score-0.6b
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    HAMO-RAIL-S 1.0
    国内可达
    需代理
  • Amethyst-1-Mini (VertexAIco)

    LoRA · 基于 gemma-3-4b-it

    Gemma 3 4B 蒸馏微调对话模型,面向轻量试验与聊天

    参数量
    4B
    商用
    需自查

    当前运行配置 VertexAIco/amethyst-1-mini

    显存
    暂无估算
    查看详情
    查看运行方式
    llama-server -hf VertexAIco/amethyst-1-mini
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Gemma Terms of Use
    上下文
    1024
    国内可达
    需代理
  • 2.6B 5-bit MLX 量化,Mac 本地推理

    参数量
    2.6B
    商用
    需自查

    当前运行配置 lmstudio-community/LFM2.5-2.6B-MLX-5bit

    显存
    暂无估算
    查看详情
    查看运行方式
    mlx_lm.generate --model lmstudio-community/LFM2.5-2.6B-MLX-5bit
    为何暂无估算
    已有格式线索,但估算映射未支持,无法估算显存
    许可证
    LFM Open License v1.0
    国内可达
    需代理
  • 30B 总参 / 3B 激活 MoE,本地 GGUF 部署

    参数量
    30B (A3B 激活)
    商用
    需自查

    当前运行配置 nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16

    显存
    ~63GB BF16(估算)
    查看详情
    查看运行方式
    vllm serve nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16
    许可证
    OpenMDW-1.1
    上下文
    1M
    国内可达
    需代理
    其它形态
    原生 · GGUF
  • 3B活跃参数,面向本地Agent和长上下文推理

    参数量
    30B (3B active)
    商用
    需自查

    当前运行配置 nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4

    显存
    暂无估算
    查看详情
    查看运行方式
    vllm serve nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4
    为何暂无估算
    格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
    许可证
    OpenMDW-1.1
    上下文
    1M
    国内可达
    需代理
  • LFM2.5-2.6B (LiquidAI)

    量化自 LFM2.5-2.6B

    6-bit MLX 量化推理模型,为 Apple Silicon 优化

    参数量
    2.6B
    商用
    需自查

    当前运行配置 lmstudio-community/LFM2.5-2.6B-MLX-6bit

    显存
    暂无估算
    查看详情
    查看运行方式
    mlx_lm.generate --model lmstudio-community/LFM2.5-2.6B-MLX-6bit
    为何暂无估算
    已有格式线索,但估算映射未支持,无法估算显存
    许可证
    LFM-1.0
    国内可达
    需代理
  • GLM-5.2 (智谱)

    量化自 GLM-5.2

    1M 上下文旗舰模型,适合复杂长程任务开发

    参数量
    753.3B
    商用
    可商用

    当前运行配置 Scrappy-Doo/GLM-5.2

    显存
    暂无估算
    查看详情
    查看运行方式
    vllm serve Scrappy-Doo/GLM-5.2 --trust-remote-code
    为何暂无估算
    缺少可用的参数量依据,无法估算显存
    许可证
    MIT
    上下文
    1M
    国内可达
    需代理
    其它形态
    原生·scrappy-doo · GGUF · 原生·zai-org
  • Nanbeige4.2-3B (Nanbeige)

    量化自 Nanbeige4.2-3B

    3B Agent 模型 GGUF 量化版本,用于资源受限部署

    参数量
    3B
    商用
    需自查

    当前运行配置 Nanbeige/Nanbeige4.2-3B

    显存
    暂无估算
    查看详情
    查看运行方式
    ollama run nanbeige/nanbeige4.2:3b-Q4_K_M
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Apache 2.0
    上下文
    131k
    国内可达
    需代理
    其它形态
    原生 · GGUF
  • LFM2.5-2.6B (LiquidAI)

    量化自 LFM2.5-2.6B

    Apple Silicon 用 4-bit 量化 LFM,始终思考模式

    参数量
    2.6B
    商用
    需自查

    当前运行配置 LiquidAI/LFM2.5-2.6B

    显存
    暂无估算
    查看详情
    查看运行方式
    llama-server -hf LiquidAI/LFM2.5-2.6B-GGUF
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    LFM Open License v1.0
    上下文
    128k
    国内可达
    需代理
    其它形态
    原生 · GGUF·liquidai · GGUF·lmstudio · 4bit · 8bit
  • Qwen3.6-35B-A3B (AutomatosX)

    量化自 Qwen3.6-35B-A3B

    Apple Silicon 本地推理的 MLX 6-bit 量化模型

    参数量
    35.1B
    商用
    可商用

    当前运行配置 AutomatosX/AX-Qwen3.6-35B-A3B-MLX-AXQ-6bit-MTP

    显存
    暂无估算
    查看详情
    查看运行方式
    mlx_lm.generate --model AutomatosX/AX-Qwen3.6-35B-A3B-MLX-AXQ-6bit-MTP
    为何暂无估算
    格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
    许可证
    Apache-2.0
    上下文
    262k
    国内可达
    需代理
  • 20B-A1B 三元推理模型,M4 218 tok/s

    参数量
    20B-A1B
    商用
    可商用

    当前运行配置 deepgrove/maple-preview

    显存
    ~5.4GB ternary(估算)
    查看详情
    暂无收录命令

    本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。

    许可证
    MIT
    上下文
    131k
    国内可达
    需代理
  • 通用文本生成的MLX量化版,供Apple Silicon本地使用

    参数量
    9B
    商用
    可商用

    当前运行配置 lmstudio-community/Ornith-1.0-9B-MLX-5bit

    显存
    暂无估算
    查看详情
    查看运行方式
    mlx_lm.generate --model lmstudio-community/Ornith-1.0-9B-MLX-5bit
    为何暂无估算
    已有格式线索,但估算映射未支持,无法估算显存
    许可证
    MIT
    国内可达
    需代理
  • DeepSeek-V4-Flash-Ablit (huihui-ai)

    量化自 DeepSeek-V4-Flash-0731

    未审查 DeepSeek-V4-Flash GGUF,供研究测试

    商用
    可商用

    当前运行配置 huihui-ai/Huihui-DeepSeek-V4-Flash-0731-abliterated-GGUF

    显存
    暂无估算
    查看详情
    查看运行方式(还有 1 种)
    ollama run hf.co/huihui-ai/Huihui-DeepSeek-V4-Flash-0731-abliterated-GGUF

    其它 1 种运行方式见详情页

    为何暂无估算
    缺少可用的参数量依据,无法估算显存
    许可证
    MIT
    上下文
    256k
    国内可达
    需代理
  • Llama-3.1-8B-Instruct (Meta)

    微调自 Meta-Llama-3.1-8B

    8B 指令微调模型,用于通用对话与文本生成任务

    参数量
    8B
    商用
    需自查

    当前运行配置 meta-llama/Llama-3.1-8B-Instruct

    显存
    暂无估算
    查看详情
    查看运行方式
    ollama run hf.co/meta-llama/Llama-3.1-8B-Instruct
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Llama 3.1 Community License
    上下文
    128k
    国内可达
    需代理
  • Qwen2.5-7B-Instruct (Qwen)

    微调自 Qwen2.5-7B

    Qwen2.5 7B 指令模型,用于多语言对话与长文本生成。

    参数量
    7B
    商用
    可商用

    当前运行配置 Qwen/Qwen2.5-7B-Instruct

    显存
    暂无估算
    查看详情
    查看运行方式
    vllm serve Qwen/Qwen2.5-7B-Instruct
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Apache-2.0
    上下文
    128k
    国内可达
    需代理
  • DeepSeek-V4-Flash GGUF (DeepSeek)

    量化自 DeepSeek-V4-Flash

    ds4引擎 DeepSeek-V4-Flash 量化,Mac 本地运行

    商用
    可商用

    当前运行配置 antirez/deepseek-v4-gguf

    显存
    暂无估算
    查看详情
    查看运行方式
    ollama run hf.co/antirez/deepseek-v4-gguf
    为何暂无估算
    缺少可用的参数量依据,无法估算显存
    许可证
    MIT
    上下文
    100k
    国内可达
    需代理
  • Koleslaw-Nemotron-30B (ThunkAboutIt)

    LoRA · 基于 NVIDIA-Nemotron-3-Nano-30B-A3B-BF16

    把粗糙提示变成结构化详细提示,方便交给任意模型

    参数量
    31.6B
    商用
    需自查

    当前运行配置 thunkaboutit/Koleslaw-Nemotron-30B-A3B-PromptEnhance

    显存
    暂无估算
    查看详情
    查看运行方式
    ollama run hf.co/thunkaboutit/Koleslaw-Nemotron-30B-A3B-PromptEnhance
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    NVIDIA Nemotron Open Model License
    上下文
    8K
    国内可达
    需代理
  • Ornith-1.0-35B (deepreinforce-ai)

    量化自 Ornith-1.0-35B

    MLX 6-bit 35B,用于 Apple Silicon 文本生成

    参数量
    35B
    商用
    可商用

    当前运行配置 lmstudio-community/Ornith-1.0-35B-MLX-6bit

    显存
    暂无估算
    查看详情
    查看运行方式
    mlx_lm.generate --model lmstudio-community/Ornith-1.0-35B-MLX-6bit
    为何暂无估算
    已有格式线索,但估算映射未支持,无法估算显存
    许可证
    MIT
    国内可达
    需代理
  • MLX量化9B文本模型,苹果芯片本地推理

    参数量
    9B
    商用
    可商用

    当前运行配置 lmstudio-community/Ornith-1.0-9B-MLX-6bit

    显存
    暂无估算
    查看详情
    查看运行方式
    mlx_lm.generate --model lmstudio-community/Ornith-1.0-9B-MLX-6bit
    为何暂无估算
    已有格式线索,但估算映射未支持,无法估算显存
    许可证
    MIT
    国内可达
    需代理
  • 69B MoE,仅3B激活,1M上下文,面向Agent与长文本任务

    参数量
    69B (激活 3B)
    商用
    可商用

    当前运行配置 meituan-longcat/LongCat-Flash-Lite-Sparse

    显存
    暂无估算
    查看详情
    查看运行方式
    python3 -m sglang.launch_server --model meituan-longcat/LongCat-Flash-Lite-Sparse --trust-remote-code --chunked-prefill-size 2048 --nsa-prefill-backend fa3 --kv-cache-dtype bfloat16
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    MIT
    上下文
    1M
    国内可达
    需代理
  • Ornith-1.0-35B (DeepReinforce)

    量化自 Ornith-1.0-35B

    在 Apple Silicon 上运行的 35B 文本生成模型

    参数量
    35B
    商用
    可商用

    当前运行配置 deepreinforce-ai/Ornith-1.0-35B

    显存
    暂无估算
    查看详情
    查看运行方式(还有 2 种)
    llama-server -hf deepreinforce-ai/Ornith-1.0-35B-GGUF --port 8000 -c 262144

    其它 2 种运行方式见详情页

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    mit
    上下文
    256k
    国内可达
    需代理
    其它形态
    原生 · FP8 · GGUF·deepreinforce-ai · GGUF·lmstudio · 4bit · 8bit · GGUF·unsloth
  • Ornith-1.0-35B-MLX (LM Studio)

    量化自 Ornith-1.0-35B

    苹果硅本地运行的 35B 文本生成模型

    参数量
    35B
    商用
    可商用

    当前运行配置 lmstudio-community/Ornith-1.0-35B-MLX-5bit

    显存
    暂无估算
    查看详情
    查看运行方式
    mlx_lm.generate --model lmstudio-community/Ornith-1.0-35B-MLX-5bit
    为何暂无估算
    已有格式线索,但估算映射未支持,无法估算显存
    许可证
    mit
    国内可达
    需代理
  • Ornith-1.0-9B (DeepReinforce)

    量化自 Ornith-1.0-9B

    MLX 8-bit量化,为Apple Silicon优化

    参数量
    9B
    商用
    可商用

    当前运行配置 deepreinforce-ai/Ornith-1.0-9B

    显存
    暂无估算
    查看详情
    查看运行方式(还有 2 种)
    llama-server -hf deepreinforce-ai/Ornith-1.0-9B-GGUF --port 8000 -c 262144

    其它 2 种运行方式见详情页

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    mit
    上下文
    256k
    国内可达
    需代理
    其它形态
    原生 · GGUF·deepreinforce-ai · GGUF·lmstudio · 4bit · 8bit · GGUF·protolabsai
  • DeepSeek-V4-Flash-0731 (DeepSeek)

    量化自 DeepSeek-V4-Flash-0731

    DeepSeek V4 系列轻量模型,本地快速对话

    商用
    可商用

    当前运行配置 lmstudio-community/DeepSeek-V4-Flash-0731-GGUF

    显存
    暂无估算
    查看详情
    查看运行方式
    ollama run hf.co/lmstudio-community/DeepSeek-V4-Flash-0731-GGUF
    为何暂无估算
    缺少可用的参数量依据,无法估算显存
    许可证
    MIT
    国内可达
    需代理
    其它形态
    GGUF·lmstudio · GGUF·unsloth
  • Neutrino-8B (Fermion)

    量化自 Qwen3-8B

    子 2 比特 8B 聊天模型,容器 2.56 GB

    参数量
    8B
    商用
    可商用

    当前运行配置 FermionResearch/Neutrino-8B

    显存
    暂无估算
    查看详情
    查看运行方式(还有 1 种)
    ollama run hf.co/FermionResearch/Neutrino-8B

    其它 1 种运行方式见详情页

    为何暂无估算
    格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
    许可证
    Apache-2.0
    上下文
    40k
    国内可达
    需代理
  • Bonsai-27B (Prism ML)

    量化自 Bonsai-27B-unpacked

    多模态 27B 模型,纯 Q1_0 量化,语言部分仅 3.8 GB

    参数量
    27B
    商用
    可商用

    当前运行配置 prism-ml/Bonsai-27B-gguf

    显存
    ~4.1GB 1-bit(估算)
    查看详情
    查看运行方式(还有 1 种)
    ollama run hf.co/prism-ml/Bonsai-27B-gguf

    其它 1 种运行方式见详情页

    许可证
    Apache-2.0
    上下文
    262K
    国内可达
    需代理
    其它形态
    GGUF·prism-ml · GGUF·lmstudio
  • Qwen3.6-35B-A3B-Escha-W2 (EschaLabs)

    量化自 Qwen3.6-35B-A3B

    2-bit Qwen3.6-35B-A3B,12.3GB,单卡本地推理

    参数量
    35B (3B active)
    商用
    可商用

    当前运行配置 EschaLabs/Qwen3.6-35B-A3B-Escha-W2

    显存
    ~12GB 2-bit(估算)
    查看详情
    暂无收录命令

    本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。

    许可证
    Apache-2.0
    上下文
    128k
    国内可达
    需代理
  • 融合推理与代码的27B单模型,适合本地编程代理

    参数量
    27B
    商用
    需自查

    当前运行配置 KyleHessling1/Qwopus3.6-27B-Fusion-GGUF

    显存
    暂无估算
    查看详情
    查看运行方式(还有 1 种)
    ollama run hf.co/KyleHessling1/Qwopus3.6-27B-Fusion-GGUF

    其它 1 种运行方式见详情页

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Qwen License
    上下文
    262k
    国内可达
    需代理
  • XYZ-Aquila-mini (XYZAILab)

    微调自 Qwen3.6-35B-A3B

    面向深度搜索的开放权重思考模型

    参数量
    35B (3B 激活)
    商用
    需自查

    当前运行配置 XYZAILab/XYZ-Aquila-mini

    显存
    暂无估算
    查看详情
    查看运行方式
    python -m sglang.launch_server --model-path XYZAILab/XYZ-Aquila-mini --reasoning-parser qwen3 --tool-call-parser qwen3_coder
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Apache 2.0
    上下文
    256k
    国内可达
    魔搭可用
  • 全开源 MoE 语言模型,16B 总参/2.8B 激活,面向研究

    参数量
    16B
    商用
    限制商用

    当前运行配置 amd/Instella-MoE-16B-A3B-Think

    显存
    暂无估算
    查看详情
    暂无收录命令

    本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    ResearchRAIL
    国内可达
    需代理
  • 全Apple Silicon训练·推理优先微调·4B预览版

    参数量
    4B
    商用
    可商用

    当前运行配置 Goekdeniz-Guelmez/JOSIE-2-4B-Preview

    显存
    暂无估算
    查看详情
    查看运行方式
    mlx_lm.generate --model Goekdeniz-Guelmez/JOSIE-2-4B-Preview
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    MIT
    国内可达
    需代理
  • 虚构机构的对话神谕,面向艺术与超虚构创作

    参数量
    14B
    商用
    可商用

    当前运行配置 gokhanturhan/CLINAMEN-Chat

    显存
    暂无估算
    查看详情
    暂无收录命令

    本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    MIT
    国内可达
    需代理
  • Laguna XS 2.1 (poolside)

    量化自 Laguna-XS-2.1

    代码生成小模型,GGUF 量化版

    参数量
    33B (3B 激活)
    商用
    需自查

    当前运行配置 poolside/Laguna-XS-2.1

    显存
    暂无估算
    查看详情
    查看运行方式
    ollama run laguna-xs-2.1
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    openmdw-1.1
    上下文
    262k
    国内可达
    需代理
    其它形态
    原生 · GGUF
  • 43.8M 意英双语对话模型,专为 CPU 环境的意大利语问答设计

    参数量
    43.8M
    商用
    可商用

    当前运行配置 ThingAI/Quak-50m-v2

    显存
    暂无估算
    查看详情
    暂无收录命令

    本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Apache-2.0
    上下文
    2048
    国内可达
    需代理
  • 直接生成可执行ELF hex的文本模型

    参数量
    约4.3B (基于F16.gguf 8.6GiB推断)
    商用
    可商用

    当前运行配置 matthewhaynesonline/gemma-4-E2B-it-crap-gguf

    显存
    暂无估算
    查看详情
    查看运行方式(还有 1 种)
    ollama run hf.co/matthewhaynesonline/gemma-4-E2B-it-crap-gguf

    其它 1 种运行方式见详情页

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Apache-2.0
    国内可达
    需代理
  • Grok-3-reasoning-gemma3-4B-GGUF (mradermacher)

    量化自 Grok-3-reasoning-gemma3-4B-distilled-HF

    Grok-3推理蒸馏Gemma3-4B的GGUF量化版

    参数量
    4B
    商用
    可商用

    当前运行配置 mradermacher/Grok-3-reasoning-gemma3-4B-distilled-HF-GGUF

    显存
    暂无估算
    查看详情
    查看运行方式
    ollama run hf.co/mradermacher/Grok-3-reasoning-gemma3-4B-distilled-HF-GGUF
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Apache-2.0
    国内可达
    需代理
  • Laguna-S-2.1 (poolside)

    量化自 Laguna-S-2.1

    poolside 代码模型,GGUF 量化版,适用于本地运行

    商用
    需自查

    当前运行配置 poolside/Laguna-S-2.1-GGUF

    显存
    暂无估算
    查看详情
    查看运行方式
    llama-server -hf poolside/Laguna-S-2.1-GGUF -m laguna-s-2.1-Q4_K_M.gguf --jinja
    为何暂无估算
    缺少可用的参数量依据,无法估算显存
    许可证
    openmdw-1.1
    上下文
    256K
    国内可达
    需代理
    其它形态
    GGUF·poolside · GGUF·lmstudio
  • POCKET-KR-MLX (FINAL-Bench)

    量化自 Darwin-36B-Opus

    35B 韩语模型,在 iPhone/Mac 上用 MLX 本地运行

    参数量
    35B
    商用
    可商用

    当前运行配置 FINAL-Bench/POCKET-KR-MLX

    显存
    ~12GB 2-bit(估算)
    查看详情
    查看运行方式
    mlx_lm.generate --model FINAL-Bench/POCKET-KR-MLX
    许可证
    Apache-2.0
    国内可达
    需代理
  • Laguna-S-2.1-NVFP4 (poolside)

    量化自 Laguna-S-2.1

    117.6B MoE (8.5B 激活) 代理编码模型,本地设备可运行

    参数量
    117.6B (8.5B 激活)
    商用
    需自查

    当前运行配置 poolside/Laguna-S-2.1-NVFP4

    显存
    暂无估算
    查看详情
    查看运行方式
    vllm serve poolside/Laguna-S-2.1-NVFP4
    为何暂无估算
    格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
    许可证
    OpenMDW-1.1
    上下文
    256K
    国内可达
    需代理
  • Ornith-35B-MLX (AtomicChat)

    量化自 Ornith-1.0-35B

    面向 Apple Silicon 的多模态量化模型,文本+图像

    参数量
    35B
    商用
    可商用

    当前运行配置 AtomicChat/ornith-35b-MLX-8bit

    显存
    ~39GB 8-bit(估算)
    查看详情
    查看运行方式
    mlx_lm.generate --model AtomicChat/ornith-35b-MLX-8bit --prompt Hello
    许可证
    MIT
    上下文
    256K
    国内可达
    需代理
  • Ornith-35b-MLX-6bit (AtomicChat)

    量化自 Ornith-1.0-35B

    35B MoE MLX 量化,Mac 本地多模态推理

    参数量
    35B
    商用
    可商用

    当前运行配置 AtomicChat/ornith-35b-MLX-6bit

    显存
    暂无估算
    查看详情
    查看运行方式
    mlx_lm.generate --model AtomicChat/ornith-35b-MLX-6bit --prompt 'Hello'
    为何暂无估算
    已有格式线索,但估算映射未支持,无法估算显存
    许可证
    MIT
    上下文
    256K
    国内可达
    需代理
  • GPT-OSS-20B (OpenAI)

    量化自 gpt-oss-20b

    2-bit 量化 MLX 模型,专为 Apple Silicon 推理

    参数量
    20B (MoE)
    商用
    需自查

    当前运行配置 majentik/gpt-oss-20b-TurboQuant-MLX-2bit

    显存
    暂无估算
    查看详情
    查看运行方式
    mlx_lm.generate --model majentik/gpt-oss-20b-TurboQuant-MLX-2bit --prompt '你的提示'
    为何暂无估算
    格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
    许可证
    Apache 2.0
    国内可达
    需代理
  • 面向硬件音乐设备的本地助手,基于Qwen3-4B微调

    参数量
    4B
    商用
    不可商用

    当前运行配置 zak-raindog/gear-manual-qwen3-4b

    显存
    ~2.4GB 4-bit(估算)
    查看详情
    查看运行方式
    mlx_lm.generate --model zak-raindog/gear-manual-qwen3-4b --prompt "如何使用EP-133?"
    许可证
    cc-by-nc-4.0
    国内可达
    需代理
  • Qwen3.6-35B-A3B (andreaborio)

    量化自 Qwen3.6-35B-A3B

    Qwen3.6 MoE 量化版,Apple Metal 加速推理

    参数量
    35B (3B 激活)
    商用
    可商用

    当前运行配置 andreaborio/Qwen3.6-35B-A3B-DS4-ExpertMajor-v1-GGUF

    显存
    暂无估算
    查看详情
    查看运行方式(还有 1 种)
    ollama run hf.co/andreaborio/Qwen3.6-35B-A3B-DS4-ExpertMajor-v1-GGUF

    其它 1 种运行方式见详情页

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    apache-2.0
    国内可达
    需代理
  • Bonsai-27B-mlx-1bit (Prism ML)

    量化自 Qwen3.6-27B

    1-bit 27B 模型, 可在手机和笔记本本地运行推理

    参数量
    27B
    商用
    可商用

    当前运行配置 prism-ml/Bonsai-27B-mlx-1bit

    显存
    ~4.1GB 1-bit(估算)
    查看详情
    查看运行方式
    mlx_lm.generate --model prism-ml/Bonsai-27B-mlx-1bit
    许可证
    apache-2.0
    上下文
    262K
    国内可达
    需代理
  • Dolphin3-Cyber-8B (RavichandranJ)

    量化自 Dolphin3.0-Llama3.1-8B-abliterated

    网络安全领域8B微调模型, 本地离线运行红蓝队工具

    参数量
    8B
    商用
    限制商用

    当前运行配置 RavichandranJ/Dolphin3-Cyber-8B-GGUF

    显存
    暂无估算
    查看详情
    查看运行方式
    ollama run hf.co/RavichandranJ/Dolphin3-Cyber-8B-GGUF
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    llama3.1
    上下文
    2k
    国内可达
    需代理
  • 多语言翻译 MoE 模型的 APEX 量化版,供本地 GGUF 推理

    参数量
    30B (3B 激活)
    商用
    可商用

    当前运行配置 alphaZimuth/Hy-MT2-30B-A3B-APEX-GGUF

    显存
    暂无估算
    查看详情
    查看运行方式
    ollama run hf.co/alphaZimuth/Hy-MT2-30B-A3B-APEX-GGUF
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Apache-2.0
    国内可达
    需代理
  • Hy3-GGUF (腾讯)

    量化自 Hy3

    腾讯 Hy3 混合精度 GGUF,针对本地受限硬件极限压缩

    商用
    可商用

    当前运行配置 AngelSlim/Hy3-GGUF

    显存
    暂无估算
    查看详情
    查看运行方式
    ollama run hf.co/AngelSlim/Hy3-GGUF
    为何暂无估算
    缺少可用的参数量依据,无法估算显存
    许可证
    apache-2.0
    上下文
    65536
    国内可达
    魔搭可用
  • MiniCPM5-1B-Thinking (OpenBMB)

    微调自 MiniCPM5-1B

    1B 思考模型,改进编码与指令遵循,适合本地部署

    参数量
    1B
    商用
    可商用

    当前运行配置 GnLOLot/MiniCPM5-1B-Claude-Opus-Fable5-Thinking

    显存
    暂无估算
    查看详情
    查看运行方式
    ollama run hf.co/GnLOLot/MiniCPM5-1B-Claude-Opus-Fable5-Thinking-GGUF
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Apache-2.0
    上下文
    128k
    国内可达
    需代理
    其它形态
    原生 · GGUF
  • 4bit MoE本地运行于Apple Silicon

    参数量
    30B (3B 激活)
    商用
    需自查

    当前运行配置 mlx-community/NVIDIA-Nemotron-3-Nano-30B-A3B-OptiQ-4bit

    显存
    暂无估算
    查看详情
    查看运行方式
    mlx_lm.generate --model mlx-community/NVIDIA-Nemotron-3-Nano-30B-A3B-OptiQ-4bit
    为何暂无估算
    格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
    许可证
    nvidia-open-model-license
    国内可达
    需代理
  • 4-bit MLX 量化,Apple Silicon 本地运行文本生成

    参数量
    35B (3B 激活)
    商用
    可商用

    当前运行配置 mlx-community/Qwen3.5-35B-A3B-OptiQ-4bit

    显存
    暂无估算
    查看详情
    查看运行方式
    mlx_lm.generate --model mlx-community/Qwen3.5-35B-A3B-OptiQ-4bit --prompt 'Explain quantum computing.' --max-tokens 200
    为何暂无估算
    格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
    许可证
    apache-2.0
    上下文
    128k
    国内可达
    需代理
  • 三元2-bit 27B开源模型,笔记本本地运行推理

    参数量
    27B
    商用
    可商用

    当前运行配置 prism-ml/Ternary-Bonsai-27B-mlx-2bit

    显存
    暂无估算
    查看详情
    查看运行方式
    llama-server -hf prism-ml/Ternary-Bonsai-27B-gguf
    为何暂无估算
    格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
    许可证
    apache-2.0
    上下文
    262k
    国内可达
    需代理
  • Ternary-Bonsai-27B (Prism ML)

    量化自 Qwen3.6-27B

    三元权重 27B 推理模型,笔记本本地运行

    参数量
    27B
    商用
    可商用

    当前运行配置 prism-ml/Ternary-Bonsai-27B-gguf

    显存
    暂无估算
    查看详情
    查看运行方式(还有 1 种)
    ollama run hf.co/prism-ml/Ternary-Bonsai-27B-gguf

    其它 1 种运行方式见详情页

    为何暂无估算
    格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
    许可证
    Apache-2.0
    上下文
    262K
    国内可达
    需代理
  • Qwen3.6-35B-A3B-VQ (aquaman164)

    量化自 Qwen3.6-35B-A3B

    MLX VQ量化35B MoE,适合Apple Silicon本地推理

    参数量
    35B (3B激活)
    商用
    可商用

    当前运行配置 aquaman164/Qwen3.6-35B-A3B-MLX-VQ-2.6bpw

    显存
    暂无估算
    查看详情
    查看运行方式
    huggingface-cli download aquaman164/Qwen3.6-35B-A3B-MLX-VQ-2.6bpw --local-dir qwen-vq && python qwen-vq/code/vq_serve.py --model qwen-vq
    为何暂无估算
    格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
    许可证
    Apache-2.0
    上下文
    128k
    国内可达
    需代理
  • Apple Silicon 上 Claude-Code 式本地编码代理

    参数量
    35B (3B 活跃)
    商用
    需自查

    当前运行配置 nathansutton/Ornith-1.0-35B-UD-Q2_K_XL-MLX

    显存
    ~12GB 2-bit(估算)
    查看详情
    查看运行方式
    uvx --from git+https://github.com/nathansutton/mlxcc chad
    国内可达
    需代理
  • Apple Silicon 本地 4-bit 混合精度量化文本生成模型

    参数量
    9B
    商用
    可商用

    当前运行配置 mlx-community/Qwen3.5-9B-OptiQ-4bit

    显存
    暂无估算
    查看详情
    查看运行方式
    mlx_lm.generate --model mlx-community/Qwen3.5-9B-OptiQ-4bit
    为何暂无估算
    格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
    许可证
    apache-2.0
    上下文
    128k
    国内可达
    需代理
  • Qwythos-9B-v2 (Empero AI)

    微调自 Qwythos-9B-Claude-Mythos-5-1M

    修复循环生成并保留1M上下文推理能力的研究型模型

    参数量
    9B
    商用
    可商用

    当前运行配置 empero-ai/Qwythos-9B-v2

    显存
    暂无估算
    查看详情
    查看运行方式
    vllm serve empero-ai/Qwythos-9B-v2 --trust-remote-code
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Apache-2.0
    上下文
    1048k
    国内可达
    需代理
    其它形态
    原生 · GGUF
  • 统一音频-文本语言模型,支持语音识别、翻译、TTS 与音频生成

    参数量
    2B
    商用
    需自查

    当前运行配置 nvidia/Nemotron-Labs-Audex-2B

    显存
    暂无估算
    查看详情
    查看运行方式
    python -c "from transformers import AutoModel; AutoModel.from_pretrained('nvidia/Nemotron-Labs-Audex-2B', trust_remote_code=True)"
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    NVIDIA OneWay Noncommercial License
    上下文
    128k
    国内可达
    需代理
  • NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B (NVIDIA)

    量化自 NVIDIA-Nemotron-3-Super-120B-A12B-BF16

    面向高吞吐推理的压缩 MoE 模型,用于交互式推理与高并发部署

    参数量
    75B (9.3B active)
    商用
    需自查

    当前运行配置 nvidia/NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B-NVFP4

    显存
    暂无估算
    查看详情
    查看运行方式
    vllm serve nvidia/NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B-NVFP4 --trust-remote-code --mamba-backend flashinfer
    为何暂无估算
    格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
    许可证
    OpenMDW-1.1
    上下文
    1M
    国内可达
    需代理
  • 音频-文本统一LLM,兼顾文本推理与语音/音频生成

    参数量
    30B MoE (3B激活)
    商用
    需自查

    当前运行配置 nvidia/Nemotron-Labs-Audex-30B-A3B

    显存
    暂无估算
    查看详情
    查看运行方式
    python -c "from transformers import AutoModelForCausalLM; AutoModelForCausalLM.from_pretrained('nvidia/Nemotron-Labs-Audex-30B-A3B', trust_remote_code=True)"
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    NVIDIA Oneway Noncommercial License
    上下文
    1M
    国内可达
    需代理
  • Supra-Router-51M (SupraLabs)

    微调自 Supra-1.5-50M-Base-exp

    51M 参数边缘路由器, 判断提示词复杂度并分发至本地或云端模型

    参数量
    51M
    商用
    需自查

    当前运行配置 SupraLabs/Supra-Router-51M

    显存
    暂无估算
    查看详情
    查看运行方式
    AutoModelForCausalLM.from_pretrained('SupraLabs/Supra-Router-51M')
    为何暂无估算
    权重格式未知,无法估算显存
    上下文
    3840
    国内可达
    需代理
  • Grug-12B (kai-os)

    微调自 gemma-4-12B-it

    紧凑推理微调,减少冗余推理轨迹,降低推理token消耗

    参数量
    12B
    商用
    需自查

    当前运行配置 kai-os/Grug-12B

    显存
    暂无估算
    查看详情
    查看运行方式
    ollama run hf.co/kai-os/Grug-12B
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    other
    国内可达
    需代理
  • Agents-A1 (InternScience)

    量化自 Agents-A1

    35B MoE 视觉 Agent,用于长程搜索与工具调用

    参数量
    35B MoE
    商用
    需自查

    当前运行配置 InternScience/Agents-A1

    显存
    暂无估算
    查看详情
    查看运行方式(还有 1 种)
    vllm serve InternScience/Agents-A1 --port 8000 --tensor-parallel-size 1 --max-model-len 262144 --reasoning-parser qwen3

    其它 1 种运行方式见详情页

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Apache 2.0
    上下文
    262k
    国内可达
    魔搭可用
    其它形态
    原生 · GGUF
  • 1.3B MoD对话模型,支持ChatML与代码/数学生成

    参数量
    1.27B
    商用
    可商用

    当前运行配置 Smilyai-labs/Nova-1-Standard-1.3B-Preview

    显存
    暂无估算
    查看详情
    查看运行方式
    pipeline('text-generation', model='Smilyai-labs/Nova-1-Standard-1.3B-Preview', trust_remote_code=True, device_map='auto')
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    apache-2.0
    上下文
    2048
    国内可达
    需代理
  • Qwen3.6-35B-A3B (Qwen)

    量化自 Qwen3.6-35B-A3B

    三元专家量化版,9.4 GB 全量跑在 16 GB Mac 上

    参数量
    35B (3B 激活)
    商用
    可商用

    当前运行配置 manjunathshiva/Qwen3.6-35B-A3B-tq3a-tqTe-g64

    显存
    暂无估算
    查看详情
    查看运行方式
    pip install 'turboquant-mlx-full>=0.12.3' && python -m turboquant_mlx.generate --model manjunathshiva/Qwen3.6-35B-A3B-tq3a-tqTe-g64
    为何暂无估算
    格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
    许可证
    Apache-2.0
    国内可达
    需代理
  • Gemma4-Gutenberg-31B-Heretic-mlx-8Bit (ailexleon)

    量化自 Gemma4-Gutenberg-31B-Heretic

    MLX 8-bit 量化英文创意写作模型,适合故事小说生成

    参数量
    31B
    商用
    可商用

    当前运行配置 ailexleon/Gemma4-Gutenberg-31B-Heretic-mlx-8Bit

    显存
    ~34GB 8-bit(估算)
    查看详情
    查看运行方式
    mlx_lm.generate --model ailexleon/Gemma4-Gutenberg-31B-Heretic-mlx-8Bit --prompt 'hello'
    许可证
    apache-2.0
    国内可达
    需代理
  • 移除安全过滤的GLM-5.2 GGUF,供研究实验用

    商用
    可商用

    当前运行配置 huihui-ai/Huihui-GLM-5.2-abliterated-GGUF

    显存
    暂无估算
    查看详情
    查看运行方式(还有 1 种)
    llama-server -m ./glm52/GLM-5.2-UD-IQ1_M.gguf -c 4096(需编译llama.cpp)

    其它 1 种运行方式见详情页

    为何暂无估算
    缺少可用的参数量依据,无法估算显存
    许可证
    MIT
    国内可达
    需代理
  • 双塔扩散LLM,块并行解码,2.42x生成吞吐量

    参数量
    30B (3B 激活)
    商用
    需自查

    当前运行配置 nvidia/Nemotron-Labs-TwoTower-30B-A3B-Base-BF16

    显存
    ~63GB BF16(估算)
    查看详情
    查看运行方式(还有 1 种)
    python3 -c "from transformers import AutoModelForCausalLM; AutoModelForCausalLM.from_pretrained('nvidia/Nemotron-Labs-TwoTower-30B-A3B-Base-BF16',trust_remote_code=True,torch_dtype='bfloat16').cuda()" (单GPU AR模式,约59GB显存)

    其它 1 种运行方式见详情页

    许可证
    NVIDIA Nemotron Open Model License
    上下文
    128k
    国内可达
    需代理
  • Qwen3.6-27B NVFP4 量化,面向 vLLM 部署与推理

    参数量
    27B
    商用
    可商用

    当前运行配置 nvidia/Qwen3.6-27B-NVFP4

    显存
    暂无估算
    查看详情
    查看运行方式
    vllm serve nvidia/Qwen3.6-27B-NVFP4 --port 8000 --quantization modelopt --max-model-len 262144 --reasoning-parser qwen3
    为何暂无估算
    格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
    许可证
    Apache-2.0
    上下文
    262k
    国内可达
    需代理
  • 8B参数1B激活MoE,消费级GPU可运行的APEX量化

    参数量
    8B (激活1B)
    商用
    需自查

    当前运行配置 mudler/LFM2.5-8B-A1B-APEX-GGUF

    显存
    暂无估算
    查看详情
    查看运行方式(还有 1 种)
    llama-server -hf mudler/LFM2.5-8B-A1B-APEX-GGUF:LFM2.5-8B-A1B-APEX-I-Balanced.gguf

    其它 1 种运行方式见详情页

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    LFM1.0
    国内可达
    需代理
  • BugTraceAI-CORE-Ultra-27B (BugTraceAI)

    量化自 Qwen3.6-27B-Heretic2-Uncensored-Finetune-Thinking

    生成漏洞利用与安全工具,面向攻防研究者

    参数量
    27B
    商用
    可商用

    当前运行配置 BugTraceAI/BugTraceAI-CORE-Ultra-27B-Q6

    显存
    暂无估算
    查看详情
    查看运行方式(还有 1 种)
    python -c "from llama_cpp import Llama; Llama.from_pretrained(repo_id='BugTraceAI/BugTraceAI-CORE-Ultra-27B-Q4', filename='BugTraceAI-CORE-Ultra-SFT-Q6_K.gguf')"

    其它 1 种运行方式见详情页

    为何暂无估算
    已有格式线索,但估算映射未支持,无法估算显存
    许可证
    Apache-2.0
    上下文
    4096
    国内可达
    需代理
  • LFM2.5-230M (LiquidAI)

    量化自 LFM2.5-230M

    混合架构边缘设备模型,用于设备端文本生成

    参数量
    230M
    商用
    需自查

    当前运行配置 LiquidAI/LFM2.5-230M

    显存
    暂无估算
    查看详情
    查看运行方式(还有 2 种)
    llama-server -hf LiquidAI/LFM2.5-230M-GGUF

    其它 2 种运行方式见详情页

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    LFM1.0
    上下文
    32768
    国内可达
    需代理
    其它形态
    原生 · GGUF
  • Mythos-nano (squ11z1)

    量化自 VibeThinker-3B

    3B无审查推理模型,专注数学与竞赛编程

    参数量
    3B
    商用
    可商用

    当前运行配置 squ11z1/Mythos-nano

    显存
    暂无估算
    查看详情
    查看运行方式(还有 3 种)
    ollama run hf.co/squ11z1/Mythos-nano

    其它 3 种运行方式见详情页

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    MIT
    国内可达
    需代理
  • Mythos-nano (squ11z1)

    量化自 Mythos-nano

    轻量推理模型,专注数学与代码任务的本地运行

    商用
    可商用

    当前运行配置 mradermacher/Mythos-nano-i1-GGUF

    显存
    暂无估算
    查看详情
    查看运行方式(还有 1 种)
    from llama_cpp import Llama; llm = Llama.from_pretrained(repo_id='mradermacher/Mythos-nano-i1-GGUF', filename='Mythos-nano.i1-Q4_K_M.gguf')

    其它 1 种运行方式见详情页

    为何暂无估算
    缺少可用的参数量依据,无法估算显存
    许可证
    MIT
    国内可达
    需代理
  • Qwen3.6-27b-Fable5 (hotdogs)

    LoRA · 基于 Qwen3.6-27B

    Qwen3.6-27B的LoRA微调,用于故事与寓言生成

    参数量
    27B (基座) + LoRA
    商用
    需自查

    当前运行配置 hotdogs/qwen3.6-27b-fable5-lora

    显存
    暂无估算
    查看详情
    查看运行方式
    vllm serve Qwen/Qwen3.6-27B --enable-lora --lora-modules fable=hotdogs/qwen3.6-27b-fable5-lora
    为何暂无估算
    权重格式未知,无法估算显存
    国内可达
    需代理
  • FastContext-1.0-4B-RL (Microsoft)

    微调自 Qwen3-4B-Instruct-2507

    为编码代理提供仓库探索与精确文件引用

    参数量
    4B
    商用
    可商用

    当前运行配置 microsoft/FastContext-1.0-4B-RL

    显存
    暂无估算
    查看详情
    查看运行方式(还有 1 种)
    python3 -m sglang.launch_server --model-path microsoft/FastContext-1.0-4B-RL --tool-call-parser qwen --context-length 262144 --trust-remote-code --dtype bfloat16 --host 0.0.0.0 --port 30000 --tp-size 1 --mem-fraction-static 0.8

    其它 1 种运行方式见详情页

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    MIT
    上下文
    262k
    国内可达
    需代理
  • Huihui-gemma-4-12B-coder-abliterated (huihui-ai)

    微调自 gemma-4-12B-coder-fable5-composer2.5-v1

    未审查版 Gemma 代码模型,用于编程与推理,已去除拒答

    参数量
    12B
    商用
    可商用

    当前运行配置 huihui-ai/Huihui-gemma-4-12B-coder-fable5-composer2.5-v1-abliterated

    显存
    暂无估算
    查看详情
    查看运行方式(还有 1 种)
    vllm serve huihui-ai/Huihui-gemma-4-12B-coder-fable5-composer2.5-v1-abliterated

    其它 1 种运行方式见详情页

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    apache-2.0
    国内可达
    需代理
  • 284B MoE 架构,13B 激活参数,原生支持百万 Token 上下文,高效推理与强训练基线。

    参数量
    158.1B
    商用
    可商用

    当前运行配置 deepseek-ai/DeepSeek-V4-Flash

    显存
    暂无估算
    查看详情
    暂无收录命令

    本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    mit
    国内可达
    魔搭可用
  • 1.6T参数MoE旗舰,原生百万token上下文,开源模型新标杆。

    参数量
    861.6B
    商用
    可商用

    当前运行配置 deepseek-ai/DeepSeek-V4-Pro

    显存
    暂无估算
    查看详情
    暂无收录命令

    本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    mit
    国内可达
    魔搭可用
  • 混合量化Gemma-4-12B,8GB显存Pascal GPU代码生成

    参数量
    12B
    商用
    可商用

    当前运行配置 wepiqx/gemma-4-12B-it-SHQ6-GGUF

    显存
    暂无估算
    查看详情
    查看运行方式(还有 1 种)
    llama-server -hf wepiqx/gemma-4-12B-it-SHQ6-GGUF:gemma-4-12b-it-SHQ6-IQ4_XS.gguf --jinja --flash-attn on -c 55555 -ngl 99

    其它 1 种运行方式见详情页

    为何暂无估算
    格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
    许可证
    Apache-2.0
    国内可达
    需代理
  • Gemma-4-31B-StyleTune (Gryphe)

    微调自 gemma-4-31B-it

    Gemma 4 31B风格微调,陈词减60%,角色扮演与创意写作。

    参数量
    31B
    商用
    可商用

    当前运行配置 Gryphe/Gemma-4-31B-StyleTune

    显存
    暂无估算
    查看详情
    查看运行方式
    python -c "from transformers import AutoModelForCausalLM; model = AutoModelForCausalLM.from_pretrained('Gryphe/Gemma-4-31B-StyleTune')"
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    apache-2.0
    国内可达
    需代理
  • VibeThinker-3B (WeiboAI)

    微调自 Qwen2.5-Coder-3B

    面向数学/代码/STEM的可验证推理3B小模型

    参数量
    3B
    商用
    可商用

    当前运行配置 WeiboAI/VibeThinker-3B

    显存
    暂无估算
    查看详情
    查看运行方式(还有 1 种)
    vllm serve WeiboAI/VibeThinker-3B

    其它 1 种运行方式见详情页

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    MIT
    上下文
    64k
    国内可达
    魔搭可用
  • FastContext-1.0-4B-SFT (Microsoft)

    微调自 Qwen3-4B-Instruct-2507

    轻量仓库探索子代理,供编码代理按需调用,减少 token 消耗

    参数量
    4B
    商用
    可商用

    当前运行配置 microsoft/FastContext-1.0-4B-SFT

    显存
    暂无估算
    查看详情
    查看运行方式(还有 1 种)
    python3 -m sglang.launch_server --model-path microsoft/FastContext-1.0-4B-SFT --tool-call-parser qwen --context-length 262144 --trust-remote-code --dtype bfloat16 --host 0.0.0.0 --port 30000 --tp-size 1 --mem-fraction-static 0.8

    其它 1 种运行方式见详情页

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    MIT
    上下文
    262k
    国内可达
    需代理
  • prism-coder-14b (dcostenco)

    量化自 prism-coder-14b

    基于 Qwen3 的 14B 代码模型 GGUF 量化,本地可跑

    参数量
    14B
    商用
    可商用

    当前运行配置 mradermacher/prism-coder-14b-GGUF

    显存
    暂无估算
    查看详情
    查看运行方式(还有 1 种)
    llama-server -hf mradermacher/prism-coder-14b-GGUF --model prism-coder-14b.Q4_K_M.gguf

    其它 1 种运行方式见详情页

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    apache-2.0
    国内可达
    需代理
  • prism-coder-14b (mradermacher)

    量化自 prism-coder-14b

    基于 Qwen3 的代码模型,GGUF 量化版,适合本地运行

    参数量
    14B
    商用
    可商用

    当前运行配置 mradermacher/prism-coder-14b-i1-GGUF

    显存
    暂无估算
    查看详情
    查看运行方式(还有 1 种)
    llama-server --hf-repo mradermacher/prism-coder-14b-i1-GGUF --hf-file prism-coder-14b.i1-Q4_K_M.gguf

    其它 1 种运行方式见详情页

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    apache-2.0
    国内可达
    需代理
  • DiffusionGemma-26B-A4B-it-NVFP4 (NVIDIA)

    量化自 diffusiongemma-26B-A4B-it

    扩散多模态文本生成,3.8B活跃参数,NVFP4量化

    参数量
    25.2B (3.8B活跃)
    商用
    可商用

    当前运行配置 nvidia/diffusiongemma-26B-A4B-it-NVFP4

    显存
    暂无估算
    查看详情
    查看运行方式
    VLLM_USE_V2_MODEL_RUNNER=1 vllm serve nvidia/diffusiongemma-26B-A4B-IT-NVFP4 --trust-remote-code --max-num-seqs 4 --attention-backend TRITON_ATTN --enable-auto-tool-choice --tool-call-parser gemma4 --reasoning-parser gemma4 --override-generation-config '{"max_new_tokens": null}' --default-chat-template-kwargs '{"enable_thinking":true}' (需H100/B100)
    为何暂无估算
    格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
    许可证
    Apache 2.0 (Gemma Terms)
    上下文
    256k
    国内可达
    需代理
  • Z-Image-Engineer-V6 (BennyDaBall)

    微调自 Z-Image-Turbo

    4B 提示词增强与 Z-Image 文本编码器,本地双用途

    参数量
    4B
    商用
    可商用

    当前运行配置 BennyDaBall/Z-Image-Engineer-V6

    显存
    暂无估算
    查看详情
    查看运行方式(还有 1 种)
    llama-server -hf BennyDaBall/Z-Image-Engineer-V6-GGUF

    其它 1 种运行方式见详情页

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Apache-2.0
    国内可达
    需代理
  • Averroes-Q-Instruct (hayulalab)

    量化自 Averroes-Q-Instruct

    Qwen2 架构的阿/英指令模型 GGUF 量化

    参数量
    7B
    商用
    可商用

    当前运行配置 mradermacher/Averroes-Q-Instruct-GGUF

    显存
    暂无估算
    查看详情
    查看运行方式(还有 1 种)
    ollama run hf.co/mradermacher/Averroes-Q-Instruct-GGUF

    其它 1 种运行方式见详情页

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    apache-2.0
    国内可达
    需代理
  • Gemma4-12B-Coder (yuxinlu1)

    量化自 gemma-4-12B-it

    本地 Python 编程模型,离线解决算法问题

    参数量
    12B
    商用
    可商用

    当前运行配置 yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUF

    显存
    暂无估算
    查看详情
    查看运行方式(还有 1 种)
    ollama run hf.co/yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUF

    其它 1 种运行方式见详情页

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    gemma
    上下文
    131k
    国内可达
    需代理
  • 18B MoE预览模型,面向Bittensor SN24研究蒸馏

    参数量
    18B (2B active)
    商用
    可商用

    当前运行配置 silx-ai/Quasar-Preview

    显存
    暂无估算
    查看详情
    查看运行方式
    python -c "from transformers import AutoModelForCausalLM; AutoModelForCausalLM.from_pretrained('silx-ai/Quasar-Preview', trust_remote_code=True)"
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    MIT
    上下文
    5M (实验性配置)
    国内可达
    需代理
  • Delphi扩展律研究基座,25B参数,终版模型

    参数量
    25B
    商用
    可商用

    当前运行配置 marin-community/delphi-1e23-25Bparams-628Btokens

    显存
    暂无估算
    查看详情
    查看运行方式
    transformers.from_pretrained('marin-community/delphi-1e23-25Bparams-628Btokens')
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    apache-2.0
    上下文
    4k
    国内可达
    需代理
  • LFM2.5-1.2B-JP (LiquidAI)

    微调自 LFM2.5-1.2B-Base

    日英双语聊天模型,适合代理工作流与工具使用

    参数量
    1.2B
    商用
    需自查

    当前运行配置 LiquidAI/LFM2.5-1.2B-JP-202606

    显存
    暂无估算
    查看详情
    查看运行方式(还有 2 种)
    llama-server -hf LiquidAI/LFM2.5-1.2B-JP-202606-GGUF

    其它 2 种运行方式见详情页

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    LFM1.0
    上下文
    32k
    国内可达
    需代理
  • Harness-1 (pat-jj)

    微调自 gpt-oss-20b

    20B搜索智能体,对标前沿检索性能

    参数量
    20B
    商用
    需自查

    当前运行配置 pat-jj/harness-1

    显存
    暂无估算
    查看详情
    查看运行方式
    transformers from_pretrained('pat-jj/harness-1')
    为何暂无估算
    权重格式未知,无法估算显存
    国内可达
    需代理
  • 零拒绝消融Gemma 4,供对齐研究与红队测试

    参数量
    12B
    商用
    限制商用

    当前运行配置 OBLITERATUS/Gemma-4-12B-OBLITERATED

    显存
    暂无估算
    查看详情
    查看运行方式(还有 1 种)
    ollama run hf.co/OBLITERATUS/Gemma-4-12B-OBLITERATED

    其它 1 种运行方式见详情页

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    gemma
    国内可达
    需代理
  • 面向编码与工具调用的智能体模型

    参数量
    35B (A3B)
    商用
    可商用

    当前运行配置 nex-agi/Nex-N2-mini

    显存
    暂无估算
    查看详情
    查看运行方式(还有 1 种)
    python -m sglang.launch_server --model-path ./model --tp 2 --reasoning-parser qwen3 --tool-call-parser qwen3_coder

    其它 1 种运行方式见详情页

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    apache-2.0
    国内可达
    魔搭可用
  • 苹果芯片4-bit MLX 量化 Qwen3.5-0.8B

    参数量
    0.8B
    商用
    可商用

    当前运行配置 mlx-community/Qwen3.5-0.8B-OptiQ-4bit

    显存
    暂无估算
    查看详情
    查看运行方式(还有 1 种)
    pip install mlx-lm; mlx_lm.generate --model mlx-community/Qwen3.5-0.8B-OptiQ-4bit --prompt '...'

    其它 1 种运行方式见详情页

    为何暂无估算
    格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
    许可证
    Apache 2.0
    国内可达
    需代理
  • 4-bit混合精度MLX量化Qwen3.5-2B,苹果芯片推理

    参数量
    2B
    商用
    可商用

    当前运行配置 mlx-community/Qwen3.5-2B-OptiQ-4bit

    显存
    暂无估算
    查看详情
    查看运行方式(还有 1 种)
    mlx-lm generate --model mlx-community/Qwen3.5-2B-OptiQ-4bit

    其它 1 种运行方式见详情页

    为何暂无估算
    格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
    许可证
    apache-2.0
    国内可达
    需代理
  • Qwen3.6-27B 的 MLX 推理加速版供苹果芯片

    参数量
    27B
    商用
    可商用

    当前运行配置 Youssofal/Qwen3.6-27B-MTPLX-Optimized-Speed

    显存
    ~16GB 4-bit(估算)
    查看详情
    查看运行方式(还有 2 种)
    brew install youssofal/mtplx/mtplx

    其它 2 种运行方式见详情页

    许可证
    Apache-2.0
    国内可达
    需代理
  • Apple Silicon的Qwen3.6-27B 4bit混合量化版

    参数量
    27B
    商用
    可商用

    当前运行配置 mlx-community/Qwen3.6-27B-OptiQ-4bit

    显存
    暂无估算
    查看详情
    查看运行方式(还有 1 种)
    mlx_lm.load('mlx-community/Qwen3.6-27B-OptiQ-4bit')

    其它 1 种运行方式见详情页

    为何暂无估算
    格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
    许可证
    Apache-2.0
    国内可达
    需代理
  • Apple Silicon 4-bit MLX混精量化+MTP投机解码

    参数量
    35B-A3B
    商用
    可商用

    当前运行配置 mlx-community/Qwen3.6-35B-A3B-OptiQ-4bit

    显存
    暂无估算
    查看详情
    查看运行方式(还有 1 种)
    optiq serve --model mlx-community/Qwen3.6-35B-A3B-OptiQ-4bit --mtp

    其它 1 种运行方式见详情页

    为何暂无估算
    格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
    许可证
    Apache-2.0
    国内可达
    需代理
  • 直接回答的指令模型,用于交互聊天、代码和工具调用

    参数量
    12B (2.5B active)
    商用
    可商用

    当前运行配置 JetBrains/Mellum2-12B-A2.5B-Instruct

    显存
    暂无估算
    查看详情
    查看运行方式(还有 1 种)
    vllm serve JetBrains/Mellum2-12B-A2.5B-Instruct --max-model-len 131072

    其它 1 种运行方式见详情页

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    apache-2.0
    上下文
    131k
    国内可达
    需代理
  • 循环异构图语言模型,用于个性化微调与端侧推理

    参数量
    40.1M
    商用
    需自查

    当前运行配置 david-thrower/HelixLM-20260529-2240-d512-h8-nl3-ffn2-s512-1500MT-ep1

    显存
    暂无估算
    查看详情
    查看运行方式(还有 1 种)
    transformers from_pretrained(trust_remote_code=True)

    其它 1 种运行方式见详情页

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Modified Apache 2.0
    上下文
    1024
    国内可达
    需代理
  • LFM2.5-8B-A1B (LiquidAI)

    量化自 LFM2.5-8B-A1B

    8.3B总参/1.5B活跃,面向端侧个人助手的混合架构模型

    参数量
    8.3B (1.5B active)
    商用
    需自查

    当前运行配置 LiquidAI/LFM2.5-8B-A1B

    显存
    暂无估算
    查看详情
    查看运行方式
    transformers >= 5.0.0: AutoModelForCausalLM.from_pretrained('LiquidAI/LFM2.5-8B-A1B')
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    LFM1.0
    上下文
    128k
    国内可达
    需代理
    其它形态
    原生 · GGUF·liquidai · GGUF·unsloth
  • 思考型助手,在<think>块中输出推理链后给出最终答案

    参数量
    12B
    商用
    可商用

    当前运行配置 JetBrains/Mellum2-12B-A2.5B-Thinking

    显存
    暂无估算
    查看详情
    查看运行方式(还有 1 种)
    vllm serve JetBrains/Mellum2-12B-A2.5B-Thinking --max-model-len 131072 --reasoning-parser qwen3

    其它 1 种运行方式见详情页

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Apache 2.0
    上下文
    131k
    国内可达
    需代理
  • Qwen3.5-9B (Qwen)

    量化自 Qwen3.5-9B

    Qwen3.5-9B MoQ量化版,MTP推测解码,适合本地快速生成

    参数量
    9B
    商用
    可商用

    当前运行配置 w-ahmad/Qwen3.5-9B-GGUF-MoQ-MTP

    显存
    暂无估算
    查看详情
    查看运行方式(还有 1 种)
    ollama run hf.co/w-ahmad/Qwen3.5-9B-GGUF-MoQ-MTP

    其它 1 种运行方式见详情页

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    MIT
    上下文
    32k
    国内可达
    需代理
  • Qwen3.6-35B-A3B-NVFP4 (NVIDIA)

    量化自 Qwen3.6-35B-A3B

    Qwen3.6-35B-A3B FP4量化版,面向vLLM高效推理

    参数量
    35B (激活3B)
    商用
    可商用

    当前运行配置 nvidia/Qwen3.6-35B-A3B-NVFP4

    显存
    暂无估算
    查看详情
    查看运行方式
    vllm serve nvidia/Qwen3.6-35B-A3B-NVFP4 --quantization modelopt
    为何暂无估算
    格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
    许可证
    Apache 2.0
    上下文
    262k
    国内可达
    需代理
  • 昇腾原生1.58-bit三元LLM,推理内存降6x,保持95.7%性能

    参数量
    8B
    商用
    可商用

    当前运行配置 openbmb/BitCPM-CANN-8B

    显存
    ~2.2GB ternary(估算)
    查看详情
    查看运行方式(还有 1 种)
    ollama create 从 https://huggingface.co/openbmb/BitCPM-CANN-8B-gguf 导入

    其它 1 种运行方式见详情页

    许可证
    apache-2.0
    国内可达
    需代理
  • aro-coder-4bit (ARO-Lang)

    LoRA · 基于 Qwen3-Coder-30B-A3B-Instruct-4bit

    为ARO语言微调的代码生成器,4bit量化,供ARO DSL开发者使用

    参数量
    30B (3B active)
    商用
    可商用

    当前运行配置 ARO-Lang/aro-coder-4bit

    显存
    ~18GB 4-bit(估算)
    查看详情
    查看运行方式(还有 2 种)
    ollama run aro-coder

    其它 2 种运行方式见详情页

    许可证
    MIT
    国内可达
    需代理
  • Hy-MT2-1.8B-GGUF (Tencent)

    量化自 Hy-MT2-1.8B

    轻量多语言翻译模型,支持 llama.cpp 本地部署

    参数量
    1.8B
    商用
    可商用

    当前运行配置 tencent/Hy-MT2-1.8B-GGUF

    显存
    暂无估算
    查看详情
    查看运行方式
    llama-server -hf tencent/Hy-MT2-1.8B-GGUF
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    apache-2.0
    国内可达
    魔搭可用
  • Qwen3.6-27B (OBLITERATUS)

    量化自 Qwen3.6-27B

    移除拒绝回路,能力保持,本地全栈部署

    参数量
    26.9B
    商用
    可商用

    当前运行配置 OBLITERATUS/Qwen3.6-27B-OBLITERATED

    显存
    暂无估算
    查看详情
    查看运行方式(还有 2 种)
    ollama run hf.co/OBLITERATUS/Qwen3.6-27B-OBLITERATED

    其它 2 种运行方式见详情页

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    apache-2.0
    上下文
    8192
    国内可达
    需代理
  • Llama-3-8B 4-bit版,M系列芯片本地推理

    参数量
    8B
    商用
    限制商用

    当前运行配置 mlx-community/Meta-Llama-3-8B-Instruct-4bit

    显存
    ~4.8GB 4-bit(估算)
    查看详情
    查看运行方式(还有 1 种)
    pip install mlx-lm && mlx_lm.generate --model mlx-community/Meta-Llama-3-8B-Instruct-4bit --prompt "hello"

    其它 1 种运行方式见详情页

    许可证
    llama3
    上下文
    8k
    国内可达
    需代理
  • Ternary-Bonsai-8B (Prism ML)

    量化自 Ternary-Bonsai-8B-unpacked

    三元1.58-bit量化8B模型,苹果芯片本地推理

    参数量
    8B
    商用
    可商用

    当前运行配置 prism-ml/Ternary-Bonsai-8B-mlx-2bit

    显存
    暂无估算
    查看详情
    查看运行方式(还有 1 种)
    mlx_lm.load('prism-ml/Ternary-Bonsai-8B-mlx-2bit')

    其它 1 种运行方式见详情页

    为何暂无估算
    格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
    许可证
    Apache-2.0
    上下文
    65k
    国内可达
    需代理
  • Granite-4.1-30B (IBM)

    量化自 granite-4.1-30b

    IBM Granite 30B GGUF量化, 本地部署与推理

    参数量
    30B
    商用
    可商用

    当前运行配置 lmstudio-community/granite-4.1-30b-GGUF

    显存
    暂无估算
    查看详情
    查看运行方式
    llama.cpp: huggingface-cli download lmstudio-community/granite-4.1-30b-GGUF --include '*.gguf' --local-dir . && ./llama-cli -m <file>
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Apache 2.0
    国内可达
    需代理
  • Granite-4.1-3B-GGUF (IBM)

    量化自 granite-4.1-3b

    IBM Granite 4.1 3B GGUF量化,本地推理与边缘部署

    参数量
    3B
    商用
    可商用

    当前运行配置 lmstudio-community/granite-4.1-3b-GGUF

    显存
    暂无估算
    查看详情
    查看运行方式
    llama.cpp -m granite-4.1-3b-Q4_K_M.gguf
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Apache-2.0
    国内可达
    需代理
  • Granite-4.1-8B-GGUF (IBM)

    量化自 granite-4.1-8b

    IBM Granite 4.1 8B的GGUF量化,用于本地推理

    参数量
    8B
    商用
    可商用

    当前运行配置 lmstudio-community/granite-4.1-8b-GGUF

    显存
    暂无估算
    查看详情
    查看运行方式
    llama.cpp -m granite-4.1-8b.gguf
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    apache-2.0
    国内可达
    需代理
  • Apple芯片上本地运行的Llama2 7B对话模型

    参数量
    7B
    商用
    限制商用

    当前运行配置 mlx-community/Llama-2-7b-chat-mlx

    显存
    暂无估算
    查看详情
    查看运行方式(还有 1 种)
    python mlx-examples/llama/llama.py --prompt 'Hi' model/

    其它 1 种运行方式见详情页

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    llama2
    上下文
    4096
    国内可达
    需代理
  • MiniMax-M2.7 (MiniMax)

    量化自 MiniMax-M2.7

    MiniMax M2.7 GGUF量化版,适合本地部署与实验

    参数量
    2.7B

    当前运行配置 lmstudio-community/MiniMax-M2.7-GGUF

    显存
    暂无估算
    查看详情
    查看运行方式(还有 1 种)
    ollama create MiniMax-M2.7 -f Modelfile (FROM ./file.gguf)

    其它 1 种运行方式见详情页

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    other
    国内可达
    需代理
  • 三模式 LM (AR/扩散/自推测),为 AI 应用开发者提供高效生成

    参数量
    14B

    当前运行配置 nvidia/Nemotron-Labs-Diffusion-14B

    显存
    暂无估算
    查看详情
    查看运行方式
    transformers from_pretrained()
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    NVIDIA Nemotron Open Model License
    国内可达
    需代理
  • Bonsai-8B-mlx-1bit (PrismML)

    量化自 Bonsai-8B-unpacked

    Apple Silicon 的 1-bit LLM,端侧极低内存推理

    参数量
    8B
    商用
    可商用

    当前运行配置 prism-ml/Bonsai-8B-mlx-1bit

    显存
    ~1.2GB 1-bit(估算)
    查看详情
    查看运行方式
    pip install mlx-lm; pip install mlx@git+https://github.com/PrismML-Eng/mlx.git@prism; from mlx_lm import load; load('prism-ml/Bonsai-8B-mlx-1bit')
    许可证
    Apache-2.0
    上下文
    65k
    国内可达
    需代理
  • 1B预对齐前缀LM,用前缀条件做结构化输出与推理

    参数量
    1B
    商用
    可商用

    当前运行配置 sapientinc/HRM-Text-1B

    显存
    暂无估算
    查看详情
    查看运行方式(还有 1 种)
    AutoModelForCausalLM.from_pretrained('sapientinc/HRM-Text-1B', trust_remote_code=True)

    其它 1 种运行方式见详情页

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Apache-2.0
    上下文
    4096
    国内可达
    需代理
  • Minimalism (salakash)

    LoRA · 基于 Qwen2.5-Coder-0.5B-Instruct

    为开发者输出最少代码行的可运行代码

    参数量
    0.5B
    商用
    可商用

    当前运行配置 salakash/Minimalism

    显存
    暂无估算
    查看详情
    查看运行方式(还有 1 种)
    mlx_lm.server --model mlx-community/Qwen2.5-Coder-0.5B-Instruct-4bit --adapter-path salakash/Minimalism --port 8080

    其它 1 种运行方式见详情页

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Apache-2.0
    上下文
    32k
    国内可达
    需代理
  • 通用问答模型,适合知识型对话与事实查询。

    参数量
    14B
    商用
    可商用

    当前运行配置 jackxinning/Leanly_AI

    显存
    暂无估算
    查看详情
    查看运行方式
    transformers: AutoModel.from_pretrained('jackxinning/Leanly_AI')
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    apache-2.0
    国内可达
    需代理
  • 600M参数早期检查点,面向低资源多语言部署

    参数量
    600M
    商用
    可商用

    当前运行配置 FrontiersMind/Nandi-Mini-600M-Early-Checkpoint

    显存
    暂无估算
    查看详情
    查看运行方式
    transformers.from_pretrained('FrontiersMind/Nandi-Mini-600M-Early-Checkpoint')
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    apache-2.0
    上下文
    2048
    国内可达
    需代理

常见坑

  • 硬件门槛仍高:仅 2-bit 就需要 238GB,官方示例直接指向 256GB 内存机器或大显存环境,消费级显卡基本跑不动 —— Scrappy-Doo/GLM-5.2
  • 1-bit 精度损失明显:top-1 准确率约 76.2%,明显低于 2-bit 的约 82%,高准确度任务不建议用 1-bit —— Scrappy-Doo/GLM-5.2
  • 与闭源旗舰'持平'多为官方口径,社区同题 1v1 对比并未明确分出胜负,实际期望不宜拉满 —— Scrappy-Doo/GLM-5.2
  • 默认版本审查较强,社区在四处寻找 abliterated 去审查文件,而这类文件有的要求公司邮箱申请、有的甚至收费 —— Scrappy-Doo/GLM-5.2
  • 即使 1-bit 版本在 Mac Studio M3 Ultra 256GB 上也只有约 21.6 tok/s,实时对话体感一般 —— Scrappy-Doo/GLM-5.2
  • GGUF 与去审查文件在社区里来源混杂,有第三方借机收费或设门槛,下载时需要甄别渠道 —— Scrappy-Doo/GLM-5.2
  • llama.cpp 下推理速度低于 15 tok/s,远不如专用引擎 —— antirez/deepseek-v4-gguf
  • 双 RTX 3060 + 96GB RAM 配置下 IQ2_M 量化仅约 3.5 tok/s —— antirez/deepseek-v4-gguf
展开其余 355 条
  • 0731 版本相比原版 V4 Flash 出现约 10 倍成本增加的问题 —— antirez/deepseek-v4-gguf
  • benchmark 表现强但实际使用稳定性不足,存在「benchmark maxed」现象 —— antirez/deepseek-v4-gguf
  • 社区量化版本种类有限,Bartowski/unsloth 等主流量化作者尚未发布多种量化 —— antirez/deepseek-v4-gguf
  • 独立评测覆盖不足,尚无足够非生成式评测以支撑公开排名 —— antirez/deepseek-v4-gguf
  • 0731 版本无架构变更,此前 GGUF 的显存占用数据仍适用 —— antirez/deepseek-v4-gguf
  • 30B 版本稳定性不足,存在较多错误 —— thunkaboutit/Koleslaw-Nemotron-30B-A3B-PromptEnhance
  • 一致性不如 qwen3-coder 30B-A3B —— thunkaboutit/Koleslaw-Nemotron-30B-A3B-PromptEnhance
  • 部分用户更倾向于使用 qwen3.6 或 gemma-4 —— thunkaboutit/Koleslaw-Nemotron-30B-A3B-PromptEnhance
  • 因无 MTP 支持,推理速度明显慢于 Qwen —— lmstudio-community/Ornith-1.0-35B-MLX-6bit
  • 在复杂 PHP 项目上表现不如 Qwen,代码审查时频繁误判代码变更 —— lmstudio-community/Ornith-1.0-35B-MLX-6bit
  • 在重叠基准上弱于 Qwen 3.6 27B —— lmstudio-community/Ornith-1.0-35B-MLX-6bit
  • 在部分任务中仅发现一个几乎所有模型都能发现的 bug,表现不佳 —— lmstudio-community/Ornith-1.0-35B-MLX-6bit
  • 无工具对话场景下幻觉问题严重 —— lmstudio-community/Ornith-1.0-35B-MLX-6bit
  • 9B 模型在无工具聊天中幻觉倾向明显,漏洞发现能力有限,仅能找到多数模型都能发现的常见问题 —— lmstudio-community/Ornith-1.0-9B-MLX-6bit
  • 9B 模型推理速度不理想,实际任务完成度不佳 —— lmstudio-community/Ornith-1.0-9B-MLX-6bit
  • 自称 self-improving 的说法引发社区质疑 —— lmstudio-community/Ornith-1.0-9B-MLX-6bit
  • 本地部署困难,Hugging Face 上仅有 MLX 版本 —— meituan-longcat/LongCat-Flash-Lite-Sparse
  • 在现有代码库上修改时容易破坏代码且无法自行修复 —— deepreinforce-ai/Ornith-1.0-35B
  • 无原生 MTP,推理速度偏慢 —— deepreinforce-ai/Ornith-1.0-35B
  • 在代码评测中仅发现多数模型都能发现的 bug,实际表现与 benchmark 排名不匹配 —— deepreinforce-ai/Ornith-1.0-35B
  • 在无工具对话中倾向产生幻觉 —— deepreinforce-ai/Ornith-1.0-35B
  • 在已有代码库上工作容易出错、难以修复 —— lmstudio-community/Ornith-1.0-35B-MLX-5bit
  • 因无原生 MTP 支持,速度比 Qwen 慢 —— lmstudio-community/Ornith-1.0-35B-MLX-5bit
  • 移植 MTP head 可提速约 5 tok/s,但非官方支持 —— lmstudio-community/Ornith-1.0-35B-MLX-5bit
  • 独立编码任务稳定性不如 Qwen 3.5/3.6,容易出现 flaky 行为 —— deepreinforce-ai/Ornith-1.0-9B
  • 实际 bug 发现能力弱于同等规模模型,与基准评测表现有落差 —— deepreinforce-ai/Ornith-1.0-9B
  • 无工具支持的纯对话场景下幻觉倾向明显 —— deepreinforce-ai/Ornith-1.0-9B
  • 实际使用一致性不如基准表现,存在'benchmark maxed'嫌疑 —— lmstudio-community/DeepSeek-V4-Flash-0731-GGUF
  • 本地部署速度有限,IQ2_M 量化在双 3060 平台上仅约 3.5 tok/s —— lmstudio-community/DeepSeek-V4-Flash-0731-GGUF
  • 部分社区用户认为实际价值被高估,不认可其热度 —— lmstudio-community/DeepSeek-V4-Flash-0731-GGUF
  • 规则与提示词跟随能力在 Preview 阶段已存在问题,社区反馈可能延续至 0731 —— lmstudio-community/DeepSeek-V4-Flash-0731-GGUF
  • 日常对话质量不及同内存占用的 Qwen 3.6 27B 和 Gemma 4 —— prism-ml/Bonsai-27B-gguf
  • 在某些配置下会无限重复输出,难以正常完成代码编辑 —— EschaLabs/Qwen3.6-35B-A3B-Escha-W2
  • 遇到不熟悉的代码容易出 eager error,几次调用就能破坏企业级代码库 —— EschaLabs/Qwen3.6-35B-A3B-Escha-W2
  • 不擅长探索代码库和制定计划,需搭配能消化全量上下文的模型 —— EschaLabs/Qwen3.6-35B-A3B-Escha-W2
  • 比 Claude 更挑剔/不稳定,需要较多人工引导 —— EschaLabs/Qwen3.6-35B-A3B-Escha-W2
  • 输出非常冗长(very verbose) —— EschaLabs/Qwen3.6-35B-A3B-Escha-W2
  • 在同尺寸开源模型中价格偏高 —— EschaLabs/Qwen3.6-35B-A3B-Escha-W2
  • 存在使用错误版本(未固定 layers)导致体验差的情况 —— EschaLabs/Qwen3.6-35B-A3B-Escha-W2
  • benchmark 在知识和技能维度上明显弱于部分竞品 —— EschaLabs/Qwen3.6-35B-A3B-Escha-W2
  • 社区口碑分歧大,同一用户在不同测试中感知不到与原始 Qwen3.6 27B 的差异 —— KyleHessling1/Qwopus3.6-27B-Fusion-GGUF
  • 有用户试用后最终转向了其他社区变体(如 Heretic-Uncensored) —— KyleHessling1/Qwopus3.6-27B-Fusion-GGUF
  • 授权协议限制仅用于学术和研究活动,任何商业用途均构成违规 —— amd/Instella-MoE-16B-A3B-Think
  • 2.8B 活跃参数仍需 16B 模型的显存规划,推理成本并不低 —— amd/Instella-MoE-16B-A3B-Think
  • 加载模型需要 trust_remote_code=True,存在安全和使用门槛 —— amd/Instella-MoE-16B-A3B-Think
  • 首选部署路径为 Linux,Windows 支持存在但非优先 —— amd/Instella-MoE-16B-A3B-Think
  • 推理速度约 9-13 tokens/秒,不适合交互式使用 —— poolside/Laguna-XS-2.1
  • 首次生成的代码可能需要调整才能运行 —— poolside/Laguna-XS-2.1
  • 实际表现参差不齐,仍落后于 OpenAI 的最优模型 —— mradermacher/Grok-3-reasoning-gemma3-4B-distilled-HF-GGUF
  • 暂无加权/imatrix 量化版本可用 —— mradermacher/Grok-3-reasoning-gemma3-4B-distilled-HF-GGUF
  • Q3_K_M 量化被标注为 lower quality —— mradermacher/Grok-3-reasoning-gemma3-4B-distilled-HF-GGUF
  • f16 量化体积 7.9GB,对 4B 模型而言被标注为 overkill —— mradermacher/Grok-3-reasoning-gemma3-4B-distilled-HF-GGUF
  • Gemma 3 4B 基座在 GPQA Diamond(30.8)和 MMLU Pro(40.5)等推理基准上得分较低 —— mradermacher/Grok-3-reasoning-gemma3-4B-distilled-HF-GGUF
  • 初期存在循环推理 bug(FP8 版本更新后已修复) —— poolside/Laguna-S-2.1-GGUF
  • 新模型发布初期可能存在未发现的稳定性问题,社区建议等待 1-2 周再使用 —— poolside/Laguna-S-2.1-GGUF
  • 在压力下会自信地'发明'事实,不宜用于处理真实数据的自主代理 —— poolside/Laguna-S-2.1-NVFP4
  • 存在已知的循环输出问题,会陷入无限重复或过度思考(20分钟以上) —— poolside/Laguna-S-2.1-NVFP4
  • 工具使用偶有故障,会忘记如何读取文件等 —— poolside/Laguna-S-2.1-NVFP4
  • 一致性和智能程度不如DeepSeek V4 Flash,不在同一级别 —— poolside/Laguna-S-2.1-NVFP4
  • RTX6000上存在已知bug(poolside正在修复) —— poolside/Laguna-S-2.1-NVFP4
  • 通用闲聊明显不是强项 —— AtomicChat/ornith-35b-MLX-8bit
  • 对已有代码的精确阅读和按提示定向修改能力较弱 —— AtomicChat/ornith-35b-MLX-8bit
  • 复杂任务仍可能跑不通(如完整游戏模拟器未成功运行) —— AtomicChat/ornith-35b-MLX-8bit
  • 不适合一般闲聊对话 —— AtomicChat/ornith-35b-MLX-6bit
  • 对已有代码库的精读与精准增量修改能力偏弱 —— AtomicChat/ornith-35b-MLX-6bit
  • 复杂项目(如 elevator simulator)存在生成失败的情况 —— AtomicChat/ornith-35b-MLX-6bit
  • 需正确配置推理运行时才能正确处理 reasoning tag 和 tool call,否则表现会明显变差 —— AtomicChat/ornith-35b-MLX-6bit
  • 安全过滤极为严格,频繁拒答 —— majentik/gpt-oss-20b-TurboQuant-MLX-2bit
  • 输出中过度重复'alternatively'等固定词汇,日常使用体验不佳 —— majentik/gpt-oss-20b-TurboQuant-MLX-2bit
  • 部分用户评价极低,称其为'最愚蠢的 COT MOE 模型' —— majentik/gpt-oss-20b-TurboQuant-MLX-2bit
  • 量化版本(如 Q4KM)在复杂任务上质量下降明显,全精度版本更可靠 —— andreaborio/Qwen3.6-35B-A3B-DS4-ExpertMajor-v1-GGUF
  • chat_template 配置不当会导致 thinking/reasoning/tool calling 异常 —— andreaborio/Qwen3.6-35B-A3B-DS4-ExpertMajor-v1-GGUF
  • JSON 输出在特定场景下不可靠 —— andreaborio/Qwen3.6-35B-A3B-DS4-ExpertMajor-v1-GGUF
  • 上下文增长后速度明显变慢 —— andreaborio/Qwen3.6-35B-A3B-DS4-ExpertMajor-v1-GGUF
  • 量化版本的速度比 Gemma 4 26B A4B 略慢 —— andreaborio/Qwen3.6-35B-A3B-DS4-ExpertMajor-v1-GGUF
  • 手机端实际运行速度偏慢 —— prism-ml/Bonsai-27B-mlx-1bit
  • 底模是 Qwen,核心创新在压缩效率而非模型本身 —— prism-ml/Bonsai-27B-mlx-1bit
  • 三元版本在质量对比中不敌同体量传统量化 Q2_K_XL —— prism-ml/Bonsai-27B-mlx-1bit
  • 综合基准测试得分明显低于近期主流同规模模型 —— RavichandranJ/Dolphin3-Cyber-8B-GGUF
  • 通用系统提示下表现不稳定,需针对性调整提示词才能发挥领域优势 —— RavichandranJ/Dolphin3-Cyber-8B-GGUF
  • 领域高度专精,通用对话和泛化能力受限 —— RavichandranJ/Dolphin3-Cyber-8B-GGUF
  • 直接替换现有翻译方案存在风险,需自行评估输出质量、数据隔离和合规性 —— alphaZimuth/Hy-MT2-30B-A3B-APEX-GGUF
  • 缺少大规模第三方社区实测,现有基准主要来自官方论文和少量自媒体评测 —— alphaZimuth/Hy-MT2-30B-A3B-APEX-GGUF
  • 非前沿级智能,整体生成质量与更大的旗舰模型存在差距,落后于 GLM-5.2 等当前开源 SOTA —— AngelSlim/Hy3-GGUF
  • 复杂任务中存在用近似代替精确物理计算的情况,偶有边缘情况 bug —— AngelSlim/Hy3-GGUF
  • 可能产出不准确、有偏见或不安全的输出 —— GnLOLot/MiniCPM5-1B-Claude-Opus-Fable5-Thinking
  • 高风险场景使用前需人工审核验证 —— GnLOLot/MiniCPM5-1B-Claude-Opus-Fable5-Thinking
  • 代码分析任务中容易产生幻觉,无法替代专用编码 agent —— mlx-community/NVIDIA-Nemotron-3-Nano-30B-A3B-OptiQ-4bit
  • 部分用户认为 Qwen 3 Coder 30B A3B 更快且更优 —— mlx-community/NVIDIA-Nemotron-3-Nano-30B-A3B-OptiQ-4bit
  • 9.6% 幻觉率,与 qwen3-next-80b-a3b-thinking(9.3%)接近但模型小得多 —— mlx-community/NVIDIA-Nemotron-3-Nano-30B-A3B-OptiQ-4bit
  • 30B 参数却叫 Nano 有误导性 —— mlx-community/NVIDIA-Nemotron-3-Nano-30B-A3B-OptiQ-4bit
  • 实际质量不如4bit量化(Q4),困惑度显著更高(PPL 13.8 vs 7.3) —— prism-ml/Ternary-Bonsai-27B-mlx-2bit
  • CPU上三元推理尚未优化,速度极低(0.7-0.8 tok/s),目前仅在GPU上有实用价值 —— prism-ml/Ternary-Bonsai-27B-mlx-2bit
  • 质量明显不如 Q4 量化,PPL(13.8)接近 Q4(7.3)的两倍 —— prism-ml/Ternary-Bonsai-27B-gguf
  • 在 KB 问答场景下,传统 Q2_K_XL 在指令遵循和内容理解上表现更好 —— prism-ml/Ternary-Bonsai-27B-gguf
  • 量化版在困难任务上质量退化严重,Q4_K_M 级别会暴露明显局限,不适合生产环境 —— aquaman164/Qwen3.6-35B-A3B-MLX-VQ-2.6bpw
  • chat_template 配置极为敏感,沿用 Qwen3.5 的模板会出现 timeout、thinking 失效等大量错误,须用默认配置 —— aquaman164/Qwen3.6-35B-A3B-MLX-VQ-2.6bpw
  • 部分自测显示 HumanEval / HumanEval+ 得分不及 Qwen3.5,Gemma 4 31B 和 26B-A4B 在该基准上反而更高 —— aquaman164/Qwen3.6-35B-A3B-MLX-VQ-2.6bpw
  • 低量化版本(q5)在 opencode 中会无限重复输出,基本不可用 —— aquaman164/Qwen3.6-35B-A3B-MLX-VQ-2.6bpw
  • 量化版 kv cache 在某些配置下性能极差,即使全部可放入 VRAM 也会强制走 CPU 处理 —— aquaman164/Qwen3.6-35B-A3B-MLX-VQ-2.6bpw
  • 视觉 benchmark 对比数据为厂商自报,第三方独立评测尚未复现,RealWorldQA 差距可疑 —— aquaman164/Qwen3.6-35B-A3B-MLX-VQ-2.6bpw
  • 上下文增长后推理速度明显变慢 —— aquaman164/Qwen3.6-35B-A3B-MLX-VQ-2.6bpw
  • 偶有循环输出,需手动停止并重新提示才能继续 —— aquaman164/Qwen3.6-35B-A3B-MLX-VQ-2.6bpw
  • 不擅长精确理解和修改已有代码,容易偏离预期改动 —— nathansutton/Ornith-1.0-35B-UD-Q2_K_XL-MLX
  • 在代码移植/对齐场景下可能出现幻觉式修改,把正确的代码改坏 —— nathansutton/Ornith-1.0-35B-UD-Q2_K_XL-MLX
  • 部分用户反馈其调试能力(找 bug)表现一般,虽然基准评测分数高 —— nathansutton/Ornith-1.0-35B-UD-Q2_K_XL-MLX
  • 下载量仅67次,缺少真实用户社区的广泛验证 —— empero-ai/Qwythos-9B-v2
  • 评测分数来自实验室内部框架而非标准Open LLM Leaderboard,与其他模型横向对比困难 —— empero-ai/Qwythos-9B-v2
  • 社区反馈与已知失效模式信息稀少 —— empero-ai/Qwythos-9B-v2
  • 文本推理容易产生幻觉,在代码分析任务中表现不佳 —— nvidia/Nemotron-Labs-Audex-2B
  • 发布首日部分资源链接(SFT 数据集)404 失效 —— nvidia/Nemotron-Labs-Audex-2B
  • 使用 XCodec2 解码音频可获得更好质量但无法流式输出 —— nvidia/Nemotron-Labs-Audex-2B
  • 推测解码在不同任务上浪费率 22%-40%,code 类任务浪费最高达 40% —— nvidia/NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B-NVFP4
  • 131K 上下文长度下需将 GPU 内存利用率降至 0.5 才能保证 4 并发序列 —— nvidia/NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B-NVFP4
  • 代码分析任务幻觉严重,给定代码库后立即开始编造信息,无法替代真正的编码 agent —— nvidia/Nemotron-Labs-Audex-30B-A3B
  • 30B 参数却命名为 'Nano',社区普遍认为名称具有误导性 —— nvidia/Nemotron-Labs-Audex-30B-A3B
  • 社区讨论度和实际采用率远低于 Qwen / Gemma 等同期竞品 —— nvidia/Nemotron-Labs-Audex-30B-A3B
  • 无法装入 RTX 5090,对高端消费级显卡的部署仍有门槛 —— nvidia/Nemotron-Labs-Audex-30B-A3B
  • 当前状态不佳,业务挣扎导致技术侧妥协 —— kai-os/Grug-12B
  • 几乎无人为平台开发应用,生态萎缩 —— kai-os/Grug-12B
  • 安全方面存在明显短板 —— kai-os/Grug-12B
  • 性能声明主要来自团队自身评测,缺乏第三方独立验证 —— InternScience/Agents-A1
  • 项目较新(2026年7月),社区生态和长期稳定性尚未验证 —— InternScience/Agents-A1
  • 35B MoE 模型对本地部署硬件要求较高,需 A6000/A5000 等企业级 GPU —— InternScience/Agents-A1
  • 仍处于早期预训练阶段,仅为checkpoint而非成品模型 —— Smilyai-labs/Nova-1-Standard-1.3B-Preview
  • 合规性与行为表现评级为F- —— Smilyai-labs/Nova-1-Standard-1.3B-Preview
  • 无特定功能特性 —— Smilyai-labs/Nova-1-Standard-1.3B-Preview
  • 对量化精度和推理参数极其敏感,参数不对时表现明显下降 —— manjunathshiva/Qwen3.6-35B-A3B-tq3a-tqTe-g64
  • MoE 的专家激活机制并不像社区预期那样能「解锁」更多模型能力 —— manjunathshiva/Qwen3.6-35B-A3B-tq3a-tqTe-g64
  • Power Ranking 编码任务仅比上代 Qwen 3.5 同尺寸略好(11/98 vs 10/98),提升有限 —— manjunathshiva/Qwen3.6-35B-A3B-tq3a-tqTe-g64
  • 在编码任务上被 Qwen 3.5 27B 密集模型大幅超越(26/98 vs 11/98),不属同一级别 —— manjunathshiva/Qwen3.6-35B-A3B-tq3a-tqTe-g64
  • 知识和技能类基准表现明显弱于其他维度,存在「刷榜」嫌疑 —— manjunathshiva/Qwen3.6-35B-A3B-tq3a-tqTe-g64
  • SVG 生成在物理合理性/遵循约束方面不如 Claude Opus 4.7 —— manjunathshiva/Qwen3.6-35B-A3B-tq3a-tqTe-g64
  • 表现不稳定,属于「碰对了参数就很好用」的类型 —— manjunathshiva/Qwen3.6-35B-A3B-tq3a-tqTe-g64
  • 标准 mlx-lm 不支持 gemma4 架构,必须使用 mlx-vlm >= 0.4.3 —— ailexleon/Gemma4-Gutenberg-31B-Heretic-mlx-8Bit
  • 加载时出现 mel filter warning,虽无害但可能引起困惑 —— ailexleon/Gemma4-Gutenberg-31B-Heretic-mlx-8Bit
  • DDR4 内存上生成速度仅 3-8 tok/s,低于人类阅读速度(~4-5 tok/s) —— ailexleon/Gemma4-Gutenberg-31B-Heretic-mlx-8Bit
  • 密集模型每 token 激活全部 31B 参数,FLOP 成本高于同等能力的 MoE 模型 —— ailexleon/Gemma4-Gutenberg-31B-Heretic-mlx-8Bit
  • 多 GPU 纵向扩展效率低,在大多数情况下添加更多 GPU 是浪费钱 —— ailexleon/Gemma4-Gutenberg-31B-Heretic-mlx-8Bit
  • HLE 得分仅 26.5,远低于 GLM-5 (50.4) 和 Kimi K2.5 (50.2) —— ailexleon/Gemma4-Gutenberg-31B-Heretic-mlx-8Bit
  • 完整下载约需 150GB 磁盘空间 —— ailexleon/Gemma4-Gutenberg-31B-Heretic-mlx-8Bit
  • 26B A4B MoE 版本仅落后 2-3% 但快 2-4 倍,性价比更高 —— ailexleon/Gemma4-Gutenberg-31B-Heretic-mlx-8Bit
  • GLM-5.2 原版 Willingness 评分仅 28%,常静默审查,合规意愿低(证据 4) —— huihui-ai/Huihui-GLM-5.2-abliterated-GGUF
  • 有用户认为 abliteration 不值得以性能/质量损失为代价(证据 6) —— huihui-ai/Huihui-GLM-5.2-abliterated-GGUF
  • 整体能力不及 Opus 4.8(证据 0) —— huihui-ai/Huihui-GLM-5.2-abliterated-GGUF
  • 无优化时推理速度仅约 2.5 tok/s,需额外优化才能实用(证据 2) —— huihui-ai/Huihui-GLM-5.2-abliterated-GGUF
  • 官方建议仅用于研究/实验,不推荐直接用于生产环境(证据 12) —— huihui-ai/Huihui-GLM-5.2-abliterated-GGUF
  • 社区实测反馈极少,除个别用户外缺乏广泛真实使用验证 —— nvidia/Nemotron-Labs-TwoTower-30B-A3B-Base-BF16
  • NVFP4 相比 FP8 的质量损失尚未被充分验证 —— nvidia/Qwen3.6-27B-NVFP4
  • 需要约 40 GB VRAM,最低需 L40S 48GB 或双卡方案 —— nvidia/Qwen3.6-27B-NVFP4
  • 双 3090 方案占用空间大、发热高 —— nvidia/Qwen3.6-27B-NVFP4
  • DGX Spark 上 35B MoE NVFP4 加推测解码实际仅约 50 tok/s,远低于宣传的 110 tok/s —— nvidia/Qwen3.6-27B-NVFP4
  • NVFP4 在 Blackwell (SM120) 上并不比 FP8 更快 —— nvidia/Qwen3.6-27B-NVFP4
  • 作为 CLI 编码代理配置(opencode)需要额外调校,不如 Claude Code 开箱即用 —— nvidia/Qwen3.6-27B-NVFP4
  • NVIDIA 版本的 NVFP4 部分不使用 NVFP4 激活,仅做权重量化 —— nvidia/Qwen3.6-27B-NVFP4
  • vLLM 在 16GB 消费卡上内存上限为 16K,长上下文受限 —— nvidia/Qwen3.6-27B-NVFP4
  • 代码审查准确度差,经 Claude/ChatGPT 交叉评估后评价很低 —— mudler/LFM2.5-8B-A1B-APEX-GGUF
  • Liquid 前代模型长期被 Gemma/Gwen 压着打,声誉透支 —— mudler/LFM2.5-8B-A1B-APEX-GGUF
  • 官方明确声明不适用于所有工作负载 —— mudler/LFM2.5-8B-A1B-APEX-GGUF
  • Hacker News 社区仍有「顺势疗法 AI」的嘲讽 —— mudler/LFM2.5-8B-A1B-APEX-GGUF
  • 官方声明模型输出需经人工验证后方可用于实际安全操作 —— BugTraceAI/BugTraceAI-CORE-Ultra-27B-Q6
  • 代码审查不准确——被 Claude 和 ChatGPT 评估后给出负面评价 —— LiquidAI/LFM2.5-230M
  • 主要面向基准测试优化,非基准场景表现可能不及预期 —— squ11z1/Mythos-nano
  • 在复杂分析任务中可能遗漏关键问题 —— squ11z1/Mythos-nano
  • 存在 cherry-picking 选择性展示最佳结果的嫌疑 —— squ11z1/Mythos-nano
  • 超强能力声称受社区广泛质疑 —— squ11z1/Mythos-nano
  • 存在为基准榜单优化的嫌疑,实际通用能力存疑 —— mradermacher/Mythos-nano-i1-GGUF
  • 可能通过 cherry-picking 选择性展示结果 —— mradermacher/Mythos-nano-i1-GGUF
  • 相对于前沿模型的实际提升幅度被社区质疑 —— mradermacher/Mythos-nano-i1-GGUF
  • 并非 Claude 替代品,声称能平替 Claude 的说法被社区认为夸大 —— hotdogs/qwen3.6-27b-fable5-lora
  • 将 opencode 调通为 CLI agent 需要大量调参,远不如 Claude Code 开箱即用 —— hotdogs/qwen3.6-27b-fable5-lora
  • 在部分基准上 Qwen3.6 反而不如 Qwen3.5 和 Gemma 4 —— hotdogs/qwen3.6-27b-fable5-lora
  • 因内置思考与规划机制,响应速度比 35B-A3B 慢 —— hotdogs/qwen3.6-27b-fable5-lora
  • hotdogs LoRA 仓库要求同意联系方式共享才能访问模型文件 —— hotdogs/qwen3.6-27b-fable5-lora
  • 模型已被微软从 HuggingFace 和 GitHub 全面下架,无法获取 —— microsoft/FastContext-1.0-4B-RL
  • 社区实测中文件路径返回存在不准确/幻觉问题 —— microsoft/FastContext-1.0-4B-RL
  • 有用户明确反馈效果差(Because it's trash apparently) —— microsoft/FastContext-1.0-4B-RL
  • 函数级 F1 仅 38.45,细粒度定位能力有限 —— microsoft/FastContext-1.0-4B-RL
  • 社区讨论度极低(HN 仅 3 points, 1 条评论),缺乏广泛验证 —— microsoft/FastContext-1.0-4B-RL
  • 社区指出更应关注子 agent 行为本身,而非仅端到端结果 —— microsoft/FastContext-1.0-4B-RL
  • 最早发布的 google/gemma-4-12B-it 权重有问题,已重新 ablation 并上传,已下载用户需重新下载 —— huihui-ai/Huihui-gemma-4-12B-coder-fable5-composer2.5-v1-abliterated
  • Gemma 12B 是唯一没有视觉编码器的版本,图像理解可能受限 —— huihui-ai/Huihui-gemma-4-12B-coder-fable5-composer2.5-v1-abliterated
  • abliteration 是「粗略的概念验证」实现,并非精细优化的安全方案 —— huihui-ai/Huihui-gemma-4-12B-coder-fable5-composer2.5-v1-abliterated
  • 官方明确警告安全过滤大幅降低,可能生成敏感或不当内容,不适合所有受众 —— huihui-ai/Huihui-gemma-4-12B-coder-fable5-composer2.5-v1-abliterated
  • coder 变体在 Spheron 估算的 VRAM 需求约 26 GB,对部分消费级 GPU 仍偏高 —— huihui-ai/Huihui-gemma-4-12B-coder-fable5-composer2.5-v1-abliterated
  • 思考/规划阶段耗时较长,可能等待数分钟才开始执行 —— deepseek-ai/DeepSeek-V4-Flash
  • 有时会忽略用户给出的具体指令 —— deepseek-ai/DeepSeek-V4-Flash
  • 一次生成往往不够,需要多轮 review/refactor 才能达到满意结果 —— deepseek-ai/DeepSeek-V4-Flash
  • 存在 expired-lease 完成 bug:原 worker 已释放租约但仍可能继续完成步骤 —— deepseek-ai/DeepSeek-V4-Flash
  • 长上下文检索任务(800K token 仓库中定位函数调用图)表现明显弱于 Pro-Max(1/3 vs 3/3) —— deepseek-ai/DeepSeek-V4-Flash
  • 复杂推理、长链条调试和分析型任务不如 V4 Pro 稳定 —— deepseek-ai/DeepSeek-V4-Flash
  • 在扩展思考(extended thinking)和真实场景中,Qwen 3.6 Plus、Minimax M2.7、GLM 5.1 等国产模型表现更优 —— deepseek-ai/DeepSeek-V4-Flash
  • 部分场景下 token 生成速度偏慢 —— deepseek-ai/DeepSeek-V4-Flash
  • 对系统指令极为字面化且敏感,容易因提示措辞产生意外行为 —— deepseek-ai/DeepSeek-V4-Pro
  • 细节丰富程度不如 Claude Opus —— deepseek-ai/DeepSeek-V4-Pro
  • 代码库规模和复杂度增大后,对模糊提示的容错性显著下降,要求精确描述 —— deepseek-ai/DeepSeek-V4-Pro
  • 在 Arena 众包用户偏好基准上表现不佳,用户主观偏好低于能力基准得分 —— deepseek-ai/DeepSeek-V4-Pro
  • 在编码工具链中存在低效的随机搜索和 grep 行为,部分归因于 harness —— deepseek-ai/DeepSeek-V4-Pro
  • 基准测试中输出 token 消耗远高于同类开源模型中位数(190M vs 47M),运行成本达 $1,071 —— deepseek-ai/DeepSeek-V4-Pro
  • 编码能力存在分歧,部分用户认为 Kimi K2.6 编码更强 —— deepseek-ai/DeepSeek-V4-Pro
  • 量化质量参差不齐,早期 Unsloth 量化存在严重循环和低质量问题 —— wepiqx/gemma-4-12B-it-SHQ6-GGUF
  • 编码能力社区争议大,多名用户认为 Qwen 在编程尤其是 agentic coding 上远优于 Gemma —— wepiqx/gemma-4-12B-it-SHQ6-GGUF
  • 与 opencode 等工具的兼容性存在问题,工具调用和文件写入不可靠 —— wepiqx/gemma-4-12B-it-SHQ6-GGUF
  • Q4 量化下质量明显下降,几乎所有任务都出错 —— wepiqx/gemma-4-12B-it-SHQ6-GGUF
  • 难度较高的技术问题上不如 Qwen 3.5 —— wepiqx/gemma-4-12B-it-SHQ6-GGUF
  • 多语言尤其是亚洲语言覆盖不如 Qwen2.5-14B —— wepiqx/gemma-4-12B-it-SHQ6-GGUF
  • 早期 Unsloth 量化需要约 4 小时调试才能正常工作 —— wepiqx/gemma-4-12B-it-SHQ6-GGUF
  • 工具调用和指令遵循能力极弱,忽略指令的情况比竞品更多 —— Gryphe/Gemma-4-31B-StyleTune
  • 在深度推理方面仍无法触及前沿闭源模型 —— Gryphe/Gemma-4-31B-StyleTune
  • 31B Dense 需全部加载,24GB 显存的 RTX 4090 成为瓶颈,需借助系统内存卸载 —— Gryphe/Gemma-4-31B-StyleTune
  • 对硬件配置敏感,部分用户报告模型表现偏执且不适合其硬件 —— Gryphe/Gemma-4-31B-StyleTune
  • 在带宽受限条件下,26B MoE 的解码吞吐量显著高于 31B Dense —— Gryphe/Gemma-4-31B-StyleTune
  • 不支持工具调用(tool use),官方定位仅限竞赛编程/可验证编码任务 —— WeiboAI/VibeThinker-3B
  • 实际编码任务(如根据论文 PDF 实现线性代数)表现远不如 Qwen3.5-4B —— WeiboAI/VibeThinker-3B
  • 社区怀疑存在严重的 benchmark 过拟合(benchmaxing),跑分与实际体验落差大 —— WeiboAI/VibeThinker-3B
  • 量化推理行为文档不足,量化后表现不稳定 —— WeiboAI/VibeThinker-3B
  • 微软已删除原始模型仓库及 GitHub 页面,官方分发渠道已不可用 —— microsoft/FastContext-1.0-4B-SFT
  • 检索结果存在准确性缺陷,社区实测中出现返回不存在文件路径的情况 —— microsoft/FastContext-1.0-4B-SFT
  • 社区反馈综合体验不佳,有用户直接评价为'trash' —— microsoft/FastContext-1.0-4B-SFT
  • 论文自述部分基准任务可能与预训练数据有重叠,结果需谨慎解读 —— microsoft/FastContext-1.0-4B-SFT
  • vLLM 部署时需使用 hermes 解析器,不能直接使用通用 OpenAI tools schema —— microsoft/FastContext-1.0-4B-SFT
  • 模型使用 tie_word_embeddings=true,lm_head 权重可能与常规 checkpoint 结构不同 —— microsoft/FastContext-1.0-4B-SFT
  • NVFP4 格式的 KV cache 在主流部署栈上不可用,需使用 fp8 KV —— microsoft/FastContext-1.0-4B-SFT
  • 仅在单一工具调用路由基准上验证,缺乏通用编码任务或实际项目中的实测数据 —— mradermacher/prism-coder-14b-GGUF
  • 事实准确性差,实测错误率是常规 Gemma 4 的约 6 倍(33 正确 vs 28 错误),官方明确质量低于常规版 —— nvidia/diffusiongemma-26B-A4B-it-NVFP4
  • 易编造人名、日期、数字等细节(如虚构 Steve Jobs 母亲的名字、虚构同事名字、编造产品价格) —— nvidia/diffusiongemma-26B-A4B-it-NVFP4
  • 冷门话题准确性更差(Jobs 4 错,Tetris 12 错,BeOS 12 错) —— nvidia/diffusiongemma-26B-A4B-it-NVFP4
  • Tool calling 精度不足,社区反馈需要更高精确度的场景表现不佳 —— nvidia/diffusiongemma-26B-A4B-it-NVFP4
  • 非数据中心 GPU 上 NVFP4 支持存在兼容性问题 —— nvidia/diffusiongemma-26B-A4B-it-NVFP4
  • 多 GPU 配置存在问题 —— nvidia/diffusiongemma-26B-A4B-it-NVFP4
  • JSON 输出存在 delimiter 拆分 bug 和引号重复问题(BF16 版本同样存在) —— nvidia/diffusiongemma-26B-A4B-it-NVFP4
  • Google 官方将其定位为实验性模型,明确建议事实敏感场景使用常规 Gemma 4 —— nvidia/diffusiongemma-26B-A4B-it-NVFP4
  • 官方说明不够直白,有用户追问『具体做什么』,描述难让人快速理解 —— BennyDaBall/Z-Image-Engineer-V6
  • 同族代号/命名相近(V6、Qwen3-4b-Z-Image-Engineer-V2.5 等),该选哪个容易困惑 —— BennyDaBall/Z-Image-Engineer-V6
  • 不走自定义节点时需要手动搭配 CLIPLoaderGGUF(lumina2 类型)与相应采样参数,配置步骤偏多 —— BennyDaBall/Z-Image-Engineer-V6
  • 代码偶尔出现低级语法错误(多出括号、逗号分隔函数定义),需手工修补 —— yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUF
  • 多数社区观点认为 35B 以下的本地权重做编程不值,直接上云端更划算 —— yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUF
  • 编码能力不如 Qwen —— yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUF
  • 思考过程 token 消耗很大 —— yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUF
  • 微调宣称的收益没有放出评测链接,质疑者难以自行核验 —— yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUF
  • 体量效率被吐槽:参数不到一半的 26B MoE 反而赢它 —— yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUF
  • 本地参数设置不当会明显拖累实际效果 —— yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUF
  • Artificial Analysis 智能指数低于 GPT-4o Mini 与 Claude 3.5 Haiku —— yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUF
  • 官方明确声明不是 SOTA 最终模型,仅为基础预训练阶段产物 —— silx-ai/Quasar-Preview
  • 训练来源与数据出处受到社区质疑 —— silx-ai/Quasar-Preview
  • 关联代币 SN24 alpha token 因质疑单日暴跌约 70%-75% —— silx-ai/Quasar-Preview
  • 模型性能依赖后续 Bittensor 子网迭代蒸馏周期,当前独立使用价值有限 —— silx-ai/Quasar-Preview
  • 证据仅涉及缩放定律预测精度,无社区讨论涉及模型实际生成质量、推理吞吐或日常使用体验 —— marin-community/delphi-1e23-25Bparams-628Btokens
  • 当前讨论集中在训练效率与损失预测,缺乏下游任务评估(benchmark 表现、人类偏好等)的证据 —— marin-community/delphi-1e23-25Bparams-628Btokens
  • Ollama 更新 llama.cpp 依赖较慢,最新版本可能无法及时通过 Ollama 使用 —— LiquidAI/LFM2.5-1.2B-JP-202606
  • 作为辅助模型使用时需通过 JIT 加载/卸载,增加使用复杂度 —— LiquidAI/LFM2.5-1.2B-JP-202606
  • Harness-1 仅返回策展文档集,不直接回答问题,需搭配下游回答模型 —— pat-jj/harness-1
  • 移除 harness 机制后召回率相对下降 12.2%,性能高度依赖该基础设施 —— pat-jj/harness-1
  • 代码输出偶发琐碎语法错误:多余的闭合括号/括号、用逗号分隔函数定义,需手动修正 —— OBLITERATUS/Gemma-4-12B-OBLITERATED
  • 代码准确率被认为低于略大的 Qwen —— OBLITERATUS/Gemma-4-12B-OBLITERATED
  • KV cache 行为异常、内存占用偏大:约 7GB 仅能容纳 20k tokens,疑似滑动窗口注意力在 oMLX 等运行时未生效 —— OBLITERATUS/Gemma-4-12B-OBLITERATED
  • 角色扮演场景明显较弱,16GB VRAM 用户用紧量化跑 31B dense 反而效果更好 —— OBLITERATUS/Gemma-4-12B-OBLITERATED
  • 能力上限仍低于 27B/31B,只是「相当接近」而非真正比肩 —— OBLITERATUS/Gemma-4-12B-OBLITERATED
  • 在 Artificial Analysis 智能指数上仅 9 分,明显低于 GPT-4o Mini(13)与 Claude 3.5 Haiku(19) —— OBLITERATUS/Gemma-4-12B-OBLITERATED
  • abliteration 会引入 KL 散度等退化,且跨架构直接对比此类指标意义有限 —— OBLITERATUS/Gemma-4-12B-OBLITERATED
  • 基于Qwen3.5-35B-A3B-Base微调,非自研基座模型 —— nex-agi/Nex-N2-mini
  • Toolathlon仅33.3分,工具调用/Agent能力与Pro版差距显著 —— nex-agi/Nex-N2-mini
  • 社区实际使用反馈极少,大部分讨论集中在Pro版 —— nex-agi/Nex-N2-mini
  • MLX 4bit 出现不稳定报告(无限循环、逻辑异常),有用户改用更小的 8bit 反而更可靠。 —— mlx-community/Qwen3.5-0.8B-OptiQ-4bit
  • MLX 内存占用高、频繁崩溃,部分用户因此转向 GGUF。 —— mlx-community/Qwen3.5-0.8B-OptiQ-4bit
  • 位宽分配基于 KL 散度敏感度校准,最终质量依赖校准集的构成。 —— mlx-community/Qwen3.5-0.8B-OptiQ-4bit
  • 复杂/长计算任务上尺寸差距明显,小尺寸更容易暴露短板(家族对比中 27B 与 122B 差距大)。 —— mlx-community/Qwen3.5-0.8B-OptiQ-4bit
  • 实际体验与硬件平台相关:有用户反映 M1 Max 上 MLX 不稳定、占满内存,也有人几分钟内就在 RTX 5090 上跑起同系列。 —— mlx-community/Qwen3.5-0.8B-OptiQ-4bit
  • 4bit 是否够用在社区仍有分歧:有人觉得最优 4bit 就够,有人宁选更小尺寸的 8bit 保证稳定性。 —— mlx-community/Qwen3.5-0.8B-OptiQ-4bit
  • MLX 稳定性不佳:有 m1 max 32GB 用户反映 MLX 量化会占满内存、频繁崩溃,最终改用 gguf。 —— mlx-community/Qwen3.5-2B-OptiQ-4bit
  • mxfp4 被部分人认为更快更好:评论称其优于 q4 且速度更快,因为 Apple Silicon 的 MLX 内核针对均匀 fp4 数学优化。 —— mlx-community/Qwen3.5-2B-OptiQ-4bit
  • 2B 只适合当辅助:社区把它定位成「lighter and faster」的补充,复杂推理仍依赖主力。 —— mlx-community/Qwen3.5-2B-OptiQ-4bit
  • 4bit 与 8bit 取舍仍有讨论:虽有人认为最优 4-bit 已足够,但该话题仍是社区常议。 —— mlx-community/Qwen3.5-2B-OptiQ-4bit
  • 受 llama.cpp MTP 机制限制:不支持 -np > 1 并行,不支持 --mmproj —— Youssofal/Qwen3.6-27B-MTPLX-Optimized-Speed
  • 依赖 llama.cpp PR #22673,对推理框架版本有硬性要求 —— Youssofal/Qwen3.6-27B-MTPLX-Optimized-Speed
  • agentic 编码强但探索/理解整个代码库、制定计划偏弱,这类任务需要搭配能吞下全上下文的模型 —— Youssofal/Qwen3.6-27B-MTPLX-Optimized-Speed
  • 使用体验比 Claude 更「较劲」,需要逐步人工引导才出彩 —— Youssofal/Qwen3.6-27B-MTPLX-Optimized-Speed
  • 多模态与 grounded 任务排名靠后:34 个候选模型里排第 24,54.1/100 —— Youssofal/Qwen3.6-27B-MTPLX-Optimized-Speed
  • IQ4_XS 量化有已知坑:此前 llama.cpp 的 bug 让 IQ4_XS 量化体积偏大,16GB 显存场景建议用 llama-quantize 默认参数、不要加 --pure —— Youssofal/Qwen3.6-27B-MTPLX-Optimized-Speed
  • 内存门槛约 20GB 起步,并非任意配置都能跑;双 16GB 卡也不一定够 —— mlx-community/Qwen3.6-27B-OptiQ-4bit
  • MLX 不总是最快的推理后端,llama.cpp 在部分场景反而更快 —— mlx-community/Qwen3.6-27B-OptiQ-4bit
  • 密集 27B 生成速度明显低于稀疏 35B-A3B(约 17-18 vs 52 token/s),速度敏感者应选 MoE 形态 —— mlx-community/Qwen3.6-27B-OptiQ-4bit
  • 配套的 oMLX 客户端 UI 在下载或改设置时容易崩溃 —— mlx-community/Qwen3.6-27B-OptiQ-4bit
  • 想用 MTP 功能时需转 llama.cpp/GGUF,MLX 侧缺 16bit 支持 —— mlx-community/Qwen3.6-27B-OptiQ-4bit
  • 针对 Qwen3.6-27B-OptiQ-4bit 的独立第三方基准仍偏少,口碑多来自相邻量化与官方数据 —— mlx-community/Qwen3.6-27B-OptiQ-4bit
  • 不熟悉的代码上容易出低级错误,有用户称 A3B 能在 3-4 次调用内搞坏企业代码库 —— mlx-community/Qwen3.6-35B-A3B-OptiQ-4bit
  • 相对 27B 是质量降级:更快、世界知识更多,但质量「a step down」,多人明确表示更偏好 27B —— mlx-community/Qwen3.6-35B-A3B-OptiQ-4bit
  • 4-bit MLX 版有死循环/逻辑异常问题,有用户因此换回更小的 qwen3.5-9b(8bit)反而更顺手 —— mlx-community/Qwen3.6-35B-A3B-OptiQ-4bit
  • 基准上知识/技能类指标明显偏弱,虽然社区实际感受与基准常有出入 —— mlx-community/Qwen3.6-35B-A3B-OptiQ-4bit
  • 有用户抱怨 35B 干活耗时太久(「why it does code for so long」),体感偏慢 —— mlx-community/Qwen3.6-35B-A3B-OptiQ-4bit
  • 消费级 NVIDIA 显存上需要激进量化才能跑,或需多卡并加 --cpu-moe 之类配置 —— mlx-community/Qwen3.6-35B-A3B-OptiQ-4bit
  • Ollama 尚不支持,Modelfile 加载报 unknown model architecture 'mellum' —— JetBrains/Mellum2-12B-A2.5B-Instruct
  • 不是推理模型,遇到 bat-and-ball 类逻辑题会跑偏,视觉生成类任务输出错误 —— JetBrains/Mellum2-12B-A2.5B-Instruct
  • 代码能力官方对标约 Qwen 3.5 9B 级别,并非顶尖 —— JetBrains/Mellum2-12B-A2.5B-Instruct
  • 代码 bug 修复偏弱:某用户实测其修复率仅约 12%,明显低于 Qwen2.5-Coder-3B 的约 50% —— LiquidAI/LFM2.5-8B-A1B
  • 同系列更小尺寸的 LFM2 2.6B 被指连贯性不如同级 2B 稠密产品(Granite/Gemma) —— LiquidAI/LFM2.5-8B-A1B
  • 部分社区用户希望有 15-20B 的更大尺寸版本,当前 12B 规模在某些场景下仍有局限 —— JetBrains/Mellum2-12B-A2.5B-Thinking
  • 同一模型无法同时擅长编码和知识库处理,需按具体场景分别选型 —— JetBrains/Mellum2-12B-A2.5B-Thinking
  • 平均吞吐低于同类同尺寸开源款——72.9 t/s 对中位 98.4 t/s,别默认「小就快」 —— w-ahmad/Qwen3.5-9B-GGUF-MoQ-MTP
  • 默认 ollama 跑容易觉得性能差/慢——换 Llama.cpp 自编译或 Llama app 可提速 30-40%,再配精调量化实测可到 3 倍以上 t/s —— w-ahmad/Qwen3.5-9B-GGUF-MoQ-MTP
  • 工具链兼容性不如更大尺寸——9B/12B 这类中间尺寸工具兼容性弱于重号,重型工具任务会想换更大的 —— w-ahmad/Qwen3.5-9B-GGUF-MoQ-MTP
  • 不是全能手——选型讨论里社区提醒小尺寸未必全面赢过 gpt,自家基准里 Qwen 系有不少翻车项,榜单第一不等于全方位好用 —— w-ahmad/Qwen3.5-9B-GGUF-MoQ-MTP
  • 同款同速在不同 CPU(Intel 与 AMD)上实测结果差异大,体验看硬件与运行环境 —— w-ahmad/Qwen3.5-9B-GGUF-MoQ-MTP
  • 已被更新的 3.6 系压过——社区认为 3.6/35B 解题能力优于它,AA 分数 3.6-27B(37)高于 3.5(29),追新玩家直接看 3.6 —— w-ahmad/Qwen3.5-9B-GGUF-MoQ-MTP
  • 自报基准需存疑——社区提醒自报数字要打折扣,务必按自己的具体场景做独立验证 —— w-ahmad/Qwen3.5-9B-GGUF-MoQ-MTP
  • 4-bit NVFP4 相对官方 FP8 质量下降明显,用户提醒不要仅凭 NVFP4 量化表现下结论,至少 27B 建议跑 FP8 —— nvidia/Qwen3.6-35B-A3B-NVFP4
  • 35B-A3B 被部分用户反馈指令跟随弱、容易忘记指令,社区对 27B 的整体口碑更好 —— nvidia/Qwen3.6-35B-A3B-NVFP4
  • 有用户认为 35B 及其衍生模型(Nex N2、Ornith 1.0)质量达不到其工作需求 —— nvidia/Qwen3.6-35B-A3B-NVFP4
  • 35B 基础模型本身偏慢,是该用户眼中的主要问题 —— nvidia/Qwen3.6-35B-A3B-NVFP4
  • 基准与部署存在坑:需要 nightly vLLM 和特定后端,会碰到报错与崩溃,有人花了三天排错 —— nvidia/Qwen3.6-35B-A3B-NVFP4
  • 编码场景仍被多数人认为明显不如 Opus 4.7;122B 更接近但速度太慢 —— nvidia/Qwen3.6-35B-A3B-NVFP4
  • 低显存机型可能遇到内存不足(如 M4 Max 64GB) —— nvidia/Qwen3.6-35B-A3B-NVFP4
  • 在翻译、法语文案、新闻深度分析等质量敏感负载上,同系列 27B 被认为更强 —— nvidia/Qwen3.6-35B-A3B-NVFP4
  • 基准测试分数随模型规模或量化位宽降低而递减,1.58bit量化在部分任务上相比全精度仍有能力损失 —— openbmb/BitCPM-CANN-8B
  • 4-bit GGUF 量化版本性能普遍不如 NVFP4/INT4 官方量化格式 —— tencent/Hy-MT2-1.8B-GGUF
  • 16GB 显存只能上 3bit 量化,留给思考的上下文空间紧张,低配显卡体验受限 —— OBLITERATUS/Qwen3.6-27B-OBLITERATED
  • 同硬件下推理速度比 35B-A3B 慢约 5 倍 —— OBLITERATUS/Qwen3.6-27B-OBLITERATED
  • Rust 编程被 Step3.7 超越,社区建议按任务自行跑评估 —— OBLITERATUS/Qwen3.6-27B-OBLITERATED
  • 基础版被质疑存在事实错误,有用户转投 Qwopus 微调版并实测其错误更少 —— OBLITERATUS/Qwen3.6-27B-OBLITERATED
  • Q8 量化舒适使用约需 36GB 内存,消费级硬件仍难满足 —— OBLITERATUS/Qwen3.6-27B-OBLITERATED
  • 编码场景精度优先于速度,重吞吐场景并非最优 —— OBLITERATUS/Qwen3.6-27B-OBLITERATED
  • 选型不能只看排行,社区强调要跑自己的评测验证 —— OBLITERATUS/Qwen3.6-27B-OBLITERATED
  • LM Studio 的 MLX 后端在反复加载/卸载模型后可能出现性能下降,需重启解决 (1) —— mlx-community/Meta-Llama-3-8B-Instruct-4bit
  • LM Studio 的 MLX 后端偶有生成时进入无限循环的问题 (1) —— mlx-community/Meta-Llama-3-8B-Instruct-4bit
  • 实际质量远不如同体量竞品 Gemma-4-E2B —— prism-ml/Ternary-Bonsai-8B-mlx-2bit
  • 三元版本答案比 1-bit 版本错误更多 —— prism-ml/Ternary-Bonsai-8B-mlx-2bit
  • 实际表现明显差于营销宣传 —— prism-ml/Ternary-Bonsai-8B-mlx-2bit
  • 基准测试成绩弱,30B 的 AA Index 仅 15,与 Gemma 4 E4B 及 Qwen 3.5 2B 等小得多的模型持平 —— lmstudio-community/granite-4.1-30b-GGUF
  • IBM 官方基准测试有意避开了 Qwen 3.6-35b-a3b 和 Qwen 3.6-27b,后者在该规模明显更强 —— lmstudio-community/granite-4.1-30b-GGUF
  • 上一代 Granite 4 小模型推理速度偏慢且逻辑题表现不佳,部分用户快速失去兴趣 —— lmstudio-community/granite-4.1-30b-GGUF
  • 在综合体验上仍不如 Qwen3.6 35B A3B 等更大的本地模型 —— lmstudio-community/granite-4.1-3b-GGUF
  • 若其他小模型跟进更新训练数据,其差异化优势可能被削弱 —— lmstudio-community/granite-4.1-3b-GGUF
  • 综合能力不如 Qwen3.6 等同期的社区冠军模型,仅适合作为辅助而非主力 —— lmstudio-community/granite-4.1-8b-GGUF
  • 定位为轻量 fallback,不适合复杂任务 —— lmstudio-community/granite-4.1-8b-GGUF
  • MLX 运行时比 llama.cpp 占用更多内存 —— mlx-community/Llama-2-7b-chat-mlx
  • Llama 2 Chat 7B 智力低于平均水平 —— mlx-community/Llama-2-7b-chat-mlx
  • MLX 量化后 token 生成速度可能只有 llama.cpp 的一半 —— mlx-community/Llama-2-7b-chat-mlx
  • MLX 模型加载速度明显慢于 llama.cpp —— mlx-community/Llama-2-7b-chat-mlx
  • GGUF K-quant 在敏感层分配更多比特,MLX 均匀量化可能导致输出质量差异 —— mlx-community/Llama-2-7b-chat-mlx
  • 对于 FIM/代码补全不如 Qwen2.5-Coder 7B —— mlx-community/Llama-2-7b-chat-mlx
  • tokens/s 不代表实际有效吞吐,需按真实场景评估 —— mlx-community/Llama-2-7b-chat-mlx
  • Ollama 未开启 MLX 后端时性能显著低于原生 llama.cpp(Metal) —— mlx-community/Llama-2-7b-chat-mlx
  • Reddit 社区有用户反馈在 Claude Code 中实际使用体验不如 M2.5,M2.5 更稳定地完成任务 [14] —— lmstudio-community/MiniMax-M2.7-GGUF
  • 输出速度 53.5 tokens/s,慢于 M2.1 的 73.3 tokens/s [11] —— lmstudio-community/MiniMax-M2.7-GGUF
  • 首 token 延迟 1.75s,高于 M2.1 的 1.67s [11] —— lmstudio-community/MiniMax-M2.7-GGUF
  • 社区几乎无人提及,缺乏实际使用反馈与口碑积累 —— nvidia/Nemotron-Labs-Diffusion-14B
  • 部分用户实测认为其回答质量明显不如 Gemma-4-E2B 等传统精度的 8B 模型 —— prism-ml/Bonsai-8B-mlx-1bit
  • MLX 版本的每权重实际比特数为 1.25 bits,高于官方宣称的 1.125 bits,存在额外打包开销 —— prism-ml/Bonsai-8B-mlx-1bit
  • 官方声称的「end-to-end 1-bit,无高精度 escape hatch」表述容易引起误解 —— prism-ml/Bonsai-8B-mlx-1bit
  • 「新 SOTA 1B 模型」的说法被社区打问号,基准成绩尚未被独立复现,能否真正超越更大规模模型仍是开放问题 —— sapientinc/HRM-Text-1B
  • HRM 是否真的是超越 LLM 的实质一步,社区(如 r/learnmachinelearning)仍在争论、未有定论 —— sapientinc/HRM-Text-1B
  • 完全极简主义生活依赖外部服务,成本较高 —— salakash/Minimalism
  • 极简主义社交平台主题范围有限,主要覆盖科技和编程领域 —— salakash/Minimalism
  • 600M 版本目前为早期检查点(Early Checkpoint),非正式发布 —— FrontiersMind/Nandi-Mini-600M-Early-Checkpoint
  • 150M 版本在 HellaSwag (37.20)、GSM8K (2.58)、HumanEval (4.27) 等基准上得分偏低,推理与代码能力有限 —— FrontiersMind/Nandi-Mini-600M-Early-Checkpoint

收藏本页,或 订阅 RSS 追踪每日更新。