模型 / 归档 / 2026-08-29

本期 (9)

30B (3.5B 激活)

面向电话语音代理的 30B-A3B 微调模型

适合英语电话语音代理 / 多轮工具调用客服

短板非英语或需长思考的通用推理

Q4 ~21GB / FP16 ~76GB · BSD-2-Clause(含 NVIDIA Nemotron Open Model License) · 262k · vllm需自查

证据2668 下载 / 127 赞

270M

面向 RAG 路由的查询重写小模型

  • MLX

适合RAG 路由前查询重写 / 多语言请求拆分与澄清

短板直接回答或执行用户指令

Q4 ~0.2GB / FP16 ~0.6GB · Gemma · 2048 · llama.cpp需自查

证据589 下载

1.2B

为 GLM-5.3-Flash 推理加速的 DFlash2 草稿模型

适合GLM-5.3-Flash 投机解码加速 / 提高 GLM-5.3-Flash 生成吞吐

短板独立文本生成

Q4 ~0.8GB / FP16 ~2.8GB · CC BY-NC-ND 4.0 · 未知 · sglang需自查

证据3253 下载 / 81 赞

3.8B

Qwen3.8 Flash 的 GGUF 量化,面向本地推理

适合GGUF 量化本地推理 / 低显存/边缘设备部署

短板需要原始权重微调或高精度推理

Q4 ~2.5GB / FP16 ~9.1GB · other · 未知 · llama.cpp需自查

证据1047 下载

3.8B

Qwen3.8 GGUF,本地图像文本推理

适合本地图像文本对话 / 低资源设备的 GGUF 推理

短板高风险合规或商用授权场景

Q4 ~2.5GB / FP16 ~9.1GB · unknown · 未知 · llama.cpp需自查

证据20.3k 下载 / 85 赞

35B

文本生成同步音视频,4步推理

适合文本生成同步音视频 / 4步推理的少步生成

短板FL2VA/Ref2VA 未蒸馏

Q4 ~23GB / FP16 ~84GB · MiniMax H3 Community License · 未知 · fastvideo需自查

证据93 赞

30B

IBM 30B MLX 6bit 量化,Mac 用

  • MLX

适合Apple 芯片 Mac 本地推理 / 工具调用 / 推理文本生成

短板非 Apple Silicon 环境

Q4 ~20GB / FP16 ~72GB · apache-2.0 · 未知 · mlx需自查

证据166 下载

3B

3B开源文本生成模型,面向Apple Silicon本地推理与工具调用

  • MLX
  • 已量化

适合Apple Silicon 本地文本生成 / 思维链推理与工具调用

短板非 Apple Silicon 平台

Q4 ~2GB / FP16 ~7.2GB · Apache-2.0 · 未知 · mlx需自查

证据150 下载

3B

IBM Granite 3B MLX 量化,苹果芯片推理

  • MLX
  • 已量化

适合苹果芯片本地 3B 推理 / 多语言推理与工具调用原型

短板需要高精度、长上下文的生产任务

Q4 ~0.7GB / FP16 ~2.5GB · apache-2.0 · 未知 · mlx_lm需自查

证据196 下载

← 前一日 2026-08-28 · 后一日 2026-08-30 →