模型 / 归档 / 2026-08-22

本期 (3)

27B

llama.cpp 投机解码草稿模型 GGUF

适合配合 Qwen3.8-27B 加速投机解码 / llama.cpp 下无损投机解码

短板不适合单独作为语言模型使用

Q4 ~18GB / FP16 ~65GB · apache-2.0 · 未知 · llama.cpp需自查

证据26.1k 下载 / 94 赞

35B MoE / 激活 3B

35B MoE 激活 3B,面向工具调用与长上下文推理

适合终端编码 Agent / 工具调用 / 需要 256K 上下文的推理任务

短板低显存单卡环境与短回复普通对话

Q4 ~24GB / FP16 ~86GB · MIT · 262k · vllm需自查

证据9165 下载 / 280 赞

0.6B

ASR 后处理文本规范化器,英文听写与字幕管道用

适合英文 ASR 输出清理和标点恢复 / 听写、字幕、会议记录后处理

短板通用对话及非英文 ASR

Q4 ~0.5GB / FP16 ~1.8GB · Apache 2.0 + 命名条款 · 未知 · transformers需自查

证据1136 下载 / 185 赞

← 前一日 2026-08-21 · 后一日 2026-08-24 →