llama.cpp 投机解码草稿模型 GGUF
适合配合 Qwen3.8-27B 加速投机解码 / llama.cpp 下无损投机解码
短板不适合单独作为语言模型使用
Q4 ~18GB / FP16 ~65GB · apache-2.0 · 未知 · llama.cpp需自查
证据26.1k 下载 / 94 赞
llama.cpp 投机解码草稿模型 GGUF
适合配合 Qwen3.8-27B 加速投机解码 / llama.cpp 下无损投机解码
短板不适合单独作为语言模型使用
Q4 ~18GB / FP16 ~65GB · apache-2.0 · 未知 · llama.cpp需自查
证据26.1k 下载 / 94 赞
35B MoE 激活 3B,面向工具调用与长上下文推理
适合终端编码 Agent / 工具调用 / 需要 256K 上下文的推理任务
短板低显存单卡环境与短回复普通对话
Q4 ~24GB / FP16 ~86GB · MIT · 262k · vllm需自查
证据9165 下载 / 280 赞
ASR 后处理文本规范化器,英文听写与字幕管道用
适合英文 ASR 输出清理和标点恢复 / 听写、字幕、会议记录后处理
短板通用对话及非英文 ASR
Q4 ~0.5GB / FP16 ~1.8GB · Apache 2.0 + 命名条款 · 未知 · transformers需自查
证据1136 下载 / 185 赞
输入关键词,跨模型 / 数据集 / 空间 / 工具 / 资讯 / 论文 检索