模型 / 归档 / 2026-08-21

本期 (6)

9B

9B 推理模型 GGUF,供本地编码与代理使用

适合OpenAI 兼容本地推理服务 / 终端编码代理后端

短板移动端低内存部署

Q4 ~5.9GB / FP16 ~22GB · MIT · 262k · llama.cpp需自查

证据54.9k 下载 / 107 赞

8B

8B-A1B 投机解码草稿侧车,配 llama.cpp 加速

适合llama.cpp 本地加速推理 / 目标模型 DSpark 投机解码

短板单独作为主模型部署

Q4 ~5.3GB / FP16 ~19GB · other (lfm1.0) · 未知 · llama.cpp需自查

证据16 赞

27B

无审查 Qwen3.8-27B,供红队与对齐研究

  • MLX

适合红队与 AI 安全评估 / 本地无审查内容生成

短板需安全过滤的生产环境

Q4 ~18GB / FP16 ~67GB · Apache-2.0 · 未知 · transformers需自查

证据4415 下载 / 246 赞

35B (激活 3B)

35B MoE 激活3B GGUF,本地编码与工具调用

适合Agentic 编码与工具调用 / 长上下文仓库级代码任务

短板低显存环境或非代码任务

Q4 ~23GB / FP16 ~84GB · MIT · 262k · ollama需自查

证据53.7k 下载 / 158 赞

9B

9B 稠密推理模型,单卡部署与终端编程

适合单卡 vLLM/SGLang 部署 / 终端编码与工具调用

短板简单问答 / 低延迟场景

Q4 ~6.2GB / FP16 ~23GB · MIT · 262k(YaRN 可扩展至约 1M) · transformers需自查

证据1324 下载 / 124 赞

27B

Mac 用 Qwen3.6-27B MLX 量化,低冗余输出

  • MLX

适合Apple Silicon 本地长上下文推理 / Token 预算受限的 agent 任务

短板32GB 及以下内存的长上下文运行

Q4 ~18GB / FP16 ~65GB · Apache-2.0 · 256k · mlx需自查

证据1275 下载 / 7 赞

← 前一日 2026-08-20 · 后一日 2026-08-22 →