模型 / 归档 / 2026-08-27

本期 (7)

27B (17.8B active)

从 Qwen3.8-27B 切割的 MoE,24GB 本地对话/代码

适合本地 24GB 量化的对话与代码生成 / 复现 router healing 与 MoE 压缩研究

短板SQL/HTML/表格结构化输出

Q4 ~18GB / FP16 ~65GB · apache-2.0 · 8k · llama.cpp需自查

证据13.8k 下载 / 89 赞

3.5B

中英文实时TTS,支持语音克隆/设计/定向

适合实时语音交互与流式合成 / 中英文语音克隆与声音设计

短板商业用途需额外授权

Q4 ~2.3GB / FP16 ~8.3GB · 研究/非商业许可;代码 Apache-2.0 · 未知 · pytorch需自查

证据51 下载 / 95 赞

未公开

MiniMax-H3 8步加速 LoRA,面向视频生成

适合MiniMax-H3 文生视频少步加速 / Ref2VA 参考视频生成加速

短板无 MiniMax-H3 基座时独立推理

未公开 · apache-2.0 · 不适用 · diffusers需自查

证据75 赞

30B

IBM Granite 4.2 30B GGUF 量化版,本地推理

适合本地 30B 级对话与文本生成 / GGUF 量化格式离线部署

短板高并发生产服务

Q4 ~20GB / FP16 ~72GB · Apache-2.0 · 未知 · llama.cpp需自查

证据167 下载 / 2 赞

3B

IBM 3B GGUF 量化,本地推理

适合本地 llama.cpp 推理 / 低显存设备部署

短板高精度复杂推理

Q4 ~2GB / FP16 ~7.2GB · Apache-2.0 · 未知 · llama.cpp需自查

证据143 下载

8B

Granite 8B GGUF 量化版,本地推理

适合本地 GGUF 量化推理 / 通用文本生成与对话

短板多模态输入与超大上下文任务

Q4 ~5.3GB / FP16 ~19GB · Apache-2.0 · 未知 · llama.cpp需自查

证据151 下载

8B

Granite 4.2 8B MLX 量化版,Mac 本地跑

  • MLX
  • 已量化

适合Mac 本地文本生成 / 多语言工具调用

短板非 Apple Silicon 环境

Q4 ~1.6GB / FP16 ~5.9GB · apache-2.0 · 未知 · mlx_lm需自查

证据102 下载

← 前一日 2026-08-26 · 后一日 2026-08-28 →