模型 / 归档 / 2026-07-31

本期 (10)

35B (3B active)

2-bit Qwen3.6-35B-A3B,12.3GB,单卡本地推理

适合本地私密推理 / 编程与复杂推理

短板多模态或视觉输入

Q4 ~23GB / FP16 ~84GB · Apache-2.0 · 128k · escha-runtime (SGLang)需自查

证据201 下载 / 91 赞

20.8B (4B active MoE)

Gemma 4 98e coder GGUF量化,本地代码生成与推理

适合本地代码生成与补全 / 高难度算法题与 LiveCodeBench

短板通用对话或非代码推理

Q4 ~14GB / FP16 ~50GB · Gemma · 32k · llama.cpp需自查

证据8500 下载 / 4 赞

35B (3B 激活)

面向深度搜索的开放权重思考模型

适合多步网页搜索与信息验证 / 长程规划与多源证据整合

短板通用闲聊或非搜索任务

Q4 ~23GB / FP16 ~84GB · Apache 2.0 · 256k · sglang需自查

证据447 下载 / 242 赞

35B (激活 3B)

Mixture of LoRA 个人助手与工具编码模型

适合个人助手与工具调用 / 代码仓库级开发与 UI 生成

短板通用闲聊与长篇创作

Q4 ~24GB / FP16 ~86GB · MIT · 262k · transformers需自查

证据1020 下载 / 58 赞

1.55B

可控逐字/意图风格的多语言ASR,精准词级时间戳

适合逐字转录(含填充词、重复) / 词级时间戳对齐与字幕生成

短板商业用途(需商业许可)

Q4 ~1GB / FP16 ~3.7GB · 非商业研究许可 · 30s音频窗口,长音频自动拼接 · ctranslate2需自查

证据1829 下载 / 53 赞

27B

融合推理与代码的27B单模型,适合本地编程代理

适合单代理闭环编程与调试 / 本地推理与代码生成

短板未经安全对齐的生产环境

Q4 ~18GB / FP16 ~65GB · Qwen License · 262k · llama.cpp需自查

证据2058 下载 / 66 赞

0.6B

0.6B多语言TTS,零样本语音克隆,支持11种语言

适合零样本语音克隆 / 多语言文本转语音生成

短板非推荐语言/方言效果不确定

Q4 ~0.4GB / FP16 ~1.4GB · Apache-2.0 · 2048 · transformers需自查

证据225 下载 / 123 赞

0.5B

边缘工具调用模型,基于 Qwen2.5-0.5B,可在树莓派运行

适合低资源设备上的工具调用 / 作为轻量 AI 助手的本地推理

短板高频长文本或复杂多步推理

Q4 ~0.3GB / FP16 ~1.2GB · apache-2.0 · 未知 · transformers需自查

证据1370 下载

82M

15语TTS GGUF,离线CPU运行

适合离线多语种语音合成 / 边缘设备部署

短板不适合广播级配音

Q4 ~0.1GB / FP16 ~0.2GB · MIT (包装) / Apache 2.0 (Kokoro) · 不适用 · kokoro需自查

证据150 下载

7B

LLaVA-1.5-7B GGUF 量化,本地图像描述与视觉问答

适合隐私敏感本地图像问答 / 截图与照片描述生成

短板非英文图像理解

Q4 ~4.6GB / FP16 ~17GB · LLaMA 2 Community · 4k · llama.cpp需自查

证据186 下载 / 1 赞

← 前一日 2026-07-29 · 后一日 2026-08-01 →