2-bit Qwen3.6-35B-A3B,12.3GB,单卡本地推理
适合本地私密推理 / 编程与复杂推理
短板多模态或视觉输入
Q4 ~23GB / FP16 ~84GB · Apache-2.0 · 128k · escha-runtime (SGLang)需自查
证据201 下载 / 91 赞
2-bit Qwen3.6-35B-A3B,12.3GB,单卡本地推理
适合本地私密推理 / 编程与复杂推理
短板多模态或视觉输入
Q4 ~23GB / FP16 ~84GB · Apache-2.0 · 128k · escha-runtime (SGLang)需自查
证据201 下载 / 91 赞
Gemma 4 98e coder GGUF量化,本地代码生成与推理
适合本地代码生成与补全 / 高难度算法题与 LiveCodeBench
短板通用对话或非代码推理
Q4 ~14GB / FP16 ~50GB · Gemma · 32k · llama.cpp需自查
证据8500 下载 / 4 赞
面向深度搜索的开放权重思考模型
适合多步网页搜索与信息验证 / 长程规划与多源证据整合
短板通用闲聊或非搜索任务
Q4 ~23GB / FP16 ~84GB · Apache 2.0 · 256k · sglang需自查
证据447 下载 / 242 赞
Mixture of LoRA 个人助手与工具编码模型
适合个人助手与工具调用 / 代码仓库级开发与 UI 生成
短板通用闲聊与长篇创作
Q4 ~24GB / FP16 ~86GB · MIT · 262k · transformers需自查
证据1020 下载 / 58 赞
可控逐字/意图风格的多语言ASR,精准词级时间戳
适合逐字转录(含填充词、重复) / 词级时间戳对齐与字幕生成
短板商业用途(需商业许可)
Q4 ~1GB / FP16 ~3.7GB · 非商业研究许可 · 30s音频窗口,长音频自动拼接 · ctranslate2需自查
证据1829 下载 / 53 赞
融合推理与代码的27B单模型,适合本地编程代理
适合单代理闭环编程与调试 / 本地推理与代码生成
短板未经安全对齐的生产环境
Q4 ~18GB / FP16 ~65GB · Qwen License · 262k · llama.cpp需自查
证据2058 下载 / 66 赞
0.6B多语言TTS,零样本语音克隆,支持11种语言
适合零样本语音克隆 / 多语言文本转语音生成
短板非推荐语言/方言效果不确定
Q4 ~0.4GB / FP16 ~1.4GB · Apache-2.0 · 2048 · transformers需自查
证据225 下载 / 123 赞
边缘工具调用模型,基于 Qwen2.5-0.5B,可在树莓派运行
适合低资源设备上的工具调用 / 作为轻量 AI 助手的本地推理
短板高频长文本或复杂多步推理
Q4 ~0.3GB / FP16 ~1.2GB · apache-2.0 · 未知 · transformers需自查
证据1370 下载
15语TTS GGUF,离线CPU运行
适合离线多语种语音合成 / 边缘设备部署
短板不适合广播级配音
Q4 ~0.1GB / FP16 ~0.2GB · MIT (包装) / Apache 2.0 (Kokoro) · 不适用 · kokoro需自查
证据150 下载
LLaVA-1.5-7B GGUF 量化,本地图像描述与视觉问答
适合隐私敏感本地图像问答 / 截图与照片描述生成
短板非英文图像理解
Q4 ~4.6GB / FP16 ~17GB · LLaMA 2 Community · 4k · llama.cpp需自查
证据186 下载 / 1 赞
输入关键词,跨模型 / 数据集 / 空间 / 工具 / 资讯 / 论文 检索