模型

来自 HuggingFace · 值得本地跑的开源模型 · 共 214 个

开源模型选型

根据任务、硬件和许可,找到真正能跑的模型

显存档为包含式(更低显存也能跑的模型一并计入,数值取 Q4 量化后估算);任务内多选取并集,不同行之间取交集。

最近更新

按收录日期排列 · 共 214 个

第 62 期 · 2026-07-21
1.14B

多语言文本嵌入,NVFP4 量化,专为 RAG 和检索设计

  • 已量化

适合多语言 RAG 检索 / 语义搜索与问答

短板生成式任务(仅输出嵌入向量)

Q4 ~0.5GB / FP16 ~1.8GB · OpenMDW-1.1 · 32k · vllm需自查

证据6682 下载 / 55 赞

20B (MoE)

2-bit 量化 MLX 模型,专为 Apple Silicon 推理

  • Apple Silicon
  • 已量化

适合Apple Silicon 设备本地推理 / 极低内存占用(约 6 GB)

短板高精度文本生成

Q4 ~14GB / FP16 ~50GB · Apache 2.0 · 未知 · mlx需自查

证据283 下载

第 61 期 · 2026-07-20
4B

面向硬件音乐设备的本地助手,基于Qwen3-4B微调

  • Apple Silicon
  • 已量化

适合回答硬件乐器操作问题 / 生成结构化的分步动画指令

短板商业用途或安全关键决策

Q4 ~2.6GB / FP16 ~9.6GB · cc-by-nc-4.0 · 未知 · mlx需自查

证据819 下载

第 60 期 · 2026-07-19
27B

多阶段微调的27B视觉模型,提升推理与创意写作

适合推理与编码 / 创意写作与角色扮演

短板内容安全敏感场景

Q4 ~18GB / FP16 ~65GB · Apache 2.0 · 256k · ollama需自查

证据9575 下载 / 64 赞 / 8 个社区来源

35B (3B 激活)

无审查视觉 MoE 模型,Hermes 工具调用,GGUF 本地推理

适合无审查对话与多模态问答 / 本地 agent 工具调用

短板需安全审查的生产环境

Q4 ~23GB / FP16 ~84GB · Apache-2.0 · 262K (可扩展至 1M) · llama.cpp需自查

证据13.4k 下载 / 57 赞 / 4 个社区来源

8B

多语言文本嵌入模型,面向RAG检索与语义搜索。

适合多语言RAG检索增强生成 / 代码语义搜索与匹配

短板不适用于文本生成或对话

Q4 ~5.3GB / FP16 ~19GB · OpenMDW-1.1 · 32768 · transformers需自查

证据14k 下载 / 52 赞

第 59 期 · 2026-07-18
1.14B

多语言文本嵌入模型,用于语义搜索与 RAG

适合多语言语义搜索 / RAG 系统的检索组件

短板不适用于文本生成

Q4 ~0.8GB / FP16 ~2.7GB · OpenMDW-1.1 · 32768 · transformers需自查

证据46.3k 下载 / 60 赞

220M / 600M · 原生 · MLX

70+语言语音识别,关注俄语、哈萨克语等小语种

适合俄/哈/吉/乌语等小语种 ASR / 多语言语音转录服务

短板英语高精度 ASR

Q4 ~0.1GB / FP16 ~0.5GB · mit · 未知 · transformers需自查

证据2399 下载 / 52 赞

161M

俄语及中亚语言离线语音转录,Apple Silicon 用

  • Apple Silicon

适合俄语/哈/吉/乌语离线转写 / macOS Apple Silicon 低资源占用 ASR

短板英语及高噪声实时流式场景

Q4 ~0.1GB / FP16 ~0.4GB · MIT · 不适用 · mlx需自查

证据124 下载 / 3 个社区来源

224M

Apple Silicon 本地离线俄哈吉乌语 ASR,MLX 量化

  • Apple Silicon

适合俄/哈/吉/乌语离线转写 / Apple Silicon 本地低延迟 ASR

短板英文或流式实时转录

Q4 ~0.1GB / FP16 ~0.5GB · MIT · 未知 · mlx需自查

证据101 下载

35B (3B 激活)

Qwen3.6 MoE 量化版,Apple Metal 加速推理

适合Apple Silicon 本地聊天 / 低内存 MoE 研究

短板非 Apple Metal 平台

Q4 ~23GB / FP16 ~84GB · apache-2.0 · 未知 · llama.cpp需自查

证据102 下载

第 58 期 · 2026-07-17
第 57 期 · 2026-07-16
27B

1-bit 27B 模型, 可在手机和笔记本本地运行推理

  • Apple Silicon

适合手机端本地27B推理 / 262K长上下文处理

短板复杂智能体编程任务

Q4 ~18GB / FP16 ~65GB · apache-2.0 · 262K · mlx需自查

证据23 下载 / 64 赞 / 3 个社区来源

未公开

腾讯 Hy3 混合精度 GGUF,针对本地受限硬件极限压缩

适合H20 单卡/双卡本地推理 / 带自推测解码的低延迟生成

短板生产环境高并发在线服务

未公开 · apache-2.0 · 65536 · llama.cpp需自查

证据107 赞

8B

网络安全领域8B微调模型, 本地离线运行红蓝队工具

适合渗透测试与漏洞分析辅助 / CTF 竞赛和安全代码审查

短板通用对话或未经人工审核的安全决策

Q4 ~5.3GB / FP16 ~19GB · llama3.1 · 2k · ollama需自查

证据51.1k 下载 / 87 赞

1B · 原生 · GGUF

1B 思考模型,改进编码与指令遵循,适合本地部署

适合代码生成与调试 / 需要推理的指令遵循

短板高难度通用推理

Q4 ~0.7GB / FP16 ~2.6GB · Apache-2.0 · 128k · transformers需自查

证据3483 下载 / 129 赞 / 2 个社区来源

5B

未审查文本生成模型,卡信息缺失

适合无限制对话 / 创意写作

短板需要内容安全过滤的场景

Q4 ~3.3GB / FP16 ~12GB · 未知 · 未知 · transformers需自查

证据3666 下载 / 23 赞

30B (3B 激活)

多语言翻译 MoE 模型的 APEX 量化版,供本地 GGUF 推理

适合多语种离线文本翻译 / 本地资源受限设备翻译服务

短板需要在线 API 的场景

Q4 ~20GB / FP16 ~72GB · Apache-2.0 · 未知 · llama.cpp需自查

证据316 下载 / 1 赞

4B

GGUF 量化,解禁角色扮演与图像描述

适合无审查角色扮演对话 / 图像内容描述

短板高精度视觉推理任务

Q4 ~2.6GB / FP16 ~9.6GB · apache-2.0 · 未知 · ollama需自查

证据310 下载

第 56 期 · 2026-07-15
27B

27B 1-bit 量化模型,面向笔记本与手机本地推理

适合本地隐私推理,笔记本/手机可用 / 262K 上下文,数学与编程任务

短板长期 agent 编码与多文件重构

Q4 ~18GB / FP16 ~65GB · Apache 2.0 · 262K · llama.cpp需自查

证据513 下载 / 62 赞 / 3 个社区来源

27B

三元权重 27B 推理模型,笔记本本地运行

适合笔记本端侧推理 27B 模型 / 长上下文 (262K) 离线分析

短板手机直接部署

Q4 ~18GB / FP16 ~65GB · Apache-2.0 · 262K · llama.cpp需自查

证据23 下载 / 105 赞 / 1 个社区来源

27B

三元2-bit 27B开源模型,笔记本本地运行推理

  • Apple Silicon

适合笔记本端27B推理(~26 tok/s) / 离线/隐私场景长文本理解

短板手机端部署与长链条代理编码

Q4 ~18GB / FP16 ~65GB · apache-2.0 · 262k · mlx需自查

证据6 下载 / 13 赞 / 3 个社区来源

31B

Wings of Fire 世界观角色扮演, 支持链式思维

适合WoF/奇幻世界观叙事 / 推理链辅助角色扮演

短板通用问答/编程

Q4 ~20GB / FP16 ~74GB · Apache-2.0 · 未知 · ollama需自查

证据5924 下载 / 2 赞 / 10 个社区来源

30B (3B 激活)

4bit MoE本地运行于Apple Silicon

  • Apple Silicon

适合Apple Silicon本地高效推理 / 代码与数学问题求解

短板需要高精度BF16的场景

Q4 ~20GB / FP16 ~72GB · nvidia-open-model-license · 未知 · mlx需自查

证据855 下载 / 2 赞 / 4 个社区来源

35B (3B 激活)

4-bit MLX 量化,Apple Silicon 本地运行文本生成

  • Apple Silicon
  • 已量化

适合Apple Silicon 本地大模型推理 / 敏感层 8-bit 保精度的代码/指令任务

短板显存<16GB 设备运行受限

Q4 ~23GB / FP16 ~84GB · apache-2.0 · 128k · mlx需自查

证据720 下载 / 3 赞 / 10 个社区来源

第 55 期 · 2026-07-14
35B (3B激活)

MLX VQ量化35B MoE,适合Apple Silicon本地推理

  • Apple Silicon
  • 已量化

适合本地日常对话与文本生成 / 资源受限的Apple设备推理

短板云端大规模部署或高精度任务

Q4 ~23GB / FP16 ~84GB · Apache-2.0 · 128k · mlx需自查

证据524 下载 / 2 赞 / 15 个社区来源

第 54 期 · 2026-07-13
9B

Apple Silicon 本地 4-bit 混合精度量化文本生成模型

  • Apple Silicon
  • 已量化

适合本地代码/推理/工具调用任务 / Apple Silicon 上的高精度轻量部署

短板需 NVIDIA GPU 的部署场景

Q4 ~5.9GB / FP16 ~21GB · apache-2.0 · 128k · mlx需自查

证据12k 下载 / 78 赞 / 8 个社区来源

9B · 原生 · GGUF

修复循环生成并保留1M上下文推理能力的研究型模型

适合长文本推理与代码生成 / 未过滤的研究与安全测试

短板需要高吞吐编码辅助的场景

Q4 ~6.4GB / FP16 ~23GB · Apache-2.0 · 1048k · vllm需自查

证据993 下载 / 71 赞 / 4 个社区来源

未公开

Krea-2 Turbo 风格化 LoRA,电影感氛围增强

适合艺术风格增强 / 电影感氛围生成

短板精确物体形状控制

未公开 · apache-2.0 · 未知 · diffusers需自查

证据1577 下载 / 73 赞 / 1 个社区来源

35B (3B 活跃)

Apple Silicon 上 Claude-Code 式本地编码代理

  • Apple Silicon

适合苹果芯片本地编码代理 / 低资源Mac代码生成/对话

短板16/18 GB 内存 Mac 不可用

Q4 ~23GB / FP16 ~83GB · unknown · 未知 · mlx需自查

证据818 下载 / 3 个社区来源

第 53 期 · 2026-07-11
2B

统一音频-文本语言模型,支持语音识别、翻译、TTS 与音频生成

适合语音识别与翻译、音频问答 / 文本转语音、音频生成

短板商业用途 (非商用许可)

Q4 ~1.3GB / FP16 ~4.8GB · NVIDIA OneWay Noncommercial License · 128k · vllm需自查

证据1050 下载 / 53 赞 / 3 个社区来源

未公开

风格参考 LoRA,将参考图风格注入 Krea2 Turbo 生成

适合风格一致的图像生成 / 基于参考图的风格迁移

短板无参考图的标准文生图

未公开 · krea-2-community-license · 不适用 · diffusers需自查

证据1463 下载 / 54 赞 / 4 个社区来源

第 52 期 · 2026-07-10
555M

流式自回归 TTS,面向实时对话与语音代理

适合实时语音代理 / 流式对话与配音

短板精确声纹匹配任务

Q4 ~0.4GB / FP16 ~1.3GB · Apache 2.0 (codec: NVIDIA Open Model License) · 未知 · vllm需自查

证据1468 下载 / 62 赞

27B

视觉语言模型,思考令牌减半,GGUF量化,适合本地运行

适合需要思维链但希望节省Token成本 / 本地视觉问答与推理部署

短板长链深度推理,精度可能略降

Q4 ~18GB / FP16 ~65GB · unknown · 未知 · llama.cpp需自查

证据298.8k 下载 / 57 赞 / 10 个社区来源

27B

Claude Opus推理蒸馏并反审查的27B模型GGUF版

适合复杂推理与多步逻辑 / 创意写作与无过滤对话

短板安全合规的生产环境

Q4 ~18GB / FP16 ~65GB · apache-2.0 · 256K · llama.cpp需自查

证据132 下载 / 14 个社区来源

第 51 期 · 2026-07-09
82M

82M 参数轻量 TTS 模型,支持多语言,可本地部署

适合本地/边缘设备语音合成 / 成本敏感的 API 服务

短板声音克隆/自定义音色

Q4 ~0.1GB / FP16 ~0.2GB · apache-2.0 · 未知 · kokoro需自查

证据13509.8k 下载 / 6479 赞 / 10 个社区来源

75B (9.3B active)

面向高吞吐推理的压缩 MoE 模型,用于交互式推理与高并发部署

  • 已量化

适合高并发聊天与代理部署 / 推理密集与长上下文任务

短板非 Blackwell GPU 低显存设备

Q4 ~29GB / FP16 ~107GB · OpenMDW-1.1 · 1M · vllm需自查

证据47 下载 / 66 赞 / 4 个社区来源

30B MoE (3B激活)

音频-文本统一LLM,兼顾文本推理与语音/音频生成

适合音频理解、语音识别与翻译 / 文本-语音/音频生成与对话

短板商业部署(非商业许可)

Q4 ~20GB / FP16 ~72GB · NVIDIA Oneway Noncommercial License · 1M · vllm需自查

证据67 赞

51M

51M 参数边缘路由器, 判断提示词复杂度并分发至本地或云端模型

适合边缘设备请求分流 / 多模型架构网关决策

短板直接文本生成

Q4 ~0GB / FP16 ~0.1GB · unknown · 3840 · transformers需自查

证据269 下载 / 65 赞

第 50 期 · 2026-07-08
22B (基模型)

LTX-2.3 身份保持 LoRA,单参考图加提示生成人物视频

适合单参考图驱动的人物视频生成 / 数字人/虚拟形象的身份一致创作

短板全身体态、大角度或遮挡人像

Q4 ~15GB / FP16 ~53GB · other · 未知 · ComfyUI需自查

证据44 赞 / 2 个社区来源

第 49 期 · 2026-07-07
12B

紧凑推理微调,减少冗余推理轨迹,降低推理token消耗

适合低成本推理服务 / 数学与代码紧凑推理

短板需要长推导的复杂推理

Q4 ~7.9GB / FP16 ~29GB · other · 未知 · transformers需自查

证据797 下载 / 47 赞 / 3 个社区来源

第 48 期 · 2026-07-06
9B

无审查 Qwen3.5-9B 微调,用于网络安全与生物医学

适合网络安全工具开发 / 长上下文无审查对话

短板需要内容过滤的生产环境

Q4 ~5.9GB / FP16 ~22GB · apache-2.0 · 1M · ollama需自查

证据4035 下载 / 49 赞

35B (3B 激活)

三元专家量化版,9.4 GB 全量跑在 16 GB Mac 上

  • Apple Silicon

适合本地聊天与问答 / 一次性代码生成与摘要

短板Agent 工具链循环与多步代码修复

Q4 ~19GB / FP16 ~69GB · Apache-2.0 · 未知 · mlx需自查

证据414 下载 / 13 个社区来源

35B MoE · 原生 · GGUF

35B MoE 视觉 Agent,用于长程搜索与工具调用

适合长程搜索与信息检索 / 科学推理与工程任务

短板纯文本闲聊

Q4 ~23GB / FP16 ~84GB · Apache 2.0 · 262k · vllm需自查

证据92 下载 / 78 赞 / 1 个社区来源

862MB LoRA

深度条件图像生成,保持输入图像3D结构,用于风格迁移与内容变换

适合保留输入图像三维结构的风格迁移 / 场景重照明、视角一致的景物变换

短板平面插画转深度控制效果弱

862MB LoRA · krea-2-community-license · N/A · ComfyUI需自查

证据49 赞 / 2 个社区来源

1.27B

1.3B MoD对话模型,支持ChatML与代码/数学生成

适合本地轻量对话与代码生成 / 资源受限设备上的文本生成

短板长上下文生成 (2048 token限制)

Q4 ~0.9GB / FP16 ~3.2GB · apache-2.0 · 2048 · transformers需自查

证据855 下载 / 4 赞 / 2 个社区来源

第 47 期 · 2026-07-05
12B · 原生 · GGUF

编程与工具调用代理微调,供开发者本地使用

适合终端多步工具调用与调试 / 本地程序合成与测试

短板通用知识问答与事实查询

Q4 ~7.9GB / FP16 ~29GB · Apache-2.0 · 16k(示例命令) · transformers需自查

证据1833 下载 / 48 赞 / 14 个社区来源

第 46 期 · 2026-07-04
33B (3B 激活)

33B MoE 编码模型,3B 激活,为本地代理与长任务设计

适合本地代理式编码 / 长上下文 SWE 任务

短板通用对话与低内存设备

Q4 ~22GB / FP16 ~80GB · OpenMDW-1.1 · 262k · vllm需自查

证据354 下载 / 44 赞 / 5 个社区来源

9B

为Flux.2 Klein 9B图像指定阳光方向,球体参考工作流

适合室外场景阳光方向控制 / 阴天图像添加定向光照

短板室内场景和已有强光源方向图像

9B · Apache-2.0 · 不适用 · diffusers需自查

证据54 赞 / 3 个社区来源

31B

MLX 8-bit 量化英文创意写作模型,适合故事小说生成

  • Apple Silicon
  • 已量化

适合英文小说/创意写作生成 / 文学风格对话与叙事

短板事实性问答或精确指令遵循

Q4 ~20GB / FP16 ~74GB · apache-2.0 · 未知 · mlx需自查

证据311 下载 / 1 赞 / 11 个社区来源

第 45 期 · 2026-07-03
4B

对话式语音合成,100+语种,零样本克隆与内联控制

适合语音代理对话合成 / 零样本多语种声音克隆与情绪控制

短板商业化部署与未经授权的语音克隆

Q4 ~3.1GB / FP16 ~11GB · boson-higgs-audio-v3-research-and-non-commercial-license · 8192 · vllm-omni需自查

证据103.9k 下载 / 581 赞 / 7 个社区来源

9B · 原生 · GGUF·deepreinforce-ai · GGUF·protolabsai

Ornith-9B MTP GGUF:llama.cpp推测解码加速

适合无需额外草稿模型的推测解码 / 低VRAM场景的批量生成吞吐优化

短板要求bitwise一致输出的评测

Q4 ~5GB / FP16 ~18GB · MIT · 256k · llama.cpp需自查

证据218 下载 / 110 赞 / 2 个社区来源

35B-MoE · 原生 · FP8 · GGUF

35B开源编码代理模型,原生工具调用与推理链

适合终端编码代理 (Terminal-Bench) / 代码仓库修复与工具调用 (SWE-bench)

短板通用闲聊与事实查询

Q4 ~23GB / FP16 ~84GB · MIT · 256k · vllm需自查

证据1005 下载 / 116 赞 / 1 个社区来源

第 44 期 · 2026-07-02
30B (3B 激活)

双塔扩散LLM,块并行解码,2.42x生成吞吐量

适合大规模批量文本生成 / 作为基座模型微调

短板低延迟对话或指令跟随

30B (3B 激活) · NVIDIA Nemotron Open Model License · 128k · transformers需自查

证据7628 下载 / 79 赞 / 2 个社区来源

26B-A4B

无审查Gemma4-26B MoE,适用于代理编码与创意写作

适合代理编码与工具调用 / 多模态角色扮演/故事创作

短板需要严格内容过滤的生产环境

26B-A4B · gemma · 256k · llama.cpp需自查

证据35.2k 下载 / 54 赞 / 11 个社区来源

9B

未审查 1M 上下文 Qwen3.5 微调,支持工具调用

适合长上下文角色扮演创作 / 工具调用与代理任务

短板需内容审查的生产场景

9B · apache-2.0 · 1M · llama.cpp需自查

证据37.9k 下载 / 55 赞 / 3 个社区来源

未公开

移除安全过滤的GLM-5.2 GGUF,供研究实验用

适合无审查的文本生成和调试 / 安全对抗性研究与测试

短板生产部署或面向未成年用户

未公开 · MIT · 未知 · llama.cpp需自查

证据901 下载 / 115 赞 / 12 个社区来源

27B

Qwen3.6-27B NVFP4 量化,面向 vLLM 部署与推理

  • 已量化

适合AI Agent 与工具调用 / 聊天机器人与 RAG 系统

短板不适用于安全敏感应用

27B · Apache-2.0 · 262k · vllm需自查

证据2671 下载 / 168 赞 / 11 个社区来源

第 43 期 · 2026-07-01
35B (3B 激活)

关闭思考的编码代理模型,降低 token 延迟,适合本地工作流

适合代理循环中的代码编辑与调试 / 本地低 token 消耗编码任务

短板需要深度推理的长链问题

35B (3B 激活) · Apache-2.0 · 未知 · llama.cpp需自查

证据84 赞 / 3 个社区来源

8B (激活1B)

8B参数1B激活MoE,消费级GPU可运行的APEX量化

适合本地低成本对话 / 消费级GPU即时推理

短板高精度复杂推理任务

8B (激活1B) · LFM1.0 · 未知 · localai需自查

证据4108 下载 / 11 赞 / 3 个社区来源

12B · 原生 · GGUF

12B 文本到图像扩散模型,GGUF 量化版,用于本地生成

适合低资源本地文本到图像生成 / 创意概念图与设计素材生成

短板精细写实摄影,敏感内容生成

12B · Krea-2-Community-License · 未知 · diffusers需自查

证据84 下载 / 69 赞 / 5 个社区来源

第 42 期 · 2026-06-30
27B

生成漏洞利用与安全工具,面向攻防研究者

适合漏洞利用与渗透工具生成 / 安全测试自动化模板编写

短板复杂攻击链推理与威胁建模

27B · Apache-2.0 · 4096 · ollama需自查

证据207 下载 / 70 赞 / 4 个社区来源

12B (以及 3B)

Gemma 4 12B/3B GGUF 量化集合,供本地聊天与代码任务

适合本机聊天与文本生成 / 代码补全与 Python 代理任务

短板文本以外的多模态任务

12B (以及 3B) · 未知 · 262k · llama.cpp需自查

证据54.5k 下载 / 8 个社区来源

3B

3B 视觉语言 OCR 模型,文档解析与 Markdown 转换

适合文档 OCR 转 Markdown(带布局/框) / 多语言长文档解析

短板通用视觉对话或复杂推理

3B · MIT · 未知 · llama.cpp需自查

证据28.2k 下载 / 50 赞 / 3 个社区来源

第 41 期 · 2026-06-29
230M · 原生 · GGUF

混合架构边缘设备模型,用于设备端文本生成

适合设备端文本生成与补全 / 低功耗场景下的轻量对话

短板复杂推理或长上下文生成

Q4 ~0.2GB / FP16 ~0.6GB · LFM1.0 · 32768 · llama.cpp需自查

证据7334 下载 / 65 赞 / 3 个社区来源

第 40 期 · 2026-06-27
35B (3B激活) · 原生 · GGUF

语言世界模型,模拟7类agent交互环境

适合7域agent环境状态预测 / world model研究与模拟数据生成

短板非通用助手,不适用直接问答

Q4 ~23GB / FP16 ~83GB · Apache-2.0 · 262k · vllm需自查

证据223 下载 / 132 赞 / 7 个社区来源

第 39 期 · 2026-06-26
27B

27B 无审查多模态混合模型,本地创作者使用

适合无审查对话与角色扮演 / 多模态图像与文档理解

短板需要内容过滤的生产环境

27B · apache-2.0 · 未知 · llama.cpp需自查

证据31.3k 下载 / 8 赞 / 13 个社区来源

31B

IQ2_M 31B 多模态 Agent,10 GiB 本地运行

适合本地多模态 Agent 推理 / 代码与工具调用任务

短板高精度语言生成

31B · gemma · 未知 · llama.cpp需自查

证据12.5k 下载 / 12 个社区来源

3B

3B无审查推理模型,专注数学与竞赛编程

适合数学与竞赛编程推理 / 可验证分数信号的任务(如LeetCode题)

短板工具调用 / agent 编程

Q4 ~2GB / FP16 ~7.4GB · MIT · 未知 · transformers需自查

证据6893 下载 / 56 赞 / 1 个社区来源

27B

无审查的27B视觉语言模型,用于多模态对话与图像理解

适合多模态无审查对话 / 图像描述与视觉问答

短板需要安全过滤的生产环境

27B · apache-2.0 · 未知 · llama.cpp需自查

证据7462 下载 / 10 赞 / 8 个社区来源

第 38 期 · 2026-06-25
未知

轻量推理模型,专注数学与代码任务的本地运行

适合本地数学推理与简单代码生成 / 轻量级智能代理原型开发

短板复杂多步推理或长文本理解

未知 · MIT · 未知 · llama.cpp需自查

证据4918 下载 / 52 赞 / 1 个社区来源

未知

Krea 2 Turbo 的 FP8 量化版,16GB 显存可用

适合16GB+ 显卡本地生图 / Turbo 8 步快速创意生成

短板商用需确认 KREA 2 许可证

未知 · krea-2-license · 未知 · diffusers需自查

证据7347 下载 / 55 赞 / 4 个社区来源

第 37 期 · 2026-06-24
4.6B

零样本声音克隆多语言TTS模型,支持31种语言和本地部署

适合零样本多语言语音克隆 / 长文本合成与精确停顿控制

短板实时流式低延迟场景

Q4 ~3GB / FP16 ~11GB · Apache-2.0 · 未知 · transformers需自查

证据5655 下载 / 47 赞 / 3 个社区来源

27B

27B编码器GGUF,兼容多种工具历史格式,供本地开发者使用

适合本地代理编码与工具调用 / 图像理解与多模态代码生成

短板非编码任务的通用对话与知识问答

27B · apache-2.0 · 32K · llama.cpp需自查

证据3958 下载 / 71 赞 / 4 个社区来源

12B

解除审查的Gemma4多模态模型,面向代理编码与创意写作

适合代理式编码与工具调用 / 创意写作与角色扮演

短板要求绝对零拒绝的严格场景

12B · gemma · 256K · llama.cpp需自查

证据2056 下载 / 57 赞 / 4 个社区来源

27B (基座) + LoRA

Qwen3.6-27B的LoRA微调,用于故事与寓言生成

适合中文寓言/故事创作 / 叙事性文本生成

短板逻辑推理与代码生成

27B (基座) + LoRA · unknown · 未知 · vllm需自查

证据403 下载 / 64 赞 / 10 个社区来源

12B

12B 图像生成基座,用于 LoRA 微调训练

适合风格化图像生成(复古、像素、抽象) / LoRA 微调训练基座

短板直接推理使用(官方建议微调)

12B · krea-2-community-license · N/A · diffusers需自查

证据194 下载 / 63 赞 / 3 个社区来源

第 36 期 · 2026-06-23
4B

为编码代理提供仓库探索与精确文件引用

适合编码代理的仓库探索与上下文收集 / 并行文件搜索与精确行范围引用

短板独立解决编码任务或通用对话

Q4 ~2.7GB / FP16 ~9.7GB · MIT · 262k · sglang需自查

证据2900 下载 / 54 赞 / 9 个社区来源

9B · 原生 · GGUF

开源 9B 推理模型,不审查,支持 1M 上下文和函数调用

适合长上下文推理与工具调用 / 网络安全 / 生物医学等敏感技术问答

短板需要安全审查的生产部署

Q4 ~6.2GB / FP16 ~23GB · Apache 2.0 · 1M · vllm需自查

证据842 下载 / 125 赞 / 4 个社区来源

35B

Qwen3.6-35b 全量微调,强化结构化推理与代码助手

适合代码生成与结构化编辑 / 技术推理与调试辅助

短板高风险生产环境直接部署

35B · MIT · 未知 · transformers需自查

证据6088 下载 / 62 赞 / 4 个社区来源

12B

未审查版 Gemma 代码模型,用于编程与推理,已去除拒答

适合编程与代码推理(无拒答) / 研究安全对齐移除效果

短板生产环境、需内容审核的场景

Q4 ~7.9GB / FP16 ~29GB · apache-2.0 · 未知 · transformers需自查

证据1773 下载 / 91 赞 / 11 个社区来源

第 35 期 · 2026-06-22
未公开(LoRA)

Ideogram 4 加速 LoRA,2 步出图,无需 CFG

适合快速出图(2-8 步) / Ideogram 4 的低步数推理

短板商用(非商用许可证)

未公开(LoRA) · ideogram-4-non-commercial · 不适用 · diffusers需自查

证据2452 下载 / 89 赞 / 2 个社区来源

753.3B · 原生 · GGUF

1M上下文开源模型,面向长文本处理与代码生成

适合长文本理解与生成 / 编程与 Agent 任务

短板低延迟实时对话

Q4 ~497GB / FP16 ~1808GB · MIT · 1M · llama.cpp需自查

证据10 个社区来源

第 34 期 · 2026-06-20
35B (3B激活)

3B活跃参数的通用Agent,自动研究/编程/推理

适合自动化机器学习与代码迭代 / 复杂推理与工具调用Agent

短板低延迟简单闲聊

35B (3B激活) · Apache-2.0 · 131k · transformers需自查

证据1243 下载 / 54 赞

4.63M

超小型英文TTS,总4.63M参数,适合本地/嵌入式实验

适合本地嵌入式TTS实验与演示 / 离线助手原型及效率研究

短板生产叙述与高保真音频生成

4.63M · Apache-2.0 · 未知 · pytorch需自查

证据121 赞 / 3 个社区来源

12B

混合量化Gemma-4-12B,8GB显存Pascal GPU代码生成

适合8GB显存本地代码生成 / 混合量化高效率推理

短板需全精度BF16或16GB+显存场景

12B · Apache-2.0 · 未知 · llama.cpp需自查

证据1420 下载 / 1 赞 / 9 个社区来源

427B

原生多模态 1M 上下文 MoE 模型,融合图文与视频理解,擅长编程及智能体协作

适合多模态长文档理解与跨图像、视频推理 / 复杂编程、工具调用与多步智能体任务

短板本地部署(显存需求极高,普通硬件无法运行),以及低延迟的简单分类或闲聊场景

Q4 ~282GB / FP16 ~1025GB · other · 未公开需自查

证据13 个社区来源

158.1B

284B MoE 架构,13B 激活参数,原生支持百万 Token 上下文,高效推理与强训练基线。

适合超长上下文理解与分析(百万 Token 级),如全库代码审查、长文档深度问答 / 复杂编程、数学竞赛题解与多步推理任务

短板本地个人设备部署(模型庞大,需专业多卡集群)及低延迟实时对话等高吞吐轻量场景

Q4 ~104GB / FP16 ~379GB · mit · 未公开可商用

证据11 个社区来源

861.6B

1.6T参数MoE旗舰,原生百万token上下文,开源模型新标杆。

适合高难度推理、编程与数学竞赛级任务 / 百万 token 超长文档分析与大规模代码库理解

短板本地部署(需专业级多卡服务器);简单闲聊或对延迟极敏感的应用。

Q4 ~569GB / FP16 ~2068GB · mit · 未公开可商用

证据11 个社区来源

1.1T

万亿参数 MoE 编码智能体,长周期复杂任务更省 token、工具调用更强

适合复杂长周期软件工程任务(多语言、全栈、基础设施等) / 需要工具调用/代码智能体的生产环境(如 MCP 工具链、自动化 Coworking)

短板不适合本地部署(1T 参数,仅限云端推理),也不适合纯粹的休闲闲聊等非工具性任务

Q4 ~699GB / FP16 ~2541GB · other · 未公开需自查

证据10 个社区来源

396.8B

面向真实生产力场景的智能体模型,统一推理、工具调用与执行闭环

适合复杂智能体工作流:编程、长程任务执行、工具调用与环境反馈闭环 / 深度研究、多步搜索与高难度推理评测

短板本地单卡部署(模型巨大,需多节点高端 GPU 集群)与低延迟轻量对话

Q4 ~262GB / FP16 ~952GB · apache-2.0 · 未公开可商用

证据12 个社区来源

225.8B

云端旗舰,225B 参数稀疏 MoE,专为智能体编程和长周期任务设计

适合复杂多步智能体编程与软件工程流水线 / 需要长上下文推理的代码生成、调试与修复

短板本地单机或个人设备部署(需超大规模 GPU 集群),不适合闲聊、简单问答等轻量任务

Q4 ~149GB / FP16 ~542GB · apache-2.0 · 未公开可商用

证据9 个社区来源

第 33 期 · 2026-06-19
350M

11 语言 ColBERT 检索模型,专为短文本 RAG 设计

适合多语言 RAG 流水线 / 消费级设备端语义搜索

短板长文档检索 (>512 tokens)

Q4 ~0.2GB / FP16 ~0.8GB · LFM Open License v1.0 · 32k · transformers需自查

证据103 下载 / 47 赞

350M

11语种双编码器,面向端侧语义检索

适合端侧本地语义搜索 (文件/邮件) / 跨语言 FAQ/知识库检索

短板长文档 (>512 tokens) 检索

Q4 ~0.2GB / FP16 ~0.9GB · lfm1.0 · 32k · sentence-transformers需自查

证据3734 下载 / 51 赞 / 3 个社区来源

第 32 期 · 2026-06-18
27B · GGUF·jackrong · GGUF·jackrong·MTP

面向代理编码与工具调用的27B推理模型

适合仓库级代码修复与代理任务 / 多轮工具调用与自动化脚本

短板通用对答与安全敏感应用

27B · Apache-2.0 · 32K · llama.cpp可商用

证据7218 下载 / 47 赞 / 2 个社区来源

27B

面向无思考代理编码的MTP微调版,本地GGUF推理

适合无思考代理编码循环 / 工具调用与 Shell 自动化

短板需要安全对齐的敏感场景

27B · Apache-2.0 · 256k · llama.cpp可商用

证据1543 下载 / 64 赞 / 10 个社区来源

31B

Gemma 4 31B风格微调,陈词减60%,角色扮演与创意写作。

适合低陈词滥调角色扮演 / 创意写作与叙事生成

短板正式文书写作与代码生成

Q4 ~22GB / FP16 ~78GB · apache-2.0 · 未知 · transformers可商用

证据278 下载 / 47 赞 / 15 个社区来源

第 31 期 · 2026-06-17
35B (3B 激活)

Qwen3.6基MoE代理编码模型(3B激活)

适合代理式编码(读/写/执行文件) / 自定义XML工具调用多轮对话

短板纯推理/通用聊天(可能Claude风格)

Q4 ~24GB / FP16 ~86GB · AGPL-3.0 · 未知 · vllm可商用

证据10 下载 / 72 赞

27B

基于 Qwen3.6 的推理与代码微调模型,面向本地部署与结构化助手

适合代码生成与调试 / 结构化指令跟随与推理

短板安全敏感或生产关键任务

27B · MIT · 未知 · transformers可商用

证据57 赞 / 4 个社区来源

3B

面向数学/代码/STEM的可验证推理3B小模型

适合数学/编程竞赛解题 / STEM可验证推理任务

短板工具调用/Agent编程

Q4 ~2GB / FP16 ~7.4GB · MIT · 64k · transformers可商用

证据196 赞 / 3 个社区来源

第 30 期 · 2026-06-16
15.5M

轻量级多语言文本检测模型,48语种,服务端/边缘可用

适合多语言文档扫描与表单检测 / 自然场景文字定位与艺术字检测

短板端到端文字识别 (需配合 rec 模型)

Q4 ~0GB / FP16 ~0.1GB · Apache-2.0 · 不适用 · paddleocr可商用

证据365 下载 / 50 赞 / 2 个社区来源

4B

轻量仓库探索子代理,供编码代理按需调用,减少 token 消耗

适合辅助编码代理定位仓库相关代码 / 降低主代理 token 消耗

短板独立对话或直接生成代码

Q4 ~2.7GB / FP16 ~9.7GB · MIT · 262k · transformers可商用

证据13 下载 / 100 赞 / 7 个社区来源

14B

基于 Qwen3 的 14B 代码模型 GGUF 量化,本地可跑

适合本地代码补全与生成 / 资源受限设备推理

短板已弃用,不建议新项目

14B · apache-2.0 · 未知 · llama.cpp可商用

证据896 下载 / 2 赞 / 1 个社区来源

14B

基于 Qwen3 的代码模型,GGUF 量化版,适合本地运行

适合本地代码生成(GGUF量化) / 低资源设备上的代码辅助

短板高精度代码推理(量化损失)

14B · apache-2.0 · 未知 · llama.cpp可商用

证据3100 下载 / 1 赞

第 29 期 · 2026-06-15
4B

4B 提示词增强与 Z-Image 文本编码器,本地双用途

适合本地提示词增强 / 替换 Z-Image 编码器双用途

短板通用对话或纯文本生成

Q4 ~2.7GB / FP16 ~9.7GB · Apache-2.0 · 未知 · transformers可商用

证据446 下载 / 51 赞 / 3 个社区来源

25.2B (3.8B活跃)

扩散多模态文本生成,3.8B活跃参数,NVFP4量化

  • 已量化

适合多模态文档/图像理解与问答 / 代码生成与函数调用代理

短板不保证事实准确性,不适合关键决策

Q4 ~9.5GB / FP16 ~35GB · Apache 2.0 (Gemma Terms) · 256k · vllm可商用

证据49.1k 下载 / 53 赞 / 7 个社区来源

unknown

精准时长控制与情感表达的中文零样本TTS

  • 人工精选

适合视频配音与对口型(时长精确可控) / 有声书/播客的情感化生成

短板对延迟敏感的实时流式交互(如实时对话助手)或主要面向英文的场景。

unknown · unknown · unknown需自查

证据5 个社区来源

第 28 期 · 2026-06-14
30B总 / 3B激活 · 原生 · GGUF

30B总/3B激活的MoE代码代理模型,专注代码生成与终端任务

适合本地代码生成与代理 / 带工具调用的自动化开发

短板非代码的通用对话

Q4 ~20GB / FP16 ~73GB · Apache-2.0 · 256K · transformers可商用

证据1784 下载 / 150 赞 / 3 个社区来源

未公开

基于 MoE 的多语言 TTS,支持零样本克隆与流式生成

适合零样本语音克隆与流式输出 / 中/英/日等多语种高保真合成

短板仅限 Linux+NVIDIA GPU

未公开 · apache-2.0 · 未知 · Mini-SGLang可商用

证据11 下载 / 56 赞 / 3 个社区来源

3B

Llama-3.2-3B 微调,GGUF 格式,给本地推理用户

适合资源受限的本地推理 / 轻量级对话与编排任务

短板高精度复杂推理

3B · unknown · 未知 · llama.cpp需自查

证据115 下载 / 3 个社区来源

7B

Qwen2 架构的阿/英指令模型 GGUF 量化

  • Apple Silicon

适合阿拉伯语/英语混合指令跟随 / 消费级设备本地推理

短板非阿拉伯语/英语任务

7B · apache-2.0 · 未知 · llama.cpp可商用

证据388 下载

12B

本地 Python 编程模型,离线解决算法问题

适合Python 算法题解答 / 本地离线编程助手

短板非 Python 任务和安全对话

12B · gemma · 131k · llama.cpp可商用

证据2433 下载 / 60 赞 / 11 个社区来源

第 27 期 · 2026-06-13
18B (2B active)

18B MoE预览模型,面向Bittensor SN24研究蒸馏

适合Bittensor SN24去中心化蒸馏 / 长上下文架构研究

短板生产级聊天或安全敏感应用

Q4 ~11GB / FP16 ~40GB · MIT · 5M (实验性配置) · transformers可商用

证据200 下载 / 59 赞 / 2 个社区来源

25.2B (3.8B active)

离散扩散文本生成,支持图像/视频输入,低延迟

适合低延迟多模态对话 / 图像/视频文本生成

短板不适宜高难度数学竞赛及长文本精确任务

25.2B (3.8B active) · Apache 2.0 · 256k · transformers可商用

证据17.7k 下载 / 212 赞 / 9 个社区来源

第 26 期 · 2026-06-12
1.2B

日英双语聊天模型,适合代理工作流与工具使用

适合代理工作流与工具调用 / 日英双语结构化输出

短板知识密集型问答

Q4 ~0.8GB / FP16 ~2.8GB · LFM1.0 · 32k · transformers需自查

证据3856 下载 / 61 赞 / 2 个社区来源

25B

Delphi扩展律研究基座,25B参数,终版模型

适合scaling law 研究与下游预测 / 基座模型微调实验

短板生产部署或指令跟随任务

Q4 ~16GB / FP16 ~60GB · apache-2.0 · 4k · transformers可商用

证据240 下载 / 3 赞 / 5 个社区来源

第 25 期 · 2026-06-11
31B · GGUF·unsloth · GGUF·google · GGUF·lmstudio

Gemma 4 31B 量化图文模型,支持工具调用,本地部署

适合多模态图文理解与工具调用 / 256K 长上下文推理

短板低延迟纯文本对话(小模型更佳)

31B · apache-2.0 · 256k · llama.cpp可商用

证据64.5k 下载 / 64 赞 / 10 个社区来源

1.5B

日语端到端语音对话,1.5B轻量实时交互

适合实时日语语音对话/客服 / 日语ASR转写与TTS合成

短板非日语语音识别与生成

Q4 ~1GB / FP16 ~3.5GB · LFM Open License v1.0 · 32k · liquid-audio需自查

证据534 下载 / 58 赞 / 3 个社区来源

20.8B (A4B 活跃)

LCB-medium 99%,12GB 级代码专家量化包

适合本地代码生成与评测 / 工具调用与多轮 agent

短板研究生级科学推理(GPQA 仅 48%)

20.8B (A4B 活跃) · apache-2.0 · 未知 · llama.cpp可商用

证据26.5k 下载 / 10 个社区来源

20B

20B搜索智能体,对标前沿检索性能

适合检索增强生成 (RAG) / 知识密集型问答与搜索

短板无检索需求的纯文本生成

Q4 ~14GB / FP16 ~50GB · unknown · 未知 · transformers需自查

证据902 下载 / 72 赞 / 3 个社区来源

未公开

Gemma 4 视觉模型 abliteration 版 GGUF 量化

适合本地视觉问答推理 / 无审查内容生成实验

短板需要安全过滤的生产环境

未公开 · gemma · 未知 · llama.cpp限制商用

证据1990 下载 / 1 赞 / 11 个社区来源

第 24 期 · 2026-06-10
12B

零拒绝消融Gemma 4,供对齐研究与红队测试

适合对齐研究与拒绝几何分析 / 红队安全评估与基准测试

短板生成造成实际伤害的内容

Q4 ~7.9GB / FP16 ~29GB · gemma · 未知 · transformers限制商用

证据8106 下载 / 129 赞 / 3 个社区来源

第 23 期 · 2026-06-09
未知

Ideogram 4 官方 NF4 量化,低显存本地出图

适合≤12GB 显存本地出图 / 创意设计、视觉探索

短板无损画质商业大片

未知 · other · 未知 · diffusers需自查

证据4963 下载 / 259 赞 / 5 个社区来源

35B (A3B)

面向编码与工具调用的智能体模型

适合长周期智能体任务与代码生成 / 工具调用与终端命令执行

短板无 GPU 环境或简单对话

Q4 ~23GB / FP16 ~84GB · apache-2.0 · 未知 · sglang可商用

证据518 下载 / 63 赞 / 2 个社区来源

第 22 期 · 2026-06-08
25.2B (3.8B active) · GGUF·unsloth · GGUF·lmstudio

Gemma 4 26B MoE 量化版,用于本地图像与文本推理

适合多模态文本/图像推理 / 256K 长上下文代码与代理

短板音频处理及低显存设备

25.2B (3.8B active) · Apache-2.0 (Gemma) · 256K · llama.cpp可商用

证据60k 下载 / 80 赞 / 11 个社区来源

7B

7B 视觉语言模型 GGUF 量化包,适合本地 VQA 与对话

适合视觉问答(VQA)实验 / 本地多模态对话原型开发

短板高精度视觉理解或生产部署

7B · Apache 2.0 · 未知 · llama.cpp可商用

证据201 下载 / 1 赞

第 21 期 · 2026-06-07
12B · GGUF·lmstudio · GGUF·google · GGUF·unsloth

Google Gemma 4 12B QAT GGUF,本地多模态推理

适合多模态文档理解与OCR / 代码生成与推理

短板移动端低内存设备

12B · Apache-2.0 · 256K · llama.cpp可商用

证据19.4k 下载 / 3 赞 / 9 个社区来源

27B

Apple Silicon的Qwen3.6-27B 4bit混合量化版

  • Apple Silicon
  • 已量化

适合Apple Silicon本地推理 / 代码/工具调用/Agent

短板非Apple Silicon设备

Q4 ~18GB / FP16 ~65GB · Apache-2.0 · 未知 · mlx-lm可商用

证据16.2k 下载 / 27 赞 / 7 个社区来源

27B

Qwen3.6-27B 的 MLX 推理加速版供苹果芯片

  • Apple Silicon
  • 已量化

适合Apple Silicon 本地代码生成 / 低延迟对话应用

短板非苹果芯片设备

Q4 ~3.1GB / FP16 ~11GB · Apache-2.0 · 未知 · mlx可商用

证据44.5k 下载 / 35 赞 / 13 个社区来源

2B

4-bit混合精度MLX量化Qwen3.5-2B,苹果芯片推理

  • Apple Silicon
  • 已量化

适合Apple Silicon本地推理及加速 / 代码生成与工具调用

短板长上下文检索 (HashHop 0%)

Q4 ~0.3GB / FP16 ~1GB · apache-2.0 · 未知 · mlx-lm可商用

证据3890 下载 / 9 赞 / 4 个社区来源

未知

文本到图像生成模型,Ideogram 4 的 FP8 量化版本

适合FP8 量化图像生成 / 艺术与设计原型

短板高精度原版生成

未知 · other · 未知 · diffusers需自查

证据2818 下载 / 313 赞 / 4 个社区来源

2B

Gemma 4 2B 指令 GGUF,本地推理

适合本地指令跟随 / 移动/边缘设备推理

短板长上下文任务

2B · apache-2.0 · 未知 · llama.cpp可商用

证据314 下载 / 7 个社区来源

4B

Google Gemma 4 量化版,本地消费级硬件推理

适合本地聊天助手 / 边缘设备文本生成

短板高吞吐生产环境(仅4B)

4B · Apache-2.0 · 未知 · llama.cpp可商用

证据419 下载 / 10 个社区来源

0.8B

苹果芯片4-bit MLX 量化 Qwen3.5-0.8B

  • Apple Silicon
  • 已量化

适合Apple Silicon 本地推理 / 工具调用与代码生成

短板非 Apple Silicon 平台

Q4 ~0.1GB / FP16 ~0.4GB · Apache 2.0 · 未知 · mlx-lm可商用

证据4860 下载 / 19 赞 / 5 个社区来源

35B-A3B

Apple Silicon 4-bit MLX混精量化+MTP投机解码

  • Apple Silicon
  • 已量化

适合Apple Silicon本地推理 / 代码/Agent/约束指令

短板非Apple Silicon平台

Q4 ~23GB / FP16 ~83GB · Apache-2.0 · 未知 · mlx可商用

证据9077 下载 / 14 赞 / 6 个社区来源

第 20 期 · 2026-06-06
4B

语音对话TTS:100+语种、零样克隆、情感/风格内联控制

适合语音对话代理与聊天机器人 / 多语种、情感可控的语音生成

短板商业用途或未经授权的声音克隆

Q4 ~3.1GB / FP16 ~11GB · Boson Research & Non-Commercial License · 8k · sglang-omni需自查

证据408 下载 / 116 赞 / 3 个社区来源

未公开

分钟级多镜头音视频长视频生成,面向研究者

适合长视频多镜头故事创作(含音频) / 交互式实时视频编辑

短板图像到视频生成(I2V 未支持)

未公开 · LTX-2 Community License (研究/非商用) · 未知 · 原生 PyTorch需自查

证据1424 下载 / 69 赞 / 4 个社区来源

第 19 期 · 2026-06-05
8.2B

面向数学证明的语义搜索嵌入模型,用于查找 mathlib 定理

适合查找 mathlib 定理 / 机器辅助证明检索

短板通用文本嵌入任务

Q4 ~5.4GB / FP16 ~20GB · Apache-2.0 · 未知 · transformers可商用

证据213 下载 / 2 赞 / 3 个社区来源

12B (2.5B active)

直接回答的指令模型,用于交互聊天、代码和工具调用

适合交互式聊天与代码辅助 / 工具调用与指令跟随

短板需显式推理的多步代理流

Q4 ~8GB / FP16 ~29GB · apache-2.0 · 131k · vllm可商用

证据1418 下载 / 48 赞 / 4 个社区来源

8B

基于 Sesame CSM 的对话 TTS 模型,支持语音上下文延续

适合高质量对话语音合成 / 从短音频提示生成语音延续

短板长篇有声书朗读

Q4 ~5.4GB / FP16 ~20GB · other · 2048 · pytorch需自查

证据76 赞 / 4 个社区来源

600M

覆盖40种语言的流式ASR,600M,可调延迟,面向实时语音代理

适合低延迟多语种语音转写 / 实时多语言语音代理

短板未微调的适配语种直接使用

600M · NVIDIA Open Model License · 未知 · nemo需自查

证据225 下载 / 102 赞 / 2 个社区来源

第 18 期 · 2026-06-04
6.3B

文本/图像生成音视频同步内容,支持多说话人音色控制

适合文本/图像生成带同步音频的视频 / 多说话人场景指定音色控制

短板单 GPU 实时推理或长于 10 秒视频

6.3B · Apache-2.0 · 未知 · torch可商用

证据159 下载 / 57 赞 / 2 个社区来源

40.1M

循环异构图语言模型,用于个性化微调与端侧推理

适合个性化语言模型冷启动训练 / 端侧或离线文本生成

短板事实性要求高的问答场景

Q4 ~0GB / FP16 ~0.1GB · Modified Apache 2.0 · 1024 · transformers需自查

证据134 下载 / 1 赞

12B · GGUF·lmstudio · GGUF·unsloth

12B 多模态模型,支持图文音频输入,本地 GGUF 量化部署

适合本地多模态聊天 / OCR 与文档理解

短板资源受限移动设备

12B · Apache 2.0 · 256k · llama.cpp可商用

证据124 下载 / 6 个社区来源

第 17 期 · 2026-06-03
8.3B (1.5B active) · 原生 · GGUF·liquidai · GGUF·unsloth

8.3B总参/1.5B活跃,面向端侧个人助手的混合架构模型

适合端侧个人助理及工具调用 / 多语言指令跟随与结构化输出

短板重度编程及无检索知识问答

Q4 ~5.6GB / FP16 ~20GB · LFM1.0 · 128k · llama.cpp需自查

证据107 赞 / 5 个社区来源

12B

思考型助手,在<think>块中输出推理链后给出最终答案

适合复杂代码调试与多步规划 / 数学竞赛与逻辑推理题

短板低延迟闲聊或直接指令回答

Q4 ~8GB / FP16 ~29GB · Apache 2.0 · 131k · vllm可商用

证据799 下载 / 103 赞 / 2 个社区来源

第 16 期 · 2026-06-02
6.3B

6.3B 文本生成同步音视频,支持多说话人音色控制

适合文本/图片生成 720p 同步音视频 / 多说话人音色控制配音视频

短板长于 10 秒视频或非中英文输入

6.3B · apache-2.0 · 文本 512 tokens · 最大 10 秒视频 · diffusers可商用

证据104 下载 / 49 赞

64B

文本生成高保真图像,面向物理AI与创作

适合物理世界场景生成 / 文本到高保真图像创作

短板安全关键任务与精确物理模拟

Q4 ~43GB / FP16 ~155GB · OpenMDW1.1 · 4k tokens (文本输入) · vLLM-Omni需自查

证据139 下载 / 50 赞 / 2 个社区来源

第 15 期 · 2026-06-01
9B

Qwen3.5-9B MoQ量化版,MTP推测解码,适合本地快速生成

适合本地内存受限下的9B模型推理 / 利用MTP推测解码加速文本生成

短板追求极致精度或官方全量模型的任务

9B · MIT · 32k · llama.cpp可商用

证据6044 下载 / 11 个社区来源

第 14 期 · 2026-05-31
35B (激活3B)

Qwen3.6-35B-A3B FP4量化版,面向vLLM高效推理

  • 已量化

适合AI Agent系统 / RAG与聊天机器人

短板有毒提示或偏见内容生成

Q4 ~12GB / FP16 ~45GB · Apache 2.0 · 262k · vllm可商用

证据67k 下载 / 46 赞 / 12 个社区来源

第 13 期 · 2026-05-30
1.7B

指令式多语言TTS,流式延迟低至97ms,9音色

适合低延迟实时语音交互(端到端97ms) / 多语言指令式配音(9音色,10语种)

短板需语音克隆的场景(应使用Base模型)

Q4 ~1.3GB / FP16 ~4.6GB · Apache-2.0 · 未公开 · transformers可商用

证据1821.2k 下载 / 1548 赞 / 9 个社区来源

第 12 期 · 2026-05-29
4B

1-bit量化文生图模型,专为Apple Silicon本地运行

  • Apple Silicon

适合Mac/iPhone/iPad本地生图 / 内存受限设备上运行扩散模型

短板高保真细节与复杂构图

4B · apache-2.0 · N/A · MLX可商用

证据15 赞 / 1 个社区来源

8.5B

零样本语音克隆多语言TTS模型,支持31种语言及显式暂停控制。

适合多语种有声内容生成 / 零样本个性化语音克隆

短板低延迟实时语音交互场景

Q4 ~5.6GB / FP16 ~20GB · Apache-2.0 · 未知 · transformers可商用

证据5447 下载 / 56 赞 / 4 个社区来源

4B

1.21GB三元文生图模型,4步采样,本地GPU运行

适合本地低显存GPU文生图创作 / 私有化部署与快速创意迭代

短板精细文字与严格构图约束

4B · Apache-2.0 · 不适用 · gemlite可商用

证据57 赞 / 2 个社区来源

4B

1.21GB 三元文生图扩散模型,苹果芯片本地运行

  • Apple Silicon

适合苹果芯片本地隐私图像生成 / 移动端快速创意迭代

短板精细文字、严格构图和细节要求高场景

4B · apache-2.0 · 不适用 · mlx可商用

证据36 赞 / 3 个社区来源

第 11 期 · 2026-05-28
1B · 原生 · GGUF

1B 模型 GGUF 量化,本地 agent 与边缘部署用

适合本地工具调用 agent / 边缘推理与桌面宠物

短板高吞吐量线上服务

Q4 ~0.7GB / FP16 ~2.6GB · apache-2.0 · 128k · llama.cpp可商用

证据2 下载 / 125 赞 / 3 个社区来源

第 10 期 · 2026-05-27
8B

昇腾原生1.58-bit三元LLM,推理内存降6x,保持95.7%性能

适合昇腾NPU上低内存推理 / 1.58-bit 三元量化研究

短板需BF16全精度的场景

8B · apache-2.0 · 未知 · transformers可商用

证据1202 下载 / 74 赞 / 3 个社区来源

第 9 期 · 2026-05-26
12B

文本到图像生成,用于开发者与创作者的视觉内容创建

适合高质量文本到图像生成 / 复杂语义与文字渲染

短板低显存或实时生成场景

12B · 非商业许可 · 不适用 · diffusers需自查

证据708.2k 下载 / 12.9k 赞 / 8 个社区来源

30B (3B active)

为ARO语言微调的代码生成器,4bit量化,供ARO DSL开发者使用

  • Apple Silicon
  • 已量化

适合生成ARO语言代码片段 / 辅助学习ARO DSL语法

短板非ARO语言的通用编程

Q4 ~0.8GB / FP16 ~3.1GB · MIT · 未知 · mlx可商用

证据383 下载

未公开

像素扩散解码器,将潜在表征一步超分至2K/4K图像

适合从LDM潜在空间直接生成2K/4K图像 / 一步完成解码与超分辨率

短板生产环境或商业生成

未公开 · NVIDIA Internal SRDML (仅限研究) · N/A · pytorch需自查

证据10 下载 / 62 赞 / 3 个社区来源

1.7B

面向远场、混响、重叠语音等严重声学退化的鲁棒语音识别

适合严重噪声、混响、剪切、限带语音转录 / 远场、重叠语音、低质量录音识别

短板安静环境下的高保真转写

1.7B · apache-2.0 · 未知 · PyTorch可商用

证据59 赞 / 1 个社区来源

第 8 期 · 2026-05-25
未公开

多说话人分割模型,从音频中区分谁在何时说话

适合会议转录说话人分离 / 多角色电话录音分割

短板低资源实时流式处理

未公开 · mit · 不适用(音频长度可分批) · pyannote.audio可商用

证据10040.3k 下载 / 1946 赞 / 8 个社区来源

1.8B

轻量多语言翻译模型,支持 llama.cpp 本地部署

适合多语言文本翻译(33 种语言) / 边缘设备离线翻译部署

短板非翻译类文本生成

1.8B · apache-2.0 · 未知 · llama.cpp可商用

证据8515 下载 / 50 赞 / 3 个社区来源

第 7 期 · 2026-05-24
27B · GGUF·jackrong·MTP · GGUF·jackrong

多Token预测推理模型,面向编码、数学、DevOps开发者

适合代码生成与系统设计 / 数学推导与复杂逻辑推理

短板生产关键任务(社区实验模型)

27B · Apache 2.0 · 128k · llama.cpp可商用

证据3532 下载 / 63 赞 / 3 个社区来源

26.9B

移除拒绝回路,能力保持,本地全栈部署

适合本地低拒答文本生成 / 拒绝消融与红队研究

短板生产环境用户产品(需安全控制)

Q4 ~18GB / FP16 ~65GB · apache-2.0 · 8192 · transformers可商用

证据1863 下载 / 53 赞 / 10 个社区来源

3.8B

3.8B文本生成图像基础模型,高效训练与高分辨率生成

适合高分辨率(1440×1440)图像生成 / 密集描述与多语言提示跟随

短板生产环境与商业产品部署

3.8B · MIT · 未知 · diffusers可商用

证据296 下载 / 52 赞 / 3 个社区来源

第 6 期 · 2026-05-23
3.8B

3.8B 高效文生图,4 步蒸馏,为开发者与创作者快速生成

适合快速 4 步高分辨率图像生成 / 多语言提示与宽高比灵活生成

短板商业产品或服务部署

3.8B · MIT · 未知 · diffusers可商用

证据116 下载 / 48 赞 / 9 个社区来源

第 5 期 · 2026-05-22
8B

三元1.58-bit量化8B模型,苹果芯片本地推理

  • Apple Silicon

适合苹果设备本地AI助手 / 离线文本生成与隐私保护

短板非苹果设备或服务器端部署

Q4 ~0.4GB / FP16 ~1.5GB · Apache-2.0 · 65k · mlx可商用

证据16.4k 下载 / 101 赞 / 3 个社区来源

8B

Llama-3-8B 4-bit版,M系列芯片本地推理

  • Apple Silicon

适合Mac本地聊天与文本生成 / 离线隐私敏感场景

短板非Apple Silicon设备(需MLX)

Q4 ~1.1GB / FP16 ~4.1GB · llama3 · 8k · mlx-lm需自查

证据10.5k 下载 / 81 赞 / 6 个社区来源

第 4 期 · 2026-05-21
35B (3B 激活) · GGUF·unsloth · GGUF·lmstudio · GGUF·unsloth·MTP

35B MoE仅3B激活的GGUF量化版,适合本地中文开发

适合本地中文对话与代码补全 / 低内存占用(3B激活)的MoE推理

短板复杂数学或长链逻辑推理

35B (3B 激活) · apache-2.0 · 262k (可扩展至1M) · llama.cpp可商用

证据2569.1k 下载 / 1052 赞 / 14 个社区来源

未知

谷歌 Gemma 4 指令模型 GGUF 量化版,本地高效部署

适合本地代码生成与补全 / 轻量级聊天机器人原型开发

短板高精度复杂推理任务

未知 · apache-2.0 · 未知 · llama.cpp可商用

证据267.3k 下载 / 12 赞 / 16 个社区来源

9B · GGUF·jackrong·MTP · GGUF·jackrong

9B多令牌预测代码模型,GGUF量化,面向代码推理

适合本地代码生成与补全 / 高吞吐 Agent 代码推理

短板长上下文推理或非量化高精度需求

9B · apache-2.0 · 128k · llama.cpp可商用

证据6680 下载 / 51 赞 / 2 个社区来源

27B · GGUF·unsloth · GGUF·lmstudio · GGUF·unsloth·MTP

27B参数GGUF版,本地AI原型开发

适合多轮对话与长文本处理 / 本地量化模型快速验证

短板生产环境高并发API

27B · apache-2.0 · 262k (可扩展至1M) · llama.cpp可商用

证据1845.9k 下载 / 692 赞 / 13 个社区来源

30B (3B 激活)

NVIDIA 多模态推理模型 GGUF 量化版,本地推理用

适合本地多模态对话 / 图像理解与推理

短板生产级高并发推理

30B (3B 激活) · NVIDIA Open Model Agreement · 未知 · llama.cpp

证据168.9k 下载 / 8 赞 / 2 个社区来源

26B (4B活跃)

26B总参/4B活跃的MoE指令模型,面向本地推理

适合本地聊天与指令跟随 / 资源受限环境文本生成

短板高精度复杂推理

26B (4B活跃) · Apache-2.0 · 128k · llama.cpp可商用

证据321.4k 下载 / 24 赞 / 13 个社区来源

31B

Google 31B 指令模型 GGUF 量化版,本地消费级硬件推理

适合本地高参数量指令遵循与对话 / 长上下文理解与 RAG 应用

短板4GB 以下显存设备运行

31B · apache-2.0 · 未知 · llama.cpp可商用

证据340.4k 下载 / 25 赞 / 12 个社区来源

4B

Gemma4-4B-it 量化版, 本地轻量推理

适合本地轻量指令跟随与聊天 / 消费级 GPU/CPU 推理

短板复杂推理与多语言长文本

4B · apache-2.0 · 未知 · llama.cpp可商用

证据1229.1k 下载 / 38 赞 / 10 个社区来源

4B

文档结构化提取和Markdown转换的4B视觉语言模型

适合发票/合同/表格等文档JSON结构化提取 / 图片/扫描PDF转Markdown供RAG使用

短板通用图像问答或纯文本生成

Q4 ~3GB / FP16 ~11GB · Apache-2.0 · 131k · vllm可商用

证据1720 下载 / 45 赞 / 2 个社区来源

14B

三模式 LM (AR/扩散/自推测),为 AI 应用开发者提供高效生成

适合高吞吐对话生成(自推测解码) / 边缘设备单用户加速推理(DGX Spark)

短板长文本场景(上下文长度未公开)

Q4 ~8.9GB / FP16 ~32GB · NVIDIA Nemotron Open Model License · 未知 · transformers

证据65 下载 / 44 赞 / 4 个社区来源

9B

Qwen3.5-9B 多模态模型,MTP 投机解码,本地快速运行

适合多模态图像理解与文档分析 / 本地 Agent 工具调用场景

短板多进程推理或 mmproj 场景

9B · apache-2.0 · 262k (可扩展至1M) · llama.cpp可商用

证据53k 下载 / 46 赞 / 6 个社区来源

2.7B

MiniMax M2.7 GGUF量化版,适合本地部署与实验

适合低成本本地推理实验 / 对话与文本生成原型

短板复杂逻辑推理与长篇生成

2.7B · other · 未知 · llama.cpp

证据13.6k 下载 / 2 赞 / 4 个社区来源

30B

IBM Granite 30B GGUF量化, 本地部署与推理

适合本地推理与微调基线 / 通用文本生成与对话

短板需高精度、无损推理的任务

30B · Apache 2.0 · 未知 · llama.cpp可商用

证据982 下载 / 3 个社区来源

3B

IBM Granite 4.1 3B GGUF量化,本地推理与边缘部署

适合本地CPU推理 / 轻量级文本生成助手

短板高精度推理或长上下文

3B · Apache-2.0 · 未知 · llama.cpp可商用

证据582 下载 / 4 个社区来源

8B

IBM Granite 4.1 8B的GGUF量化,用于本地推理

适合本地CPU推理 / 低资源设备文本生成

短板高并发生产环境

8B · apache-2.0 · 未知 · llama.cpp可商用

证据1015 下载 / 4 个社区来源

7B

Apple芯片上本地运行的Llama2 7B对话模型

  • Apple Silicon

适合Apple芯片本地聊天机器人开发 / 离线文本生成与原型测试

短板非Apple芯片或NVIDIA GPU推理

7B · llama2 · 4096 · mlx限制商用

证据4057 下载 / 85 赞 / 6 个社区来源

第 3 期 · 2026-05-20
8B

Apple Silicon 的 1-bit LLM,端侧极低内存推理

  • Apple Silicon

适合iPhone/Mac 本地隐私推理 / 移动端及边缘低功耗部署

短板需全精度浮点的高敏感任务

Q4 ~0.3GB / FP16 ~0.9GB · Apache-2.0 · 65k · mlx可商用

证据15k 下载 / 206 赞 / 4 个社区来源

26B (4-bit)

Gemma4 26B 无审查 MLX, 本地代理加速

  • Apple Silicon
  • 已量化

适合代码与工具使用代理 / 无审查对话与指令跟随

短板视觉或多模态任务

Q4 ~17GB / FP16 ~61GB · gemma · 未知 · mlx限制商用

证据25.7k 下载 / 236 赞 / 9 个社区来源

577M

覆盖4000+语言的语音基础模型,供ASR/翻译微调

  • Apple Silicon

适合多语言语音识别微调 / 语音翻译与语音tokenization

短板不微调直接用于生产ASR

577M · CC BY-NC-SA 4.0 · 未知 · espnet不可商用

证据149 下载 / 148 赞 / 2 个社区来源

1.55B

Apple Silicon 上运行的 Whisper 语音识别模型

  • Apple Silicon

适合Mac 本地离线语音转录 / 与 MLX 生态无缝集成

短板非 Apple Silicon 设备

1.55B · MIT · 30s 音频片段 · mlx可商用

证据151.4k 下载 / 81 赞 / 3 个社区来源

0.5B

为开发者输出最少代码行的可运行代码

  • Apple Silicon

适合输出最少代码行的可运行代码 / Apple Silicon本地推理

短板非Python或复杂软件项目

0.5B · Apache-2.0 · 32k · mlx-lm可商用

证据437 下载 / 187 赞 / 5 个社区来源

1B

1B预对齐前缀LM,用前缀条件做结构化输出与推理

适合Few-shot 直接答案提取(direct前缀) / 复合条件 CoT 推理(synth,cot前缀)

短板聊天对话与代码生成

Q4 ~0.8GB / FP16 ~2.8GB · Apache-2.0 · 4096 · transformers可商用

证据884 下载 / 112 赞 / 3 个社区来源

809M

Mac端Whisper large-v3-turbo,MLX低延迟转写

  • Apple Silicon

适合Mac本地离线语音转写 / 低延迟实时字幕生成

短板非Apple Silicon设备

809M · unknown · 30s · mlx

证据32.7k 下载 / 93 赞 / 3 个社区来源

未公开

LTX-2.3模型的ComfyUI工作流集合,用于图像/视频生成。

适合快速搭建图像/视频到视频流水线 / image-to-video等多媒体生成任务

短板不使用ComfyUI的纯脚本生成

未公开 · unknown · 未知 · ComfyUI

证据589 赞 / 3 个社区来源

第 2 期 · 2026-05-18
26B

无审查Gemma 4 26B GGUF,适合苹果硅本地快速推理

适合本地苹果硅无审查对话 / 快速编程与韩语任务

短板需严格内容审核的场景

26B · gemma · 未知 · llama.cpp限制商用

证据267.4k 下载 / 624 赞 / 9 个社区来源

9B

像素空间文生图模型,基于AsymFlow,适合文字渲染与细节生成

适合高质量文本渲染的生成 / 需要精细细节的艺术创作

短板低显存设备或实时推理

9B · flux-non-commercial-license · N/A · diffusers

证据1608 下载 / 49 赞 / 4 个社区来源

1.74B

多模态嵌入模型,支持文本/图像/视频/音频

适合多模态检索与RAG / 跨模态零样本分类与聚类

短板仅需文本嵌入的轻量场景

Q4 ~1.1GB / FP16 ~3.9GB · cc-by-nc-4.0 · 32768 · transformers不可商用

证据28.9k 下载 / 49 赞 / 4 个社区来源

500M

日语TTS,表情符号控制风格,零样本克隆

适合零样本日语语音克隆 / 表情符号驱动风格与音效控制

短板非日语文本或需精确汉字阅读

Q4 ~0.3GB / FP16 ~1.2GB · MIT · 未知 · pytorch可商用

证据67 赞 / 4 个社区来源

4B

无审查的Gemma 4多模态模型,适合内容生成开发者

适合无审查的多模态聊天应用 / 本地图像/音频内容生成

短板需安全合规的生产环境

4B · Gemma · 131k · llama.cpp限制商用

证据796.4k 下载 / 607 赞 / 9 个社区来源

26B (25.2B total, 3.8B active)

Gemma4 无审查多模态 MoE,面向创意写作与角色扮演

适合创意写作与角色扮演 / 多模态图片-文本对话

短板高复杂度 agentic 编程任务

26B (25.2B total, 3.8B active) · Apache-2.0 · 256K · llama.cpp可商用

证据40.3k 下载 / 53 赞 / 7 个社区来源

未公开

LTX2.3 微调的图生视频 GGUF 模型,用于 ComfyUI

适合图像首帧到视频生成 / 对话与动作驱动的视频生成

短板高分辨率或长片段生成

未公开 · unknown · 未知 · ComfyUI

证据71.5k 下载 / 65 赞 / 4 个社区来源

第 1 期 · 2026-05-16
613M

为开发者提供600+语言零样本语音合成

适合全球多语种语音合成与声音克隆 / 创意声音设计与非语言符号表达

短板实时流式对话系统

Q4 ~0.4GB / FP16 ~1.5GB · apache-2.0 · 不适用 · omnivoice可商用

证据2087.6k 下载 / 890 赞 / 10 个社区来源

99M

31种语言本地TTS,面向AI应用开发者的语音合成

适合多语言离线语音合成 / 低资源设备端实时TTS

短板语音克隆与高拟真度需求

99M · OpenRAIL-M · 未知 · ONNX Runtime限制商用

证据16.5k 下载 / 258 赞 / 4 个社区来源

40B

多模态无审查推理模型,面向代码与视觉应用

适合无审查代码生成与推理 / 多模态图像理解

短板需要内容过滤的生产场景

40B · apache-2.0 · 未知 · llama.cpp可商用

证据207.1k 下载 / 94 赞 / 2 个社区来源

4B

动漫风格图像生成,面向二次元AI应用开发者

适合生成动漫风格插画 / 二次元角色设计

短板写实照片生成

4B · apache-2.0 · 未知 · diffusers可商用

证据14.5k 下载 / 384 赞 / 4 个社区来源

22B · 原生 · GGUF

图像到视频基座模型,GGUF量化版,适合本地推理

适合本地图像到视频生成推理 / 低资源设备快速原型

短板高分辨率长视频生成

22B · other · 未知 · llama.cpp

证据875.4k 下载 / 1004 赞 / 9 个社区来源

14B

通用问答模型,适合知识型对话与事实查询。

适合知识问答 / 事实查询

短板复杂推理或创意生成

14B · apache-2.0 · 未知 · transformers可商用

证据11k 下载 / 113 赞

600M

600M参数早期检查点,面向低资源多语言部署

适合低内存/边缘设备部署 / 英印多语言文本生成

短板生产环境或最终模型

Q4 ~0.4GB / FP16 ~1.5GB · apache-2.0 · 2048 · transformers可商用

证据8324 下载 / 57 赞 / 3 个社区来源

35B

35B MoE多模态去审查模型,适合本地无限制输出

  • 人工精选

适合创意写作与角色扮演(无内容过滤) / 本地多模态应用(图像理解/生成式交互)

短板生产环境需内容审查、低显存(<16GB)或对输出安全性有严格要求的场景。

35B · apache-2.0 · unknown可商用

证据1320.8k 下载 / 646 赞 / 3 个社区来源

未知

通用文本转语音,面向配音与有声内容制作者

适合多角色配音生成 / 有声书合成

短板低延迟实时语音场景

未知 · other · 不适用 · huggingface_hub

证据869 下载 / 96 赞 / 3 个社区来源

未公开

文本到图像扩散模型,面向 AI 应用构建者

适合风格化视觉内容生成 / 集成到自动化绘图管线

短板要求照片级真实感的生产任务

未公开 · cc-by-nc-4.0 · 未公开 · diffusers不可商用

证据17.2k 下载 / 68 赞 / 4 个社区来源

未公开

TTS 模型,面向语音合成开发者

适合文本转语音合成 / AI 语音内容制作

短板高并发实时语音服务

未公开 · other · 未知 · 未公开

证据176 下载 / 65 赞 / 4 个社区来源

查看全部模型 归档 →