多语言文本嵌入,NVFP4 量化,专为 RAG 和检索设计
- 已量化
适合多语言 RAG 检索 / 语义搜索与问答
短板生成式任务(仅输出嵌入向量)
Q4 ~0.5GB / FP16 ~1.8GB · OpenMDW-1.1 · 32k · vllm需自查
证据6682 下载 / 55 赞
来自 HuggingFace · 值得本地跑的开源模型 · 共 214 个
根据任务、硬件和许可,找到真正能跑的模型
显存档为包含式(更低显存也能跑的模型一并计入,数值取 Q4 量化后估算);任务内多选取并集,不同行之间取交集。
0 / 214 个模型匹配
没有同时满足所选条件的模型,试着去掉一个筛选。
按收录日期排列 · 共 214 个
多语言文本嵌入,NVFP4 量化,专为 RAG 和检索设计
适合多语言 RAG 检索 / 语义搜索与问答
短板生成式任务(仅输出嵌入向量)
Q4 ~0.5GB / FP16 ~1.8GB · OpenMDW-1.1 · 32k · vllm需自查
证据6682 下载 / 55 赞
2-bit 量化 MLX 模型,专为 Apple Silicon 推理
适合Apple Silicon 设备本地推理 / 极低内存占用(约 6 GB)
短板高精度文本生成
Q4 ~14GB / FP16 ~50GB · Apache 2.0 · 未知 · mlx需自查
证据283 下载
面向硬件音乐设备的本地助手,基于Qwen3-4B微调
适合回答硬件乐器操作问题 / 生成结构化的分步动画指令
短板商业用途或安全关键决策
Q4 ~2.6GB / FP16 ~9.6GB · cc-by-nc-4.0 · 未知 · mlx需自查
证据819 下载
多阶段微调的27B视觉模型,提升推理与创意写作
适合推理与编码 / 创意写作与角色扮演
短板内容安全敏感场景
Q4 ~18GB / FP16 ~65GB · Apache 2.0 · 256k · ollama需自查
证据9575 下载 / 64 赞 / 8 个社区来源
无审查视觉 MoE 模型,Hermes 工具调用,GGUF 本地推理
适合无审查对话与多模态问答 / 本地 agent 工具调用
短板需安全审查的生产环境
Q4 ~23GB / FP16 ~84GB · Apache-2.0 · 262K (可扩展至 1M) · llama.cpp需自查
证据13.4k 下载 / 57 赞 / 4 个社区来源
多语言文本嵌入模型,面向RAG检索与语义搜索。
适合多语言RAG检索增强生成 / 代码语义搜索与匹配
短板不适用于文本生成或对话
Q4 ~5.3GB / FP16 ~19GB · OpenMDW-1.1 · 32768 · transformers需自查
证据14k 下载 / 52 赞
多语言文本嵌入模型,用于语义搜索与 RAG
适合多语言语义搜索 / RAG 系统的检索组件
短板不适用于文本生成
Q4 ~0.8GB / FP16 ~2.7GB · OpenMDW-1.1 · 32768 · transformers需自查
证据46.3k 下载 / 60 赞
70+语言语音识别,关注俄语、哈萨克语等小语种
适合俄/哈/吉/乌语等小语种 ASR / 多语言语音转录服务
短板英语高精度 ASR
Q4 ~0.1GB / FP16 ~0.5GB · mit · 未知 · transformers需自查
证据2399 下载 / 52 赞
俄语及中亚语言离线语音转录,Apple Silicon 用
适合俄语/哈/吉/乌语离线转写 / macOS Apple Silicon 低资源占用 ASR
短板英语及高噪声实时流式场景
Q4 ~0.1GB / FP16 ~0.4GB · MIT · 不适用 · mlx需自查
证据124 下载 / 3 个社区来源
Apple Silicon 本地离线俄哈吉乌语 ASR,MLX 量化
适合俄/哈/吉/乌语离线转写 / Apple Silicon 本地低延迟 ASR
短板英文或流式实时转录
Q4 ~0.1GB / FP16 ~0.5GB · MIT · 未知 · mlx需自查
证据101 下载
Qwen3.6 MoE 量化版,Apple Metal 加速推理
适合Apple Silicon 本地聊天 / 低内存 MoE 研究
短板非 Apple Metal 平台
Q4 ~23GB / FP16 ~84GB · apache-2.0 · 未知 · llama.cpp需自查
证据102 下载
1B 工具调用思考模型 GGUF 量化,本地运行
适合工具调用与函数调用 / 代码生成与调试
短板高精度复杂推理任务
Q4 ~0.7GB / FP16 ~2.4GB · Apache-2.0 · 128k · llama.cpp需自查
证据3691 下载 / 94 赞
1-bit 27B 模型, 可在手机和笔记本本地运行推理
适合手机端本地27B推理 / 262K长上下文处理
短板复杂智能体编程任务
Q4 ~18GB / FP16 ~65GB · apache-2.0 · 262K · mlx需自查
证据23 下载 / 64 赞 / 3 个社区来源
腾讯 Hy3 混合精度 GGUF,针对本地受限硬件极限压缩
适合H20 单卡/双卡本地推理 / 带自推测解码的低延迟生成
短板生产环境高并发在线服务
未公开 · apache-2.0 · 65536 · llama.cpp需自查
证据107 赞
网络安全领域8B微调模型, 本地离线运行红蓝队工具
适合渗透测试与漏洞分析辅助 / CTF 竞赛和安全代码审查
短板通用对话或未经人工审核的安全决策
Q4 ~5.3GB / FP16 ~19GB · llama3.1 · 2k · ollama需自查
证据51.1k 下载 / 87 赞
1B 思考模型,改进编码与指令遵循,适合本地部署
适合代码生成与调试 / 需要推理的指令遵循
短板高难度通用推理
Q4 ~0.7GB / FP16 ~2.6GB · Apache-2.0 · 128k · transformers需自查
证据3483 下载 / 129 赞 / 2 个社区来源
未审查文本生成模型,卡信息缺失
适合无限制对话 / 创意写作
短板需要内容安全过滤的场景
Q4 ~3.3GB / FP16 ~12GB · 未知 · 未知 · transformers需自查
证据3666 下载 / 23 赞
多语言翻译 MoE 模型的 APEX 量化版,供本地 GGUF 推理
适合多语种离线文本翻译 / 本地资源受限设备翻译服务
短板需要在线 API 的场景
Q4 ~20GB / FP16 ~72GB · Apache-2.0 · 未知 · llama.cpp需自查
证据316 下载 / 1 赞
GGUF 量化,解禁角色扮演与图像描述
适合无审查角色扮演对话 / 图像内容描述
短板高精度视觉推理任务
Q4 ~2.6GB / FP16 ~9.6GB · apache-2.0 · 未知 · ollama需自查
证据310 下载
27B 1-bit 量化模型,面向笔记本与手机本地推理
适合本地隐私推理,笔记本/手机可用 / 262K 上下文,数学与编程任务
短板长期 agent 编码与多文件重构
Q4 ~18GB / FP16 ~65GB · Apache 2.0 · 262K · llama.cpp需自查
证据513 下载 / 62 赞 / 3 个社区来源
三元权重 27B 推理模型,笔记本本地运行
适合笔记本端侧推理 27B 模型 / 长上下文 (262K) 离线分析
短板手机直接部署
Q4 ~18GB / FP16 ~65GB · Apache-2.0 · 262K · llama.cpp需自查
证据23 下载 / 105 赞 / 1 个社区来源
三元2-bit 27B开源模型,笔记本本地运行推理
适合笔记本端27B推理(~26 tok/s) / 离线/隐私场景长文本理解
短板手机端部署与长链条代理编码
Q4 ~18GB / FP16 ~65GB · apache-2.0 · 262k · mlx需自查
证据6 下载 / 13 赞 / 3 个社区来源
Wings of Fire 世界观角色扮演, 支持链式思维
适合WoF/奇幻世界观叙事 / 推理链辅助角色扮演
短板通用问答/编程
Q4 ~20GB / FP16 ~74GB · Apache-2.0 · 未知 · ollama需自查
证据5924 下载 / 2 赞 / 10 个社区来源
4bit MoE本地运行于Apple Silicon
适合Apple Silicon本地高效推理 / 代码与数学问题求解
短板需要高精度BF16的场景
Q4 ~20GB / FP16 ~72GB · nvidia-open-model-license · 未知 · mlx需自查
证据855 下载 / 2 赞 / 4 个社区来源
4-bit MLX 量化,Apple Silicon 本地运行文本生成
适合Apple Silicon 本地大模型推理 / 敏感层 8-bit 保精度的代码/指令任务
短板显存<16GB 设备运行受限
Q4 ~23GB / FP16 ~84GB · apache-2.0 · 128k · mlx需自查
证据720 下载 / 3 赞 / 10 个社区来源
MLX VQ量化35B MoE,适合Apple Silicon本地推理
适合本地日常对话与文本生成 / 资源受限的Apple设备推理
短板云端大规模部署或高精度任务
Q4 ~23GB / FP16 ~84GB · Apache-2.0 · 128k · mlx需自查
证据524 下载 / 2 赞 / 15 个社区来源
Apple Silicon 本地 4-bit 混合精度量化文本生成模型
适合本地代码/推理/工具调用任务 / Apple Silicon 上的高精度轻量部署
短板需 NVIDIA GPU 的部署场景
Q4 ~5.9GB / FP16 ~21GB · apache-2.0 · 128k · mlx需自查
证据12k 下载 / 78 赞 / 8 个社区来源
修复循环生成并保留1M上下文推理能力的研究型模型
适合长文本推理与代码生成 / 未过滤的研究与安全测试
短板需要高吞吐编码辅助的场景
Q4 ~6.4GB / FP16 ~23GB · Apache-2.0 · 1048k · vllm需自查
证据993 下载 / 71 赞 / 4 个社区来源
Krea-2 Turbo 风格化 LoRA,电影感氛围增强
适合艺术风格增强 / 电影感氛围生成
短板精确物体形状控制
未公开 · apache-2.0 · 未知 · diffusers需自查
证据1577 下载 / 73 赞 / 1 个社区来源
Apple Silicon 上 Claude-Code 式本地编码代理
适合苹果芯片本地编码代理 / 低资源Mac代码生成/对话
短板16/18 GB 内存 Mac 不可用
Q4 ~23GB / FP16 ~83GB · unknown · 未知 · mlx需自查
证据818 下载 / 3 个社区来源
阿拉伯语自动语音识别 (ASR) 模型
适合阿拉伯语音频转文字 / 会议/播客字幕生成
短板非阿拉伯语识别
Q4 ~1.4GB / FP16 ~5GB · unknown · 未知 · transformers需自查
证据5948 下载 / 78 赞
统一音频-文本语言模型,支持语音识别、翻译、TTS 与音频生成
适合语音识别与翻译、音频问答 / 文本转语音、音频生成
短板商业用途 (非商用许可)
Q4 ~1.3GB / FP16 ~4.8GB · NVIDIA OneWay Noncommercial License · 128k · vllm需自查
证据1050 下载 / 53 赞 / 3 个社区来源
风格参考 LoRA,将参考图风格注入 Krea2 Turbo 生成
适合风格一致的图像生成 / 基于参考图的风格迁移
短板无参考图的标准文生图
未公开 · krea-2-community-license · 不适用 · diffusers需自查
证据1463 下载 / 54 赞 / 4 个社区来源
流式自回归 TTS,面向实时对话与语音代理
适合实时语音代理 / 流式对话与配音
短板精确声纹匹配任务
Q4 ~0.4GB / FP16 ~1.3GB · Apache 2.0 (codec: NVIDIA Open Model License) · 未知 · vllm需自查
证据1468 下载 / 62 赞
视觉语言模型,思考令牌减半,GGUF量化,适合本地运行
适合需要思维链但希望节省Token成本 / 本地视觉问答与推理部署
短板长链深度推理,精度可能略降
Q4 ~18GB / FP16 ~65GB · unknown · 未知 · llama.cpp需自查
证据298.8k 下载 / 57 赞 / 10 个社区来源
Claude Opus推理蒸馏并反审查的27B模型GGUF版
适合复杂推理与多步逻辑 / 创意写作与无过滤对话
短板安全合规的生产环境
Q4 ~18GB / FP16 ~65GB · apache-2.0 · 256K · llama.cpp需自查
证据132 下载 / 14 个社区来源
82M 参数轻量 TTS 模型,支持多语言,可本地部署
适合本地/边缘设备语音合成 / 成本敏感的 API 服务
短板声音克隆/自定义音色
Q4 ~0.1GB / FP16 ~0.2GB · apache-2.0 · 未知 · kokoro需自查
证据13509.8k 下载 / 6479 赞 / 10 个社区来源
面向高吞吐推理的压缩 MoE 模型,用于交互式推理与高并发部署
适合高并发聊天与代理部署 / 推理密集与长上下文任务
短板非 Blackwell GPU 低显存设备
Q4 ~29GB / FP16 ~107GB · OpenMDW-1.1 · 1M · vllm需自查
证据47 下载 / 66 赞 / 4 个社区来源
音频-文本统一LLM,兼顾文本推理与语音/音频生成
适合音频理解、语音识别与翻译 / 文本-语音/音频生成与对话
短板商业部署(非商业许可)
Q4 ~20GB / FP16 ~72GB · NVIDIA Oneway Noncommercial License · 1M · vllm需自查
证据67 赞
51M 参数边缘路由器, 判断提示词复杂度并分发至本地或云端模型
适合边缘设备请求分流 / 多模型架构网关决策
短板直接文本生成
Q4 ~0GB / FP16 ~0.1GB · unknown · 3840 · transformers需自查
证据269 下载 / 65 赞
LTX-2.3 身份保持 LoRA,单参考图加提示生成人物视频
适合单参考图驱动的人物视频生成 / 数字人/虚拟形象的身份一致创作
短板全身体态、大角度或遮挡人像
Q4 ~15GB / FP16 ~53GB · other · 未知 · ComfyUI需自查
证据44 赞 / 2 个社区来源
紧凑推理微调,减少冗余推理轨迹,降低推理token消耗
适合低成本推理服务 / 数学与代码紧凑推理
短板需要长推导的复杂推理
Q4 ~7.9GB / FP16 ~29GB · other · 未知 · transformers需自查
证据797 下载 / 47 赞 / 3 个社区来源
无审查 Qwen3.5-9B 微调,用于网络安全与生物医学
适合网络安全工具开发 / 长上下文无审查对话
短板需要内容过滤的生产环境
Q4 ~5.9GB / FP16 ~22GB · apache-2.0 · 1M · ollama需自查
证据4035 下载 / 49 赞
三元专家量化版,9.4 GB 全量跑在 16 GB Mac 上
适合本地聊天与问答 / 一次性代码生成与摘要
短板Agent 工具链循环与多步代码修复
Q4 ~19GB / FP16 ~69GB · Apache-2.0 · 未知 · mlx需自查
证据414 下载 / 13 个社区来源
35B MoE 视觉 Agent,用于长程搜索与工具调用
适合长程搜索与信息检索 / 科学推理与工程任务
短板纯文本闲聊
Q4 ~23GB / FP16 ~84GB · Apache 2.0 · 262k · vllm需自查
证据92 下载 / 78 赞 / 1 个社区来源
深度条件图像生成,保持输入图像3D结构,用于风格迁移与内容变换
适合保留输入图像三维结构的风格迁移 / 场景重照明、视角一致的景物变换
短板平面插画转深度控制效果弱
862MB LoRA · krea-2-community-license · N/A · ComfyUI需自查
证据49 赞 / 2 个社区来源
1.3B MoD对话模型,支持ChatML与代码/数学生成
适合本地轻量对话与代码生成 / 资源受限设备上的文本生成
短板长上下文生成 (2048 token限制)
Q4 ~0.9GB / FP16 ~3.2GB · apache-2.0 · 2048 · transformers需自查
证据855 下载 / 4 赞 / 2 个社区来源
用途未公开
适合用途未公开 / 用途未公开
短板未知
未公开 · unknown · 未知需自查
证据141k 下载 / 2 赞 / 8 个社区来源
编程与工具调用代理微调,供开发者本地使用
适合终端多步工具调用与调试 / 本地程序合成与测试
短板通用知识问答与事实查询
Q4 ~7.9GB / FP16 ~29GB · Apache-2.0 · 16k(示例命令) · transformers需自查
证据1833 下载 / 48 赞 / 14 个社区来源
33B MoE 编码模型,3B 激活,为本地代理与长任务设计
适合本地代理式编码 / 长上下文 SWE 任务
短板通用对话与低内存设备
Q4 ~22GB / FP16 ~80GB · OpenMDW-1.1 · 262k · vllm需自查
证据354 下载 / 44 赞 / 5 个社区来源
为Flux.2 Klein 9B图像指定阳光方向,球体参考工作流
适合室外场景阳光方向控制 / 阴天图像添加定向光照
短板室内场景和已有强光源方向图像
9B · Apache-2.0 · 不适用 · diffusers需自查
证据54 赞 / 3 个社区来源
MLX 8-bit 量化英文创意写作模型,适合故事小说生成
适合英文小说/创意写作生成 / 文学风格对话与叙事
短板事实性问答或精确指令遵循
Q4 ~20GB / FP16 ~74GB · apache-2.0 · 未知 · mlx需自查
证据311 下载 / 1 赞 / 11 个社区来源
对话式语音合成,100+语种,零样本克隆与内联控制
适合语音代理对话合成 / 零样本多语种声音克隆与情绪控制
短板商业化部署与未经授权的语音克隆
Q4 ~3.1GB / FP16 ~11GB · boson-higgs-audio-v3-research-and-non-commercial-license · 8192 · vllm-omni需自查
证据103.9k 下载 / 581 赞 / 7 个社区来源
Ornith-9B MTP GGUF:llama.cpp推测解码加速
适合无需额外草稿模型的推测解码 / 低VRAM场景的批量生成吞吐优化
短板要求bitwise一致输出的评测
Q4 ~5GB / FP16 ~18GB · MIT · 256k · llama.cpp需自查
证据218 下载 / 110 赞 / 2 个社区来源
35B开源编码代理模型,原生工具调用与推理链
适合终端编码代理 (Terminal-Bench) / 代码仓库修复与工具调用 (SWE-bench)
短板通用闲聊与事实查询
Q4 ~23GB / FP16 ~84GB · MIT · 256k · vllm需自查
证据1005 下载 / 116 赞 / 1 个社区来源
双塔扩散LLM,块并行解码,2.42x生成吞吐量
适合大规模批量文本生成 / 作为基座模型微调
短板低延迟对话或指令跟随
30B (3B 激活) · NVIDIA Nemotron Open Model License · 128k · transformers需自查
证据7628 下载 / 79 赞 / 2 个社区来源
无审查Gemma4-26B MoE,适用于代理编码与创意写作
适合代理编码与工具调用 / 多模态角色扮演/故事创作
短板需要严格内容过滤的生产环境
26B-A4B · gemma · 256k · llama.cpp需自查
证据35.2k 下载 / 54 赞 / 11 个社区来源
未审查 1M 上下文 Qwen3.5 微调,支持工具调用
适合长上下文角色扮演创作 / 工具调用与代理任务
短板需内容审查的生产场景
9B · apache-2.0 · 1M · llama.cpp需自查
证据37.9k 下载 / 55 赞 / 3 个社区来源
移除安全过滤的GLM-5.2 GGUF,供研究实验用
适合无审查的文本生成和调试 / 安全对抗性研究与测试
短板生产部署或面向未成年用户
未公开 · MIT · 未知 · llama.cpp需自查
证据901 下载 / 115 赞 / 12 个社区来源
Qwen3.6-27B NVFP4 量化,面向 vLLM 部署与推理
适合AI Agent 与工具调用 / 聊天机器人与 RAG 系统
短板不适用于安全敏感应用
27B · Apache-2.0 · 262k · vllm需自查
证据2671 下载 / 168 赞 / 11 个社区来源
关闭思考的编码代理模型,降低 token 延迟,适合本地工作流
适合代理循环中的代码编辑与调试 / 本地低 token 消耗编码任务
短板需要深度推理的长链问题
35B (3B 激活) · Apache-2.0 · 未知 · llama.cpp需自查
证据84 赞 / 3 个社区来源
8B参数1B激活MoE,消费级GPU可运行的APEX量化
适合本地低成本对话 / 消费级GPU即时推理
短板高精度复杂推理任务
8B (激活1B) · LFM1.0 · 未知 · localai需自查
证据4108 下载 / 11 赞 / 3 个社区来源
12B 文本到图像扩散模型,GGUF 量化版,用于本地生成
适合低资源本地文本到图像生成 / 创意概念图与设计素材生成
短板精细写实摄影,敏感内容生成
12B · Krea-2-Community-License · 未知 · diffusers需自查
证据84 下载 / 69 赞 / 5 个社区来源
生成漏洞利用与安全工具,面向攻防研究者
适合漏洞利用与渗透工具生成 / 安全测试自动化模板编写
短板复杂攻击链推理与威胁建模
27B · Apache-2.0 · 4096 · ollama需自查
证据207 下载 / 70 赞 / 4 个社区来源
Gemma 4 12B/3B GGUF 量化集合,供本地聊天与代码任务
适合本机聊天与文本生成 / 代码补全与 Python 代理任务
短板文本以外的多模态任务
12B (以及 3B) · 未知 · 262k · llama.cpp需自查
证据54.5k 下载 / 8 个社区来源
3B 视觉语言 OCR 模型,文档解析与 Markdown 转换
适合文档 OCR 转 Markdown(带布局/框) / 多语言长文档解析
短板通用视觉对话或复杂推理
3B · MIT · 未知 · llama.cpp需自查
证据28.2k 下载 / 50 赞 / 3 个社区来源
混合架构边缘设备模型,用于设备端文本生成
适合设备端文本生成与补全 / 低功耗场景下的轻量对话
短板复杂推理或长上下文生成
Q4 ~0.2GB / FP16 ~0.6GB · LFM1.0 · 32768 · llama.cpp需自查
证据7334 下载 / 65 赞 / 3 个社区来源
语言世界模型,模拟7类agent交互环境
适合7域agent环境状态预测 / world model研究与模拟数据生成
短板非通用助手,不适用直接问答
Q4 ~23GB / FP16 ~83GB · Apache-2.0 · 262k · vllm需自查
证据223 下载 / 132 赞 / 7 个社区来源
27B 无审查多模态混合模型,本地创作者使用
适合无审查对话与角色扮演 / 多模态图像与文档理解
短板需要内容过滤的生产环境
27B · apache-2.0 · 未知 · llama.cpp需自查
证据31.3k 下载 / 8 赞 / 13 个社区来源
IQ2_M 31B 多模态 Agent,10 GiB 本地运行
适合本地多模态 Agent 推理 / 代码与工具调用任务
短板高精度语言生成
31B · gemma · 未知 · llama.cpp需自查
证据12.5k 下载 / 12 个社区来源
3B无审查推理模型,专注数学与竞赛编程
适合数学与竞赛编程推理 / 可验证分数信号的任务(如LeetCode题)
短板工具调用 / agent 编程
Q4 ~2GB / FP16 ~7.4GB · MIT · 未知 · transformers需自查
证据6893 下载 / 56 赞 / 1 个社区来源
无审查的27B视觉语言模型,用于多模态对话与图像理解
适合多模态无审查对话 / 图像描述与视觉问答
短板需要安全过滤的生产环境
27B · apache-2.0 · 未知 · llama.cpp需自查
证据7462 下载 / 10 赞 / 8 个社区来源
轻量推理模型,专注数学与代码任务的本地运行
适合本地数学推理与简单代码生成 / 轻量级智能代理原型开发
短板复杂多步推理或长文本理解
未知 · MIT · 未知 · llama.cpp需自查
证据4918 下载 / 52 赞 / 1 个社区来源
Krea 2 Turbo 的 FP8 量化版,16GB 显存可用
适合16GB+ 显卡本地生图 / Turbo 8 步快速创意生成
短板商用需确认 KREA 2 许可证
未知 · krea-2-license · 未知 · diffusers需自查
证据7347 下载 / 55 赞 / 4 个社区来源
零样本声音克隆多语言TTS模型,支持31种语言和本地部署
适合零样本多语言语音克隆 / 长文本合成与精确停顿控制
短板实时流式低延迟场景
Q4 ~3GB / FP16 ~11GB · Apache-2.0 · 未知 · transformers需自查
证据5655 下载 / 47 赞 / 3 个社区来源
27B编码器GGUF,兼容多种工具历史格式,供本地开发者使用
适合本地代理编码与工具调用 / 图像理解与多模态代码生成
短板非编码任务的通用对话与知识问答
27B · apache-2.0 · 32K · llama.cpp需自查
证据3958 下载 / 71 赞 / 4 个社区来源
解除审查的Gemma4多模态模型,面向代理编码与创意写作
适合代理式编码与工具调用 / 创意写作与角色扮演
短板要求绝对零拒绝的严格场景
12B · gemma · 256K · llama.cpp需自查
证据2056 下载 / 57 赞 / 4 个社区来源
Qwen3.6-27B的LoRA微调,用于故事与寓言生成
适合中文寓言/故事创作 / 叙事性文本生成
短板逻辑推理与代码生成
27B (基座) + LoRA · unknown · 未知 · vllm需自查
证据403 下载 / 64 赞 / 10 个社区来源
12B 图像生成基座,用于 LoRA 微调训练
适合风格化图像生成(复古、像素、抽象) / LoRA 微调训练基座
短板直接推理使用(官方建议微调)
12B · krea-2-community-license · N/A · diffusers需自查
证据194 下载 / 63 赞 / 3 个社区来源
为编码代理提供仓库探索与精确文件引用
适合编码代理的仓库探索与上下文收集 / 并行文件搜索与精确行范围引用
短板独立解决编码任务或通用对话
Q4 ~2.7GB / FP16 ~9.7GB · MIT · 262k · sglang需自查
证据2900 下载 / 54 赞 / 9 个社区来源
开源 9B 推理模型,不审查,支持 1M 上下文和函数调用
适合长上下文推理与工具调用 / 网络安全 / 生物医学等敏感技术问答
短板需要安全审查的生产部署
Q4 ~6.2GB / FP16 ~23GB · Apache 2.0 · 1M · vllm需自查
证据842 下载 / 125 赞 / 4 个社区来源
Qwen3.6-35b 全量微调,强化结构化推理与代码助手
适合代码生成与结构化编辑 / 技术推理与调试辅助
短板高风险生产环境直接部署
35B · MIT · 未知 · transformers需自查
证据6088 下载 / 62 赞 / 4 个社区来源
未审查版 Gemma 代码模型,用于编程与推理,已去除拒答
适合编程与代码推理(无拒答) / 研究安全对齐移除效果
短板生产环境、需内容审核的场景
Q4 ~7.9GB / FP16 ~29GB · apache-2.0 · 未知 · transformers需自查
证据1773 下载 / 91 赞 / 11 个社区来源
Ideogram 4 加速 LoRA,2 步出图,无需 CFG
适合快速出图(2-8 步) / Ideogram 4 的低步数推理
短板商用(非商用许可证)
未公开(LoRA) · ideogram-4-non-commercial · 不适用 · diffusers需自查
证据2452 下载 / 89 赞 / 2 个社区来源
1M上下文开源模型,面向长文本处理与代码生成
适合长文本理解与生成 / 编程与 Agent 任务
短板低延迟实时对话
Q4 ~497GB / FP16 ~1808GB · MIT · 1M · llama.cpp需自查
证据10 个社区来源
3B活跃参数的通用Agent,自动研究/编程/推理
适合自动化机器学习与代码迭代 / 复杂推理与工具调用Agent
短板低延迟简单闲聊
35B (3B激活) · Apache-2.0 · 131k · transformers需自查
证据1243 下载 / 54 赞
超小型英文TTS,总4.63M参数,适合本地/嵌入式实验
适合本地嵌入式TTS实验与演示 / 离线助手原型及效率研究
短板生产叙述与高保真音频生成
4.63M · Apache-2.0 · 未知 · pytorch需自查
证据121 赞 / 3 个社区来源
混合量化Gemma-4-12B,8GB显存Pascal GPU代码生成
适合8GB显存本地代码生成 / 混合量化高效率推理
短板需全精度BF16或16GB+显存场景
12B · Apache-2.0 · 未知 · llama.cpp需自查
证据1420 下载 / 1 赞 / 9 个社区来源
原生多模态 1M 上下文 MoE 模型,融合图文与视频理解,擅长编程及智能体协作
适合多模态长文档理解与跨图像、视频推理 / 复杂编程、工具调用与多步智能体任务
短板本地部署(显存需求极高,普通硬件无法运行),以及低延迟的简单分类或闲聊场景
Q4 ~282GB / FP16 ~1025GB · other · 未公开需自查
证据13 个社区来源
284B MoE 架构,13B 激活参数,原生支持百万 Token 上下文,高效推理与强训练基线。
适合超长上下文理解与分析(百万 Token 级),如全库代码审查、长文档深度问答 / 复杂编程、数学竞赛题解与多步推理任务
短板本地个人设备部署(模型庞大,需专业多卡集群)及低延迟实时对话等高吞吐轻量场景
Q4 ~104GB / FP16 ~379GB · mit · 未公开可商用
证据11 个社区来源
1.6T参数MoE旗舰,原生百万token上下文,开源模型新标杆。
适合高难度推理、编程与数学竞赛级任务 / 百万 token 超长文档分析与大规模代码库理解
短板本地部署(需专业级多卡服务器);简单闲聊或对延迟极敏感的应用。
Q4 ~569GB / FP16 ~2068GB · mit · 未公开可商用
证据11 个社区来源
万亿参数 MoE 编码智能体,长周期复杂任务更省 token、工具调用更强
适合复杂长周期软件工程任务(多语言、全栈、基础设施等) / 需要工具调用/代码智能体的生产环境(如 MCP 工具链、自动化 Coworking)
短板不适合本地部署(1T 参数,仅限云端推理),也不适合纯粹的休闲闲聊等非工具性任务
Q4 ~699GB / FP16 ~2541GB · other · 未公开需自查
证据10 个社区来源
面向真实生产力场景的智能体模型,统一推理、工具调用与执行闭环
适合复杂智能体工作流:编程、长程任务执行、工具调用与环境反馈闭环 / 深度研究、多步搜索与高难度推理评测
短板本地单卡部署(模型巨大,需多节点高端 GPU 集群)与低延迟轻量对话
Q4 ~262GB / FP16 ~952GB · apache-2.0 · 未公开可商用
证据12 个社区来源
云端旗舰,225B 参数稀疏 MoE,专为智能体编程和长周期任务设计
适合复杂多步智能体编程与软件工程流水线 / 需要长上下文推理的代码生成、调试与修复
短板本地单机或个人设备部署(需超大规模 GPU 集群),不适合闲聊、简单问答等轻量任务
Q4 ~149GB / FP16 ~542GB · apache-2.0 · 未公开可商用
证据9 个社区来源
11 语言 ColBERT 检索模型,专为短文本 RAG 设计
适合多语言 RAG 流水线 / 消费级设备端语义搜索
短板长文档检索 (>512 tokens)
Q4 ~0.2GB / FP16 ~0.8GB · LFM Open License v1.0 · 32k · transformers需自查
证据103 下载 / 47 赞
11语种双编码器,面向端侧语义检索
适合端侧本地语义搜索 (文件/邮件) / 跨语言 FAQ/知识库检索
短板长文档 (>512 tokens) 检索
Q4 ~0.2GB / FP16 ~0.9GB · lfm1.0 · 32k · sentence-transformers需自查
证据3734 下载 / 51 赞 / 3 个社区来源
面向代理编码与工具调用的27B推理模型
适合仓库级代码修复与代理任务 / 多轮工具调用与自动化脚本
短板通用对答与安全敏感应用
27B · Apache-2.0 · 32K · llama.cpp可商用
证据7218 下载 / 47 赞 / 2 个社区来源
面向无思考代理编码的MTP微调版,本地GGUF推理
适合无思考代理编码循环 / 工具调用与 Shell 自动化
短板需要安全对齐的敏感场景
27B · Apache-2.0 · 256k · llama.cpp可商用
证据1543 下载 / 64 赞 / 10 个社区来源
Gemma 4 31B风格微调,陈词减60%,角色扮演与创意写作。
适合低陈词滥调角色扮演 / 创意写作与叙事生成
短板正式文书写作与代码生成
Q4 ~22GB / FP16 ~78GB · apache-2.0 · 未知 · transformers可商用
证据278 下载 / 47 赞 / 15 个社区来源
Qwen3.6基MoE代理编码模型(3B激活)
适合代理式编码(读/写/执行文件) / 自定义XML工具调用多轮对话
短板纯推理/通用聊天(可能Claude风格)
Q4 ~24GB / FP16 ~86GB · AGPL-3.0 · 未知 · vllm可商用
证据10 下载 / 72 赞
基于 Qwen3.6 的推理与代码微调模型,面向本地部署与结构化助手
适合代码生成与调试 / 结构化指令跟随与推理
短板安全敏感或生产关键任务
27B · MIT · 未知 · transformers可商用
证据57 赞 / 4 个社区来源
面向数学/代码/STEM的可验证推理3B小模型
适合数学/编程竞赛解题 / STEM可验证推理任务
短板工具调用/Agent编程
Q4 ~2GB / FP16 ~7.4GB · MIT · 64k · transformers可商用
证据196 赞 / 3 个社区来源
轻量级多语言文本检测模型,48语种,服务端/边缘可用
适合多语言文档扫描与表单检测 / 自然场景文字定位与艺术字检测
短板端到端文字识别 (需配合 rec 模型)
Q4 ~0GB / FP16 ~0.1GB · Apache-2.0 · 不适用 · paddleocr可商用
证据365 下载 / 50 赞 / 2 个社区来源
轻量仓库探索子代理,供编码代理按需调用,减少 token 消耗
适合辅助编码代理定位仓库相关代码 / 降低主代理 token 消耗
短板独立对话或直接生成代码
Q4 ~2.7GB / FP16 ~9.7GB · MIT · 262k · transformers可商用
证据13 下载 / 100 赞 / 7 个社区来源
基于 Qwen3 的 14B 代码模型 GGUF 量化,本地可跑
适合本地代码补全与生成 / 资源受限设备推理
短板已弃用,不建议新项目
14B · apache-2.0 · 未知 · llama.cpp可商用
证据896 下载 / 2 赞 / 1 个社区来源
基于 Qwen3 的代码模型,GGUF 量化版,适合本地运行
适合本地代码生成(GGUF量化) / 低资源设备上的代码辅助
短板高精度代码推理(量化损失)
14B · apache-2.0 · 未知 · llama.cpp可商用
证据3100 下载 / 1 赞
4B 提示词增强与 Z-Image 文本编码器,本地双用途
适合本地提示词增强 / 替换 Z-Image 编码器双用途
短板通用对话或纯文本生成
Q4 ~2.7GB / FP16 ~9.7GB · Apache-2.0 · 未知 · transformers可商用
证据446 下载 / 51 赞 / 3 个社区来源
扩散多模态文本生成,3.8B活跃参数,NVFP4量化
适合多模态文档/图像理解与问答 / 代码生成与函数调用代理
短板不保证事实准确性,不适合关键决策
Q4 ~9.5GB / FP16 ~35GB · Apache 2.0 (Gemma Terms) · 256k · vllm可商用
证据49.1k 下载 / 53 赞 / 7 个社区来源
精准时长控制与情感表达的中文零样本TTS
适合视频配音与对口型(时长精确可控) / 有声书/播客的情感化生成
短板对延迟敏感的实时流式交互(如实时对话助手)或主要面向英文的场景。
unknown · unknown · unknown需自查
证据5 个社区来源
30B总/3B激活的MoE代码代理模型,专注代码生成与终端任务
适合本地代码生成与代理 / 带工具调用的自动化开发
短板非代码的通用对话
Q4 ~20GB / FP16 ~73GB · Apache-2.0 · 256K · transformers可商用
证据1784 下载 / 150 赞 / 3 个社区来源
基于 MoE 的多语言 TTS,支持零样本克隆与流式生成
适合零样本语音克隆与流式输出 / 中/英/日等多语种高保真合成
短板仅限 Linux+NVIDIA GPU
未公开 · apache-2.0 · 未知 · Mini-SGLang可商用
证据11 下载 / 56 赞 / 3 个社区来源
Llama-3.2-3B 微调,GGUF 格式,给本地推理用户
适合资源受限的本地推理 / 轻量级对话与编排任务
短板高精度复杂推理
3B · unknown · 未知 · llama.cpp需自查
证据115 下载 / 3 个社区来源
Qwen2 架构的阿/英指令模型 GGUF 量化
适合阿拉伯语/英语混合指令跟随 / 消费级设备本地推理
短板非阿拉伯语/英语任务
7B · apache-2.0 · 未知 · llama.cpp可商用
证据388 下载
本地 Python 编程模型,离线解决算法问题
适合Python 算法题解答 / 本地离线编程助手
短板非 Python 任务和安全对话
12B · gemma · 131k · llama.cpp可商用
证据2433 下载 / 60 赞 / 11 个社区来源
18B MoE预览模型,面向Bittensor SN24研究蒸馏
适合Bittensor SN24去中心化蒸馏 / 长上下文架构研究
短板生产级聊天或安全敏感应用
Q4 ~11GB / FP16 ~40GB · MIT · 5M (实验性配置) · transformers可商用
证据200 下载 / 59 赞 / 2 个社区来源
离散扩散文本生成,支持图像/视频输入,低延迟
适合低延迟多模态对话 / 图像/视频文本生成
短板不适宜高难度数学竞赛及长文本精确任务
25.2B (3.8B active) · Apache 2.0 · 256k · transformers可商用
证据17.7k 下载 / 212 赞 / 9 个社区来源
日英双语聊天模型,适合代理工作流与工具使用
适合代理工作流与工具调用 / 日英双语结构化输出
短板知识密集型问答
Q4 ~0.8GB / FP16 ~2.8GB · LFM1.0 · 32k · transformers需自查
证据3856 下载 / 61 赞 / 2 个社区来源
Delphi扩展律研究基座,25B参数,终版模型
适合scaling law 研究与下游预测 / 基座模型微调实验
短板生产部署或指令跟随任务
Q4 ~16GB / FP16 ~60GB · apache-2.0 · 4k · transformers可商用
证据240 下载 / 3 赞 / 5 个社区来源
Gemma 4 31B 量化图文模型,支持工具调用,本地部署
适合多模态图文理解与工具调用 / 256K 长上下文推理
短板低延迟纯文本对话(小模型更佳)
31B · apache-2.0 · 256k · llama.cpp可商用
证据64.5k 下载 / 64 赞 / 10 个社区来源
日语端到端语音对话,1.5B轻量实时交互
适合实时日语语音对话/客服 / 日语ASR转写与TTS合成
短板非日语语音识别与生成
Q4 ~1GB / FP16 ~3.5GB · LFM Open License v1.0 · 32k · liquid-audio需自查
证据534 下载 / 58 赞 / 3 个社区来源
LCB-medium 99%,12GB 级代码专家量化包
适合本地代码生成与评测 / 工具调用与多轮 agent
短板研究生级科学推理(GPQA 仅 48%)
20.8B (A4B 活跃) · apache-2.0 · 未知 · llama.cpp可商用
证据26.5k 下载 / 10 个社区来源
20B搜索智能体,对标前沿检索性能
适合检索增强生成 (RAG) / 知识密集型问答与搜索
短板无检索需求的纯文本生成
Q4 ~14GB / FP16 ~50GB · unknown · 未知 · transformers需自查
证据902 下载 / 72 赞 / 3 个社区来源
Gemma 4 视觉模型 abliteration 版 GGUF 量化
适合本地视觉问答推理 / 无审查内容生成实验
短板需要安全过滤的生产环境
未公开 · gemma · 未知 · llama.cpp限制商用
证据1990 下载 / 1 赞 / 11 个社区来源
零拒绝消融Gemma 4,供对齐研究与红队测试
适合对齐研究与拒绝几何分析 / 红队安全评估与基准测试
短板生成造成实际伤害的内容
Q4 ~7.9GB / FP16 ~29GB · gemma · 未知 · transformers限制商用
证据8106 下载 / 129 赞 / 3 个社区来源
Ideogram 4 官方 NF4 量化,低显存本地出图
适合≤12GB 显存本地出图 / 创意设计、视觉探索
短板无损画质商业大片
未知 · other · 未知 · diffusers需自查
证据4963 下载 / 259 赞 / 5 个社区来源
面向编码与工具调用的智能体模型
适合长周期智能体任务与代码生成 / 工具调用与终端命令执行
短板无 GPU 环境或简单对话
Q4 ~23GB / FP16 ~84GB · apache-2.0 · 未知 · sglang可商用
证据518 下载 / 63 赞 / 2 个社区来源
Gemma 4 26B MoE 量化版,用于本地图像与文本推理
适合多模态文本/图像推理 / 256K 长上下文代码与代理
短板音频处理及低显存设备
25.2B (3.8B active) · Apache-2.0 (Gemma) · 256K · llama.cpp可商用
证据60k 下载 / 80 赞 / 11 个社区来源
7B 视觉语言模型 GGUF 量化包,适合本地 VQA 与对话
适合视觉问答(VQA)实验 / 本地多模态对话原型开发
短板高精度视觉理解或生产部署
7B · Apache 2.0 · 未知 · llama.cpp可商用
证据201 下载 / 1 赞
Google Gemma 4 12B QAT GGUF,本地多模态推理
适合多模态文档理解与OCR / 代码生成与推理
短板移动端低内存设备
12B · Apache-2.0 · 256K · llama.cpp可商用
证据19.4k 下载 / 3 赞 / 9 个社区来源
Apple Silicon的Qwen3.6-27B 4bit混合量化版
适合Apple Silicon本地推理 / 代码/工具调用/Agent
短板非Apple Silicon设备
Q4 ~18GB / FP16 ~65GB · Apache-2.0 · 未知 · mlx-lm可商用
证据16.2k 下载 / 27 赞 / 7 个社区来源
Qwen3.6-27B 的 MLX 推理加速版供苹果芯片
适合Apple Silicon 本地代码生成 / 低延迟对话应用
短板非苹果芯片设备
Q4 ~3.1GB / FP16 ~11GB · Apache-2.0 · 未知 · mlx可商用
证据44.5k 下载 / 35 赞 / 13 个社区来源
4-bit混合精度MLX量化Qwen3.5-2B,苹果芯片推理
适合Apple Silicon本地推理及加速 / 代码生成与工具调用
短板长上下文检索 (HashHop 0%)
Q4 ~0.3GB / FP16 ~1GB · apache-2.0 · 未知 · mlx-lm可商用
证据3890 下载 / 9 赞 / 4 个社区来源
文本到图像生成模型,Ideogram 4 的 FP8 量化版本
适合FP8 量化图像生成 / 艺术与设计原型
短板高精度原版生成
未知 · other · 未知 · diffusers需自查
证据2818 下载 / 313 赞 / 4 个社区来源
Gemma 4 2B 指令 GGUF,本地推理
适合本地指令跟随 / 移动/边缘设备推理
短板长上下文任务
2B · apache-2.0 · 未知 · llama.cpp可商用
证据314 下载 / 7 个社区来源
Google Gemma 4 量化版,本地消费级硬件推理
适合本地聊天助手 / 边缘设备文本生成
短板高吞吐生产环境(仅4B)
4B · Apache-2.0 · 未知 · llama.cpp可商用
证据419 下载 / 10 个社区来源
苹果芯片4-bit MLX 量化 Qwen3.5-0.8B
适合Apple Silicon 本地推理 / 工具调用与代码生成
短板非 Apple Silicon 平台
Q4 ~0.1GB / FP16 ~0.4GB · Apache 2.0 · 未知 · mlx-lm可商用
证据4860 下载 / 19 赞 / 5 个社区来源
Apple Silicon 4-bit MLX混精量化+MTP投机解码
适合Apple Silicon本地推理 / 代码/Agent/约束指令
短板非Apple Silicon平台
Q4 ~23GB / FP16 ~83GB · Apache-2.0 · 未知 · mlx可商用
证据9077 下载 / 14 赞 / 6 个社区来源
语音对话TTS:100+语种、零样克隆、情感/风格内联控制
适合语音对话代理与聊天机器人 / 多语种、情感可控的语音生成
短板商业用途或未经授权的声音克隆
Q4 ~3.1GB / FP16 ~11GB · Boson Research & Non-Commercial License · 8k · sglang-omni需自查
证据408 下载 / 116 赞 / 3 个社区来源
分钟级多镜头音视频长视频生成,面向研究者
适合长视频多镜头故事创作(含音频) / 交互式实时视频编辑
短板图像到视频生成(I2V 未支持)
未公开 · LTX-2 Community License (研究/非商用) · 未知 · 原生 PyTorch需自查
证据1424 下载 / 69 赞 / 4 个社区来源
面向数学证明的语义搜索嵌入模型,用于查找 mathlib 定理
适合查找 mathlib 定理 / 机器辅助证明检索
短板通用文本嵌入任务
Q4 ~5.4GB / FP16 ~20GB · Apache-2.0 · 未知 · transformers可商用
证据213 下载 / 2 赞 / 3 个社区来源
直接回答的指令模型,用于交互聊天、代码和工具调用
适合交互式聊天与代码辅助 / 工具调用与指令跟随
短板需显式推理的多步代理流
Q4 ~8GB / FP16 ~29GB · apache-2.0 · 131k · vllm可商用
证据1418 下载 / 48 赞 / 4 个社区来源
基于 Sesame CSM 的对话 TTS 模型,支持语音上下文延续
适合高质量对话语音合成 / 从短音频提示生成语音延续
短板长篇有声书朗读
Q4 ~5.4GB / FP16 ~20GB · other · 2048 · pytorch需自查
证据76 赞 / 4 个社区来源
覆盖40种语言的流式ASR,600M,可调延迟,面向实时语音代理
适合低延迟多语种语音转写 / 实时多语言语音代理
短板未微调的适配语种直接使用
600M · NVIDIA Open Model License · 未知 · nemo需自查
证据225 下载 / 102 赞 / 2 个社区来源
文本/图像生成音视频同步内容,支持多说话人音色控制
适合文本/图像生成带同步音频的视频 / 多说话人场景指定音色控制
短板单 GPU 实时推理或长于 10 秒视频
6.3B · Apache-2.0 · 未知 · torch可商用
证据159 下载 / 57 赞 / 2 个社区来源
循环异构图语言模型,用于个性化微调与端侧推理
适合个性化语言模型冷启动训练 / 端侧或离线文本生成
短板事实性要求高的问答场景
Q4 ~0GB / FP16 ~0.1GB · Modified Apache 2.0 · 1024 · transformers需自查
证据134 下载 / 1 赞
12B 多模态模型,支持图文音频输入,本地 GGUF 量化部署
适合本地多模态聊天 / OCR 与文档理解
短板资源受限移动设备
12B · Apache 2.0 · 256k · llama.cpp可商用
证据124 下载 / 6 个社区来源
8.3B总参/1.5B活跃,面向端侧个人助手的混合架构模型
适合端侧个人助理及工具调用 / 多语言指令跟随与结构化输出
短板重度编程及无检索知识问答
Q4 ~5.6GB / FP16 ~20GB · LFM1.0 · 128k · llama.cpp需自查
证据107 赞 / 5 个社区来源
思考型助手,在<think>块中输出推理链后给出最终答案
适合复杂代码调试与多步规划 / 数学竞赛与逻辑推理题
短板低延迟闲聊或直接指令回答
Q4 ~8GB / FP16 ~29GB · Apache 2.0 · 131k · vllm可商用
证据799 下载 / 103 赞 / 2 个社区来源
6.3B 文本生成同步音视频,支持多说话人音色控制
适合文本/图片生成 720p 同步音视频 / 多说话人音色控制配音视频
短板长于 10 秒视频或非中英文输入
6.3B · apache-2.0 · 文本 512 tokens · 最大 10 秒视频 · diffusers可商用
证据104 下载 / 49 赞
文本生成高保真图像,面向物理AI与创作
适合物理世界场景生成 / 文本到高保真图像创作
短板安全关键任务与精确物理模拟
Q4 ~43GB / FP16 ~155GB · OpenMDW1.1 · 4k tokens (文本输入) · vLLM-Omni需自查
证据139 下载 / 50 赞 / 2 个社区来源
Qwen3.5-9B MoQ量化版,MTP推测解码,适合本地快速生成
适合本地内存受限下的9B模型推理 / 利用MTP推测解码加速文本生成
短板追求极致精度或官方全量模型的任务
9B · MIT · 32k · llama.cpp可商用
证据6044 下载 / 11 个社区来源
Qwen3.6-35B-A3B FP4量化版,面向vLLM高效推理
适合AI Agent系统 / RAG与聊天机器人
短板有毒提示或偏见内容生成
Q4 ~12GB / FP16 ~45GB · Apache 2.0 · 262k · vllm可商用
证据67k 下载 / 46 赞 / 12 个社区来源
指令式多语言TTS,流式延迟低至97ms,9音色
适合低延迟实时语音交互(端到端97ms) / 多语言指令式配音(9音色,10语种)
短板需语音克隆的场景(应使用Base模型)
Q4 ~1.3GB / FP16 ~4.6GB · Apache-2.0 · 未公开 · transformers可商用
证据1821.2k 下载 / 1548 赞 / 9 个社区来源
1-bit量化文生图模型,专为Apple Silicon本地运行
适合Mac/iPhone/iPad本地生图 / 内存受限设备上运行扩散模型
短板高保真细节与复杂构图
4B · apache-2.0 · N/A · MLX可商用
证据15 赞 / 1 个社区来源
零样本语音克隆多语言TTS模型,支持31种语言及显式暂停控制。
适合多语种有声内容生成 / 零样本个性化语音克隆
短板低延迟实时语音交互场景
Q4 ~5.6GB / FP16 ~20GB · Apache-2.0 · 未知 · transformers可商用
证据5447 下载 / 56 赞 / 4 个社区来源
1.21GB三元文生图模型,4步采样,本地GPU运行
适合本地低显存GPU文生图创作 / 私有化部署与快速创意迭代
短板精细文字与严格构图约束
4B · Apache-2.0 · 不适用 · gemlite可商用
证据57 赞 / 2 个社区来源
1.21GB 三元文生图扩散模型,苹果芯片本地运行
适合苹果芯片本地隐私图像生成 / 移动端快速创意迭代
短板精细文字、严格构图和细节要求高场景
4B · apache-2.0 · 不适用 · mlx可商用
证据36 赞 / 3 个社区来源
1B 模型 GGUF 量化,本地 agent 与边缘部署用
适合本地工具调用 agent / 边缘推理与桌面宠物
短板高吞吐量线上服务
Q4 ~0.7GB / FP16 ~2.6GB · apache-2.0 · 128k · llama.cpp可商用
证据2 下载 / 125 赞 / 3 个社区来源
昇腾原生1.58-bit三元LLM,推理内存降6x,保持95.7%性能
适合昇腾NPU上低内存推理 / 1.58-bit 三元量化研究
短板需BF16全精度的场景
8B · apache-2.0 · 未知 · transformers可商用
证据1202 下载 / 74 赞 / 3 个社区来源
文本到图像生成,用于开发者与创作者的视觉内容创建
适合高质量文本到图像生成 / 复杂语义与文字渲染
短板低显存或实时生成场景
12B · 非商业许可 · 不适用 · diffusers需自查
证据708.2k 下载 / 12.9k 赞 / 8 个社区来源
为ARO语言微调的代码生成器,4bit量化,供ARO DSL开发者使用
适合生成ARO语言代码片段 / 辅助学习ARO DSL语法
短板非ARO语言的通用编程
Q4 ~0.8GB / FP16 ~3.1GB · MIT · 未知 · mlx可商用
证据383 下载
像素扩散解码器,将潜在表征一步超分至2K/4K图像
适合从LDM潜在空间直接生成2K/4K图像 / 一步完成解码与超分辨率
短板生产环境或商业生成
未公开 · NVIDIA Internal SRDML (仅限研究) · N/A · pytorch需自查
证据10 下载 / 62 赞 / 3 个社区来源
面向远场、混响、重叠语音等严重声学退化的鲁棒语音识别
适合严重噪声、混响、剪切、限带语音转录 / 远场、重叠语音、低质量录音识别
短板安静环境下的高保真转写
1.7B · apache-2.0 · 未知 · PyTorch可商用
证据59 赞 / 1 个社区来源
多说话人分割模型,从音频中区分谁在何时说话
适合会议转录说话人分离 / 多角色电话录音分割
短板低资源实时流式处理
未公开 · mit · 不适用(音频长度可分批) · pyannote.audio可商用
证据10040.3k 下载 / 1946 赞 / 8 个社区来源
轻量多语言翻译模型,支持 llama.cpp 本地部署
适合多语言文本翻译(33 种语言) / 边缘设备离线翻译部署
短板非翻译类文本生成
1.8B · apache-2.0 · 未知 · llama.cpp可商用
证据8515 下载 / 50 赞 / 3 个社区来源
多Token预测推理模型,面向编码、数学、DevOps开发者
适合代码生成与系统设计 / 数学推导与复杂逻辑推理
短板生产关键任务(社区实验模型)
27B · Apache 2.0 · 128k · llama.cpp可商用
证据3532 下载 / 63 赞 / 3 个社区来源
移除拒绝回路,能力保持,本地全栈部署
适合本地低拒答文本生成 / 拒绝消融与红队研究
短板生产环境用户产品(需安全控制)
Q4 ~18GB / FP16 ~65GB · apache-2.0 · 8192 · transformers可商用
证据1863 下载 / 53 赞 / 10 个社区来源
3.8B文本生成图像基础模型,高效训练与高分辨率生成
适合高分辨率(1440×1440)图像生成 / 密集描述与多语言提示跟随
短板生产环境与商业产品部署
3.8B · MIT · 未知 · diffusers可商用
证据296 下载 / 52 赞 / 3 个社区来源
3.8B 高效文生图,4 步蒸馏,为开发者与创作者快速生成
适合快速 4 步高分辨率图像生成 / 多语言提示与宽高比灵活生成
短板商业产品或服务部署
3.8B · MIT · 未知 · diffusers可商用
证据116 下载 / 48 赞 / 9 个社区来源
三元1.58-bit量化8B模型,苹果芯片本地推理
适合苹果设备本地AI助手 / 离线文本生成与隐私保护
短板非苹果设备或服务器端部署
Q4 ~0.4GB / FP16 ~1.5GB · Apache-2.0 · 65k · mlx可商用
证据16.4k 下载 / 101 赞 / 3 个社区来源
Llama-3-8B 4-bit版,M系列芯片本地推理
适合Mac本地聊天与文本生成 / 离线隐私敏感场景
短板非Apple Silicon设备(需MLX)
Q4 ~1.1GB / FP16 ~4.1GB · llama3 · 8k · mlx-lm需自查
证据10.5k 下载 / 81 赞 / 6 个社区来源
35B MoE仅3B激活的GGUF量化版,适合本地中文开发
适合本地中文对话与代码补全 / 低内存占用(3B激活)的MoE推理
短板复杂数学或长链逻辑推理
35B (3B 激活) · apache-2.0 · 262k (可扩展至1M) · llama.cpp可商用
证据2569.1k 下载 / 1052 赞 / 14 个社区来源
谷歌 Gemma 4 指令模型 GGUF 量化版,本地高效部署
适合本地代码生成与补全 / 轻量级聊天机器人原型开发
短板高精度复杂推理任务
未知 · apache-2.0 · 未知 · llama.cpp可商用
证据267.3k 下载 / 12 赞 / 16 个社区来源
9B多令牌预测代码模型,GGUF量化,面向代码推理
适合本地代码生成与补全 / 高吞吐 Agent 代码推理
短板长上下文推理或非量化高精度需求
9B · apache-2.0 · 128k · llama.cpp可商用
证据6680 下载 / 51 赞 / 2 个社区来源
27B参数GGUF版,本地AI原型开发
适合多轮对话与长文本处理 / 本地量化模型快速验证
短板生产环境高并发API
27B · apache-2.0 · 262k (可扩展至1M) · llama.cpp可商用
证据1845.9k 下载 / 692 赞 / 13 个社区来源
NVIDIA 多模态推理模型 GGUF 量化版,本地推理用
适合本地多模态对话 / 图像理解与推理
短板生产级高并发推理
30B (3B 激活) · NVIDIA Open Model Agreement · 未知 · llama.cpp
证据168.9k 下载 / 8 赞 / 2 个社区来源
26B总参/4B活跃的MoE指令模型,面向本地推理
适合本地聊天与指令跟随 / 资源受限环境文本生成
短板高精度复杂推理
26B (4B活跃) · Apache-2.0 · 128k · llama.cpp可商用
证据321.4k 下载 / 24 赞 / 13 个社区来源
Google 31B 指令模型 GGUF 量化版,本地消费级硬件推理
适合本地高参数量指令遵循与对话 / 长上下文理解与 RAG 应用
短板4GB 以下显存设备运行
31B · apache-2.0 · 未知 · llama.cpp可商用
证据340.4k 下载 / 25 赞 / 12 个社区来源
Gemma4-4B-it 量化版, 本地轻量推理
适合本地轻量指令跟随与聊天 / 消费级 GPU/CPU 推理
短板复杂推理与多语言长文本
4B · apache-2.0 · 未知 · llama.cpp可商用
证据1229.1k 下载 / 38 赞 / 10 个社区来源
文档结构化提取和Markdown转换的4B视觉语言模型
适合发票/合同/表格等文档JSON结构化提取 / 图片/扫描PDF转Markdown供RAG使用
短板通用图像问答或纯文本生成
Q4 ~3GB / FP16 ~11GB · Apache-2.0 · 131k · vllm可商用
证据1720 下载 / 45 赞 / 2 个社区来源
三模式 LM (AR/扩散/自推测),为 AI 应用开发者提供高效生成
适合高吞吐对话生成(自推测解码) / 边缘设备单用户加速推理(DGX Spark)
短板长文本场景(上下文长度未公开)
Q4 ~8.9GB / FP16 ~32GB · NVIDIA Nemotron Open Model License · 未知 · transformers
证据65 下载 / 44 赞 / 4 个社区来源
Qwen3.5-9B 多模态模型,MTP 投机解码,本地快速运行
适合多模态图像理解与文档分析 / 本地 Agent 工具调用场景
短板多进程推理或 mmproj 场景
9B · apache-2.0 · 262k (可扩展至1M) · llama.cpp可商用
证据53k 下载 / 46 赞 / 6 个社区来源
MiniMax M2.7 GGUF量化版,适合本地部署与实验
适合低成本本地推理实验 / 对话与文本生成原型
短板复杂逻辑推理与长篇生成
2.7B · other · 未知 · llama.cpp
证据13.6k 下载 / 2 赞 / 4 个社区来源
IBM Granite 30B GGUF量化, 本地部署与推理
适合本地推理与微调基线 / 通用文本生成与对话
短板需高精度、无损推理的任务
30B · Apache 2.0 · 未知 · llama.cpp可商用
证据982 下载 / 3 个社区来源
IBM Granite 4.1 3B GGUF量化,本地推理与边缘部署
适合本地CPU推理 / 轻量级文本生成助手
短板高精度推理或长上下文
3B · Apache-2.0 · 未知 · llama.cpp可商用
证据582 下载 / 4 个社区来源
IBM Granite 4.1 8B的GGUF量化,用于本地推理
适合本地CPU推理 / 低资源设备文本生成
短板高并发生产环境
8B · apache-2.0 · 未知 · llama.cpp可商用
证据1015 下载 / 4 个社区来源
Apple芯片上本地运行的Llama2 7B对话模型
适合Apple芯片本地聊天机器人开发 / 离线文本生成与原型测试
短板非Apple芯片或NVIDIA GPU推理
7B · llama2 · 4096 · mlx限制商用
证据4057 下载 / 85 赞 / 6 个社区来源
Apple Silicon 的 1-bit LLM,端侧极低内存推理
适合iPhone/Mac 本地隐私推理 / 移动端及边缘低功耗部署
短板需全精度浮点的高敏感任务
Q4 ~0.3GB / FP16 ~0.9GB · Apache-2.0 · 65k · mlx可商用
证据15k 下载 / 206 赞 / 4 个社区来源
Gemma4 26B 无审查 MLX, 本地代理加速
适合代码与工具使用代理 / 无审查对话与指令跟随
短板视觉或多模态任务
Q4 ~17GB / FP16 ~61GB · gemma · 未知 · mlx限制商用
证据25.7k 下载 / 236 赞 / 9 个社区来源
覆盖4000+语言的语音基础模型,供ASR/翻译微调
适合多语言语音识别微调 / 语音翻译与语音tokenization
短板不微调直接用于生产ASR
577M · CC BY-NC-SA 4.0 · 未知 · espnet不可商用
证据149 下载 / 148 赞 / 2 个社区来源
Apple Silicon 上运行的 Whisper 语音识别模型
适合Mac 本地离线语音转录 / 与 MLX 生态无缝集成
短板非 Apple Silicon 设备
1.55B · MIT · 30s 音频片段 · mlx可商用
证据151.4k 下载 / 81 赞 / 3 个社区来源
为开发者输出最少代码行的可运行代码
适合输出最少代码行的可运行代码 / Apple Silicon本地推理
短板非Python或复杂软件项目
0.5B · Apache-2.0 · 32k · mlx-lm可商用
证据437 下载 / 187 赞 / 5 个社区来源
1B预对齐前缀LM,用前缀条件做结构化输出与推理
适合Few-shot 直接答案提取(direct前缀) / 复合条件 CoT 推理(synth,cot前缀)
短板聊天对话与代码生成
Q4 ~0.8GB / FP16 ~2.8GB · Apache-2.0 · 4096 · transformers可商用
证据884 下载 / 112 赞 / 3 个社区来源
Mac端Whisper large-v3-turbo,MLX低延迟转写
适合Mac本地离线语音转写 / 低延迟实时字幕生成
短板非Apple Silicon设备
809M · unknown · 30s · mlx
证据32.7k 下载 / 93 赞 / 3 个社区来源
LTX-2.3模型的ComfyUI工作流集合,用于图像/视频生成。
适合快速搭建图像/视频到视频流水线 / image-to-video等多媒体生成任务
短板不使用ComfyUI的纯脚本生成
未公开 · unknown · 未知 · ComfyUI
证据589 赞 / 3 个社区来源
解禁版Qwen3.6-27B量化模型,为创意写作与代码而生
适合创意写作与角色扮演 / 图像理解与代码生成
短板需严格内容过滤的场景
27B · apache-2.0 · 256k · llama.cpp可商用
证据357.5k 下载 / 183 赞 / 6 个社区来源
无审查Gemma 4 26B GGUF,适合苹果硅本地快速推理
适合本地苹果硅无审查对话 / 快速编程与韩语任务
短板需严格内容审核的场景
26B · gemma · 未知 · llama.cpp限制商用
证据267.4k 下载 / 624 赞 / 9 个社区来源
像素空间文生图模型,基于AsymFlow,适合文字渲染与细节生成
适合高质量文本渲染的生成 / 需要精细细节的艺术创作
短板低显存设备或实时推理
9B · flux-non-commercial-license · N/A · diffusers
证据1608 下载 / 49 赞 / 4 个社区来源
多模态嵌入模型,支持文本/图像/视频/音频
适合多模态检索与RAG / 跨模态零样本分类与聚类
短板仅需文本嵌入的轻量场景
Q4 ~1.1GB / FP16 ~3.9GB · cc-by-nc-4.0 · 32768 · transformers不可商用
证据28.9k 下载 / 49 赞 / 4 个社区来源
日语TTS,表情符号控制风格,零样本克隆
适合零样本日语语音克隆 / 表情符号驱动风格与音效控制
短板非日语文本或需精确汉字阅读
Q4 ~0.3GB / FP16 ~1.2GB · MIT · 未知 · pytorch可商用
证据67 赞 / 4 个社区来源
无审查的Gemma 4多模态模型,适合内容生成开发者
适合无审查的多模态聊天应用 / 本地图像/音频内容生成
短板需安全合规的生产环境
4B · Gemma · 131k · llama.cpp限制商用
证据796.4k 下载 / 607 赞 / 9 个社区来源
Gemma4 无审查多模态 MoE,面向创意写作与角色扮演
适合创意写作与角色扮演 / 多模态图片-文本对话
短板高复杂度 agentic 编程任务
26B (25.2B total, 3.8B active) · Apache-2.0 · 256K · llama.cpp可商用
证据40.3k 下载 / 53 赞 / 7 个社区来源
LTX2.3 微调的图生视频 GGUF 模型,用于 ComfyUI
适合图像首帧到视频生成 / 对话与动作驱动的视频生成
短板高分辨率或长片段生成
未公开 · unknown · 未知 · ComfyUI
证据71.5k 下载 / 65 赞 / 4 个社区来源
为开发者提供600+语言零样本语音合成
适合全球多语种语音合成与声音克隆 / 创意声音设计与非语言符号表达
短板实时流式对话系统
Q4 ~0.4GB / FP16 ~1.5GB · apache-2.0 · 不适用 · omnivoice可商用
证据2087.6k 下载 / 890 赞 / 10 个社区来源
31种语言本地TTS,面向AI应用开发者的语音合成
适合多语言离线语音合成 / 低资源设备端实时TTS
短板语音克隆与高拟真度需求
99M · OpenRAIL-M · 未知 · ONNX Runtime限制商用
证据16.5k 下载 / 258 赞 / 4 个社区来源
多模态无审查推理模型,面向代码与视觉应用
适合无审查代码生成与推理 / 多模态图像理解
短板需要内容过滤的生产场景
40B · apache-2.0 · 未知 · llama.cpp可商用
证据207.1k 下载 / 94 赞 / 2 个社区来源
动漫风格图像生成,面向二次元AI应用开发者
适合生成动漫风格插画 / 二次元角色设计
短板写实照片生成
4B · apache-2.0 · 未知 · diffusers可商用
证据14.5k 下载 / 384 赞 / 4 个社区来源
图像到视频基座模型,GGUF量化版,适合本地推理
适合本地图像到视频生成推理 / 低资源设备快速原型
短板高分辨率长视频生成
22B · other · 未知 · llama.cpp
证据875.4k 下载 / 1004 赞 / 9 个社区来源
通用问答模型,适合知识型对话与事实查询。
适合知识问答 / 事实查询
短板复杂推理或创意生成
14B · apache-2.0 · 未知 · transformers可商用
证据11k 下载 / 113 赞
600M参数早期检查点,面向低资源多语言部署
适合低内存/边缘设备部署 / 英印多语言文本生成
短板生产环境或最终模型
Q4 ~0.4GB / FP16 ~1.5GB · apache-2.0 · 2048 · transformers可商用
证据8324 下载 / 57 赞 / 3 个社区来源
35B MoE多模态去审查模型,适合本地无限制输出
适合创意写作与角色扮演(无内容过滤) / 本地多模态应用(图像理解/生成式交互)
短板生产环境需内容审查、低显存(<16GB)或对输出安全性有严格要求的场景。
35B · apache-2.0 · unknown可商用
证据1320.8k 下载 / 646 赞 / 3 个社区来源
通用文本转语音,面向配音与有声内容制作者
适合多角色配音生成 / 有声书合成
短板低延迟实时语音场景
未知 · other · 不适用 · huggingface_hub
证据869 下载 / 96 赞 / 3 个社区来源
文本到图像扩散模型,面向 AI 应用构建者
适合风格化视觉内容生成 / 集成到自动化绘图管线
短板要求照片级真实感的生产任务
未公开 · cc-by-nc-4.0 · 未公开 · diffusers不可商用
证据17.2k 下载 / 68 赞 / 4 个社区来源
TTS 模型,面向语音合成开发者
适合文本转语音合成 / AI 语音内容制作
短板高并发实时语音服务
未公开 · other · 未知 · 未公开
证据176 下载 / 65 赞 / 4 个社区来源
查看全部模型 归档 →
输入关键词,跨模型 / 数据集 / 空间 / 工具 / 资讯 / 论文 检索