可用 CPU 运行的文本生成模型
共 27 个
Qwen3.6-35B-A3B (andreaborio) Qwen3.6 MoE 量化版,Apple Metal 加速推理 Dolphin3-Cyber-8B (RavichandranJ) 网络安全领域8B微调模型, 本地离线运行红蓝队工具 Hy3-GGUF (腾讯) 腾讯 Hy3 混合精度 GGUF,针对本地受限硬件极限压缩 MiniCPM5-1B-Thinking (OpenBMB) 1B 思考模型,改进编码与指令遵循,适合本地部署 Bonsai-27B (Prism ML) 27B 1-bit 量化模型,面向笔记本与手机本地推理 Ternary-Bonsai-27B (Prism ML) 三元权重 27B 推理模型,笔记本本地运行 Qwythos-9B-v2 (Empero AI) 修复循环生成并保留1M上下文推理能力的研究型模型 Nemotron-Labs-Audex-2B (NVIDIA) 统一音频-文本语言模型,支持语音识别、翻译、TTS 与音频生成 Supra-Router-51M (SupraLabs) 51M 参数边缘路由器, 判断提示词复杂度并分发至本地或云端模型 Agents-A1 (InternScience) 35B MoE 视觉 Agent,用于长程搜索与工具调用 Nova-1-Standard-1.3B (Smilyai Labs) 1.3B MoD对话模型,支持ChatML与代码/数学生成 Ornith-1.0-35B (DeepReinforce) 35B开源编码代理模型,原生工具调用与推理链 Ornith-1.0-9B (DeepReinforce) Ornith-9B MTP GGUF:llama.cpp推测解码加速 Huihui-GLM-5.2-GGUF (huihui-ai) 移除安全过滤的GLM-5.2 GGUF,供研究实验用 LFM2.5-230M (LiquidAI) 混合架构边缘设备模型,用于设备端文本生成 Mythos-nano (squ11z1) 3B无审查推理模型,专注数学与竞赛编程 Gemma-4-12B-it-LWQ6 (wepiqx) 混合量化Gemma-4-12B,8GB显存Pascal GPU代码生成 VibeThinker-3B (WeiboAI) 面向数学/代码/STEM的可验证推理3B小模型 Gemma4-12B-Coder (yuxinlu1) 本地 Python 编程模型,离线解决算法问题 LFM2.5-1.2B-JP (LiquidAI) 日英双语聊天模型,适合代理工作流与工具使用 Qwen3.5-0.8B-OptiQ-4bit (mlx-community) 苹果芯片4-bit MLX 量化 Qwen3.5-0.8B HelixLM-40M-ep1 (david-thrower) 循环异构图语言模型,用于个性化微调与端侧推理 LFM2.5-8B-A1B (LiquidAI) 8.3B总参/1.5B活跃,面向端侧个人助手的混合架构模型 Bonsai-8B-mlx-1bit (PrismML) Apple Silicon 的 1-bit LLM,端侧极低内存推理 HRM-Text-1B (sapientinc) 1B预对齐前缀LM,用前缀条件做结构化输出与推理 Minimalism (salakash) 为开发者输出最少代码行的可运行代码 Nandi-Mini-600M (FrontiersMind) 600M参数早期检查点,面向低资源多语言部署