指南 / 文本生成模型 / 8GB 显存能跑

8GB 显存能跑的文本生成模型

共 40 个

显存档为包含式:更低显存也能跑的模型一并列在此。数值取 Q4 量化后显存估算。

GPT-OSS-20B (OpenAI) 2-bit 量化 MLX 模型,专为 Apple Silicon 推理 gear-manual-qwen3-4b (Raindog) 面向硬件音乐设备的本地助手,基于Qwen3-4B微调 Bonsai-27B-mlx-1bit (Prism ML) 1-bit 27B 模型, 可在手机和笔记本本地运行推理 Dolphin3-Cyber-8B (RavichandranJ) 网络安全领域8B微调模型, 本地离线运行红蓝队工具 MiniCPM5-1B-Thinking (OpenBMB) 1B 思考模型,改进编码与指令遵循,适合本地部署 Bonsai-27B (Prism ML) 27B 1-bit 量化模型,面向笔记本与手机本地推理 Ternary Bonsai 27B (prism-ml) 三元2-bit 27B开源模型,笔记本本地运行推理 Ternary-Bonsai-27B (Prism ML) 三元权重 27B 推理模型,笔记本本地运行 Qwythos-9B-v2 (Empero AI) 修复循环生成并保留1M上下文推理能力的研究型模型 Nemotron-Labs-Audex-2B (NVIDIA) 统一音频-文本语言模型,支持语音识别、翻译、TTS 与音频生成 Supra-Router-51M (SupraLabs) 51M 参数边缘路由器, 判断提示词复杂度并分发至本地或云端模型 Grug-12B (kai-os) 紧凑推理微调,减少冗余推理轨迹,降低推理token消耗 Nova-1-Standard-1.3B (Smilyai Labs) 1.3B MoD对话模型,支持ChatML与代码/数学生成 Qwen3.6-35B-A3B (Qwen) 三元专家量化版,9.4 GB 全量跑在 16 GB Mac 上 Ornith-1.0-9B (DeepReinforce) Ornith-9B MTP GGUF:llama.cpp推测解码加速 LFM2.5-230M (LiquidAI) 混合架构边缘设备模型,用于设备端文本生成 Mythos-nano (squ11z1) 3B无审查推理模型,专注数学与竞赛编程 FastContext-1.0-4B-RL (Microsoft) 为编码代理提供仓库探索与精确文件引用 Huihui-gemma-4-12B-coder-abliterated (huihui-ai) 未审查版 Gemma 代码模型,用于编程与推理,已去除拒答 VibeThinker-3B (WeiboAI) 面向数学/代码/STEM的可验证推理3B小模型 FastContext-1.0-4B-SFT (Microsoft) 轻量仓库探索子代理,供编码代理按需调用,减少 token 消耗 Z-Image-Engineer-V6 (BennyDaBall) 4B 提示词增强与 Z-Image 文本编码器,本地双用途 Gemma4-12B-Coder (yuxinlu1) 本地 Python 编程模型,离线解决算法问题 LFM2.5-1.2B-JP (LiquidAI) 日英双语聊天模型,适合代理工作流与工具使用 Gemma-4-12B-OBLITERATED (OBLITERATUS) 零拒绝消融Gemma 4,供对齐研究与红队测试 Qwen3.5-0.8B-OptiQ-4bit (mlx-community) 苹果芯片4-bit MLX 量化 Qwen3.5-0.8B Qwen3.5-2B-OptiQ-4bit (mlx-community) 4-bit混合精度MLX量化Qwen3.5-2B,苹果芯片推理 Mellum2-12B-A2.5B-Instruct (JetBrains) 直接回答的指令模型,用于交互聊天、代码和工具调用 HelixLM-40M-ep1 (david-thrower) 循环异构图语言模型,用于个性化微调与端侧推理 LFM2.5-8B-A1B (LiquidAI) 8.3B总参/1.5B活跃,面向端侧个人助手的混合架构模型 Mellum2-12B-A2.5B-Thinking (JetBrains) 思考型助手,在<think>块中输出推理链后给出最终答案 Qwen3.5-9B (Qwen) Qwen3.5-9B MoQ量化版,MTP推测解码,适合本地快速生成 BitCPM-CANN-8B (OpenBMB) 昇腾原生1.58-bit三元LLM,推理内存降6x,保持95.7%性能 Meta-Llama-3-8B-Instruct-4bit (mlx-community) Llama-3-8B 4-bit版,M系列芯片本地推理 Ternary-Bonsai-8B (Prism ML) 三元1.58-bit量化8B模型,苹果芯片本地推理 Llama-2-7b-chat-mlx (mlx-community) Apple芯片上本地运行的Llama2 7B对话模型 Bonsai-8B-mlx-1bit (PrismML) Apple Silicon 的 1-bit LLM,端侧极低内存推理 HRM-Text-1B (sapientinc) 1B预对齐前缀LM,用前缀条件做结构化输出与推理 Minimalism (salakash) 为开发者输出最少代码行的可运行代码 Nandi-Mini-600M (FrontiersMind) 600M参数早期检查点,面向低资源多语言部署