GLM-5.2
1M上下文开源模型,面向长文本处理与代码生成
仅 safetensors · 无 pickle 加载风险
社区实测
GLM-5.2 被社区普遍视为当前最强开源模型,通过 Unsloth 的 GGUF 量化(2-bit 238GB、1-bit 217GB)首次让 744B 参数旗舰模型可在本地运行,性能对标 Claude 4.8 Opus / GPT-5.5 / Gemini 3.1 Pro;但实际部署硬件门槛仍然很高,Q4 量化需 512GB RAM + 双 3090 仅约 6 tok/s,且基准测试基线选择存在社区争议。
- 超大模型本地化:将 1.51TB BF16 原始模型压缩至 217GB(1-bit)/ 238GB(2-bit),压缩率达 84-86%
- 多推理框架兼容:支持 llama.cpp、llama-cpp-python、vLLM、Unsloth Studio、Docker Model Runner、Lemonade、Pi、Hermes Agent 等
- Mac 本地运行:1-bit 版本在 Mac Studio M3 Ultra 256GB 统一内存上可达 ~21.6 tok/s
- 2-bit 量化精度保持:压缩 84% 后仍保留约 82% 准确率
- 1-bit 量化可用:Dynamic 1-bit top-1 准确率约 76.2%,虽为首次一次性尝试但展示了一比特量化的可行性
- 1M 上下文窗口:支持超长文本处理,且 IndexShare 架构在 1M token 时降低每 token FLOPs 2.9 倍
- MTP 推测解码优化:多 token 预测层提升推测解码接受长度最多 20%
- 内置代码执行:Unsloth Studio 中支持 Python 和 Bash 代码执行
- 思维链推理可控:可在 UI 中切换 High/Max Thinking 与非思考模式
- 长上下文 KV Cache 量化:通过 KV cache 量化进一步降低长文本推理的显存占用
- 实际部署硬件门槛极高:Q4_K_XL 量化需 512GB RAM + 2×3090 GPU,速度仅约 6 tok/s
- 运行功耗与成本不低:满负载约 600W,每日约 14kWh,按 $0.2/kWh 计年电费约 $1000
- 基准测试基线存争议:有社区用户指出对比基线并非原始 GLM 5.2,而是 Q8 量化版本,可能夸大了量化后的精度保持表现
- 低量化在慢内存上几乎不可用:Q2 量化在 DDR4 内存上速度极慢,用户体验差
- 1-bit 量化为首次一次性尝试,质量稳定性未经充分验证
- SWE-bench Pro 得分 62.1,编程能力与闭源旗舰仍有差距
- 2-bit 版本仍需 238GB 存储,超出大多数单卡/单机配置
GLM-5.2 - How to Run Locally | Unsloth DocumentationGLM-5.2 can now run locally in llama.cpp and Unsloth Studio. : r/LocalLLaMAunsloth GLM-5.2-GGUF , including 2bit at 238GB : r/LocalLLaMA1-bit GLM-5.2 GGUF vs. Claude 4.8 Opus vs. GPT-5.5 - RedditPSA: unsloth/GLM-5.2-GGUF is uploading : r/LocalLLaMA - Redditunsloth/GLM-5.2-GGUF - Hugging FaceGLM-5.2 – How to Run Locally - Hacker NewsUnsloth Quantizes GLM-5.2's 1.51TB to 217GB for Local Inference | AI1-bit GLM-5.2 GGUF vs. Claude 4.8 Opus vs. GPT-5.5 We gave 3 ...unsloth/GLM-5.2-GGUF - Hugging Face
截至 2026-06-28