此页是 2026-06-22 的观测快照,查看该模型当前信息 → /m/zai-org__glm-52/

归档 / 2026-06-22 / GLM-5.2-GGUF (Unsloth)

GLM-5.2-GGUF (Unsloth)

1M上下文开源模型,面向长文本处理与代码生成

入选理由
GLM-5.2的GGUF量化版,可直接用llama.cpp/Ollama本地运行,1M上下文+强编码能力,适合长文本与代码任务。需自备GPU与推理工具。
对位
对位 DeepSeek-V3 等同级开源 MoE
适合
长文本理解与生成 / 编程与 Agent 任务
不适合
低延迟实时对话
规模
未公开 · 1M
授权
MIT · 需自查
框架
llama.cpp / ollama / vllm
血统
量化自 GLM-5.2
可信度
HuggingFace 下载量 32k,基础模型 GLM-5.2 有 MIT 开源与公开技术报告

社区实测

GLM-5.2 被社区普遍视为当前最强开源模型,通过 Unsloth 的 GGUF 量化(2-bit 238GB、1-bit 217GB)首次让 744B 参数旗舰模型可在本地运行,性能对标 Claude 4.8 Opus / GPT-5.5 / Gemini 3.1 Pro;但实际部署硬件门槛仍然很高,Q4 量化需 512GB RAM + 双 3090 仅约 6 tok/s,且基准测试基线选择存在社区争议。

  • 超大模型本地化:将 1.51TB BF16 原始模型压缩至 217GB(1-bit)/ 238GB(2-bit),压缩率达 84-86%
  • 多推理框架兼容:支持 llama.cpp、llama-cpp-python、vLLM、Unsloth Studio、Docker Model Runner、Lemonade、Pi、Hermes Agent 等
  • Mac 本地运行:1-bit 版本在 Mac Studio M3 Ultra 256GB 统一内存上可达 ~21.6 tok/s
  • 2-bit 量化精度保持:压缩 84% 后仍保留约 82% 准确率
  • 1-bit 量化可用:Dynamic 1-bit top-1 准确率约 76.2%,虽为首次一次性尝试但展示了一比特量化的可行性
  • 1M 上下文窗口:支持超长文本处理,且 IndexShare 架构在 1M token 时降低每 token FLOPs 2.9 倍
  • MTP 推测解码优化:多 token 预测层提升推测解码接受长度最多 20%
  • 内置代码执行:Unsloth Studio 中支持 Python 和 Bash 代码执行
  • 思维链推理可控:可在 UI 中切换 High/Max Thinking 与非思考模式
  • 长上下文 KV Cache 量化:通过 KV cache 量化进一步降低长文本推理的显存占用
  • 实际部署硬件门槛极高:Q4_K_XL 量化需 512GB RAM + 2×3090 GPU,速度仅约 6 tok/s
  • 运行功耗与成本不低:满负载约 600W,每日约 14kWh,按 $0.2/kWh 计年电费约 $1000
  • 基准测试基线存争议:有社区用户指出对比基线并非原始 GLM 5.2,而是 Q8 量化版本,可能夸大了量化后的精度保持表现
  • 低量化在慢内存上几乎不可用:Q2 量化在 DDR4 内存上速度极慢,用户体验差
  • 1-bit 量化为首次一次性尝试,质量稳定性未经充分验证
  • SWE-bench Pro 得分 62.1,编程能力与闭源旗舰仍有差距
  • 2-bit 版本仍需 238GB 存储,超出大多数单卡/单机配置

截至 2026-06-28

快速上手

ollama run hf.co/unsloth/GLM-5.2-GGUF

评分详情

Q1
今天能接上用吗   5 / 5
Q2
有可信证据吗   3 / 5
Q3
是新东西吗   1 / 5
总分
9

HuggingFace 原始数据 (抓取于 2026-06-22)

作者
unsloth
任务类型
text-generation
推理库
未指定
下载
32,260
点赞
224
许可证
MIT
标签
gguf, glm_moe_dsa, unsloth, text-generation, en, zh, arxiv:2602.15763, arxiv:2603.12201, base_model:zai-org/GLM-5.2, base_model:quantized:zai-org/GLM-5.2, license:mit, endpoints_compatible, region:us, conversational

探索

源链接