工具 / colibrì

colibrì

  • inference
  • cli

纯 C 推理引擎,25 GB 消费机上跑 744B MoE,专家从磁盘流式加载

colibrì 是一个纯 C 推理引擎,在约 25 GB RAM 的消费级机器上运行 GLM-5.2(744B 参数 MoE)模型。核心理念:模型的密集部分(~17B 参数)以 int4 驻留在 RAM(~9.9 GB),而 21,504 个路由专家留在磁盘上(~370 GB),按需流式加载,配合逐层 LRU 缓存和 OS 页缓存。引擎本身是单个 C 文件(c/glm.c,约 2,400 行),零运行时依赖,无需 GPU(可选 CUDA 后端用于常驻张量)。支持 MTP 推测解码(作者自测 2.2–2.8 token/forward)、MLA 注意力压缩 KV-cache(57× 更小)、DSA 稀疏注意力、语法引导推测解码、会话 KV 持久化及学习缓存(越用越快)。提供 CLI 聊天、OpenAI 兼容 HTTP API 和社区维护的 Web UI。开发机(WSL2,12 核,25 GB RAM)上冷启动约 0.05–0.1 tok/s;社区实测 Apple M5 Max(Metal 后端)上达 1.83 tok/s。

cd c && ./setup.sh

← 返回工具列表