SummFlow 2026-06-14 tools

oMLX

  • cli
  • app

Apple Silicon 上的 LLM 推理服务器,两级 KV 缓存 + 菜单栏管理

oMLX 是专为 Apple Silicon 设计的本地 LLM 推理服务器,基于 Apple MLX 框架。核心机制是两级 KV 缓存:热层在内存、冷层落 SSD (safetensors 格式),前缀命中时从磁盘恢复而非重算,使编码 agent 跨轮次保持低延迟。支持 continuous batching 并发处理请求。通过 OpenAI 和 Anthropic 兼容 API 对外暴露,可直连 Claude Code、OpenClaw、Cursor 等工具。内置 Web 管理面板提供模型下载、聊天和实时监控。提供原生 SwiftUI 菜单栏应用,含应用内自动更新。项目始于 vllm-mlx v0.1.0,在此基础上增加了多模型服务、两级 KV 缓存、VLM 支持、管理面板和菜单栏应用。

社区实测

社区认为 oMLX 是一个有潜力的开源 MLX 推理服务,能在 Mac 上跑 LM Studio 跑不动的更大模型且速度更快,但目前仍处于早期阶段,存在稳定性问题。

  • 在 Mac 上运行 27B 级别模型,而 LM Studio 无法运行
  • 推理速度显著优于 LM Studio,M4 Pro 24GB 上跑 9B 模型可达 60t/s
  • 通过 SSD 缓存的 KV cache 将 coding agent 的 TTFT 从 90 秒降至 1 秒
  • 存在稳定性问题:/health 返回 200 但 completions 会静默挂起(v0.4.0rc2/4.4rc1)
  • 社区采用度较低,HN 帖子仅 4 分 1 条评论

截至 2026-06-18

brew tap jundot/omlx https://github.com/jundot/omlx && brew install omlx