工具 / Rapid-MLX

Rapid-MLX

  • cli
  • inference

Apple Silicon 本地推理引擎, OpenAI API 兼容

基于 Apple MLX 框架的本地推理服务器,利用 Apple Silicon 的统一内存与 Metal 计算后端,免去 GPU 显存与主存之间的数据搬运。一条 rapid-mlx serve 命令启动 OpenAI 兼容的 HTTP API(默认 localhost:8000/v1),任何兼容 OpenAI API 的客户端可直接对接,无需改代码。内置 17 种 tool call 解析器,支持 prompt cache 与连续批处理,可通过 extras 选装视觉、音频、嵌入支持。预置 72 个模型别名覆盖 13 个模型族,首次使用时自动从 HuggingFace 下载。仅限 Apple Silicon(M1–M4)macOS,Python 3.10+。

社区实测

社区反馈两极分化:有用户称在 Apple Silicon 上替代 Ollama 可获得 2-4 倍提速,但也有独立基准测试表明 MLX 在特定场景下整体比 llama.cpp GGUF 更慢

  • 作为 OpenAI 兼容的本地服务端,可无缝替换 Ollama
  • 在 Apple Silicon(M1/M2/M3/M4)上提供更快的 LLM 推理速度,有用户实测感知明显
  • 非 Qwen 模型(如 Llama、DeepSeek-R1)的结构化工具调用成功率波动大,仅 40% 到 100%
  • 独立基准测试在 M1 Max 上发现 MLX 在长上下文场景下整体比 llama.cpp GGUF 更慢,prefill 占 MLX 总响应时间 94%
  • Ollama 已引入 MLX 支持,Rapid-MLX 的相对优势可能缩小

截至 2026-07-19

brew install raullenchai/rapid-mlx/rapid-mlx

← 返回工具列表