Rapid-MLX
Apple Silicon 本地推理引擎, OpenAI API 兼容
基于 Apple MLX 框架的本地推理服务器,利用 Apple Silicon 的统一内存与 Metal 计算后端,免去 GPU 显存与主存之间的数据搬运。一条 rapid-mlx serve 命令启动 OpenAI 兼容的 HTTP API(默认 localhost:8000/v1),任何兼容 OpenAI API 的客户端可直接对接,无需改代码。内置 17 种 tool call 解析器,支持 prompt cache 与连续批处理,可通过 extras 选装视觉、音频、嵌入支持。预置 72 个模型别名覆盖 13 个模型族,首次使用时自动从 HuggingFace 下载。仅限 Apple Silicon(M1–M4)macOS,Python 3.10+。
社区实测
社区反馈两极分化:有用户称在 Apple Silicon 上替代 Ollama 可获得 2-4 倍提速,但也有独立基准测试表明 MLX 在特定场景下整体比 llama.cpp GGUF 更慢
- 作为 OpenAI 兼容的本地服务端,可无缝替换 Ollama
- 在 Apple Silicon(M1/M2/M3/M4)上提供更快的 LLM 推理速度,有用户实测感知明显
- 非 Qwen 模型(如 Llama、DeepSeek-R1)的结构化工具调用成功率波动大,仅 40% 到 100%
- 独立基准测试在 M1 Max 上发现 MLX 在长上下文场景下整体比 llama.cpp GGUF 更慢,prefill 占 MLX 总响应时间 94%
- Ollama 已引入 MLX 支持,Rapid-MLX 的相对优势可能缩小
来源
Rapid-MLX Review: 4x Faster Local LLM Server for MacShow HN: Rapid-MLX – Run local LLMs on Mac, 2-3x faster than alternativesRapid-MLX: 2-4x faster Ollama alternative as OpenAI-compatible backendMLX is not faster. I benchmarked MLX vs llama.cpp on M1 Max
截至 2026-07-19
brew install raullenchai/rapid-mlx/rapid-mlx pip install rapid-mlx curl -fsSL https://raullenchai.github.io/Rapid-MLX/install.sh | bash