SummFlow 2026-07-05 tools

MLX LM

  • mlx-lm
  • cli
  • app

Apple 官方的 Apple Silicon LLM 推理与微调工具,带 OpenAI 兼容 HTTP 服务

Apple 机器学习研究团队出品的 LLM 工具包,基于 MLX 数组框架在 Apple Silicon 上做文本生成、对话、微调与模型量化。mlx_lm.generate 单次推理,mlx_lm.chat 进入 REPL 对话,mlx_lm.server 启动一个 OpenAI 兼容的 /v1/chat/completions HTTP 服务(默认 localhost:8080),模型从 HuggingFace Hub 自动拉取,默认使用 mlx-community/Llama-3.2-3B-Instruct-4bit——4-bit 量化 3B 参数,16 GB 统一内存的 Mac 可直接运行。Python API 提供 load/generate/stream_generate,支持流式输出、采样参数控制与 tool calling。另有 mlx_lm.lora 做 LoRA/QLoRA 微调(覆盖 Mistral/Llama/Qwen/Gemma 等模型族),mlx_lm.convert 做模型量化与上传,mlx_lm.manage 管理本地模型缓存。社区在 mlx-community 下维护了数千个预量化模型。

社区实测

社区认为 MLX LM 是 Apple Silicon 上最便捷的 LLM 本地推理方案之一,mlx_lm.server 的 OpenAI 兼容 API 降低了接入门槛,但在并发场景下吞吐不及 llama-server。

  • 单命令启动 OpenAI 兼容的本地推理服务,无需额外配置
  • 与 HuggingFace Hub 深度集成,数千个预量化模型即拉即用
  • LoRA/QLoRA 微调在同一工具链内完成,无需切换框架
  • 服务器官方标注不适合生产环境,仅实现了基础安全检查
  • 不支持连续批处理,多并发请求会串行化
  • 16GB Mac 可跑 3B-4B 量化模型,7B+ 模型需要更大内存

截至 2026-07-05

pip install mlx-lm