MLX LM
Apple 官方的 Apple Silicon LLM 推理与微调工具,带 OpenAI 兼容 HTTP 服务
Apple 机器学习研究团队出品的 LLM 工具包,基于 MLX 数组框架在 Apple Silicon 上做文本生成、对话、微调与模型量化。mlx_lm.generate 单次推理,mlx_lm.chat 进入 REPL 对话,mlx_lm.server 启动一个 OpenAI 兼容的 /v1/chat/completions HTTP 服务(默认 localhost:8080),模型从 HuggingFace Hub 自动拉取,默认使用 mlx-community/Llama-3.2-3B-Instruct-4bit——4-bit 量化 3B 参数,16 GB 统一内存的 Mac 可直接运行。Python API 提供 load/generate/stream_generate,支持流式输出、采样参数控制与 tool calling。另有 mlx_lm.lora 做 LoRA/QLoRA 微调(覆盖 Mistral/Llama/Qwen/Gemma 等模型族),mlx_lm.convert 做模型量化与上传,mlx_lm.manage 管理本地模型缓存。社区在 mlx-community 下维护了数千个预量化模型。
社区实测
MLX/MLX-LM 是 Apple Silicon 上值得关注的本地 ML 方案,但生态仍偏早期,安装和跨平台部署存在明显摩擦。
- Apple Silicon 原生的本地 LLM 推理框架(类似 PyTorch/numpy 但专为 Apple Silicon 设计)
- 多机模型分片用于解码加速,官方基准中 batch size 1 下 4 机可达 3.5 倍 token 生成提升
- KV cache 可溢出到 SSD 以降低显存/内存压力
- 提供轻量原生服务端 mlx-serve,可执行文件仅 3.1MB,无需 Python 及大量依赖
- 安装过程可能遇到依赖问题(如 cmake 版本兼容性导致安装失败)
- 仅限 Apple Silicon,无法直接部署到通用 Linux 服务器
- 同一模型在不同量化/服务方案下的代码审查能力差异很大(实测 3/10 到 5/10),参数规模并不单调地决定代码审查质量
MLX is worth paying attention to. It's still pretty young... | Hacker NewsI follow the MLX team on Twitter and they sometimes post about using MLX on two ... | Hacker NewsMLX-serve vs LM Studio on Apple Silicon ~40% faster in my benchmarks (w/ MTP/PLD) : r/LocalLLMMedium
截至 2026-08-05
pip install mlx-lm conda install -c conda-forge mlx-lm