Llama-2-7b-chat-mlx (mlx-community)
Apple芯片上本地运行的Llama2 7B对话模型
社区实测
MLX 在 Apple Silicon 上的稳态解码速度确实优于 llama.cpp,Ollama 的切换也验证了这条路线;但社区生态(模板维护、模型转换覆盖)明显不如 GGUF 活跃,实际使用中速度宣传有时被夸大,且存在稳定性坑。
- 在 Apple Silicon 上稳态解码速度优于 llama.cpp
- 利用统一内存架构实现 CPU/GPU 零拷贝张量操作
- SSD 缓存比 llama.cpp 更稳定
- 4-bit 量化版本可直接通过 MLX Python API 加载运行
- Ollama 已切换至 MLX 后端,验证了该路线的可行性
- MLX 社区不如 GGUF 活跃,模板修复和量化改进滞后
- 实际使用可能出现崩溃、prompt 缓存缺失、内存压力问题
- 宣传的 token 速度在实际场景中可能被夸大
- mlx-community 模型集合维护不足,部分模型系列只有少量转换
- 权重从 bfloat16 转为 float16 存储,numpy 兼容性受限
来源
Whats up with MLX? : r/LocalLLaMAPursuit of performance Llama.cpp to MLX : r/LocalLLaMA - RedditApple MLX vs llama.cpp: Which is Really Faster? (4 Runtimes - Ollama Included)Apple's MLX Runs Local LLMs 3x Faster Than llama.cpp — Until ...mlx-community/Llama-2-7b-chat-4-bit · Hugging FaceMLX vs llama.cpp on Apple Silicon: Benchmarks, M5 Neural Accelerators, and Why Ollama Switched
截至 2026-06-28
本形态 ~4.2GB 4-bit · 国内 需代理 · 4,057 下载
快速上手
python mlx-examples/llama/llama.py --prompt 'Hi' model/ 下载动量
30天下载 3.6k → 3.2k