Meta-Llama-3-8B-Instruct-4bit (mlx-community)
Llama-3-8B 4-bit版,M系列芯片本地推理
- Apple Silicon
仅 safetensors · 无 pickle 加载风险
社区实测
社区普遍认为 MLX 4bit 版 Llama 3 8B 是 Apple Silicon Mac 上最便捷的本地部署方案之一,几行代码即可加载运行;在 MMLU Pro 上质量与 GGUF q4_K_M 基本持平,8GB 内存的 M2 mini 即可跑到约 18.5 tok/s;首次加载内存占用比 GGUF q4_K_M 减少约 30%,适合轻量日常使用和快速原型验证。
- 在 8GB 统一内存的 M2 mini 上即可流畅运行,部署门槛极低
- 通过 mlx_lm 库两行代码即可加载和生成,上手简单
- MLX 4bit 量化在 MMLU Pro 上的质量与 GGUF q4_K_M 基本持平
- 首次加载时内存占用比 GGUF q4_K_M 减少约 30%
- 已被 Xinference 收录为内置模型,支持一键部署
- 基于 Meta 官方 Llama 3 Instruct 直接转换,对话优化表现稳定
- 在相同硬件上吞吐量低于 gemma-2-9b,尽管参数量更少
- MMLU Pro 评测结果存在一定的随机波动,单次跑分需谨慎解读
来源
mlx-community/Meta-Llama-3-8B-Instruct-4bit · Hugging Facemlx-community/Meta-Llama-3-8B-Instruct-4bit · ml-explore/mlx · Discussion #1013 · GitHubLM Studio ships an MLX backend! Run any LLM from the Hugging ...MLX-4bit vs GGUF-q4_K_M : r/LocalLLaMAllama-3-instruct — XinferenceRunning LLMs Locally on Your Mac: A Deep Dive into MLX ...
截至 2026-06-21
快速上手
pip install mlx-lm && mlx_lm.generate --model mlx-community/Meta-Llama-3-8B-Instruct-4bit --prompt "hello"