vLLM
GPU 高吞吐 LLM 推理与服务引擎,支持 200+ 模型架构
vLLM 是 UC Berkeley Sky Computing Lab 发起的 LLM 推理与服务引擎,现由 2000 余位贡献者维护。其核心创新是 PagedAttention——将注意力 KV cache 按页管理以降低显存碎片、提升吞吐。对外提供 vllm serve 命令部署 OpenAI 兼容 API(默认 8000 端口),也支持 vllm chat 交互对话和离线批推理。支持 200 余种模型架构,覆盖 NVIDIA/AMD GPU、Google TPU、x86/ARM CPU 等硬件,内置 FP8/INT8/GPTQ/AWQ 等量化方案与 FlashAttention/FlashInfer 等优化后端。 其扩展项目 vLLM-Omni 将能力延伸到多模态领域(图文音视频生成),以 DiT(Diffusion Transformer)为主要架构,通过 vllm serve --omni 部署全模态服务。Omni 以独立库 vllm-omni 发布,基于 vLLM 主线版本构建。
社区实测
vLLM 在生产部署中是性能与服务能力的代表,比 Ollama/LM Studio 更强,但显存占用和运行稳定性是社区常被吐槽的点。
- OpenAI 兼容 API 让迁移很省事
- 基于 PagedAttention 的 benchmark 表现出色,适合生产环境 serving
- 相比 Ollama 和 LM Studio 推理能力更强
- 负载下会出现随机 CUDA out-of-memory 错误
- 显存开销大,24GB 的 RTX 4090 跑 13B 模型都很吃力
- 工具调用(tool calling)体验不理想,社区有人没搞定
- 不用于对外服务、只是自己本地用时,是否值得用被反复讨论
10 Best vLLM Alternatives for LLM Inference in Production (2026)r/LocalLLM: vLLM vs Ollama vs LMStudio?r/LocalLLaMA: is vllm is most recommended llm inference toolr/LocalLLaMA: Is using vLLM actually worth it if you aren't serving the model to other people?
截至 2026-08-12
uv pip install vllm docker pull vllm/vllm-openai uv pip install vllm-omni