工具 / vLLM

vLLM

  • cli
  • inference

GPU 高吞吐 LLM 推理与服务引擎,支持 200+ 模型架构

vLLM 是 UC Berkeley Sky Computing Lab 发起的 LLM 推理与服务引擎,现由 2000 余位贡献者维护。其核心创新是 PagedAttention——将注意力 KV cache 按页管理以降低显存碎片、提升吞吐。对外提供 vllm serve 命令部署 OpenAI 兼容 API(默认 8000 端口),也支持 vllm chat 交互对话和离线批推理。支持 200 余种模型架构,覆盖 NVIDIA/AMD GPU、Google TPU、x86/ARM CPU 等硬件,内置 FP8/INT8/GPTQ/AWQ 等量化方案与 FlashAttention/FlashInfer 等优化后端。 其扩展项目 vLLM-Omni 将能力延伸到多模态领域(图文音视频生成),以 DiT(Diffusion Transformer)为主要架构,通过 vllm serve --omni 部署全模态服务。Omni 以独立库 vllm-omni 发布,基于 vLLM 主线版本构建。

社区实测

vLLM 在生产部署中是性能与服务能力的代表,比 Ollama/LM Studio 更强,但显存占用和运行稳定性是社区常被吐槽的点。

  • OpenAI 兼容 API 让迁移很省事
  • 基于 PagedAttention 的 benchmark 表现出色,适合生产环境 serving
  • 相比 Ollama 和 LM Studio 推理能力更强
  • 负载下会出现随机 CUDA out-of-memory 错误
  • 显存开销大,24GB 的 RTX 4090 跑 13B 模型都很吃力
  • 工具调用(tool calling)体验不理想,社区有人没搞定
  • 不用于对外服务、只是自己本地用时,是否值得用被反复讨论

截至 2026-08-12

uv pip install vllm

← 返回工具库