SummFlow 2026-07-05 tools

vLLM

  • cli
  • inference

GPU 高吞吐 LLM 推理与服务引擎,支持 200+ 模型架构

vLLM 是 UC Berkeley Sky Computing Lab 发起的 LLM 推理与服务引擎,现由 2000 余位贡献者维护。其核心创新是 PagedAttention——将注意力 KV cache 按页管理以降低显存碎片、提升吞吐。对外提供 vllm serve 命令部署 OpenAI 兼容 API(默认 8000 端口),也支持 vllm chat 交互对话和离线批推理。支持 200 余种模型架构,覆盖 NVIDIA/AMD GPU、Google TPU、x86/ARM CPU 等硬件,内置 FP8/INT8/GPTQ/AWQ 等量化方案与 FlashAttention/FlashInfer 等优化后端。 其扩展项目 vLLM-Omni 将能力延伸到多模态领域(图文音视频生成),以 DiT(Diffusion Transformer)为主要架构,通过 vllm serve --omni 部署全模态服务。Omni 以独立库 vllm-omni 发布,基于 vLLM 主线版本构建。

社区实测

截至 2026-07-05

uv pip install vllm