SGLang
LLM 推理引擎:前缀缓存、约束解码与多模态 serving,从单 GPU 到万卡集群
SGLang 是 LMSYS(做 Chatbot Arena 的团队)开发的 LLM 推理引擎,分两层:前端是嵌在 Python 里的 DSL,用 fork 做并行生成、gen 调模型、regex/json_schema 约束解码,能把多条 LLM 调用编排成带控制流的程序;后端 Runtime 靠 RadixAttention 把 KV 缓存组织成 radix tree,同一前缀的请求自动复用缓存、省掉重复计算,配合零开销 batch 调度器与 continuous batching 撑高并发。 结构化生成支持 JSON Schema、regex、EBNF 三种约束,底层可选 XGrammar(默认)、Outlines、Llguidance 三种语法后端,输出保证符合给定格式。 两个子项目:SGLang-Omni 处理 omni/多模态模型(文本+图像+音频+视频入,文本+语音出)的多阶段流水线 serving,通过 sglang-omni 包发布,支持 Higgs Audio、Qwen3-Omni、Ming-Omni 等模型;SGLang Diffusion 加速图像与视频生成。 模型覆盖 Llama、Qwen、DeepSeek、GLM、Mistral、GPT-oss 等系列;硬件覆盖 NVIDIA/AMD GPU、Intel CPU、Google TPU、Ascend NPU。NeurIPS 2024 论文,Apache-2.0 开源,由 LMSYS 非营利组织托管。
社区实测
截至 2026-07-05
uv pip install --prerelease=allow sglang docker pull lmsysorg/sglang:latest docker pull lmsysorg/sglang-omni:dev