25× 推理性能提升
实现 25 倍推理性能提升,配合大规模专家并行和 PD 分离,解锁旗舰硬件全部潜力。
LMSYS · UC Berkeley — 高性能大模型推理服务框架
SGLang 是由 LMSYS(UC Berkeley 主导的非营利开源组织)开发的高性能大模型推理服务框架,专为大语言模型(LLM)和多模态模型设计,提供低延迟、高吞吐的推理能力。从单张 GPU 到大规模分布式集群均可部署,已成为业界事实标准,全球超 40 万张 GPU 上运行。
核心技术亮点:RadixAttention(前缀缓存复用,KV Cache 共享)、零开销 CPU 调度器、Prefill-Decode 分离架构、投机解码(DFlash / Spec V2)、连续批处理、PagedAttention、张量/流水线/专家/数据并行、结构化输出(压缩有限状态机,JSON 解码加速 3×)、多 LoRA 批处理、FP4/FP8/INT4/AWQ/GPTQ 量化。
支持主流模型:Llama、Qwen、DeepSeek、Kimi、GLM、GPT、Gemma、Mistral 等 LLM,以及嵌入模型、奖励模型、扩散模型(WAN、Qwen-Image)。提供完整的 OpenAI 兼容 API,可作为所有 AI 科研工具的推理后端。
实现 25 倍推理性能提升,配合大规模专家并行和 PD 分离,解锁旗舰硬件全部潜力。
首日支持 DeepSeek V3/V4/R1 系列模型推理,含 Sparse Attention 优化;PD 分离 + 大规模 EP 实测 3.8× Prefill 提升。
基于压缩有限状态机(Compressed FSM)实现 JSON 解码 3 倍加速,支持 JSON Schema / 正则约束,零精度损失。
自动复用请求间的公共前缀 KV Cache,多轮对话、Few-shot 场景下推理速度提升可达 5×,无需人工管理缓存。
原生支持 NVIDIA、AMD、Intel Xeon、Google TPU等主流硬件。
作为训练前沿模型的 Rollout 后端,原生集成 AReaL、Miles、verl 等 Post-Training 框架,支持 Verified RL 流程。
本页 <head> 已内嵌机器可读的 application/agent-deploy+json 清单。默认目标 = 安装 SGLang 并启动推理服务。遇到 REQUIRED human-input 时 Agent 必须暂停询问。成功判定:curl http://127.0.0.1:30000/v1/models 返回模型列表。
python3 --version # required: 3.10+(推荐 3.11) pip3 --version # required nvidia-smi # required: CUDA GPU nvcc --version # required: CUDA 12.1+ Qwen/Qwen2.5-7B-Instruct = 30000 推理服务监听端口,默认 30000 # 1. 安装 SGLang(含 FlashInfer 加速后端) pip install "sglang[all]" --find-links https://flashinfer.ai/whl/cu124/torch2.5/flashinfer \ -i https://mirrors.aliyun.com/pypi/simple/ --trusted-host mirrors.aliyun.com --timeout 300 # 2. (可选)设置 HuggingFace 镜像加速模型下载 export HF_ENDPOINT=https://hf-mirror.com # 3. 启动推理服务 python -m sglang.launch_server \ --model-path MODEL_PATH \ --port 30000 \ --host 0.0.0.0 # 多 GPU 张量并行示例(2 卡): # python -m sglang.launch_server --model-path MODEL_PATH --port 30000 --tp 2 # FP8 量化(显存减半): # python -m sglang.launch_server --model-path MODEL_PATH --port 30000 --quantization fp8 # === 验证服务启动 === curl -s http://127.0.0.1:30000/v1/models | python3 -m json.tool # 应返回包含 model ID 的 JSON # === 验证推理能力 === curl -s http://127.0.0.1:30000/v1/chat/completions \ -H "Content-Type: application/json" \ -d '{"model":"default","messages":[{"role":"user","content":"Hello"}],"max_tokens":32}' \ | python3 -m json.tool echo "🎉 SGLang 推理服务已启动,部署成功!" --tp N 多卡并行;--quantization fp8 可减半显存pip install flashinfer -i https://flashinfer.ai/whl/cu124/torch2.5/flashinfer;确认 CUDA 版本匹配export HF_ENDPOINT=https://hf-mirror.com;或先手动下载到本地再用路径启动--port 30001;或 lsof -ti:30000 | xargs killexport HF_TOKEN=hf_***;确保在 HuggingFace 上已接受模型 License