SGLang — 高性能大模型推理服务框架
💡 建议配合 学习模式 使用本工具 学术合规

SGLang 是由 LMSYS(UC Berkeley 主导的非营利开源组织)开发的高性能大模型推理服务框架,专为大语言模型(LLM)和多模态模型设计,提供低延迟、高吞吐的推理能力。从单张 GPU 到大规模分布式集群均可部署,已成为业界事实标准,全球超 40 万张 GPU 上运行。

核心技术亮点:RadixAttention(前缀缓存复用,KV Cache 共享)、零开销 CPU 调度器、Prefill-Decode 分离架构、投机解码(DFlash / Spec V2)、连续批处理、PagedAttention、张量/流水线/专家/数据并行、结构化输出(压缩有限状态机,JSON 解码加速 3×)、多 LoRA 批处理、FP4/FP8/INT4/AWQ/GPTQ 量化。

支持主流模型:Llama、Qwen、DeepSeek、Kimi、GLM、GPT、Gemma、Mistral 等 LLM,以及嵌入模型、奖励模型、扩散模型(WAN、Qwen-Image)。提供完整的 OpenAI 兼容 API,可作为所有 AI 科研工具的推理后端。

25× 推理性能提升

实现 25 倍推理性能提升,配合大规模专家并行和 PD 分离,解锁旗舰硬件全部潜力。

DeepSeek-V3/R1 Day-0 支持

首日支持 DeepSeek V3/V4/R1 系列模型推理,含 Sparse Attention 优化;PD 分离 + 大规模 EP 实测 3.8× Prefill 提升。

结构化输出加速 3×

基于压缩有限状态机(Compressed FSM)实现 JSON 解码 3 倍加速,支持 JSON Schema / 正则约束,零精度损失。

RadixAttention 前缀缓存

自动复用请求间的公共前缀 KV Cache,多轮对话、Few-shot 场景下推理速度提升可达 5×,无需人工管理缓存。

广泛硬件支持

原生支持 NVIDIA、AMD、Intel Xeon、Google TPU等主流硬件。

RL & Post-Training 骨干

作为训练前沿模型的 Rollout 后端,原生集成 AReaL、Miles、verl 等 Post-Training 框架,支持 Verified RL 流程。

科研推理后端为 AI-Researcher、ASI-Evolve 等科研 Agent 提供本地高速推理服务,替代远程 API 调用
模型评测 Benchmark高吞吐批量推理支撑大规模评测(MMLU、HumanEval、MT-Bench 等)
多模态应用服务 VLM(LLaVA、Qwen-VL)和扩散模型(WAN 视频生成),统一推理入口
RAG 系统加速RadixAttention 复用长文档前缀,RAG 检索增强生成延迟显著降低
强化学习训练作为 RLHF/Verified RL 的 Rollout Engine,为 reward 采样提供高吞吐推理
私有化部署企业/高校在本地 GPU 集群部署私有 LLM 服务,数据不出网、OpenAI 兼容 API

本页 <head> 已内嵌机器可读的 application/agent-deploy+json 清单。默认目标 = 安装 SGLang 并启动推理服务。遇到 REQUIRED human-input 时 Agent 必须暂停询问。成功判定curl http://127.0.0.1:30000/v1/models 返回模型列表。

① 前置条件检查(Agent 自检)

需要 NVIDIA GPU + CUDA 12.1+
python3 --version       # required: 3.10+(推荐 3.11) pip3 --version          # required nvidia-smi              # required: CUDA GPU nvcc --version          # required: CUDA 12.1+

② 需人类补齐(Agent 必须暂停询问)

MODEL_PATH HuggingFace 模型 ID 或本地路径,如 Qwen/Qwen2.5-7B-Instruct
HF_TOKEN 仅 Gated 模型(Llama/Gemma)需要;去 HuggingFace 创建
SERVE_PORT = 30000 推理服务监听端口,默认 30000

③ 按序执行命令(Agent 串行跑)

# 1. 安装 SGLang(含 FlashInfer 加速后端) pip install "sglang[all]" --find-links https://flashinfer.ai/whl/cu124/torch2.5/flashinfer \   -i https://mirrors.aliyun.com/pypi/simple/ --trusted-host mirrors.aliyun.com --timeout 300  # 2. (可选)设置 HuggingFace 镜像加速模型下载 export HF_ENDPOINT=https://hf-mirror.com  # 3. 启动推理服务 python -m sglang.launch_server \   --model-path MODEL_PATH \   --port 30000 \   --host 0.0.0.0  # 多 GPU 张量并行示例(2 卡): # python -m sglang.launch_server --model-path MODEL_PATH --port 30000 --tp 2  # FP8 量化(显存减半): # python -m sglang.launch_server --model-path MODEL_PATH --port 30000 --quantization fp8

④ 安装成功验证

# === 验证服务启动 === curl -s http://127.0.0.1:30000/v1/models | python3 -m json.tool # 应返回包含 model ID 的 JSON  # === 验证推理能力 === curl -s http://127.0.0.1:30000/v1/chat/completions \   -H "Content-Type: application/json" \   -d '{"model":"default","messages":[{"role":"user","content":"Hello"}],"max_tokens":32}' \   | python3 -m json.tool  echo "🎉 SGLang 推理服务已启动,部署成功!"
⑤ 常见故障排查
CUDA out of memory换更小模型或加 --tp N 多卡并行;--quantization fp8 可减半显存
FlashInfer 安装失败pip install flashinfer -i https://flashinfer.ai/whl/cu124/torch2.5/flashinfer;确认 CUDA 版本匹配
模型下载超时export HF_ENDPOINT=https://hf-mirror.com;或先手动下载到本地再用路径启动
端口被占用--port 30001;或 lsof -ti:30000 | xargs kill
Gated 模型 403 Permission Deniedexport HF_TOKEN=hf_***;确保在 HuggingFace 上已接受模型 License
首次请求慢正常——首次请求触发 CUDA Kernel 编译和 KV Cache 分配,后续请求将恢复正常速度

AI·RESEARCH·HUB — SGLang — 高性能大模型推理服务框架