

Lmsys · seit Januar 2024 · 11× · zuletzt 08. Juli 2026
SGLang ist ein Open-Source-Serving-Framework für große Sprachmodelle (LLMs) und multimodale Modelle, entwickelt von Forschern der UC Berkeley/Stanford und gehostet von der gemeinnützigen Organisation LMSYS. Kernstück ist RadixAttention für effizientes KV-Cache-Wiederverwenden, ergänzt durch Zero-Overhead-Scheduling, kontinuierliches Batching, Spekulative Dekodierung (u.a. das neue DSpark-Verfahren) und breite Quantisierungsunterstützung. Das Framework wird produktiv auf über 400.000 GPUs weltweit eingesetzt und unterstützt zahlreiche Modelle wie Llama, Qwen, DeepSeek, GLM, Gemma und Mistral. SGLang bietet eine OpenAI-kompatible API und läuft auf NVIDIA-, AMD-, Intel-Xeon-, Google-TPU- und Ascend-NPU-Hardware.
Features
| Durchsatz/Latenz | DeepSeek-V4-Pro: 383,7 Tok/s bei B=1 auf B300 mit DSpark; bis zu ~20% höherer Durchsatz bei hoher Last ggü. festem Budget |
| Lizenz | Apache License 2.0 |
| Plattform | NVIDIA, AMD, Intel Xeon, Google TPU, Ascend NPU; Linux, Docker, Kubernetes |
| Preis | Kostenlos, Open Source (keine Lizenzgebühren) |
| Protokoll-Kompatibilität | OpenAI-kompatible API; kompatibel mit Hugging Face APIs |
| Release-Datum | Initiales Release: 17. Januar 2024 |
| Unterstützte Modelle/Provider | Llama, Qwen, DeepSeek, Kimi, GLM, GPT, Gemma, Mistral u.v.m.; zudem Embedding-, Reward- und Diffusionsmodelle (WAN, Qwen-Image) |