

Sglang · 3× · zuletzt 24. Aug. 2026
SGLang ist ein Open-Source-Framework zur Programmierung und zum Serving von Large Language Models und multimodalen Modellen, das von der gemeinnützigen Organisation LMSYS betreut wird. Kernstück ist eine Backend-Runtime mit RadixAttention für automatisches Wiederverwenden von KV-Caches sowie Funktionen wie kontinuierliches Batching, spekulative Dekodierung, disaggregiertes Prefill/Decode und Quantisierung. Das System ist auf niedrige Latenz und hohen Durchsatz bei Produktions-Workloads ausgelegt und unterstützt eine breite Palette offener Modelle (u. a. Llama, Qwen, DeepSeek) über eine OpenAI-kompatible API. Laut eigenen Angaben läuft SGLang produktiv auf über 400.000 GPUs weltweit und verarbeitet täglich Billionen Tokens.
Features
| Deployment (Self-host/Cloud) | Self-hosted von Single-GPU bis verteilte Cluster; genutzt in Produktion auf über 400.000 GPUs weltweit |
| Durchsatz/Latenz | Ausgelegt auf niedrige Latenz und hohen Durchsatz durch RadixAttention, Prefix-Caching und Multi-GPU-Parallelismus |
| Lizenz | Apache License 2.0 |
| Plattform | NVIDIA-, AMD-, Intel-Xeon-, Google-TPU- und Ascend-NPU-Hardware; Installation via pip, Source oder Docker |
| Preis | Kostenlos, Open Source (keine Lizenzgebühren) |
| Protokoll-Kompatibilität | Kompatibel mit OpenAI-API und Hugging-Face-Modellen |
| Release-Datum | Erstveröffentlichung 17. Januar 2024; aktuelle Versionen erscheinen fortlaufend (z. B. v0.4 im Dezember 2024) |
| Unterstützte Modelle/Provider | Breite Unterstützung u. a. für Llama, Qwen, DeepSeek, Gemma, Mistral, GLM, LLaVA sowie Embedding- und Reward-Modelle |