Synthszr Charts — die großen AI-Marken im Wettkampf ums Podium
synthszr charts
sglang

Sglang · 3× · zuletzt 24. Aug. 2026

43
Momentum

SGLang ist ein Open-Source-Framework zur Programmierung und zum Serving von Large Language Models und multimodalen Modellen, das von der gemeinnützigen Organisation LMSYS betreut wird. Kernstück ist eine Backend-Runtime mit RadixAttention für automatisches Wiederverwenden von KV-Caches sowie Funktionen wie kontinuierliches Batching, spekulative Dekodierung, disaggregiertes Prefill/Decode und Quantisierung. Das System ist auf niedrige Latenz und hohen Durchsatz bei Produktions-Workloads ausgelegt und unterstützt eine breite Palette offener Modelle (u. a. Llama, Qwen, DeepSeek) über eine OpenAI-kompatible API. Laut eigenen Angaben läuft SGLang produktiv auf über 400.000 GPUs weltweit und verarbeitet täglich Billionen Tokens.

Momentum-Verlauf
26.05.24.08.

Features

Deployment (Self-host/Cloud)Self-hosted von Single-GPU bis verteilte Cluster; genutzt in Produktion auf über 400.000 GPUs weltweit
Durchsatz/LatenzAusgelegt auf niedrige Latenz und hohen Durchsatz durch RadixAttention, Prefix-Caching und Multi-GPU-Parallelismus
LizenzApache License 2.0
PlattformNVIDIA-, AMD-, Intel-Xeon-, Google-TPU- und Ascend-NPU-Hardware; Installation via pip, Source oder Docker
PreisKostenlos, Open Source (keine Lizenzgebühren)
Protokoll-KompatibilitätKompatibel mit OpenAI-API und Hugging-Face-Modellen
Release-DatumErstveröffentlichung 17. Januar 2024; aktuelle Versionen erscheinen fortlaufend (z. B. v0.4 im Dezember 2024)
Unterstützte Modelle/ProviderBreite Unterstützung u. a. für Llama, Qwen, DeepSeek, Gemma, Mistral, GLM, LLaVA sowie Embedding- und Reward-Modelle

Weitere Produkte in dieser Kategorie: LLM-Inferenz & Serving

Belege (3)

Subscribe free. Unsubscribe the second it sucks.

High-signal news across AI, business, UX, and tech. Every morning.