Synthszr Charts — die großen AI-Marken im Wettkampf ums Podium
synthszr charts
lmsys

Lmsys · seit Januar 2024 · 11× · zuletzt 08. Juli 2026

38
Momentum

SGLang ist ein Open-Source-Serving-Framework für große Sprachmodelle (LLMs) und multimodale Modelle, entwickelt von Forschern der UC Berkeley/Stanford und gehostet von der gemeinnützigen Organisation LMSYS. Kernstück ist RadixAttention für effizientes KV-Cache-Wiederverwenden, ergänzt durch Zero-Overhead-Scheduling, kontinuierliches Batching, Spekulative Dekodierung (u.a. das neue DSpark-Verfahren) und breite Quantisierungsunterstützung. Das Framework wird produktiv auf über 400.000 GPUs weltweit eingesetzt und unterstützt zahlreiche Modelle wie Llama, Qwen, DeepSeek, GLM, Gemma und Mistral. SGLang bietet eine OpenAI-kompatible API und läuft auf NVIDIA-, AMD-, Intel-Xeon-, Google-TPU- und Ascend-NPU-Hardware.

Momentum-Verlauf
19.05.17.08.

Features

Durchsatz/LatenzDeepSeek-V4-Pro: 383,7 Tok/s bei B=1 auf B300 mit DSpark; bis zu ~20% höherer Durchsatz bei hoher Last ggü. festem Budget
LizenzApache License 2.0
PlattformNVIDIA, AMD, Intel Xeon, Google TPU, Ascend NPU; Linux, Docker, Kubernetes
PreisKostenlos, Open Source (keine Lizenzgebühren)
Protokoll-KompatibilitätOpenAI-kompatible API; kompatibel mit Hugging Face APIs
Release-DatumInitiales Release: 17. Januar 2024
Unterstützte Modelle/ProviderLlama, Qwen, DeepSeek, Kimi, GLM, GPT, Gemma, Mistral u.v.m.; zudem Embedding-, Reward- und Diffusionsmodelle (WAN, Qwen-Image)

Weitere Produkte in dieser Kategorie: LLM-Inferenz & Serving

Belege (11)

Subscribe free. Unsubscribe the second it sucks.

High-signal news across AI, business, UX, and tech. Every morning.