Schema: Mehrere Anfragen mit gleichem Textanfang laufen in eine Baumstruktur zusammengeführter Zwischenspeicher (RadixAttention) und verzweigen sich erst dort, wo ihr Text abweicht; rechts der Ausgabeschritt mit erzwungener Antwortform.

SGLang

SGLang ist eine kostenlos verfügbare Software, mit der man große Sprachmodelle auf eigenen Rechnern betreibt und deren Antworten ausliefert. Sie ist darauf ausgelegt, viele Anfragen gleichzeitig schnell und mit wenig Rechenaufwand zu bearbeiten.

SGLang ist eine frei verfügbare Software, die fertig trainierte Sprachmodelle betreibt. Ein Sprachmodell ist ein Programm, das aus einer Eingabe Wort für Wort eine Antwort berechnet – etwa ein Chatbot. Ein solches Modell ist zunächst nur eine riesige Datei mit Zahlen. Damit daraus ein nutzbarer Dienst wird, braucht man ein Programm, das die Anfragen annimmt, die Rechnung auf den Grafikkarten organisiert und den Text zurückschickt. Genau diese Rolle übernimmt SGLang. Der Name steht für „Structured Generation Language“, weil das Projekt außerdem Werkzeuge mitbringt, um die Form der Antwort vorzugeben.

Warum solche Server-Software über die Kosten entscheidet

Das Trainieren eines großen Modells ist teuer, passiert aber einmal. Der Betrieb dagegen läuft dauerhaft. Jede einzelne Antwort an jeden einzelnen Nutzer kostet Rechenzeit auf Grafikkarten, und die sind teuer und knapp. Wer einen Dienst mit Millionen Anfragen pro Tag anbietet, spürt schon kleine Effizienzgewinne sofort in der Rechnung.

Deshalb ist die Wahl der Betriebssoftware keine Nebensache. Zwei Server können dasselbe Modell laden und trotzdem sehr unterschiedlich viele Nutzer pro Grafikkarte bedienen. Der Unterschied liegt darin, wie geschickt die Software Anfragen bündelt und wie wenig sie doppelt rechnet. SGLang ist bekannt dafür, hier besonders gute Werte zu erreichen.

Ein zweiter Grund ist Unabhängigkeit. Wer ein Modell selbst betreibt, muss seine Daten nicht an einen externen Anbieter schicken. Für Banken, Krankenhäuser oder Behörden ist das oft entscheidend. Freie Software wie SGLang macht diesen Weg praktisch möglich, ohne dass man ein eigenes Team von Spezialisten für Grafikkarten-Programmierung braucht.

Wiederverwenden statt neu rechnen

Ein Sprachmodell rechnet zu jedem gelesenen Wort Zwischenergebnisse aus und legt sie in einem Zwischenspeicher ab. Bei der nächsten Anfrage beginnt es normalerweise von vorne. Sehr oft haben Anfragen aber einen identischen Anfang: dieselbe Anweisung, dasselbe Dokument, denselben Gesprächsverlauf. SGLangs wichtigste Idee heißt RadixAttention: Sie ordnet diese Zwischenergebnisse in einer Baumstruktur, in der gemeinsame Anfänge nur einmal existieren.

Man kann sich das wie einen Stammbaum vorstellen. Anfragen mit gleichem Beginn teilen sich den Stamm und trennen sich erst dort, wo ihr Text auseinandergeht. Der geteilte Teil muss nur einmal berechnet werden. In Anwendungen mit vielen ähnlichen Anfragen bringt das ein Vielfaches an Durchsatz.

Der zweite Baustein ist die erzwungene Antwortform. Oft soll ein Modell keinen freien Text liefern, sondern eine Datenstruktur – etwa eine Liste aus Name, Datum und Betrag. SGLang kann während der Textausgabe alle Wörter sperren, die diese Form verletzen würden. Das Ergebnis ist maschinenlesbar, ohne dass man hinterher aufräumen muss. Abzugrenzen ist das Projekt von reinen Bibliotheken zum Trainieren: SGLang trainiert nichts, es betreibt nur bereits fertige Modelle.

Wer SGLang einsetzt

Direkt sichtbar ist SGLang selten. Man begegnet ihm als unsichtbare Schicht hinter Chat-Diensten, Programmierassistenten und Suchfunktionen von Firmen, die ihre Modelle selbst hosten. Auch Anbieter, die den Zugang zu offenen Modellen gegen Bezahlung bereitstellen, nutzen häufig solche Server-Software.

In Tech-News taucht der Name meist im Vergleich mit vLLM auf, dem bekanntesten konkurrierenden Projekt. Beide verfolgen dasselbe Ziel, beide sind offen, und beide veröffentlichen regelmäßig Messwerte, wie viele Anfragen sie pro Sekunde schaffen. Wenn ein Labor ein neues offenes Modell veröffentlicht, steht in der Ankündigung oft, welche dieser Server es ab Tag eins unterstützen.

Ein häufiger Irrtum ist, SGLang mache ein Modell klüger. Das tut es nicht. Die Qualität der Antworten kommt vom Modell selbst. SGLang verändert nur, wie schnell, wie günstig und in welcher Form diese Antworten beim Nutzer ankommen.

Subscribe free. Unsubscribe the second it sucks.

High-signal news across AI, business, UX, and tech. Every morning.