Schema: Ein eingegebenes Wort gelangt zum Router, der aus acht dargestellten Experten zwei auswählt; nur diese zwei sind hervorgehoben und rechnen, ihre Ergebnisse werden gewichtet zusammengeführt, die übrigen sechs bleiben grau und inaktiv.

Sparse MoE

Sparse MoE ist eine Bauweise für große KI-Modelle, bei der pro Anfrage nur ein kleiner Teil des Modells rechnet und der große Rest ruht. So können Modelle sehr viel Wissen speichern, ohne dass jede Antwort entsprechend teuer wird.

Moderne Sprachprogramme wie ChatGPT bestehen aus riesigen Rechennetzen mit Milliarden einstellbarer Zahlenwerte. Diese Zahlenwerte speichern alles, was das Programm beim Lernen aus Texten aufgenommen hat. Normalerweise werden bei jeder Frage alle diese Werte durchgerechnet. Sparse MoE bricht mit dieser Regel: Das Netz wird in viele kleine Teilnetze zerlegt, und pro Frage arbeiten nur zwei oder drei davon. « Sparse » heißt auf Deutsch « spärlich » und meint genau das: nur ein spärlicher Bruchteil des Programms ist gleichzeitig aktiv. Die englische Abkürzung MoE steht für « Mixture of Experts », also « Mischung von Fachleuten » — die Teilnetze nennt man Experten.

Große Modelle zum Preis von kleinen

Bei KI-Modellen gilt eine unbequeme Faustregel: mehr Speicherplätze für Gelerntes bedeuten mehr Können, aber auch mehr Rechenaufwand. Rechenaufwand kostet Strom, Zeit und teure Spezialchips. Wer ein Modell für Millionen Nutzer betreibt, zahlt diesen Preis bei jeder einzelnen Antwort. Sparse MoE trennt die beiden Größen voneinander: Das Modell darf riesig sein, die Rechnung pro Antwort bleibt klein.

Ein Beispiel macht das greifbar. Ein Modell mit 600 Milliarden Speicherplätzen kann so gebaut sein, dass pro Frage nur etwa 30 Milliarden davon rechnen. Der Aufwand entspricht dann einem zwanzigmal kleineren Modell. Das Wissen der anderen Experten ist aber nicht verloren, sondern wird bei passenden Fragen abgerufen.

Deshalb sind fast alle sehr großen Modelle der letzten Jahre auf diese Weise gebaut. Auch mehrere frei verfügbare Modelle aus China nutzen die Technik. Sie war ein wichtiger Grund dafür, dass die Kosten pro Antwort deutlich gefallen sind.

Der Router und die Frage, wer antwortet

Die Auswahl der Experten trifft ein kleines Zusatznetz, der Router. Für jedes einzelne Wort berechnet er Punktzahlen für alle Experten und schickt das Wort an die besten zwei oder vier. Deren Ergebnisse werden anschließend gewichtet zusammengerechnet. Der Router lernt seine Entscheidungen mit, niemand teilt Fachgebiete von Hand zu.

Man sollte sich die Experten nicht als Schulfächer vorstellen. Es gibt selten den einen Experten für Chemie und den anderen für Französisch. Die Aufteilung, die beim Lernen entsteht, ist für Menschen meist kaum deutbar. Wichtig ist nur, dass sie das Modell insgesamt besser macht.

Zwei Probleme begleiten die Bauweise. Erstens muss das komplette Modell im Speicher der Chips liegen, auch die gerade untätigen Experten. Man spart Rechenzeit, nicht Speicher — genau das macht solche Modelle für Heimcomputer schwierig. Zweitens neigt der Router dazu, Lieblingsexperten zu überlasten, während andere kaum etwas lernen. Dagegen gibt es beim Training zusätzliche Regeln, die eine gleichmäßigere Verteilung erzwingen.

Woran man Sparse MoE in Produktmeldungen erkennt

In Ankündigungen neuer Modelle stehen oft zwei Zahlen nebeneinander. Eine nennt die Gesamtzahl der Speicherplätze, die andere die « aktiven Parameter ». Wenn die zweite Zahl deutlich kleiner ist, handelt es sich um ein Sparse-MoE-Modell. Formulierungen wie « 8 Experten, davon 2 aktiv » bedeuten dasselbe.

Für dich als Nutzer bleibt die Technik unsichtbar. Du merkst sie nur indirekt: Antworten kommen schneller, und leistungsfähige Modelle sind auch in kostenlosen Zugängen verfügbar. Umgekehrt erklärt Sparse MoE, warum manche starken Modelle trotzdem enorme Serverhardware brauchen.

Zur Abgrenzung: Das Gegenstück heißt « dense », also dicht. Dort rechnet bei jeder Anfrage das gesamte Modell mit. Dense-Modelle sind einfacher zu bauen und laufen stabiler, skalieren aber teurer. In Fachdiskussionen werden beide Ansätze deshalb regelmäßig gegeneinander abgewogen.

Subscribe free. Unsubscribe the second it sucks.

High-signal news across AI, business, UX, and tech. Every morning.