
Matrixmultiplikation
Matrixmultiplikation ist eine mathematische Rechenoperation, bei der zwei rechteckige Zahlentabellen miteinander verknüpft werden. Sie ist die zentrale Rechenoperation hinter fast allen KI-Modellen und bestimmt maßgeblich, wie viel Rechenleistung ein Modell benötigt.
Eine Matrix ist eine rechteckige Tabelle aus Zahlen — zum Beispiel vier Zeilen und vier Spalten. Bei der Matrixmultiplikation werden zwei solcher Tabellen nach einer festen Regel miteinander verknüpft und ergeben eine neue Tabelle. Die Regel lautet: Jede Zelle im Ergebnis entsteht, indem man eine Zeile der ersten Matrix mit einer Spalte der zweiten Matrix Schritt für Schritt multipliziert und alle Produkte addiert. Das klingt nach Schulstoff — und das ist es auch. In der KI ist es aber die häufigste und rechenintensivste Operation überhaupt.
Matrixmultiplikation als Herzstück von KI-Modellen
Ein neuronales Netz — also das Grundprinzip hinter Sprachmodellen wie ChatGPT oder Bildgeneratoren — besteht aus vielen Schichten. In jeder dieser Schichten werden eingehende Daten mit einer Matrix voller gelernter Gewichte multipliziert. Das passiert hunderte oder tausende Male pro Anfrage.
Die Größe dieser Matrizen bestimmt, wie leistungsfähig ein Modell ist. Große Modelle haben Gewichtsmatrizen mit Milliarden von Einträgen. Die schiere Anzahl der dafür nötigen Rechenoperationen ist der Hauptgrund, warum das Training und der Betrieb solcher Modelle so viel Strom und Hardware verschlingen. Schätzungen zufolge bestehen über 90 Prozent der Rechenarbeit eines großen Sprachmodells aus Matrixmultiplikationen.
Wer also die Matrixmultiplikation versteht, hat einen direkten Blick darauf, warum KI so teuer ist — und warum Forscher so viel Mühe darauf verwenden, sie effizienter zu gestalten.
Warum Grafikchips für Matrixmultiplikation gebaut sind
Eine normale CPU, wie sie in jedem Laptop steckt, rechnet Aufgaben nacheinander ab — eine nach der anderen. Matrixmultiplikation lässt sich aber in Tausende voneinander unabhängige Teilrechnungen zerlegen. All diese Teilrechnungen können gleichzeitig stattfinden.
Genau dafür sind GPUs (Grafikprozessoren) gebaut: Sie haben tausende kleiner Recheneinheiten, die parallel arbeiten. Was auf einer CPU Minuten dauern würde, schafft eine GPU in Sekunden. Unternehmen wie Nvidia verdienen ihr Geld genau damit — ihre Chips sind im Kern hochoptimierte Maschinen für Matrixmultiplikation. Neuere Spezialprozessoren wie Googles TPU (Tensor Processing Unit) gehen noch einen Schritt weiter und sind ausschließlich auf diese eine Operation ausgerichtet.
Ein typisches Matrixprodukt für ein mittelgroßes Modell umfasst Matrizen mit tausenden Zeilen und Spalten. Die Anzahl der dabei anfallenden Einzelmultiplikationen wächst mit dem Würfel der Matrixgröße — was erklärt, warum schon eine Verdopplung der Modellgröße die Rechenkosten vervielfachen kann.
Matmul in News, Produkten und Forschung
In Technikmedien taucht Matrixmultiplikation meist unter dem Kürzel „Matmul“ auf. Wenn Nvidia einen neuen Chip vorstellt, steht im Mittelpunkt fast immer eine Kennzahl: wie viele Billionen Matrixmultiplikationen der Chip pro Sekunde schafft, gemessen in FLOPS (Floating Point Operations Per Second, also Gleitkommaoperationen pro Sekunde).
Auch Effizienzforschung dreht sich oft direkt um diese Operation. Methoden wie Quantisierung — dabei werden die Zahlen in den Matrizen ungenauer, aber platzsparender gespeichert — oder Low-Rank-Approximation, bei der man große Matrizen durch zwei kleinere annähert, zielen alle darauf ab, Matrixmultiplikationen zu beschleunigen oder zu verkleinern.
2022 sorgte Googles AlphaTensor für Aufsehen: Eine KI hatte einen neuen Algorithmus entdeckt, der Matrixmultiplikation für bestimmte Größen in weniger Schritten löst als alle bisher bekannten Verfahren. Das war das erste Mal seit Jahrzehnten, dass sich an diesem Grundproblem etwas verbessert hat — ein Zeichen dafür, wie zentral die Operation für die gesamte Branche ist.