
DeepGEMM
DeepGEMM ist eine von DeepSeek entwickelte Bibliothek, die Matrizenmultiplikationen auf KI-Beschleunigern wie GPUs extrem schnell ausführt. Sie ist ein zentraler Baustein, um große Sprachmodelle effizient zu betreiben, und wurde von DeepSeek als Open-Source-Projekt veröffentlicht.
Große KI-Modelle sind im Kern Rechenmaschinen. Der häufigste Rechenvorgang, den sie durchführen, ist die Matrizenmultiplikation: zwei große Tabellen aus Zahlen werden nach festen Regeln miteinander verrechnet. Dieser Vorgang — auf Englisch General Matrix Multiplication, kurz GEMM — kommt beim Betrieb eines Sprachmodells tausende Male pro Sekunde vor. DeepGEMM ist eine Software-Bibliothek des chinesischen KI-Unternehmens DeepSeek, die genau diesen Rechenvorgang auf spezieller Hardware so schnell wie möglich ausführt. Die Bibliothek wurde Anfang 2025 als Open Source veröffentlicht, also für jeden kostenlos zugänglich gemacht.
Matrizenmultiplikation als Flaschenhals von KI-Modellen
Wer ein großes Sprachmodell betreibt, zahlt für jede Antwort, die es generiert. Der teuerste Posten dabei ist die Rechenzeit auf speziellen Prozessoren, sogenannten GPUs oder KI-Beschleunigern. Je effizienter die Matrizenmultiplikation läuft, desto mehr Anfragen kann eine GPU pro Sekunde beantworten — und desto niedriger sind die Kosten.
Dieser Zusammenhang macht eine Bibliothek wie DeepGEMM strategisch bedeutsam. Große Anbieter wie Nvidia liefern zwar eigene optimierte Lösungen für ihre Hardware, etwa die Bibliothek cuBLAS. DeepSeek hat jedoch gezeigt, dass man mit gezielten Anpassungen die offiziellen Lösungen bei bestimmten Aufgaben deutlich übertreffen kann. In eigenen Benchmarks — also standardisierten Geschwindigkeitstests — erreichte DeepGEMM bis zu 1,3-fache Beschleunigung gegenüber vergleichbaren Implementierungen.
Wie DeepGEMM die Hardware ausreizt
Moderne GPUs haben spezialisierte Recheneinheiten, die für Matrizenmultiplikation gebaut sind — bei Nvidias aktuellen Modellen heißen sie Tensor Cores. Das Problem: Diese Einheiten sind nur dann ausgelastet, wenn Daten im richtigen Format und in der richtigen Reihenfolge angeliefert werden. Ist das nicht der Fall, warten die Kerne auf Nachschub und die Rechenkapazität verpufft ungenutzt.
DeepGEMM ist für ein besonders kompaktes Zahlenformat namens FP8 ausgelegt. FP8 speichert jede Zahl in nur 8 Bit statt der üblichen 16 oder 32 Bit. Das klingt nach einem simplen Trick, ist aber technisch anspruchsvoll: Kleinere Zahlenformate sind ungenauer, und diese Ungenauigkeit muss die Software aktiv ausgleichen. DeepGEMM tut das mit sogenannten Skalierungsfaktoren, die kachelweise — also für kleine Blöcke der Matrix — berechnet werden, anstatt für die gesamte Tabelle einen einzigen Wert zu verwenden. Das Ergebnis ist ein guter Kompromiss zwischen Geschwindigkeit und Rechengenauigkeit.
Zusätzlich schreibt DeepGEMM seinen Maschinencode nicht von Hand, sondern erzeugt ihn zur Laufzeit automatisch — maßgeschneidert für die genaue Größe der jeweiligen Matrizen. Dieser Ansatz, Just-in-Time-Kompilierung genannt, ist aufwendiger zu entwickeln, liefert aber auf vielen realen Eingaben bessere Ergebnisse als vorab festgelegter Code.
DeepGEMM in der Praxis und in den Nachrichten
DeepGEMM ist der Rechenunterbau der Modelle von DeepSeek, darunter DeepSeek-V3 und DeepSeek-R1. Diese Modelle sorgten Anfang 2025 für Schlagzeilen, weil sie trotz vergleichsweise geringem Trainingsbudget mit deutlich teureren westlichen Konkurrenzmodellen mithalten konnten. DeepGEMM war einer der Gründe dafür: Wer die verfügbare Hardware effizienter nutzt, kommt weiter mit demselben Budget.
Durch die Veröffentlichung als Open Source können Forscher und Unternehmen weltweit die Bibliothek in eigene Projekte einbauen oder als Vorlage für eigene Optimierungen nutzen. Das ist ungewöhnlich: Solche tief in die Hardware eingreifenden Optimierungen gelten normalerweise als Betriebsgeheimnis. DeepSeeks Entscheidung, sie offenzulegen, hat die Diskussion darüber angefacht, wie viel Wettbewerbsvorteil wirklich in proprietären Werkzeugen liegt — und wie viel in offener Zusammenarbeit entstehen kann.
Für Nutzer von KI-Produkten ist DeepGEMM unsichtbar. Es wirkt im Hintergrund, ähnlich wie ein optimierter Motor, den man nicht sieht, dessen Leistung man aber spürt — in Form schnellerer Antworten und günstigerer Preise für KI-Dienste.