
FlashMLA
FlashMLA ist eine von DeepSeek entwickelte Methode, die einen bestimmten Rechenschritt in großen Sprachmodellen — die sogenannte Attention — deutlich schneller und speicherschonender ausführt. Sie ist speziell für Nvidias H800-GPUs optimiert und wurde Anfang 2025 als Open-Source-Projekt veröffentlicht.
Wenn ein Sprachmodell einen Text verarbeitet, muss es für jedes Wort berechnen, welche anderen Wörter im Satz relevant sind. Dieser Schritt heißt Attention — auf Deutsch etwa « Aufmerksamkeit ». Er ist einer der rechenintensivsten Teile überhaupt. FlashMLA ist eine Technik des chinesischen KI-Unternehmens DeepSeek, die genau diesen Schritt beschleunigt. Konkret geht es um eine Variante namens Multi-head Latent Attention, kurz MLA, bei der das Modell Informationen über den bisherigen Gesprächsverlauf komprimiert zwischenspeichert. FlashMLA macht diese komprimierte Berechnung auf modernen Grafikprozessoren so effizient wie möglich.
Das Speicherproblem bei langen Texten
Je länger ein Gespräch mit einem KI-Modell wird, desto mehr Kontext muss das Modell gleichzeitig im Blick behalten. Dafür legt es einen Zwischenspeicher an, den sogenannten KV-Cache — « KV » steht für « Key » und « Value », zwei Datentabellen, mit denen die Attention arbeitet. Dieser Cache wächst mit jeder neuen Nachricht und frisst schnell große Mengen an GPU-Speicher.
Multi-head Latent Attention löst dieses Problem, indem sie den Cache stark komprimiert. Statt alle Tabellen in voller Größe zu speichern, fasst MLA sie in einem viel kleineren Datensatz zusammen. Das spart Speicher — schafft aber gleichzeitig eine neue rechnerische Herausforderung, weil die Daten vor der eigentlichen Berechnung erst wieder entpackt werden müssen. Genau hier setzt FlashMLA an: Es macht dieses Entpacken und Rechnen so schnell, dass der Speichervorteil nicht durch Zeitverlust erkauft wird.
Wie FlashMLA die GPU-Hardware ausreizt
Moderne Grafikprozessoren haben zwei Arten von Speicher: einen kleinen, extrem schnellen Puffer direkt auf dem Chip und einen großen, langsameren Speicher daneben. Der Flaschenhals bei vielen KI-Berechnungen ist nicht die Rechenleistung selbst, sondern das ständige Hin- und Herschieben von Daten zwischen diesen beiden Speichern. Dieses Problem nennt man « memory-bandwidth-bound » — die Bandbreite, also wie viel Daten pro Sekunde wandern können, ist der begrenzende Faktor.
FlashMLA ist so geschrieben, dass es Daten in großen Blöcken in den schnellen Chip-Puffer lädt und dort möglichst viele Rechenschritte auf einmal erledigt, bevor es wieder in den langsamen Speicher schreibt. Diese Strategie nennt sich « tiling ». Zusätzlich nutzt FlashMLA eine spezielle Funktion der Nvidia-H800-GPU namens WGMMA und einen schnellen asynchronen Speichermechanismus namens TMA — beides Hardware-Features, die das Chip explizit für genau solche Operationen mitbringt. Auf einer H800-GPU erreicht FlashMLA dadurch laut DeepSeek bis zu 580 Teraflops, also 580 Billionen Rechenoperationen pro Sekunde — ein großer Teil der theoretisch möglichen Maximalleistung des Chips.
Wichtig ist der Unterschied zur älteren FlashAttention-Methode, die ebenfalls Attention beschleunigt, aber mit dem klassischen, unkomprimierten KV-Cache arbeitet. FlashMLA hingegen ist speziell auf den komprimierten MLA-Cache zugeschnitten. Beide Techniken verfolgen eine ähnliche Philosophie, sind aber für unterschiedliche Modellarchitekturen gedacht.
FlashMLA in der Praxis und in den News
FlashMLA ist ein Kernbestandteil von DeepSeeks eigenem Modell DeepSeek-V3 und dem darauf basierenden DeepSeek-R1. Diese Modelle sorgten Anfang 2025 für Aufsehen, weil sie trotz deutlich günstigerer Hardware mit den führenden Modellen aus den USA mithalten konnten. FlashMLA war einer der technischen Bausteine, die das möglich machten.
Im Februar 2025 veröffentlichte DeepSeek FlashMLA als Open-Source-Projekt auf der Plattform GitHub. Innerhalb weniger Tage wurde das Repository tausendfach mit einem Stern markiert — ein Zeichen dafür, wie groß das Interesse in der Entwickler-Community war. Andere Unternehmen und Forscher können den Code seitdem frei verwenden und anpassen.
In den Tech-News taucht FlashMLA meist im Zusammenhang mit der Frage auf, wie viel eine leistungsfähige KI wirklich kosten muss. DeepSeek hat mit solchen Optimierungen gezeigt, dass es möglich ist, mit weniger teurer Hardware viel zu erreichen — was den Druck auf westliche Anbieter erhöht hat und die Diskussion über KI-Exportbeschränkungen neu entfacht hat.