NVFP4

NVFP4

NVFP4 ist ein von NVIDIA entwickeltes Zahlenformat, das Gewichte und Aktivierungen in KI-Modellen mit nur 4 Bit speichert und so Rechengeschwindigkeit sowie Energieeffizienz drastisch steigert. Es wurde mit der Blackwell-GPU-Generation eingeführt und ist speziell auf die Anforderungen moderner großer Sprachmodelle ausgelegt.

Ein KI-Modell besteht im Kern aus Millionen oder Milliarden von Zahlenwerten, sogenannten Gewichten. Je mehr Bits man pro Zahl verwendet, desto präziser ist sie — aber desto mehr Speicher und Rechenzeit braucht man auch. NVFP4 ist ein Zahlenformat von NVIDIA, das jeden dieser Werte mit nur 4 Bit darstellt. Zum Vergleich: Ältere Standardformate nutzen 16 oder sogar 32 Bit pro Zahl. Mit NVFP4 passen also vier- bis achtmal so viele Werte in denselben Speicher — und die Recheneinheiten der Grafikkarte können entsprechend mehr Operationen pro Sekunde durchführen. Eingeführt wurde das Format mit NVIDIAs Blackwell-Chip-Generation im Jahr 2025.

Warum 4 Bit so viel ausmachen

Moderne Sprachmodelle wie GPT-4 oder Llama haben hunderte Milliarden Gewichte. Selbst wenn man jede Zahl nur um ein paar Bits kürzt, summiert sich das auf viele Gigabyte, die nicht mehr übertragen oder gespeichert werden müssen. Der Flaschenhals bei der Inferenz — also beim tatsächlichen Berechnen einer Antwort — ist oft nicht die Rechenleistung selbst, sondern die Geschwindigkeit, mit der Daten zwischen Speicher und Recheneinheit fließen. Schmalere Formate wie NVFP4 entschärfen genau diesen Engpass.

NVIDIA gibt an, dass Blackwell-GPUs mit NVFP4 bis zu viermal so viele Berechnungen pro Sekunde leisten wie mit dem bisher üblichen 16-Bit-Format FP16. Das ist keine kosmetische Verbesserung, sondern ein Faktor, der darüber entscheidet, ob ein Modell auf einer einzelnen GPU läuft oder ob man viele davon bündeln muss. Für Unternehmen bedeutet das direkt niedrigere Kosten pro Anfrage.

Wie NVFP4 Präzision trotz weniger Bits bewahrt

4 Bit klingen wenig — und das sind sie auch. Mit 4 Bit lassen sich nur 16 verschiedene Zahlenwerte darstellen. Das reicht nicht, um beliebige Dezimalzahlen präzise zu kodieren. NVFP4 ist deshalb ein sogenanntes Gleitkommaformat: Statt eine feste Skala zu verwenden, teilt es die 4 Bit auf Vorzeichen, Exponent und Mantisse auf — ähnlich wie wissenschaftliche Schreibweise, bei der man sagt „3,1 × 10²“ statt „310“. Das erlaubt es, sehr kleine und sehr große Werte mit derselben Bitzahl darzustellen.

Weil 16 Stufen trotzdem grob sind, braucht NVFP4 eine sogenannte Skalierung: Gruppen von Gewichten bekommen einen gemeinsamen Faktor, der in einem etwas breiteren Format gespeichert wird. Dieser Faktor dehnt oder staucht die 16 Stufen so, dass sie den tatsächlichen Wertebereich der Gruppe gut abdecken. Das Ergebnis ist ein Kompromiss: minimal weniger Genauigkeit, dafür massiv mehr Geschwindigkeit. In der Praxis fällt der Qualitätsverlust bei gut trainierten Modellen kaum auf.

Ein wichtiger Unterschied zu älteren Quantisierungsverfahren — also älteren Methoden, die Bitbreite nachträglich zu reduzieren — ist, dass NVFP4 bereits beim Training berücksichtigt werden soll. NVIDIA empfiehlt, Modelle direkt mit Blick auf dieses Format zu trainieren oder zumindest fein abzustimmen. Das erhöht den Aufwand vorab, verbessert aber die Qualität der komprimierten Version erheblich.

NVFP4 in Produkten und News

NVFP4 debütierte mit NVIDIAs Blackwell-Architektur, konkret mit den B100- und B200-GPUs sowie der GeForce RTX 5000-Serie. Diese Chips enthalten spezialisierte Recheneinheiten namens Tensor Cores, die explizit für 4-Bit-Operationen ausgelegt sind. Ohne diese Hardware-Unterstützung würde das Format keinen Geschwindigkeitsvorteil bringen.

In der Tech-Presse taucht NVFP4 vor allem in Berichten über KI-Infrastruktur und Betriebskosten auf. Wer große Sprachmodelle im Cloud-Dienst anbietet — etwa über Plattformen wie Amazon Web Services oder Google Cloud — interessiert sich für NVFP4, weil jede Antwort, die ein Nutzer bekommt, Geld kostet. Schnellere Berechnung bei gleicher Hardware bedeutet mehr Antworten pro Sekunde und niedrigere Kosten pro Anfrage.

Für Endnutzer ist das Format unsichtbar. Wer ChatGPT oder einen anderen Dienst benutzt, wählt kein Zahlenformat aus. Der Effekt ist aber spürbar: Antworten kommen schneller, Server können mehr Nutzer gleichzeitig bedienen, und die Betreiber können günstigere Tarife anbieten. NVFP4 ist damit weniger ein Nutzer-Feature als eine Infrastrukturentscheidung — eine, die dennoch bestimmt, wie schnell und wie günstig KI-Dienste in den nächsten Jahren werden.

Subscribe free. Unsubscribe the second it sucks.

High-signal news across AI, business, UX, and tech. Every morning.