FastText

FastText

FastText ist ein von Facebook entwickeltes Werkzeug, das Wörter in Zahlenreihen umrechnet und Texte automatisch einordnet. Es zerlegt Wörter dabei in kurze Buchstabenfolgen und versteht so auch Wörter, die es nie gesehen hat.

Computer können mit Buchstaben nicht rechnen, mit Zahlen dagegen sehr gut. Deshalb gibt es Programme, die jedes Wort einer Sprache in eine lange Zahlenreihe übersetzen. Wörter mit ähnlicher Bedeutung erhalten dabei ähnliche Zahlenreihen. FastText ist ein solches Programm, veröffentlicht 2016 von der Forschungsabteilung von Facebook, dem heutigen Meta. Sein Trick: Es betrachtet nicht nur ganze Wörter, sondern auch deren Bruchstücke aus drei bis sechs Buchstaben. Außerdem kann FastText Texte sortieren, etwa nach Sprache oder nach Themengebiet.

Warum Wortbruchstücke so viel bringen

Ältere Verfahren behandelten jedes Wort als eigenständiges Symbol. Für sie waren « Haus », « Häuser » und « Hausdach » drei völlig unverwandte Dinge. Sie mussten für jede Form getrennt lernen, und bei einem unbekannten Wort gaben sie schlicht auf. Für Deutsch ist das ein echtes Problem, weil unsere Sprache endlos zusammensetzt und beugt.

FastText löst das über die Bruchstücke. Weil « Hausdach » die Buchstabenfolge « Haus » enthält, landet es automatisch in der Nähe von « Haus ». Selbst ein frei erfundenes Wort wie « Hausdachziegelei » bekommt eine brauchbare Zahlenreihe. Das Modell rät aus den Teilen, was das Ganze bedeuten könnte.

Der zweite Grund für die Beliebtheit ist die Geschwindigkeit. FastText trainiert auf einem normalen Laptop in Minuten, wo größere Sprachmodelle Rechenzentren und Tage brauchen. Meta veröffentlichte fertige Modelle für 157 Sprachen kostenlos. Damit wurde FastText jahrelang zum Standardwerkzeug für alle, die keine teure Hardware hatten.

Von Buchstabenfolgen zur Zahlenreihe

Das Training läuft nach einem einfachen Grundgedanken ab. Das Programm schiebt ein Fenster über riesige Textmengen, etwa über die gesamte Wikipedia. Für jedes Wort schaut es an, welche Wörter direkt daneben stehen. Dann passt es die Zahlenreihen so lange an, bis Wörter mit ähnlicher Nachbarschaft ähnliche Zahlen haben. Wer immer neben « bellt » und « Leine » auftaucht, landet in der Nachbarschaft von « Hund ».

Der Unterschied zu Vorgängern liegt im Zwischenschritt. FastText schneidet jedes Wort erst in überlappende Buchstabenstücke, sogenannte Zeichen-n-Gramme. Aus « Hund » werden zum Beispiel « Hun », « und », « Hund ». Jedes Stück bekommt seine eigene Zahlenreihe. Die Zahlenreihe des ganzen Wortes ist dann die Summe seiner Teile.

Eine wichtige Grenze sollte man kennen. FastText gibt jedem Wort immer dieselbe Zahlenreihe, unabhängig vom Satz. Die « Bank » im Park und die « Bank » mit dem Konto teilen sich einen einzigen Eintrag. Moderne Sprachmodelle wie die hinter ChatGPT rechnen dagegen für jedes Vorkommen neu und beziehen den ganzen Satz ein. Dafür sind sie tausendfach aufwendiger.

FastText im Einsatz bei Suche und Spam-Filtern

Am häufigsten begegnet man FastText als Spracherkenner. Wenn ein Browser fragt, ob er eine Seite übersetzen soll, muss vorher jemand die Sprache bestimmen. Das fertige FastText-Modell dafür ist wenige Megabyte groß und entscheidet in Millisekunden. Auch große Textsammlungen für das Training moderner KI werden damit nach Sprachen vorsortiert.

In Unternehmen steckt FastText oft in unauffälliger Textarbeit. Support-Anfragen werden automatisch der richtigen Abteilung zugeordnet. Produktbeschreibungen wandern in Shop-Kategorien. Spam-Filter und die Suche in Online-Shops nutzen es, damit « Turnschuh » und « Sportschuhe » als verwandt gelten.

In den Nachrichten taucht der Name heute seltener auf, weil große Sprachmodelle die Aufmerksamkeit binden. Verschwunden ist FastText aber nicht. Für einfache Sortieraufgaben ist es weiterhin schnell, sparsam und ausreichend genau. Ein häufiger Irrtum ist übrigens, FastText sei ein Chatbot. Es schreibt keine Texte, es ordnet sie nur ein.

Subscribe free. Unsubscribe the second it sucks.

High-signal news across AI, business, UX, and tech. Every morning.