Bernoulli-Verteilung

Bernoulli-Verteilung

Die Bernoulli-Verteilung beschreibt einen einzelnen Versuch mit genau zwei möglichen Ergebnissen, etwa Treffer oder kein Treffer. Sie hat nur eine einzige Kennzahl: die Wahrscheinlichkeit p für den Treffer.

Manche Vorgänge haben nur zwei mögliche Ausgänge. Eine Münze zeigt Kopf oder Zahl. Eine E-Mail ist Werbemüll oder eben nicht. Ein Kunde klickt auf eine Anzeige oder er klickt nicht. Für solche Fälle gibt es in der Mathematik ein sehr einfaches Rechenmodell, benannt nach dem Schweizer Mathematiker Jakob Bernoulli. Man legt eine Zahl p zwischen 0 und 1 fest: die Wahrscheinlichkeit für das eine Ergebnis, das man üblicherweise Treffer nennt. Alles andere ergibt sich daraus, denn das zweite Ergebnis hat automatisch die Wahrscheinlichkeit 1 minus p. Damit ist die Bernoulli-Verteilung die kleinstmögliche Beschreibung des Zufalls, die überhaupt noch etwas aussagt.

Der Baustein hinter jeder Ja-Nein-Statistik

Die Bernoulli-Verteilung ist für sich genommen langweilig. Interessant wird sie, weil man aus ihr größere Modelle zusammensetzt. Wiederholt man denselben Versuch hundertmal, zählt man die Treffer und landet bei der Binomialverteilung. Diese sagt zum Beispiel, wie wahrscheinlich es ist, bei hundert Münzwürfen genau 58-mal Kopf zu sehen. Fast jede Statistik über Ja-Nein-Fragen hat die Bernoulli-Verteilung als Grundbaustein.

Auch in der künstlichen Intelligenz taucht sie ständig auf. Viele Modelle sollen eine Entscheidung treffen: Ist auf dem Bild ein Tumor oder nicht? Ist diese Überweisung Betrug oder nicht? Das Modell gibt dabei keine harte Antwort aus, sondern eine Zahl wie 0,87. Genau diese Zahl ist das p einer Bernoulli-Verteilung. Das Modell behauptet also nicht, sicher zu sein, sondern gibt eine Trefferwahrscheinlichkeit an.

Diese Sichtweise hat einen praktischen Nutzen. Weil das Ergebnis eine Wahrscheinlichkeit ist, kann man die Schwelle frei wählen. Bei einer medizinischen Voruntersuchung schlägt man vielleicht schon ab 0,2 Alarm, weil ein übersehener Fall schlimmer ist als ein Fehlalarm. Bei einem Spamfilter wählt man eine hohe Schwelle, damit keine wichtige Mail verschwindet.

Ein einziger Parameter und was man daraus rechnet

Formal nimmt eine Bernoulli-verteilte Größe nur die Werte 1 und 0 an. Die 1 steht für den Treffer und tritt mit Wahrscheinlichkeit p ein. Die 0 steht für den Nichttreffer und tritt mit 1 minus p ein. Mehr Zutaten braucht das Modell nicht. Deshalb spricht man von einer Verteilung mit nur einem Parameter.

Der Erwartungswert, also der Durchschnitt auf lange Sicht, ist schlicht p. Wirft man eine faire Münze sehr oft und notiert für Kopf eine 1, liegt der Mittelwert bei etwa 0,5. Die Varianz, ein Maß für die Schwankung, beträgt p mal (1 minus p). Sie ist am größten bei p gleich 0,5 und geht gegen null, wenn p nahe bei 0 oder 1 liegt. Das passt zur Intuition: Ein Ereignis, das fast immer eintritt, überrascht kaum.

Beim Training von KI-Modellen wird diese Verteilung zur Bewertungsregel. Das Modell sagt eine Wahrscheinlichkeit voraus, danach schaut man auf das tatsächliche Ergebnis. War die vorhergesagte Wahrscheinlichkeit für den eingetretenen Fall hoch, gibt es wenig Strafpunkte. War sie niedrig, gibt es viele. Dieses Maß heißt binäre Kreuzentropie und stammt direkt aus der Bernoulli-Verteilung. Wichtig ist die Abgrenzung: Die Verteilung beschreibt einen einzelnen Versuch, nicht eine Serie. Wer Treffer über viele Versuche zählt, ist schon bei der Binomialverteilung.

Von A/B-Tests bis zum Klickmodell

Im Alltag begegnet einem das Modell überall dort, wo etwas gezählt wird, das nur zwei Zustände kennt. Onlineshops testen zwei Varianten einer Seite gegeneinander, den sogenannten A/B-Test. Jeder Besucher kauft oder kauft nicht, also ein Bernoulli-Versuch pro Person. Erst die Summe über Tausende Besucher zeigt, welche Variante besser abschneidet.

In Wirtschaftsnachrichten stecken dieselben Rechnungen hinter Begriffen wie Ausfallwahrscheinlichkeit. Ein Kreditnehmer zahlt zurück oder er zahlt nicht. Banken schätzen für jeden Kunden ein p und rechnen daraus hoch, wie viel Geld sie als Puffer zurücklegen müssen. Auch Versicherungen arbeiten so: Ein Schaden tritt ein oder eben nicht.

Ein häufiger Irrtum ist die Annahme, die einzelnen Versuche seien immer unabhängig voneinander. Das gilt nur, wenn ein Ergebnis das nächste nicht beeinflusst. In einer Finanzkrise fallen viele Kredite gleichzeitig aus, weil dieselbe Ursache dahintersteckt. Rechnet man dann trotzdem mit unabhängigen Bernoulli-Versuchen, unterschätzt man das Risiko massiv. Genau das war einer der Fehler, die 2008 sichtbar wurden.

Subscribe free. Unsubscribe the second it sucks.

High-signal news across AI, business, UX, and tech. Every morning.