Tokenwerk · Das LLM-Lehrbuch

Kapitel 7 · I · Neuronale Netze verstehen · 5 Minuten

Wie messen wir eine falsche Antwort?

Bevor ein Netz lernen kann, brauchen wir eine Zahl für die Größe seines Fehlers. Wir beginnen mit einer Vorhersage von 2 statt 6.

Richtig oder falsch ist oft zu grob

Unser kleines Modell soll bei Eingabe 2 den Wert 6 liefern. Mit seiner aktuellen Einstellung gibt es aber 2 aus. Eine Vorhersage von 5 wäre ebenfalls falsch, läge aber viel näher am Ziel. Wir möchten diese Verbesserung messen können.

Dafür definieren wir eine Fehlerfunktion, auch Verlustfunktion oder Loss-Funktion genannt. Sie nimmt Vorhersage und Zielwert und liefert eine Zahl. In unserem Beispiel gilt: je kleiner diese Zahl, desto besser passt die Vorhersage.

Erst den Unterschied berechnen

Wir ziehen den Zielwert von der Vorhersage ab. Für Vorhersage 2 und Zielwert 6 ergibt das 2−6=−4. Das negative Vorzeichen sagt: Die Vorhersage liegt zu niedrig. Bei Vorhersage 10 erhalten wir 10−6=4, also eine zu hohe Vorhersage.

Beide Fehler sind betragsmäßig gleich groß. Würden wir nur die vorzeichenbehafteten Unterschiede vieler Beispiele addieren, könnten sie sich aufheben: −4+4=0. Dann sähe eine falsche Rechnung versehentlich fehlerfrei aus.

Den Unterschied quadrieren

Eine einfache Lösung ist, jeden Unterschied mit sich selbst zu multiplizieren. Sowohl (−4)² als auch 4² ergeben 16. Eine exakte Vorhersage hat Unterschied null und damit Fehler null.

Vorhersage Zielwert Unterschied Quadratischer Fehler
2 6 −4 16
4 6 −2 4
5 6 −1 1
6 6 0 0
7 6 1 1
10 6 4 16

„Quadratisch“ heißt hier lediglich: Wir verwenden das Quadrat des Unterschieds. Große Abweichungen werden dadurch stärker gewichtet als kleine.

Die Formel beschreibt genau diese Tabelle

Wir nennen die Vorhersage y^\hat y, gesprochen „y-Dach“, und den Zielwert yy. Die Fehlerzahl nennen wir LL, vom englischen Wort Loss.

L=(y^−y)2.L=(\hat y-y)^2.

Lies die Formel: Ziehe den Zielwert von der Vorhersage ab. Multipliziere den Unterschied mit sich selbst. Nenne das Ergebnis L.

Das Dach ist nur ein Kennzeichen für die Vorhersage. Die Zwei oben ist eine Potenz. Mit den Zahlen 2 und 6 entsteht wieder (2−6)²=16. Du musst also keine neue Rechnung lernen, um diese Formel zu verstehen.

Ein Fehlerwert sagt noch nicht, wie wir lernen

Wenn wir wissen, dass L=16 ist, kennen wir die Größe dieses Fehlers. Wir wissen dadurch noch nicht unmittelbar, welcher von neun oder Millionen Parametern wie verändert werden sollte.

Beim Ein-Parameter-Modell können wir verschiedene Einstellungen ausprobieren. Bei sehr vielen Parametern wäre das einzeln ausprobierte Suchen aufwendig. Im nächsten Kapitel lernen wir deshalb, die Änderungsrichtung mit einer Ableitung zu bestimmen. Die Fehlerfunktion ist das Ziel; die Änderungsregel ist der Weg, dieses Ziel zu verbessern.

Mehrere Beispiele zusammen betrachten

Nehmen wir unser Modell „Eingabe mal Gewicht“ mit Gewicht 2. Die Trainingsbeispiele sind 1→3, 2→6 und 3→9. Es sagt 2, 4 und 6 voraus. Die Unterschiede sind −1, −2 und −3. Ihre Quadrate sind 1, 4 und 9.

Der mittlere quadratische Fehler ist (1+4+9)/3=14/3≈4,667. „Mittlerer“ bedeutet: Wir addieren die Fehler und teilen durch die Anzahl der Beispiele. Auf Englisch heißt dieser häufige Fehlerwert Mean Squared Error, abgekürzt MSE.

Der Durchschnitt macht Läufe mit gleichartig aufgebauten Beispielen vergleichbarer, als nur eine immer wachsende Summe zu betrachten. Er kann trotzdem einzelne große Fehler verdecken. Für eine genaue Auswertung betrachten wir später zusätzlich konkrete Aufgaben.

Warum nicht einfach den Betrag nehmen?

Auch der absolute Unterschied wäre ein mögliches Fehlermaß. Für 2 statt 6 beträgt er 4. Der quadratische Fehler beträgt dagegen 16. Unterschiedliche Fehlermaße bewerten große und kleine Abweichungen verschieden und können zu anderem Lernverhalten führen.

Es gibt also nicht „den einen Fehler“ für alle Aufgaben. Für unsere Zahlenvorhersage ist der quadratische Fehler leicht zu verstehen. Bei einem Sprachmodell wollen wir dagegen eine Verteilung über mögliche nächste Textstücke bewerten. Dafür führen wir später ein anderes Fehlermaß ein. Dort beginnen wir wieder mit Zahlenbeispielen.

Was eine kleine Fehlerzahl belegt

Eine kleine Fehlerzahl belegt, dass die Vorhersagen auf den gemessenen Beispielen zu den verwendeten Zielen passen. Sie beweist nicht, dass unbekannte Beispiele ebenfalls funktionieren. Ebenso kann ein fehlerhafter Zielwert vom Modell gut nachgeahmt werden.

Trainingsdaten werden zum Verändern der Gewichte benutzt. Validierungsdaten sind zurückgehaltene Beispiele, mit denen wir zwischendurch prüfen, wie das Modell auf nicht zum Lernen verwendeten Daten arbeitet. Eine abschließende unabhängige Prüfung behandeln wir später genauer.

Im Experiment

Verstelle nur die Vorhersage und beobachte den Unterschied und sein Quadrat. Stelle dann zwei Vorhersagen ein, die gleich weit links und rechts vom Ziel liegen. Der Fehlerwert sollte gleich sein. Seine Größe und die Richtung der notwendigen Verbesserung sind zwei verschiedene Informationen.