Tokenwerk · Das LLM-Lehrbuch

Kapitel 8 · I · Neuronale Netze verstehen · 5 Minuten

Wie Zahlen tatsächlich lernen

Ableitungen, Kettenregel und Backpropagation an einem Modell mit nur einem Gewicht. Jede Zahl bleibt sichtbar.

Wir verbessern dieselbe kleine Rechenmaschine

Du kennst jetzt Gewichte, Vorhersagen und einen Fehlerwert. Unser Modell multipliziert eine Eingabe mit einem Gewicht. Die Eingabe ist 2, der gewünschte Zielwert 6 und das aktuelle Gewicht 1. Die Vorhersage ist deshalb 2, der quadratische Fehler 16.

Wie sollen wir das Gewicht verändern? Wir könnten zunächst zwei nahe Einstellungen ausprobieren. Bei Gewicht 0,99 liefert das Modell 1,98 und einen Fehler von 16,1604. Bei Gewicht 1,01 liefert es 2,02 und einen Fehler von 15,8404. Etwas größer ist hier offenbar besser.

Eine Steigung aus zwei Messpunkten

Zwischen den Gewichten 0,99 und 1,01 liegt ein Abstand von 0,02. Der Fehler verändert sich dabei von 16,1604 auf 15,8404, also um −0,32. Teilen wir Fehleränderung durch Gewichtsänderung, ergibt sich −0,32/0,02=−16.

Diese Zahl beschreibt die Steigung der Fehlerkurve in der Nähe des aktuellen Gewichts. Ein negatives Ergebnis sagt: Wenn das Gewicht ein wenig wächst, sinkt der Fehler. Ein positives Ergebnis würde bedeuten, dass der Fehler bei größerem Gewicht steigt.

Eine Ableitung beschreibt diese lokale Steigung im Grenzfall immer kleinerer Änderungen. „Lokal“ bedeutet: in der Nähe der gerade betrachteten Einstellung. Es ist keine Aussage darüber, was ein riesiger Sprung irgendwo anders bewirkt.

Was das schwierige Zeichen bedeutet

Der Fehler heißt LL, das Gewicht ww. Die Schreibweise für die Ableitung lautet:

dLdw.\frac{dL}{dw}.

Lies das als: „Ableitung des Fehlers L nach dem Gewicht w.“ Inhaltlich fragen wir: Wie empfindlich reagiert der Fehler auf eine kleine Änderung dieses Gewichts? In diesem Beispiel ist die Antwort am Start −16.

Das Zeichen ist eine feststehende Notation für eine Ableitung. Du musst es nicht als gewöhnlichen Bruch zweier bereits bekannter Zahlen auffassen. Die Rechnung mit zwei Messpunkten ist eine Näherung, mit der du seine Bedeutung prüfen kannst.

Die Richtung umkehren

Die Ableitung zeigt, wie der Fehler bei zunehmendem Gewicht steigt oder fällt. Wir möchten ihn senken. Deshalb verändern wir das Gewicht entgegen der Steigung.

Bei Steigung −16 bedeutet das: Gewicht erhöhen. Bei Steigung +16 wäre es: Gewicht verringern. Die Schrittgröße legen wir mit einer Lernrate fest. Eine Lernrate von 0,05 bedeutet in unserem Beispiel, dass wir 0,05 mal die Ableitung als Korrektur verwenden.

Die Rechnung lautet: neues Gewicht = altes Gewicht − Lernrate × Ableitung. Mit unseren Zahlen erhalten wir 1−0,05×(−16)=1,8. Ein Minus vor einer negativen Zahl führt hier zur Erhöhung.

Erst danach die Kurzform

wneu=walt−ηdLdw.w_{neu}=w_{alt}-\eta\frac{dL}{dw}.
Zeichen Bedeutung hier Wert
waltw_{alt} Gewicht vor dem Lernschritt 1
wneuw_{neu} Gewicht nach dem Lernschritt 1,8
η\eta Lernrate; „Eta“ ist nur ihr kurzer Name 0,05
dL/dwdL/dw Steigung des Fehlers beim aktuellen Gewicht −16

Diese Lernregel heißt Gradient Descent, auf Deutsch Gradientenabstieg: Wir gehen in die Gegenrichtung des Gradienten, also bergab. Bei nur einem Gewicht genügt eine Ableitung. Bei vielen Gewichten sammeln wir je eine solche Ableitung für jedes Gewicht. Diese Sammlung heißt Gradient.

Wir prüfen den Schritt, statt ihm blind zu glauben

Mit Gewicht 1,8 wird die Vorhersage 1,8×2=3,6. Der neue Unterschied zum Ziel ist 3,6−6=−2,4. Sein Quadrat beträgt 5,76. Der Fehler ist tatsächlich kleiner als die vorherigen 16.

Es ist noch nicht die richtige Antwort. Lernen besteht normalerweise aus vielen solchen Schritten. Vor jedem Schritt berechnen wir die Ableitung an der neuen Einstellung. Wir benutzen nicht für immer die anfängliche −16.

Woher bekommt der Computer die Ableitung?

Für unser einfaches Beispiel kann man eine direkte Regel herleiten: Ableitung = 2 × Unterschied × Eingabe. Der Faktor 2 stammt vom Quadrat in unserer Fehlerfunktion. Der Faktor „Eingabe“ entsteht, weil eine Gewichtsänderung zuerst die Vorhersage um genau dieses Vielfache verändert.

Bei Unterschied −4 und Eingabe 2 ergibt sich 2×(−4)×2=−16. Im folgenden Kapitel erklären wir diesen Weg durch mehrere Rechenschritte genauer. Du musst die Regel hier noch nicht selbst aus der Algebra herleiten können.

Große Netze verwenden ein Verfahren, das solche lokalen Änderungsregeln systematisch zusammensetzt. Die dafür genutzte automatische Ableitungsrechnung lernen wir später als Autograd kennen.

Warum große Schritte scheitern können

Wähle im Experiment eine Lernrate von 0,3. Der erste Schritt ergibt 1−0,3×(−16)=5,8. Die Vorhersage ist dann 11,6 und der Fehler (11,6−6)²=31,36. Obwohl die anfängliche Richtung richtig war, ist der Schritt so groß, dass er die gute Region überschießt.

Deshalb sagt eine lokale Ableitung nicht „gehe beliebig weit in diese Richtung“. Die Lernrate gehört zur Lernmethode. Sie ist eine Einstellung, die wir wählen; sie ist in diesem Beispiel nicht selbst ein Gewicht des Modells.

Was du jetzt verstanden haben solltest

Ein Lernschritt hat drei getrennte Aufgaben: eine Vorhersage berechnen, die lokale Wirkung der Gewichte auf den Fehler bestimmen und die Gewichte vorsichtig verändern. Die erste Aufgabe ist der Vorwärtsdurchlauf. Die zweite wird bei größeren Netzen durch Rückwärtsrechnung erledigt. Die dritte übernimmt eine Aktualisierungsregel, oft Optimizer genannt.

Im nächsten Kapitel bleibt jede dieser Aufgaben sichtbar. Wir nehmen zwei hintereinandergeschaltete Rechenschritte und verfolgen, wie ein frühes Gewicht noch am späteren Fehler beteiligt ist.