Tokenwerk · Das LLM-Lehrbuch

Kapitel 5 · I · Neuronale Netze verstehen · 5 Minuten

Aus Neuronen wird ein kleines Netz

Zwei Eingaben, zwei innere Neuronen und eine Ausgabe. Jede Verbindung bekommt einen nachvollziehbaren Zahlenwert.

Ein Ergebnis wird zur nächsten Eingabe

Ein neuronales Netz entsteht, wenn wir Recheneinheiten miteinander verbinden. Die Ausgabe eines Neurons kann als Eingabe für weitere Neuronen dienen. Mehrere Neuronen, die auf derselben Stufe rechnen, fassen wir zu einer Schicht zusammen.

Unser kleines Netz hat zwei Eingabewerte. Daraus berechnen zwei Neuronen zwei Zwischenwerte. Ein letztes Neuron kombiniert diese Zwischenwerte zu einer Ausgabe. Wir benötigen keine Wörter und keine großen Matrizen, um diesen Ablauf zu verstehen.

Die Namen der Schichten

Die Eingabeschicht bezeichnet hier die bereitgestellten Zahlen. An diesen Eingabeknoten wird noch keine trainierbare Rechnung durchgeführt. Die versteckte Schicht liegt zwischen Eingabe und Ausgabe und berechnet Zwischenwerte. Die Ausgabeschicht erzeugt die Vorhersage, die wir mit dem Zielwert vergleichen.

„Versteckt“ bedeutet nicht, dass die Zahlen unzugänglich wären. Wir können sie ausgeben und nachrechnen. Gemeint ist: Für diese Zwischenwerte gibt der Datensatz normalerweise keine eigenen Zielwerte vor. Wir sehen Eingabe und gewünschtes Endergebnis, aber keine vorgeschriebenen Antworten für jede innere Einheit.

Unser gemeinsames Zahlenbeispiel

Die zwei Eingaben sind wieder 2 und 1. Die versteckte Schicht enthält zwei ReLU-Neuronen. Ihre Gewichte sind unterschiedlich, obwohl beide dieselben Eingaben sehen.

Neuron Erster Beitrag Zweiter Beitrag Bias Summe Nach ReLU
Erstes inneres Neuron 2 × 1 = 2 1 × 1 = 1 −2 1 1
Zweites inneres Neuron 2 × (−1) = −2 1 × 2 = 2 +1 1 1

Beide Zwischenwerte sind hier zufällig gleich eins. Sie stammen dennoch aus verschiedenen Rechnungen. Wenn wir eine Eingabe verändern, müssen sie nicht gleich bleiben.

Das Ausgabeneuron multipliziert den ersten Zwischenwert mit 2 und den zweiten mit 3. Sein Bias ist null. Es benutzt in diesem Beispiel keine abschließende ReLU:

Vorhersage = erster Zwischenwert × 2 + zweiter Zwischenwert × 3 = 1 × 2 + 1 × 3 = 5.

Damit haben wir das gesamte Netz von Hand ausgeführt.

Was „Forward“ bedeutet

Diesen Weg von den Eingaben zur berechneten Ausgabe nennen wir Vorwärtsdurchlauf, auf Englisch Forward Pass. In einem solchen Durchlauf werden zunächst nur die festgelegten Rechnungen ausgeführt. Die Gewichte verändern sich dabei nicht.

Im Experiment kannst du die Eingaben verändern und beobachten, wie sich beide Zwischenwerte und die Ausgabe ändern. Es wird dabei nicht trainiert. Du benutzt denselben Bauplan mit denselben Gewichten für neue Eingaben.

Diese Trennung ist wichtig: „Das Ergebnis ändert sich“ bedeutet nicht automatisch „das Netz lernt“. Auch ein Taschenrechner gibt für unterschiedliche Eingaben unterschiedliche Ergebnisse aus, ohne seine Rechenregeln zu verändern.

Wie viele Parameter hat dieses Netz?

Jedes der beiden inneren Neuronen besitzt zwei Gewichte und einen Bias. Das sind jeweils drei Parameter, zusammen sechs. Das Ausgabeneuron besitzt ebenfalls zwei Gewichte und einen Bias, also weitere drei. Insgesamt hat unser Netz neun Parameter.

Die zwei Eingaben zählen nicht dazu. Auch die zwei berechneten Zwischenwerte sind keine dauerhaften Parameter. Sie entstehen neu für das jeweilige Beispiel. Diese Zwischenwerte heißen Aktivierungen beziehungsweise interne Zustände.

Später sprechen wir über Millionen Parameter. Die Zählidee ist dieselbe: Wir zählen die veränderbaren Einstellungen, nicht die Anzahl gelesener Wörter oder die Zahl möglicher Eingaben.

Breite und Tiefe

Breite meint grob, wie viele Einheiten oder Zahlen pro Stufe vorhanden sind. Unsere versteckte Schicht hat Breite zwei. Tiefe beschreibt die Zahl aufeinanderfolgender Verarbeitungsschichten. Ob Eingabe- oder Ausgabeschicht bei einer Angabe mitgezählt werden, ist nicht überall einheitlich; wir nennen deshalb möglichst die konkreten trainierbaren Schichten.

Ein breiteres Netz kann mehr verschiedene Zwischenrechnungen parallel ausführen. Ein tieferes Netz kann Ergebnisse über mehr Stufen weiterverarbeiten. Beides erhöht nicht automatisch die Qualität. Die Daten und das Training müssen zu diesem Bauplan passen.

Welche Bedeutung haben die inneren Neuronen?

Wir haben den inneren Neuronen keine Bedeutungen wie „Grammatik“ oder „Wissen“ zugewiesen. Hier sind es zunächst nur zwei Rechenwege. Beim Lernen können sich nützliche Muster entwickeln. Es ist aber nicht garantiert, dass jede einzelne Einheit eine gut benennbare menschliche Eigenschaft besitzt.

Die Fähigkeiten entstehen aus dem Zusammenspiel des Netzes. Das ist ein Grund, warum es später schwierig sein kann, große Netze allein durch Betrachten einzelner Gewichtszahlen zu erklären.

Die nächste Frage

Angenommen, der richtige Zielwert unseres Beispiels wäre 6. Unser Netz liefert 5. Wir wissen damit, dass die Vorhersage nicht stimmt. Aber wie machen wir daraus ein Lernsignal? Nach einer kurzen Einführung in die Schreibweise definieren wir dafür ein Fehlermaß: eine Zahl, die sagt, wie weit das Modell vom gewünschten Ergebnis entfernt ist.