Tokenwerk · Das LLM-Lehrbuch

Kapitel 2 · I · Neuronale Netze verstehen · 4 Minuten

Was bedeutet: Ein Programm lernt?

Eine Eingabe, eine gewünschte Ausgabe und eine einstellbare Zahl. Daran kannst du den gesamten Lernvorgang erkennen.

Erst eine gewöhnliche Rechenregel

Stell dir vor, wir möchten aus der Zahl 2 die Zahl 6 machen. Wenn wir die Regel kennen, programmieren wir einfach: „Multipliziere die Eingabe mit drei.“ Für die Eingabe 4 liefert das Programm dann 12.

Bei vielen Aufgaben kennen wir die Regel jedoch nicht vollständig. Wie genau erkennst du einen handgeschriebenen Buchstaben? Welche Wörter passen an das Ende eines Satzes? Du kannst Beispiele zeigen, aber nur schwer jede erforderliche Regel von Hand aufschreiben. Maschinelles Lernen versucht, eine geeignete Rechenvorschrift anhand solcher Beispiele einzustellen.

Für den Einstieg verwenden wir trotzdem eine einfache Regel. So können wir jederzeit kontrollieren, ob das Verfahren vernünftig arbeitet.

Wir geben Beispiele statt der fertigen Einstellung

Unser Programm erhält diese Tabelle:

Eingabe Gewünschte Ausgabe
1 3
2 6
3 9

Eine Zeile heißt Trainingsbeispiel. Die Eingabe ist das, was das Modell zu sehen bekommt. Die gewünschte Ausgabe heißt Zielwert oder auf Englisch Target. Das gesamte Bündel solcher Beispiele nennen wir Trainingsdaten.

Wir erlauben dem Modell eine sehr einfache Rechnung: Eingabe mal eine einstellbare Zahl. Diese einstellbare Zahl ist ein Parameter. Sie startet beispielsweise bei 1. Dann sagt das Modell für die Eingabe 2 zunächst 2 voraus. Der Zielwert ist aber 6.

Was wir vorgeben und was gelernt wird

Wir geben den Bauplan „Eingabe mal Parameter“ vor. Das Modell erfindet in diesem Beispiel weder neue Programmzeilen noch eine andere Rechenart. Beim Lernen verändert sich die Parameterzahl.

Mit Parameter 2 wird aus der Eingabe 2 die Vorhersage 4. Mit Parameter 3 wird daraus 6. Wir können ausprobieren, welche Einstellung besser zu unseren Beispielen passt. Später wird dieses Verändern automatisch durchgeführt.

Ein Modell ist hier die gewählte Rechenvorschrift zusammen mit ihren aktuellen Parametern. Training bedeutet, die Parameter anhand von Beispielen zu verbessern. Die Regel zum Verändern der Parameter behandeln wir erst im Lernkapitel. Zunächst genügt, dass überhaupt etwas verstellbar ist.

Die Vorhersage ist nicht der Zielwert

Der Zielwert kommt aus dem Beispiel. Die Vorhersage berechnet das Modell selbst. Beide müssen wir auseinanderhalten, sonst können wir keine Fehler erkennen.

Begriff In unserem Beispiel
Eingabe 2
Aktueller Parameter 1
Berechnete Vorhersage 2 × 1 = 2
Gewünschter Zielwert 6
Unterschied Vorhersage liegt 4 zu niedrig

Das Wort „Vorhersage“ setzt keine Zukunft voraus. Auch wenn alle Zahlen schon bekannt sind, nennen wir die vom Modell berechnete Ausgabe eine Vorhersage.

Was passiert nach dem Training?

Nach dem Einstellen des Parameters möchten wir eine Eingabe verwenden, die nicht in der Tabelle stand: 4. Der gelernte Parameter 3 liefert dann 12. Das Anwenden des gelernten Modells heißt Inferenz. Für dieses Wort kannst du zunächst einfach „Benutzung“ lesen.

Wenn ein Modell auf neuen passenden Beispielen gut arbeitet, sprechen wir von Generalisierung. Es soll nicht nur die gezeigten Beispiele wiedergeben, sondern ein nützliches Muster übertragen. Unser einfaches Modell kann nicht beliebige Antworten speichern: Ein einziger Multiplikationsfaktor muss zu allen Zeilen passen.

Warum nicht einfach jede Antwort speichern?

Eine Nachschlagetabelle könnte die drei bekannten Zeilen exakt ausgeben. Für die neue Eingabe 4 fehlt aber eine gespeicherte Antwort. Ein gut gewähltes Modell kann über seine Rechenstruktur Beziehungen zwischen den Beispielen ausdrücken.

Darin liegt zugleich eine Begrenzung. Wenn die gewünschten Ausgaben einer ganz anderen Regel folgen, reicht unser einziger Multiplikationsfaktor vielleicht nicht aus. Es gibt dann keine Einstellung, die alle Beispiele korrekt beschreibt. Das ist kein Fehler des Suchverfahrens, sondern ein zu einfacher Bauplan.

Zum Beispiel kann „Eingabe mal eine Zahl“ bei Eingabe 0 immer nur 0 liefern. Soll die Ausgabe bei 0 schon 5 sein, benötigen wir zusätzlich eine Verschiebung. Genau dafür lernen wir im nächsten Kapitel den Bias kennen.

Für das spätere Sprachmodell

Bei einem Sprachmodell sind die Beispiele nicht nur kleine Zahlenpaare. Es sieht bisherigen Text und soll eine passende Fortsetzung berechnen. Die Grundrollen bleiben trotzdem erhalten: Eingabe, gewünschte Ausgabe, berechnete Ausgabe und veränderbare Parameter.

Es gibt sehr viel mehr Parameter und einen komplexeren Bauplan. Wir bauen diesen Bauplan schrittweise auf. Die Lernidee, die du hier kennengelernt hast, bleibt dabei erkennbar.