Du musst neuronale Netze noch nicht kennen
Dieses Buch beginnt vor den Fachbegriffen. Du brauchst für den Einstieg nur Addition, Multiplikation und die Bereitschaft, kleine Beispiele nachzurechnen. Wenn eine mathematische Schreibweise hinzukommt, erklären wir, wie man sie liest. Programmiererfahrung hilft im späteren Praxisteil. Erfahrungen mit maschinellem Lernen setzen wir nicht voraus.
Unser Ziel ist ein eigenes Sprachmodell: ein Programm, das aus Beispieltexten lernt, welche Textstücke aufeinander folgen können. Gibst du ihm „Die Katze sitzt auf dem“, berechnet es Möglichkeiten für die Fortsetzung. Daraus kann es schrittweise einen neuen Text zusammensetzen. Ein kleines Modell kann einfache Sprachmuster lernen. Zuverlässige Antworten auf neue Fragen sind ein weitergehendes Ziel, das wir getrennt trainieren und prüfen.
Bevor wir uns mit Sprache beschäftigen, klären wir eine viel kleinere Frage: Wie kann ein Programm aus Beispielen lernen, eine Zahl mit drei zu multiplizieren, ohne dass wir die Drei vorgeben? An diesem überschaubaren Fall lernst du den Kern des Trainings kennen.
Was du Schritt für Schritt aufbaust
Zuerst besteht unser Modell nur aus einer einstellbaren Zahl. Dann bauen wir eine Recheneinheit, ein künstliches Neuron. Mehrere solcher Einheiten werden zu einem kleinen neuronalen Netz verbunden. Wir berechnen eine Ausgabe von Hand und schauen, wie falsche Ausgaben zu besseren Einstellungen führen können.
Erst danach übertragen wir die Idee auf Sprache. Text wird in Zahlenkennungen übersetzt. Das Modell verarbeitet diese Kennungen und bewertet mögliche Fortsetzungen. Später lernt es, frühere Textstellen gezielt miteinander zu verbinden. Die dafür verwendete Netzarchitektur heißt Transformer. Architektur meint hier schlicht den Bauplan des Netzes: welche Teile es enthält und wie sie verbunden sind.
Am Ende hast du einen vollständigen Ablauf: Texte vorbereiten, ein Modell mit zufälligen Anfangswerten erstellen, es trainieren, speichern und zum Erzeugen von Text verwenden. Im letzten Praxisteil trainierst du außerdem anhand von Fragen und gewünschten Antworten.
So ist jedes Kapitel gedacht
Beginne mit der Frage, die das Kapitel lösen will. Lies dann das kleine Beispiel und rechne es nach. Erst wenn die Zahlen verständlich sind, lies dieselbe Rechnung in ihrer kürzeren mathematischen Schreibweise. Die Formel beschreibt also etwas, das du bereits gesehen hast.
Unter „Experiment“ kannst du Zahlen verändern. Sage vor dem Verstellen eines Reglers voraus, was passieren müsste. Unter „Üben“ findest du eine offene Aufgabe und einen Verständnischeck. Vergleiche deine Lösung erst nach deinem eigenen Versuch. Eine falsche Antwort zeigt dir, welche Stelle du noch einmal untersuchen solltest.
Am Kapitelanfang stehen die benötigten Vorkenntnisse mit Links. Gepunktet unterstrichene Begriffe lassen sich antippen; dann öffnet sich eine kurze Erklärung mit Beispiel und gegebenenfalls einem Link zum Grundlagenkapitel. Diese Erklärungen ergänzen den Text. Du musst nicht ständig ins Glossar wechseln.
Drei Dinge, die ähnlich heißen, aber verschieden sind
Ein Modell benutzen: Du gibst einem bereits trainierten Programm eine Eingabe und erhältst eine Ausgabe. Dabei wird es normalerweise nicht weitertrainiert.
Ein bestehendes Modell weitertrainieren: Du beginnst mit den bereits gelernten Einstellungen und passt sie mit zusätzlichen Beispielen an. Das heißt Fine-Tuning. Dieser Ausdruck wird später genauer eingeführt.
Ein Modell von Grund auf trainieren: Du beginnst mit zufälligen Einstellungen. Keine fertigen Modellgewichte werden geladen. Genau diesen Weg gehen wir. „Gewichte“ sind die einstellbaren Zahlen im Netz; schon im Neuronkapitel wirst du ihre Wirkung sehen.
Was „modern“ hier bedeutet
Das Buch führt bis zu Bausteinen, die in modernen Sprachmodellen verbreitet sind. Ihre Namen brauchst du jetzt noch nicht zu lernen. Du wirst später jeweils verstehen, welches Problem ein neuer Baustein lösen soll und wie er die bisherige Rechnung verändert.
Ein kleines eigenes Modell bleibt viel kleiner und begrenzter als ein sehr großes Assistenzsystem. Unser erstes Ziel ist deshalb überprüfbar: Das Modell soll einfache Muster lernen und verständliche kurze Fortsetzungen erzeugen können. Danach prüfen wir, ob es auf einem begrenzten Themenbereich auch neue Fragen sinnvoll beantwortet. Dafür sind ausreichend passende Daten und Trainingszeit nötig.
Was du tatsächlich selbst machst
Die Website enthält kleine Rechenexperimente, die direkt in deinem Browser laufen. Das vollständige Modell trainierst du später mit dem herunterladbaren Python-Projekt auf deinem Rechner. Das Programmieren beginnt erst, nachdem du die grundlegenden Rechnungen kennengelernt hast.
Lesefortschritt, Antworten und Notizen werden in diesem Browser gespeichert. Der Knopf „Kapitel abgeschlossen“ ist deine eigene Einschätzung. Beim Gerätewechsel wird dieser lokale Fortschritt nicht automatisch übernommen.
Ein kleines Notizbuch hilft: Schreibe vor jedem Versuch auf, was du verändern willst und welches Ergebnis du erwartest. Danach notierst du, was tatsächlich passiert ist. Schon damit arbeitest du genauer, als wenn du nur nach jeder Änderung einen hübschen Beispieltext suchst.
Als Nächstes
Im folgenden Kapitel braucht unser Programm noch keine Wörter, Tabellen oder neuronalen Schichten. Es erhält nur Zahlenpaare wie „1 wird 3“ und „2 wird 6“. Wir untersuchen, was daran überhaupt „Lernen“ heißen kann.