Tokenwerk · Das LLM-Lehrbuch

Kapitel 33 · VI · Dein eigenes Projekt · 31 Minuten

Glossar, Formeln und Quellen

Ein Nachschlagewerk für die wichtigsten Begriffe und geprüfte Primärquellen zum Weiterlesen.

Fünf Formeln, die du erklären können solltest

Die Kurzformen erinnern an bereits hergeleitete Rechnungen. Über die Kapitelverweise gelangst du zu Zahlenbeispiel und vollständiger Symbolerklärung.

Softmax: pi=exp⁡(zi)/∑jexp⁡(zj)p_i=\exp(z_i)/\sum_j\exp(z_j). Sie normalisiert die Scores über mögliche nächste Tokens. Schrittweise Erklärung.

Next-Token-Loss: L=−log⁡ptargetL=-\log p_{target}. Bei mehreren aktiven Targets summieren und durch deren Anzahl teilen. Schrittweise Erklärung.

Gradientenschritt: w←w−η∇wLw\leftarrow w-\eta\nabla_w L. Eta ist die Lernrate; ∇ (Nabla) bezeichnet die Liste der Ableitungen, also den Gradienten. Der Pfeil ← bedeutet: Ersetze den alten Wert durch das rechts berechnete Ergebnis. Schrittweise Erklärung.

Attention: softmax⁡(QK⊤/d+M)V\operatorname{softmax}(QK^\top/\sqrt d+M)V. Query/Key liefern Gewichte; Values liefern die gemischten Informationen. M ist die additive Maske: 0 für erlaubte Quellen, minus unendlich für verbotene. Attentionrechnung und Maskierung.

KV-Cache: 2LBTHkvde2LBTH_{kv}de. Die Faktoren beschreiben Keys plus Values für jede Schicht, jedes Batchbeispiel und jede gespeicherte Position. Rechnung mit Größen und Einheiten.

Ein guter Weg durch Forschungspapiere

Lies zuerst Abstract, Problemstellung und Architekturabbildung. Schreibe anschließend in eigenen Worten: Welche bestehende Schwierigkeit soll die Methode lösen? Welcher Teil der Rechnung ändert sich? Welche Vergleichsbedingungen wurden benutzt? Welche Einschränkungen bleiben?

Erst danach versuche, die zentrale Gleichung nachzurechnen und den kleinsten relevanten Code zu schreiben. Ein Paper mit großen Leistungswerten ist nicht automatisch eine Anleitung für dein kleines Modell. Übertrage Annahmen und Experimente bewusst.

Grundlagen und kleine Modelle

Moderne Architekturbausteine

Skalierung und Posttraining

Offizielle Implementierungsdokumentation

  • PyTorch-Installation: passende Installation für dein Betriebssystem und Backend.
  • SDPA: Masken, Dropout und Kernelbedingungen der verwendeten Attentionfunktion.
  • AdamW: Optimizer-Argumente und Implementierungsdetails.
  • Automatic Mixed Precision: Autocast und Gradient Scaling.
  • MPS-Backend: Apple-Silicon-Unterstützung und Gerätewahl.

Die Inhalte dieses Lehrbuchs sind eigenständig erklärte Lernbeispiele, keine Übersetzung einzelner Papers. Technische Quellen wurden bei der Erstellung am 6. Oktober 2026 nachgeschlagen. Bibliotheksdokumentation kann sich später ändern. Der Download beschreibt die unterstützten Annahmen seines Referenzcodes; die Links ergänzen ihn.

Häufige Missverständnisse

„Attention versteht automatisch die Bedeutung.“ Attention ist ein lernbarer Informationsmischmechanismus. Welche nützlichen Beziehungen entstehen, hängt von Training und Gesamtarchitektur ab.

„Mehr Parameter bedeuten mehr Wahrheit.“ Parameterzahl beschreibt Kapazität, nicht Faktenprüfung. Datenfehler und falsche Ausgabeziele können auch in größeren Netzen bleiben.

„SFT ist nur Format.“ SFT kann auch Aufgabenwissen und Verhalten vermitteln. Es ersetzt jedoch nicht automatisch fehlende breite Sprachkompetenz und kann bei kleinen Daten stark memorisieren.

„Ein langes Kontextfenster ist ein langes Gedächtnis.“ Ein Fenster definiert verfügbaren Input. Zuverlässige Nutzung über große Abstände muss trainiert und geprüft werden; dauerhafter externer Speicher ist wieder eine andere Funktion.

„Ein guter Loss beweist ein gutes Produkt.“ Die Trainingsmetrik ist nur ein Teil des Ziels. Für eine Anwendung gehören passende Aufgabenprüfungen, Fehlerbehandlung und Systemverhalten dazu.

Alle Begriffe mit Beispiel

Die gleichen Erklärungen kannst du beim Lesen direkt über die gepunktet unterstrichenen Begriffe öffnen. Die alphabetische Sammlung bleibt auch im heruntergeladenen Buch vollständig enthalten.

Ablation

Evaluation prüft Leistung; ein Benchmark ist eine festgelegte Sammlung von Prüfaufgaben. Eine Ablation vergleicht Varianten mit gezielt verändertem Einzelbaustein.

Beispiel: Zwei sonst gleiche Modelle mit und ohne eine bestimmte Normalisierung vergleichen.

Ausführlich im Kapitel „Antworten ehrlich bewerten“.

Ableitung

Die lokale Änderungsrate einer Größe bezüglich einer anderen. Sie beschreibt, wie empfindlich das Ergebnis auf eine sehr kleine Änderung reagiert.

Beispiel: Ableitung −16: Eine kleine Gewichtserhöhung um 0,01 senkt den Fehler in der lokalen Näherung um 0,16.

Ausführlich im Kapitel „Wie Zahlen tatsächlich lernen“.

AdamW

Optimierungsverfahren, die für jeden Parameter Statistiken vergangener Gradienten führen. AdamW trennt eine zusätzliche Gewichtsverkleinerung vom gradientenbasierten Schritt.

Beispiel: Ein Parameter mit stark schwankenden Gradienten bekommt eine andere Skalierung als einer mit gleichmäßigen Gradienten.

Ausführlich im Kapitel „Deine erste Trainingsschleife“.

Aktivierung

Ein bei der Vorwärtsrechnung berechneter Zwischenwert, oft die Ausgabe einer Aktivierungsfunktion. Er entsteht für die aktuelle Eingabe und ist kein dauerhaftes Gewicht.

Beispiel: Ein Neuron hat Summe −2. Nach ReLU ist seine Aktivierung 0.

Ausführlich im Kapitel „Aus Neuronen wird ein kleines Netz“.

Aktivierungsfunktion

Eine Funktion, die den berechneten Wert eines Neurons weiterverarbeitet. Nichtlineare Aktivierungen erlauben komplexere Zusammenhänge.

Beispiel: ReLU macht aus −3 eine 0 und lässt 4 unverändert.

Ausführlich im Kapitel „Warum Neuronen eine Aktivierungsfunktion brauchen“.

Attention

Eine Berechnung, bei der jede Position Informationen aus erlaubten Positionen mit veränderlichen Mischgewichten zusammenfasst.

Beispiel: Values 10,20,30 mit Gewichten 0,5;0,25;0,25 ergeben 17,5.

Ausführlich im Kapitel „Self-Attention ohne Geheimnisse“.

Ausgabekopf

Die letzte Umrechnung von internen Zahlenlisten in die benötigten Ausgabewerte.

Beispiel: Eine Positionsliste mit 128 Zahlen wird zu 320 Logits für 320 mögliche Tokens.

Ausführlich im Kapitel „Der vollständige Transformer-Block“.

Autograd

Die automatische Berechnung von Ableitungen aus den ausgeführten Rechenschritten. PyTorch stellt dafür ein System bereit.

Beispiel: Nach einer Vorwärtsrechnung löst loss.backward() die Rückwärtsrechnung aus.

Ausführlich im Kapitel „Lernen durch mehrere Schichten“.

Backpropagation

Ein Verfahren, das die Einflüsse auf den Fehler rückwärts durch die einzelnen Rechnungen verfolgt. Es berechnet Gradienten; die Gewichte ändert erst der Optimierer.

Beispiel: Erst den Einfluss auf die Ausgabe bestimmen, dann auf den Zwischenwert und schließlich auf das frühere Gewicht.

Ausführlich im Kapitel „Lernen durch mehrere Schichten“.

Baseline

Eine Baseline ist ein einfacher Vergleichsmaßstab. Unsere Bigram-Baseline schätzt den nächsten Token nur aus seinem unmittelbaren Vorgänger.

Beispiel: Nach a wurden b und c je einmal gesehen: Beide erhalten ohne Glättung Wahrscheinlichkeit 1/2.

Ausführlich im Kapitel „Dein erstes echtes Sprachmodell“.

Batch

Eine Gruppe von Beispielen, die in einem Rechenschritt gemeinsam verarbeitet wird. Batchgröße ist die Anzahl dieser Beispiele.

Beispiel: Ein Batch aus 4 Textausschnitten hat B = 4.

Ausführlich im Kapitel „Vektoren, Matrizen und Tensorformen“.

Bias

Ein zusätzlicher trainierbarer Summand, der unabhängig von der aktuellen Eingabe addiert wird.

Beispiel: Bei 3 × x + 1 ist der Bias 1. Selbst für x = 0 bleibt die Ausgabe 1.

Ausführlich im Kapitel „Ein künstliches Neuron zum Nachrechnen“.

BPE

Byte Pair Encoding: Ein Verfahren, das häufige benachbarte Einheiten schrittweise zusammenführt. Byte-BPE beginnt mit Bytes statt Zeichen.

Beispiel: Aus häufig benachbartem „a“ und „b“ kann eine neue Einheit „ab“ werden.

Ausführlich im Kapitel „Vom Text zu Token-IDs“.

Broadcasting

Eine Regel, mit der eine Operation eine kleinere passende Zahlenform über größere Achsen wiederverwendet.

Beispiel: Ein Bias mit D Einträgen wird zu jeder der vielen Positionslisten mit D Einträgen addiert.

Ausführlich im Kapitel „Vektoren, Matrizen und Tensorformen“.

Byte

Ein Byte speichert 8 Bits. UTF-8 ist eine feste Regel, die Textzeichen in ein oder mehrere Bytes übersetzt.

Beispiel: Das ASCII-Zeichen a braucht ein Byte in UTF-8; viele andere Zeichen brauchen mehrere.

Ausführlich im Kapitel „Vom Text zu Token-IDs“.

Checkpoint

Ein gespeicherter Trainingsstand. Zum Fortsetzen gehören neben Gewichten auch Einstellungen und der Zustand des Optimierers dazu.

Beispiel: Nach Schritt 100 speichern und später ab diesem Zustand weitertrainieren.

Ausführlich im Kapitel „Deine Python-Werkstatt“.

Cross-Entropy

Das Fehlermaß für unsere nächste Tokenvorhersage: der negative Logarithmus der Wahrscheinlichkeit des richtigen Tokens.

Beispiel: Richtiges Token mit Wahrscheinlichkeit 0,5 ergibt Fehler ungefähr 0,693.

Ausführlich im Kapitel „Das Lernziel: Cross-Entropy“.

Data Parallelism

Arten, Training auf Geräte zu verteilen. Datenparallelität verteilt Beispiele, Tensorparallelität Teile von Rechnungen und Pipelineparallelität Schichten. Sharding zerlegt gespeicherte Zustände.

Beispiel: Zwei Geräte verarbeiten verschiedene Batches und gleichen ihre Gradienten ab.

Ausführlich im Kapitel „Größer werden, ohne blind zu rechnen“.

Datenleck

Prüfinformation gelangt unerlaubt in Training oder Modellauswahl. Das lässt die gemessene Leistung zu gut erscheinen.

Beispiel: Derselbe Text steht sowohl im Training als auch in der Validierung.

Ausführlich im Kapitel „Daten sind ein Teil des Modells“.

Decoder

Ein Transformer verarbeitet Zahlenlisten mit Attention und kleinen Netzen. Unser Decoder ist eine Variante, die nur bisherigen Text liest und den nächsten Token vorhersagt.

Beispiel: Embedding → mehrere kausale Blöcke → Norm → Logits für die Fortsetzung.

Ausführlich im Kapitel „Der vollständige Transformer-Block“.

Dimension

Je nach Zusammenhang entweder die Länge einer Zahlenliste oder eine Achse eines Zahlenfelds. Wir nennen die jeweilige Bedeutung im Text.

Beispiel: Embeddingdimension 128 heißt: 128 Zahlen pro Tokenliste. Ein Tensor mit Form [2,3,128] hat drei Achsen.

Ausführlich im Kapitel „Vektoren, Matrizen und Tensorformen“.

Embedding

Eine trainierbare Zahlenliste, die über eine ID aus einer Tabelle gelesen wird.

Beispiel: Token-ID 1 wählt Zeile 1, zum Beispiel [0,4;0,6].

Ausführlich im Kapitel „Embeddings und geteilte Repräsentationen“.

Entropie

Eine Maßzahl dafür, wie breit eine Wahrscheinlichkeitsverteilung ist. Eine sehr sichere Auswahl hat niedrige Entropie.

Beispiel: Drei gleich wahrscheinliche Tokens haben höhere Entropie als [0,98;0,01;0,01].

Ausführlich im Kapitel „Sprache als Wahrscheinlichkeitsproblem“.

EOS

Besondere Tokenarten zur Kennzeichnung von Grenzen und Rollen. BOS markiert einen Anfang, EOS ein Ende; USER und ASSISTANT kennzeichnen Gesprächsrollen.

Beispiel: Ein Antwortbeispiel kann nach der letzten Antwort mit einem EOS-Token enden.

Ausführlich im Kapitel „Vom Textmodell zum Antwortmodell“.

Epoche

Ein vollständiger Durchgang durch einen fest definierten Trainingsdatensatz. Beim zufälligen Ziehen von Textfenstern ist ein solcher Durchgang nicht automatisch gegeben.

Beispiel: Wenn jedes der 100 Beispiele genau einmal verarbeitet wurde, ist eine Epoche beendet.

Ausführlich im Kapitel „Deine erste Trainingsschleife“.

Epsilon

Eine sehr kleine positive Schutzkonstante, etwa damit eine Rechnung nicht durch null teilt.

Beispiel: LayerNorm addiert Epsilon zur Varianz, bevor die Wurzel gezogen wird.

Ausführlich im Kapitel „Der vollständige Transformer-Block“.

Exponentialfunktion

Die Funktion exp(x) = e hoch x, mit e ungefähr 2,718. Sie erzeugt positive Zahlen und steigt mit x.

Beispiel: exp(0) = 1, exp(1) ungefähr 2,718. Softmax nutzt diese positiven Werte.

Ausführlich im Kapitel „Sprache als Wahrscheinlichkeitsproblem“.

Feature

Ein einzelner Eintrag einer Darstellung. Gelernte Features müssen keine von Menschen benennbare Eigenschaft darstellen.

Beispiel: In [0,2; 0,7] sind 0,2 und 0,7 die beiden Komponenten.

Ausführlich im Kapitel „Embeddings und geteilte Repräsentationen“.

FlashAttention

FlashAttention berechnet dichte Attention blockweise mit weniger Speicherverkehr. SDPA ist PyTorchs Schnittstelle zur skalierten Skalarprodukt-Attention. Ein Kernel ist die konkrete gerätenahe Rechenroutine.

Beispiel: Ein SDPA-Aufruf kann je nach Gerät eine andere Rechenroutine verwenden; der Funktionsname garantiert keine bestimmte Beschleunigung.

Ausführlich im Kapitel „GQA, FlashAttention und KV-Cache“.

FLOPs

Eine Anzahl von Gleitkommaoperationen, also Rechenarbeit. Ein PFLOP entspricht 10 hoch 15 Operationen. Erst FLOP/s beschreibt eine Geschwindigkeit.

Beispiel: 6 × Parameter × Trainingstokens ist eine grobe Arbeitsschätzung für dichtes Transformertraining.

Ausführlich im Kapitel „Größer werden, ohne blind zu rechnen“.

Forward-Pass

Das Berechnen einer Vorhersage vom Eingang bis zum Ausgang mit den aktuellen Parametern.

Beispiel: Erst h = 2 × w, dann Vorhersage = h × v. Dabei ändern sich w und v noch nicht.

Ausführlich im Kapitel „Aus Neuronen wird ein kleines Netz“.

GELU

Eine glatte Aktivierungsfunktion, die negative Eingaben weich abschwächt statt sie wie ReLU hart bei null abzuschneiden.

Beispiel: Sie verändert die Zwischenwerte zwischen den beiden linearen Schichten des klassischen MLPs.

Ausführlich im Kapitel „Der vollständige Transformer-Block“.

Generalisierung

Das erfolgreiche Anwenden gelernter Muster auf bisher nicht verwendete Beispiele.

Beispiel: Nach 1→3, 2→6 und 3→9 liefert das Modell für die neue Eingabe 4 den Wert 12.

Ausführlich im Kapitel „Was bedeutet: Ein Programm lernt?“.

Gewicht

Ein trainierbarer Multiplikator. Er bestimmt, wie ein Eingabewert zu einer folgenden Rechnung beiträgt.

Beispiel: Ein Gewicht −2 macht aus Eingabe 3 den Beitrag −6.

Ausführlich im Kapitel „Ein künstliches Neuron zum Nachrechnen“.

GQA

Varianten der Verteilung von Query-, Key- und Value-Köpfen. GQA lässt mehrere Query-Köpfe gemeinsame Key/Value-Köpfe verwenden.

Beispiel: 8 Query-Köpfe und 2 Key/Value-Köpfe: Je vier Queries teilen sich ein K/V-Paar.

Ausführlich im Kapitel „GQA, FlashAttention und KV-Cache“.

Gradient

Die Liste der Ableitungen des Fehlers nach den Parametern. Sie beschreibt ihre jeweiligen lokalen Einflüsse.

Beispiel: Bei einem einzigen Gewicht ist der Gradient nur eine Zahl, etwa −16.

Ausführlich im Kapitel „Wie Zahlen tatsächlich lernen“.

Gradient Accumulation

Mehrere kleine Beispielgruppen werden nacheinander vorwärts und rückwärts berechnet. Ihre Gradienten sammeln sich vor einem gemeinsamen Parameterupdate.

Beispiel: Vier Microbatches mit je 2 Beispielen können einen Update-Schritt mit effektiv 8 Beispielen bilden.

Ausführlich im Kapitel „Deine erste Trainingsschleife“.

Eine getrennte Attentionberechnung mit eigenen Darstellungen. Mehrere Köpfe können parallel unterschiedliche Mischungen bilden.

Beispiel: Bei Gesamtbreite 128 und 4 Köpfen kann jeder Kopf mit Breite 32 rechnen.

Ausführlich im Kapitel „Kausalität und mehrere Köpfe“.

Hidden State

Eine innerhalb des Netzes berechnete Zahlenliste. Sie ist ein Zwischenwert und kein eigener, von Menschen vorgegebener Zielwert.

Beispiel: Die Darstellung einer Textposition nach dem ersten Transformerblock ist ein Hidden State.

Ausführlich im Kapitel „Aus Neuronen wird ein kleines Netz“.

Inferenz

Inferenz ist das Anwenden eines trainierten Modells. Bei autoregressiver Generierung wird jeweils ein neuer Token angehängt und erneut vorhergesagt.

Beispiel: Aus „Die Katze“ wird erst „Die Katze sitzt“ und anschließend eine längere Folge.

Ausführlich im Kapitel „Aus Scores wird ein Text“.

Kettenregel

Eine Ableitungsregel für hintereinandergeschaltete Funktionen: Die lokalen Änderungsraten entlang eines Weges werden multipliziert.

Beispiel: Wenn h auf w mit Faktor 2 reagiert und die Ausgabe auf h mit Faktor 3, ist der kombinierte Einfluss 6.

Ausführlich im Kapitel „Lernen durch mehrere Schichten“.

Key

Die zum Vergleich verwendete Zahlenliste einer möglichen Informationsquelle.

Beispiel: Query und Key bestimmen einen Score. Der anschließend gemischte Inhalt steht im Value.

Ausführlich im Kapitel „Self-Attention ohne Geheimnisse“.

Korpus

Die Sammlung von Texten, aus der Trainings- oder Prüfdaten erzeugt werden.

Beispiel: Zehn voneinander getrennte Geschichten bilden einen kleinen Korpus.

Ausführlich im Kapitel „Daten sind ein Teil des Modells“.

KV-Cache

Ein KV-Cache speichert bisher berechnete Keys und Values. Prefill liest den Prompt; Decode ergänzt danach neue Tokens einzeln.

Beispiel: Beim nächsten Token werden frühere Keys und Values wiederverwendet, statt sie vollständig neu zu berechnen.

Ausführlich im Kapitel „GQA, FlashAttention und KV-Cache“.

LayerNorm

LayerNorm normalisiert die Komponenten einer Position und lernt danach Skalierung und Verschiebung. Pre-Norm heißt: Normalisierung vor der folgenden Operation.

Beispiel: Im Pre-Norm-Block wird x normalisiert, bevor Attention aufgerufen wird.

Ausführlich im Kapitel „Der vollständige Transformer-Block“.

Lernrate

Eine Einstellung dafür, wie groß ein Lernschritt ausfällt. Sie multipliziert im einfachen Gradientenschritt die Ableitung.

Beispiel: Bei Lernrate 0,05 und Gradient −16 wird aus w = 1 der neue Wert 1,8.

Ausführlich im Kapitel „Wie Zahlen tatsächlich lernen“.

Logarithmus

Hier der natürliche Logarithmus: die Umkehrfunktion von exp. Er fragt, welcher Exponent eine Zahl erzeugt.

Beispiel: Weil exp(0) = 1, gilt log(1) = 0. Für Wahrscheinlichkeiten kleiner als 1 ist log negativ.

Ausführlich im Kapitel „Das Lernziel: Cross-Entropy“.

Logit

Ein zunächst unbeschränkter Zahlenwert für eine mögliche Ausgabe. Erst Softmax macht aus allen Logits zusammen Wahrscheinlichkeiten.

Beispiel: Die Logits [2,1,0] ergeben ungefähr [0,665;0,245;0,090].

Ausführlich im Kapitel „Sprache als Wahrscheinlichkeitsproblem“.

Loss

Eine Zahl, die bewertet, wie unpassend die Vorhersage zum vorgegebenen Ziel ist. Kleiner ist nach diesem Maß besser.

Beispiel: Vorhersage 2, Ziel 6: Der quadratische Fehler ist (2−6)² = 16.

Ausführlich im Kapitel „Wie messen wir eine falsche Antwort?“.

Markov-Kette

Ein schrittweiser Zufallsprozess, dessen nächster Zustand nur vom aktuellen Zustand abhängt.

Beispiel: Das Bigram-Modell wählt den nächsten Token aus der Zeile des zuletzt erzeugten Tokens.

Ausführlich im Kapitel „Dein erstes echtes Sprachmodell“.

Maske

Eine Regel, die festlegt, welche Einträge bei einer Rechnung teilnehmen dürfen. Eine kausale Maske verbietet zukünftige Textpositionen.

Beispiel: Position 2 darf die Positionen 1 und 2 lesen, aber nicht 3.

Ausführlich im Kapitel „Kausalität und mehrere Köpfe“.

Matrix

Eine rechteckige Zahlentabelle mit Zeilen und Spalten.

Beispiel: Eine 3-mal-2-Matrix enthält sechs Zahlen.

Ausführlich im Kapitel „Vektoren, Matrizen und Tensorformen“.

Matrixmultiplikation

Eine Verknüpfung von Zahlentabellen durch Skalarprodukte ihrer Zeilen und Spalten. Die inneren Größen müssen zusammenpassen.

Beispiel: [1,2] mal [[3,4],[5,6]] ergibt [13,16].

Ausführlich im Kapitel „Vektoren, Matrizen und Tensorformen“.

MiB

Binäre Speichereinheiten: 1 MiB = 1024² Bytes; 1 GiB = 1024³ Bytes.

Beispiel: 1.048.576 FP32-Zahlen mit je 4 Bytes belegen 4 MiB.

Ausführlich im Kapitel „Präzision und Trainingsspeicher“.

MLP

Multilayer Perceptron: ein Netz aus aufeinanderfolgenden linearen Schichten mit Aktivierung dazwischen. Im Transformer arbeitet es separat pro Position.

Beispiel: Breite 8 → lineare Schicht auf 32 → Aktivierung → lineare Schicht zurück auf 8.

Ausführlich im Kapitel „Der vollständige Transformer-Block“.

Modell

Eine festgelegte Rechenregel zusammen mit ihren eingestellten Parametern, die aus Eingaben Vorhersagen erzeugt.

Beispiel: Bei Vorhersage = Eingabe × w ist die Regel eine Multiplikation und w der Parameter.

Ausführlich im Kapitel „Was bedeutet: Ein Programm lernt?“.

MoE

Eine Architektur mit mehreren Teilnetzen, von denen pro Token nur ausgewählte Teile verwendet werden.

Beispiel: Ein Auswahlmechanismus leitet eine Positionsdarstellung an wenige von vielen Expertennetzen weiter.

Ausführlich im Kapitel „Was heutige große Systeme zusätzlich brauchen“.

MSE

Mean Squared Error: der Mittelwert der quadrierten Abweichungen zwischen Vorhersagen und Zielwerten.

Beispiel: Einzelfehler 1, 4 und 9 ergeben MSE = 14/3.

Ausführlich im Kapitel „Wie messen wir eine falsche Antwort?“.

Nats

Die Einheit von Informationsmaßen, die mit dem natürlichen Logarithmus berechnet werden. Sie ist keine zusätzliche Modellgröße.

Beispiel: −log(0,5) ergibt ungefähr 0,693 Nats. Mit einem Logarithmus zur Basis 2 wäre dasselbe Informationsmaß 1 Bit.

Ausführlich im Kapitel „Das Lernziel: Cross-Entropy“.

Neuron

Eine Recheneinheit, die Eingaben mit Gewichten multipliziert und die Beiträge samt Bias addiert. Häufig folgt eine Aktivierungsfunktion.

Beispiel: 2 × 1 + 1 × (−1) + 0,5 = 1,5 vor der Aktivierung.

Ausführlich im Kapitel „Ein künstliches Neuron zum Nachrechnen“.

Neuronales Netz

Ein Rechenmodell aus verbundenen Einheiten. Jede Einheit verarbeitet Zahlen; veränderbare Gewichte bestimmen das Ergebnis.

Beispiel: Zwei Eingaben werden von zwei versteckten Neuronen verarbeitet und danach zu einer Ausgabe kombiniert.

Ausführlich im Kapitel „Aus Neuronen wird ein kleines Netz“.

Nichtlinearität

Eine Eigenschaft einer Rechenregel, die sich nicht durch eine einzige gewichtete Summe mit Bias beschreiben lässt.

Beispiel: ReLU hat einen Knick. Keine einzige Gerade kann ihre gesamte Kurve beschreiben.

Ausführlich im Kapitel „Warum Neuronen eine Aktivierungsfunktion brauchen“.

Normalisierung

Eine Rechnung, die die Größenordnung von Werten auf festgelegte Weise anpasst. „Norm“ kann auch die Länge eines Vektors bedeuten; der Kontext entscheidet.

Beispiel: LayerNorm zieht den Mittelwert einer Positionsliste ab und teilt durch ihre geschützte Standardabweichung.

Ausführlich im Kapitel „Der vollständige Transformer-Block“.

One-Hot

Eine Liste mit genau einer 1 und sonst Nullen. Die Position der 1 kennzeichnet eine ausgewählte Kategorie.

Beispiel: Für die zweite von drei Möglichkeiten: [0,1,0].

Ausführlich im Kapitel „Embeddings und geteilte Repräsentationen“.

Optimierer

Eine Regel, die berechnete Gradienten in konkrete Parameteränderungen übersetzt.

Beispiel: Ein einfacher Optimierer zieht Lernrate mal Gradient vom bisherigen Gewicht ab.

Ausführlich im Kapitel „Deine erste Trainingsschleife“.

Padding

Zusätzliche Platzhalter, damit verschieden lange Folgen in ein gemeinsames rechteckiges Zahlenfeld passen. Sie sollen nicht als echte Zieltexte zählen.

Beispiel: Eine kurze Folge wird bis zur Länge der längsten Folge im Batch aufgefüllt.

Ausführlich im Kapitel „Das Lernziel: Cross-Entropy“.

Parameter

Eine Zahl im Modell, die beim Training verändert werden kann. Eingabedaten und feste Einstellungen sind keine trainierbaren Parameter.

Beispiel: Das Gewicht w beginnt bei 1 und wird beim Lernen in Richtung 3 verändert.

Ausführlich im Kapitel „Was bedeutet: Ein Programm lernt?“.

Perplexity

Die Exponentialfunktion des mittleren Tokenfehlers. Bei gleichverteilten Möglichkeiten entspricht sie deren Anzahl.

Beispiel: Vier gleich wahrscheinliche Tokens ergeben Perplexity 4.

Ausführlich im Kapitel „Das Lernziel: Cross-Entropy“.

Pretraining

Das erste breite Training, bei dem das Modell aus vielen Textfolgen nächste Tokens vorhersagt.

Beispiel: Vor einem Frage-Antwort-Training lernt das Grundmodell an allgemeinen Texten.

Ausführlich im Kapitel „Deine erste Trainingsschleife“.

Projektion

Hier eine gelernte lineare Umrechnung einer Zahlenliste in eine neue Liste, gegebenenfalls mit Bias.

Beispiel: Eine lineare Schicht rechnet eine Darstellung mit 128 Komponenten in 320 Logits um.

Ausführlich im Kapitel „Embeddings und geteilte Repräsentationen“.

Prompt

Der Text, den das Modell bei der aktuellen Vorhersage lesen darf. Präfix bezeichnet den bisher gegebenen Anfang einer Folge.

Beispiel: Bei „Die Katze sitzt“ ist dieser gesamte bisherige Text Kontext für den nächsten Token.

Ausführlich im Kapitel „Vom Text zu Token-IDs“.

Präzision

Das Zahlenformat bestimmt Speicherbedarf, Wertebereich und Rundungsgenauigkeit. Float32/FP32 verwendet 32 Bits, FP16 und BF16 jeweils 16 Bits.

Beispiel: Eine Million FP32-Zahlen braucht etwa 4 Millionen Bytes allein für ihre Werte.

Ausführlich im Kapitel „Präzision und Trainingsspeicher“.

Quantisierung

Werte werden mit weniger Abstufungen beziehungsweise weniger Bits dargestellt. Das spart Speicher, kann aber Rundungsfehler erhöhen.

Beispiel: Eine Gewichtstabelle wird in 8-Bit-Werte samt Skalierungsinformationen umgerechnet.

Ausführlich im Kapitel „Präzision und Trainingsspeicher“.

Query

Die Zahlenliste einer lesenden Position, die mit den Keys möglicher Quellen verglichen wird.

Beispiel: Query [1,0] hat mit Key [1,1] das Skalarprodukt 1.

Ausführlich im Kapitel „Self-Attention ohne Geheimnisse“.

RAG

Retrieval sucht passende externe Informationen. RAG fügt solche gefundenen Texte zum Eingabekontext des Sprachmodells hinzu.

Beispiel: Vor einer Antwort werden passende Abschnitte eines Handbuchs gesucht und mitgegeben.

Ausführlich im Kapitel „Was heutige große Systeme zusätzlich brauchen“.

Rechengraph

Eine Darstellung von Rechnungen als verbundene Schritte: Die Ausgabe eines Schritts wird zur Eingabe des nächsten.

Beispiel: Multiplikation → zweite Multiplikation → Abweichung → Quadrat.

Ausführlich im Kapitel „Lernen durch mehrere Schichten“.

Regularisierung

Verfahren, die eine zu spezielle Anpassung an vorhandene Daten begrenzen. Additive Glättung ergänzt bei Zählungen kleine Beiträge auch für ungesehene Fälle.

Beispiel: Aus Zählwerten [0,1,1] werden nach Addition von 1 die Werte [1,2,2].

Ausführlich im Kapitel „Dein erstes echtes Sprachmodell“.

ReLU

Eine einfache Aktivierungsfunktion: negative Werte werden 0, alle anderen bleiben erhalten.

Beispiel: ReLU(−2) = 0 und ReLU(2) = 2.

Ausführlich im Kapitel „Warum Neuronen eine Aktivierungsfunktion brauchen“.

Residualverbindung

Ein direkter Additionsweg, bei dem die ursprüngliche Eingabe zum Ergebnis einer Operation hinzukommt.

Beispiel: [2,5] + [0,3;−0,2] ergibt [2,3;4,8].

Ausführlich im Kapitel „Der vollständige Transformer-Block“.

RLHF

Verfahren, die Bewertungen oder bevorzugte Antworten für weiteres Training nutzen. RLHF verwendet ein Belohnungssignal; DPO nutzt Antwortvergleiche direkt in einem Trainingsziel.

Beispiel: Zu derselben Frage wird Antwort A gegenüber Antwort B bevorzugt; das beeinflusst das weitere Training.

Ausführlich im Kapitel „Was heutige große Systeme zusätzlich brauchen“.

RMSNorm

RMS ist die Wurzel des mittleren Quadrats. RMSNorm teilt Komponenten durch diesen Wert und lernt eine Skalierung, ohne vorher den Mittelwert abzuziehen.

Beispiel: [3,4] hat RMS √12,5 ≈ 3,536.

Ausführlich im Kapitel „RMSNorm, RoPE und SwiGLU“.

RoPE

RoPE kodiert Positionen durch Drehungen von Komponentenpaaren in Queries und Keys. Sinus und Kosinus berechnen die Koordinaten dieser Drehung.

Beispiel: [1,0] wird durch eine Vierteldrehung zu [0,1]. Die Länge bleibt gleich.

Ausführlich im Kapitel „RMSNorm, RoPE und SwiGLU“.

Sampling

Sampling wählt aus einer Verteilung einen Token. Greedy nimmt immer den größten Wert. Top-k beschränkt auf k Kandidaten; Top-p auf eine Menge mit vorgegebener Gesamtwahrscheinlichkeit.

Beispiel: Bei 70 % Sofa und 30 % Dach kann Zufallssampling beide auswählen. Greedy nimmt Sofa.

Ausführlich im Kapitel „Aus Scores wird ein Text“.

Schicht

Eine Gruppe von Recheneinheiten auf derselben Stufe des Netzes.

Beispiel: Zwei Neuronen lesen dieselben Eingaben. Ihre beiden Ausgaben bilden eine versteckte Schicht.

Ausführlich im Kapitel „Aus Neuronen wird ein kleines Netz“.

Seed

Eine Startzahl für einen Pseudozufallsgenerator. Sie hilft, Zufallsentscheidungen bei gleicher Umgebung zu wiederholen.

Beispiel: Mit gleichem Seed kann dieselbe Aufteilung in Trainings- und Prüfdokumente entstehen.

Ausführlich im Kapitel „Daten sind ein Teil des Modells“.

SFT

Weitertraining auf vorgegebenen Eingaben und gewünschten Ausgaben. Hier werden Fragen als Kontext und Antworten als aktive Ziele verwendet.

Beispiel: Zur Frage „Warum schmilzt Eis?“ wird eine sachlich richtige Beispielantwort trainiert.

Ausführlich im Kapitel „Vom Textmodell zum Antwortmodell“.

Skalar

Eine einzelne Zahl, im Unterschied zu einer Liste oder Tabelle.

Beispiel: Die Lernrate 0,01 ist ein Skalar.

Ausführlich im Kapitel „Vektoren, Matrizen und Tensorformen“.

Skalarprodukt

Zwei gleich lange Listen komponentenweise multiplizieren und die Produkte addieren. Das Ergebnis ist eine einzelne Zahl.

Beispiel: [1,2] und [3,4] ergeben 1×3 + 2×4 = 11.

Ausführlich im Kapitel „Vektoren, Matrizen und Tensorformen“.

Softmax

Eine Funktion, die eine Liste von Zahlen in positive Werte mit Summe 1 umrechnet. Höhere Eingabezahlen erhalten höhere Wahrscheinlichkeiten.

Beispiel: Drei gleiche Logits ergeben jeweils Wahrscheinlichkeit 1/3.

Ausführlich im Kapitel „Sprache als Wahrscheinlichkeitsproblem“.

SwiGLU

SwiGLU mischt zwei gelernte Zahlenpfade durch komponentenweise Multiplikation. Einer wird vorher durch SiLU verändert. SiLU(x) = x × Sigmoid(x), Sigmoid(x) = 1/(1+exp(−x)).

Beispiel: Für einen Gate-Wert 1 und einen zweiten Wert 2 entsteht vor der letzten Projektion ungefähr 0,731 × 2 = 1,462.

Ausführlich im Kapitel „RMSNorm, RoPE und SwiGLU“.

Target

Target heißt Zielwert. Beim nächsten-Token-Training ist das Ziel gegenüber der Eingabe um eine Position nach vorn verschoben: der Target-Shift.

Beispiel: Eingaben a,b,c haben Ziele b,c,d.

Ausführlich im Kapitel „Das Lernziel: Cross-Entropy“.

Temperatur

Eine positive Zahl, durch die wir Logits vor Softmax teilen. Sie verändert, wie stark sich die Auswahl auf hohe Scores konzentriert.

Beispiel: Unter 1 wird die Verteilung meist spitzer, über 1 flacher. Gleiche Logits bleiben gleich wahrscheinlich.

Ausführlich im Kapitel „Aus Scores wird ein Text“.

Tensor

Ein geordnetes Zahlenfeld mit einer oder mehreren Achsen; auch eine einzelne Zahl kann als Tensor gespeichert werden.

Beispiel: [2,3,4] als Form bedeutet 2 Gruppen mit je 3 Listen aus jeweils 4 Zahlen.

Ausführlich im Kapitel „Vektoren, Matrizen und Tensorformen“.

Token

Eine Einheit, in die der Tokenizer Text zerlegt. Sie kann ein Zeichen, ein Wortstück oder ein ganzes Wort sein.

Beispiel: Ein Tokenizer könnte „lernen“ in „lern“ und „en“ teilen. Die tatsächliche Zerlegung hängt vom Tokenizer ab.

Ausführlich im Kapitel „Vom Text zu Token-IDs“.

Tokenizer

Das Verfahren zum Zerlegen von Text und Übersetzen der Teile in festgelegte Nummern.

Beispiel: „Katze“ wird in Einheiten zerlegt; jede Einheit erhält ihre Token-ID.

Ausführlich im Kapitel „Vom Text zu Token-IDs“.

Training

Das wiederholte Berechnen von Vorhersagen und Verändern von Parametern anhand von Beispielen und Fehlern.

Beispiel: Vorwärts rechnen → Fehler messen → Gradienten berechnen → Parameter ändern.

Ausführlich im Kapitel „Was bedeutet: Ein Programm lernt?“.

Transponieren

Zeilen und Spalten einer Matrix vertauschen.

Beispiel: Eine Tabelle mit 2 Zeilen und 3 Spalten bekommt 3 Zeilen und 2 Spalten.

Ausführlich im Kapitel „Vektoren, Matrizen und Tensorformen“.

Validierung

Das Prüfen auf getrennten Daten, die nicht für die unmittelbaren Parameterupdates genutzt werden. Damit wählen wir Einstellungen und Trainingsstände.

Beispiel: Trainingsfehler sinkt, Prüffehler steigt: Das Modell passt sich womöglich zu stark den Trainingsbeispielen an.

Ausführlich im Kapitel „Loss lesen und Fehler finden“.

Value

Die Inhaltsliste einer Position, die Attention nach den errechneten Gewichten in das Ergebnis einmischt.

Beispiel: Ein Value 20 trägt bei Gewicht 0,25 genau 5 zur Summe bei.

Ausführlich im Kapitel „Self-Attention ohne Geheimnisse“.

Varianz

Varianz ist der Mittelwert der quadrierten Abstände zum Mittelwert. Die Standardabweichung ist ihre Quadratwurzel.

Beispiel: [1,3] hat Mittelwert 2, Varianz 1 und Standardabweichung 1.

Ausführlich im Kapitel „Der vollständige Transformer-Block“.

Vektor

Eine geordnete Liste von Zahlen. Die Reihenfolge ihrer Einträge zählt.

Beispiel: [0,2; 0,7] kann eine zweikomponentige Darstellung eines Tokens sein.

Ausführlich im Kapitel „Vektoren, Matrizen und Tensorformen“.

Verteilung

Die Zuordnung einer Wahrscheinlichkeit zu jeder möglichen Alternative. Alle Wahrscheinlichkeiten summieren sich auf 1.

Beispiel: Sofa 0,5, Dach 0,3, Meer 0,2.

Ausführlich im Kapitel „Sprache als Wahrscheinlichkeitsproblem“.

Vokabular

Die Sammlung aller Tokenarten mit ihren IDs. V ist die Anzahl dieser Einträge.

Beispiel: Bei V = 320 kann jede Token-ID eine von 320 festgelegten Einheiten auswählen.

Ausführlich im Kapitel „Vom Text zu Token-IDs“.

Warmup

Die Anfangsphase, in der die Lernrate schrittweise bis zu ihrem vorgesehenen Wert steigt.

Beispiel: Über die ersten 100 Schritte steigt sie von einem kleinen Wert zur maximalen Lernrate.

Ausführlich im Kapitel „Deine erste Trainingsschleife“.

Weight Decay

Eine kleine zusätzliche Verkleinerung von Gewichten beim Training. Sie soll übergroße Gewichte begrenzen.

Beispiel: Neben dem eigentlichen Lernschritt wird ein kleiner Anteil des bisherigen Gewichts abgezogen.

Ausführlich im Kapitel „Deine erste Trainingsschleife“.

Weight Tying

Mehrere Rechenstellen verwenden dieselben Parameter. Beim Weight Tying teilen sich Eingabeembedding und Ausgabekopf eine Gewichtstabelle.

Beispiel: Eine Tabelle mit V × D Zahlen wird für den Eingabezugriff und für die Ausgabeprojektion verwendet. Eine zweite solche Tabelle entfällt.

Ausführlich im Kapitel „Embeddings und geteilte Repräsentationen“.

Überanpassung

Das Modell passt immer besser zu seinen Trainingsbeispielen, ohne bei neuen Beispielen entsprechend besser zu werden.

Beispiel: Es vervollständigt gelernte Sätze gut, macht aber bei neuen Sätzen mehr Fehler.

Ausführlich im Kapitel „Loss lesen und Fehler finden“.