Fünf Formeln, die du erklären können solltest
Die Kurzformen erinnern an bereits hergeleitete Rechnungen. Über die Kapitelverweise gelangst du zu Zahlenbeispiel und vollständiger Symbolerklärung.
Softmax: . Sie normalisiert die Scores über mögliche nächste Tokens. Schrittweise Erklärung.
Next-Token-Loss: . Bei mehreren aktiven Targets summieren und durch deren Anzahl teilen. Schrittweise Erklärung.
Gradientenschritt: . Eta ist die Lernrate; ∇ (Nabla) bezeichnet die Liste der Ableitungen, also den Gradienten. Der Pfeil ← bedeutet: Ersetze den alten Wert durch das rechts berechnete Ergebnis. Schrittweise Erklärung.
Attention: . Query/Key liefern Gewichte; Values liefern die gemischten Informationen. M ist die additive Maske: 0 für erlaubte Quellen, minus unendlich für verbotene. Attentionrechnung und Maskierung.
KV-Cache: . Die Faktoren beschreiben Keys plus Values für jede Schicht, jedes Batchbeispiel und jede gespeicherte Position. Rechnung mit Größen und Einheiten.
Ein guter Weg durch Forschungspapiere
Lies zuerst Abstract, Problemstellung und Architekturabbildung. Schreibe anschließend in eigenen Worten: Welche bestehende Schwierigkeit soll die Methode lösen? Welcher Teil der Rechnung ändert sich? Welche Vergleichsbedingungen wurden benutzt? Welche Einschränkungen bleiben?
Erst danach versuche, die zentrale Gleichung nachzurechnen und den kleinsten relevanten Code zu schreiben. Ein Paper mit großen Leistungswerten ist nicht automatisch eine Anleitung für dein kleines Modell. Übertrage Annahmen und Experimente bewusst.
Grundlagen und kleine Modelle
- Attention Is All You Need — Vaswani et al., 2017: ursprüngliche Transformerarbeit. Das originale Encoder-Decoder-Modell ist nicht identisch mit unserem kausalen Decoder.
- TinyStories — Eldan & Li, 2023: Untersuchungen zu kleinen Sprachmodellen auf vereinfachten englischen Geschichten.
- TinyStories-Datensatz und Beschreibung: offizielle Datenquelle. Nutze für eigene Läufe die aktuelle Beschreibung und dokumentiere deine Auswahl.
Moderne Architekturbausteine
- Root Mean Square Layer Normalization — Zhang & Sennrich, 2019: Normalisierung ohne Mittelwertzentrierung.
- RoFormer — Su et al., 2021: Rotary Position Embeddings.
- GLU Variants Improve Transformer — Shazeer, 2020: gegatete Feed-Forward-Varianten.
- Fast Transformer Decoding (MQA) — Shazeer, 2019: alle Query-Köpfe teilen sich ein Key/Value-Paar.
- GQA — Ainslie et al., 2023: Gruppen von Queries mit geteilten Keys und Values.
- On Layer Normalization in the Transformer Architecture — Xiong et al., 2020: warum Pre-Norm stabiler trainiert.
- YaRN — Peng et al., 2023: RoPE-Kontext nachträglich verlängern.
- FlashAttention — Dao et al., 2022: IO-bewusste dichte Attention mit reduzierter Zwischenwertmaterialisierung.
Skalierung und Posttraining
- Scaling Laws for Neural Language Models — Kaplan et al., 2020: Potenzgesetze für Loss, Modellgröße, Daten und Rechenaufwand; Herkunft der 6ND-Näherung.
- Training Compute-Optimal Large Language Models — Hoffmann et al., 2022: gemeinsame Planung von Modellgröße und Trainingsdaten bei festem Budget.
- Decoupled Weight Decay (AdamW) — Loshchilov & Hutter, 2019: der Standard-Optimierer für Transformer.
- Mixtral of Experts — Jiang et al., 2024: ein konkretes Sparse-MoE-Sprachmodell.
- DeepSeek-V3 Technical Report, 2024: großes MoE-Modell mit FP8-Training und Multi-Head Latent Attention.
- The Curious Case of Neural Text Degeneration (Nucleus Sampling) — Holtzman et al., 2019: Top-p-Sampling.
- InstructGPT — Ouyang et al., 2022: SFT und RLHF mit Belohnungsmodell.
- LoRA — Hu et al., 2021: Feintuning mit kleinen Zusatzmatrizen.
- Direct Preference Optimization — Rafailov et al., 2023: direktes Lernen aus Antwortpräferenzen.
- DeepSeekMath (GRPO) — Shao et al., 2024: RL ohne Wertmodell durch Vergleich mehrerer Antworten.
- DeepSeek-R1, 2025: Reasoning-Fähigkeiten durch RL mit prüfbaren Belohnungen.
- Speculative Decoding — Leviathan et al., 2022: schnellere Generierung ohne veränderte Ausgabeverteilung.
Offizielle Implementierungsdokumentation
- PyTorch-Installation: passende Installation für dein Betriebssystem und Backend.
- SDPA: Masken, Dropout und Kernelbedingungen der verwendeten Attentionfunktion.
- AdamW: Optimizer-Argumente und Implementierungsdetails.
- Automatic Mixed Precision: Autocast und Gradient Scaling.
- MPS-Backend: Apple-Silicon-Unterstützung und Gerätewahl.
Die Inhalte dieses Lehrbuchs sind eigenständig erklärte Lernbeispiele, keine Übersetzung einzelner Papers. Technische Quellen wurden bei der Erstellung am 6. Oktober 2026 nachgeschlagen. Bibliotheksdokumentation kann sich später ändern. Der Download beschreibt die unterstützten Annahmen seines Referenzcodes; die Links ergänzen ihn.
Häufige Missverständnisse
„Attention versteht automatisch die Bedeutung.“ Attention ist ein lernbarer Informationsmischmechanismus. Welche nützlichen Beziehungen entstehen, hängt von Training und Gesamtarchitektur ab.
„Mehr Parameter bedeuten mehr Wahrheit.“ Parameterzahl beschreibt Kapazität, nicht Faktenprüfung. Datenfehler und falsche Ausgabeziele können auch in größeren Netzen bleiben.
„SFT ist nur Format.“ SFT kann auch Aufgabenwissen und Verhalten vermitteln. Es ersetzt jedoch nicht automatisch fehlende breite Sprachkompetenz und kann bei kleinen Daten stark memorisieren.
„Ein langes Kontextfenster ist ein langes Gedächtnis.“ Ein Fenster definiert verfügbaren Input. Zuverlässige Nutzung über große Abstände muss trainiert und geprüft werden; dauerhafter externer Speicher ist wieder eine andere Funktion.
„Ein guter Loss beweist ein gutes Produkt.“ Die Trainingsmetrik ist nur ein Teil des Ziels. Für eine Anwendung gehören passende Aufgabenprüfungen, Fehlerbehandlung und Systemverhalten dazu.
Alle Begriffe mit Beispiel
Die gleichen Erklärungen kannst du beim Lesen direkt über die gepunktet unterstrichenen Begriffe öffnen. Die alphabetische Sammlung bleibt auch im heruntergeladenen Buch vollständig enthalten.
Ablation
Evaluation prüft Leistung; ein Benchmark ist eine festgelegte Sammlung von Prüfaufgaben. Eine Ablation vergleicht Varianten mit gezielt verändertem Einzelbaustein.
Beispiel: Zwei sonst gleiche Modelle mit und ohne eine bestimmte Normalisierung vergleichen.
Ausführlich im Kapitel „Antworten ehrlich bewerten“.
Ableitung
Die lokale Änderungsrate einer Größe bezüglich einer anderen. Sie beschreibt, wie empfindlich das Ergebnis auf eine sehr kleine Änderung reagiert.
Beispiel: Ableitung −16: Eine kleine Gewichtserhöhung um 0,01 senkt den Fehler in der lokalen Näherung um 0,16.
Ausführlich im Kapitel „Wie Zahlen tatsächlich lernen“.
AdamW
Optimierungsverfahren, die für jeden Parameter Statistiken vergangener Gradienten führen. AdamW trennt eine zusätzliche Gewichtsverkleinerung vom gradientenbasierten Schritt.
Beispiel: Ein Parameter mit stark schwankenden Gradienten bekommt eine andere Skalierung als einer mit gleichmäßigen Gradienten.
Ausführlich im Kapitel „Deine erste Trainingsschleife“.
Aktivierung
Ein bei der Vorwärtsrechnung berechneter Zwischenwert, oft die Ausgabe einer Aktivierungsfunktion. Er entsteht für die aktuelle Eingabe und ist kein dauerhaftes Gewicht.
Beispiel: Ein Neuron hat Summe −2. Nach ReLU ist seine Aktivierung 0.
Ausführlich im Kapitel „Aus Neuronen wird ein kleines Netz“.
Aktivierungsfunktion
Eine Funktion, die den berechneten Wert eines Neurons weiterverarbeitet. Nichtlineare Aktivierungen erlauben komplexere Zusammenhänge.
Beispiel: ReLU macht aus −3 eine 0 und lässt 4 unverändert.
Ausführlich im Kapitel „Warum Neuronen eine Aktivierungsfunktion brauchen“.
Attention
Eine Berechnung, bei der jede Position Informationen aus erlaubten Positionen mit veränderlichen Mischgewichten zusammenfasst.
Beispiel: Values 10,20,30 mit Gewichten 0,5;0,25;0,25 ergeben 17,5.
Ausführlich im Kapitel „Self-Attention ohne Geheimnisse“.
Ausgabekopf
Die letzte Umrechnung von internen Zahlenlisten in die benötigten Ausgabewerte.
Beispiel: Eine Positionsliste mit 128 Zahlen wird zu 320 Logits für 320 mögliche Tokens.
Ausführlich im Kapitel „Der vollständige Transformer-Block“.
Autograd
Die automatische Berechnung von Ableitungen aus den ausgeführten Rechenschritten. PyTorch stellt dafür ein System bereit.
Beispiel: Nach einer Vorwärtsrechnung löst loss.backward() die Rückwärtsrechnung aus.
Ausführlich im Kapitel „Lernen durch mehrere Schichten“.
Backpropagation
Ein Verfahren, das die Einflüsse auf den Fehler rückwärts durch die einzelnen Rechnungen verfolgt. Es berechnet Gradienten; die Gewichte ändert erst der Optimierer.
Beispiel: Erst den Einfluss auf die Ausgabe bestimmen, dann auf den Zwischenwert und schließlich auf das frühere Gewicht.
Ausführlich im Kapitel „Lernen durch mehrere Schichten“.
Baseline
Eine Baseline ist ein einfacher Vergleichsmaßstab. Unsere Bigram-Baseline schätzt den nächsten Token nur aus seinem unmittelbaren Vorgänger.
Beispiel: Nach a wurden b und c je einmal gesehen: Beide erhalten ohne Glättung Wahrscheinlichkeit 1/2.
Ausführlich im Kapitel „Dein erstes echtes Sprachmodell“.
Batch
Eine Gruppe von Beispielen, die in einem Rechenschritt gemeinsam verarbeitet wird. Batchgröße ist die Anzahl dieser Beispiele.
Beispiel: Ein Batch aus 4 Textausschnitten hat B = 4.
Ausführlich im Kapitel „Vektoren, Matrizen und Tensorformen“.
Bias
Ein zusätzlicher trainierbarer Summand, der unabhängig von der aktuellen Eingabe addiert wird.
Beispiel: Bei 3 × x + 1 ist der Bias 1. Selbst für x = 0 bleibt die Ausgabe 1.
Ausführlich im Kapitel „Ein künstliches Neuron zum Nachrechnen“.
BPE
Byte Pair Encoding: Ein Verfahren, das häufige benachbarte Einheiten schrittweise zusammenführt. Byte-BPE beginnt mit Bytes statt Zeichen.
Beispiel: Aus häufig benachbartem „a“ und „b“ kann eine neue Einheit „ab“ werden.
Ausführlich im Kapitel „Vom Text zu Token-IDs“.
Broadcasting
Eine Regel, mit der eine Operation eine kleinere passende Zahlenform über größere Achsen wiederverwendet.
Beispiel: Ein Bias mit D Einträgen wird zu jeder der vielen Positionslisten mit D Einträgen addiert.
Ausführlich im Kapitel „Vektoren, Matrizen und Tensorformen“.
Byte
Ein Byte speichert 8 Bits. UTF-8 ist eine feste Regel, die Textzeichen in ein oder mehrere Bytes übersetzt.
Beispiel: Das ASCII-Zeichen a braucht ein Byte in UTF-8; viele andere Zeichen brauchen mehrere.
Ausführlich im Kapitel „Vom Text zu Token-IDs“.
Checkpoint
Ein gespeicherter Trainingsstand. Zum Fortsetzen gehören neben Gewichten auch Einstellungen und der Zustand des Optimierers dazu.
Beispiel: Nach Schritt 100 speichern und später ab diesem Zustand weitertrainieren.
Ausführlich im Kapitel „Deine Python-Werkstatt“.
Cross-Entropy
Das Fehlermaß für unsere nächste Tokenvorhersage: der negative Logarithmus der Wahrscheinlichkeit des richtigen Tokens.
Beispiel: Richtiges Token mit Wahrscheinlichkeit 0,5 ergibt Fehler ungefähr 0,693.
Ausführlich im Kapitel „Das Lernziel: Cross-Entropy“.
Data Parallelism
Arten, Training auf Geräte zu verteilen. Datenparallelität verteilt Beispiele, Tensorparallelität Teile von Rechnungen und Pipelineparallelität Schichten. Sharding zerlegt gespeicherte Zustände.
Beispiel: Zwei Geräte verarbeiten verschiedene Batches und gleichen ihre Gradienten ab.
Ausführlich im Kapitel „Größer werden, ohne blind zu rechnen“.
Datenleck
Prüfinformation gelangt unerlaubt in Training oder Modellauswahl. Das lässt die gemessene Leistung zu gut erscheinen.
Beispiel: Derselbe Text steht sowohl im Training als auch in der Validierung.
Ausführlich im Kapitel „Daten sind ein Teil des Modells“.
Decoder
Ein Transformer verarbeitet Zahlenlisten mit Attention und kleinen Netzen. Unser Decoder ist eine Variante, die nur bisherigen Text liest und den nächsten Token vorhersagt.
Beispiel: Embedding → mehrere kausale Blöcke → Norm → Logits für die Fortsetzung.
Ausführlich im Kapitel „Der vollständige Transformer-Block“.
Dimension
Je nach Zusammenhang entweder die Länge einer Zahlenliste oder eine Achse eines Zahlenfelds. Wir nennen die jeweilige Bedeutung im Text.
Beispiel: Embeddingdimension 128 heißt: 128 Zahlen pro Tokenliste. Ein Tensor mit Form [2,3,128] hat drei Achsen.
Ausführlich im Kapitel „Vektoren, Matrizen und Tensorformen“.
Embedding
Eine trainierbare Zahlenliste, die über eine ID aus einer Tabelle gelesen wird.
Beispiel: Token-ID 1 wählt Zeile 1, zum Beispiel [0,4;0,6].
Ausführlich im Kapitel „Embeddings und geteilte Repräsentationen“.
Entropie
Eine Maßzahl dafür, wie breit eine Wahrscheinlichkeitsverteilung ist. Eine sehr sichere Auswahl hat niedrige Entropie.
Beispiel: Drei gleich wahrscheinliche Tokens haben höhere Entropie als [0,98;0,01;0,01].
Ausführlich im Kapitel „Sprache als Wahrscheinlichkeitsproblem“.
EOS
Besondere Tokenarten zur Kennzeichnung von Grenzen und Rollen. BOS markiert einen Anfang, EOS ein Ende; USER und ASSISTANT kennzeichnen Gesprächsrollen.
Beispiel: Ein Antwortbeispiel kann nach der letzten Antwort mit einem EOS-Token enden.
Ausführlich im Kapitel „Vom Textmodell zum Antwortmodell“.
Epoche
Ein vollständiger Durchgang durch einen fest definierten Trainingsdatensatz. Beim zufälligen Ziehen von Textfenstern ist ein solcher Durchgang nicht automatisch gegeben.
Beispiel: Wenn jedes der 100 Beispiele genau einmal verarbeitet wurde, ist eine Epoche beendet.
Ausführlich im Kapitel „Deine erste Trainingsschleife“.
Epsilon
Eine sehr kleine positive Schutzkonstante, etwa damit eine Rechnung nicht durch null teilt.
Beispiel: LayerNorm addiert Epsilon zur Varianz, bevor die Wurzel gezogen wird.
Ausführlich im Kapitel „Der vollständige Transformer-Block“.
Exponentialfunktion
Die Funktion exp(x) = e hoch x, mit e ungefähr 2,718. Sie erzeugt positive Zahlen und steigt mit x.
Beispiel: exp(0) = 1, exp(1) ungefähr 2,718. Softmax nutzt diese positiven Werte.
Ausführlich im Kapitel „Sprache als Wahrscheinlichkeitsproblem“.
Feature
Ein einzelner Eintrag einer Darstellung. Gelernte Features müssen keine von Menschen benennbare Eigenschaft darstellen.
Beispiel: In [0,2; 0,7] sind 0,2 und 0,7 die beiden Komponenten.
Ausführlich im Kapitel „Embeddings und geteilte Repräsentationen“.
FlashAttention
FlashAttention berechnet dichte Attention blockweise mit weniger Speicherverkehr. SDPA ist PyTorchs Schnittstelle zur skalierten Skalarprodukt-Attention. Ein Kernel ist die konkrete gerätenahe Rechenroutine.
Beispiel: Ein SDPA-Aufruf kann je nach Gerät eine andere Rechenroutine verwenden; der Funktionsname garantiert keine bestimmte Beschleunigung.
Ausführlich im Kapitel „GQA, FlashAttention und KV-Cache“.
FLOPs
Eine Anzahl von Gleitkommaoperationen, also Rechenarbeit. Ein PFLOP entspricht 10 hoch 15 Operationen. Erst FLOP/s beschreibt eine Geschwindigkeit.
Beispiel: 6 × Parameter × Trainingstokens ist eine grobe Arbeitsschätzung für dichtes Transformertraining.
Ausführlich im Kapitel „Größer werden, ohne blind zu rechnen“.
Forward-Pass
Das Berechnen einer Vorhersage vom Eingang bis zum Ausgang mit den aktuellen Parametern.
Beispiel: Erst h = 2 × w, dann Vorhersage = h × v. Dabei ändern sich w und v noch nicht.
Ausführlich im Kapitel „Aus Neuronen wird ein kleines Netz“.
GELU
Eine glatte Aktivierungsfunktion, die negative Eingaben weich abschwächt statt sie wie ReLU hart bei null abzuschneiden.
Beispiel: Sie verändert die Zwischenwerte zwischen den beiden linearen Schichten des klassischen MLPs.
Ausführlich im Kapitel „Der vollständige Transformer-Block“.
Generalisierung
Das erfolgreiche Anwenden gelernter Muster auf bisher nicht verwendete Beispiele.
Beispiel: Nach 1→3, 2→6 und 3→9 liefert das Modell für die neue Eingabe 4 den Wert 12.
Ausführlich im Kapitel „Was bedeutet: Ein Programm lernt?“.
Gewicht
Ein trainierbarer Multiplikator. Er bestimmt, wie ein Eingabewert zu einer folgenden Rechnung beiträgt.
Beispiel: Ein Gewicht −2 macht aus Eingabe 3 den Beitrag −6.
Ausführlich im Kapitel „Ein künstliches Neuron zum Nachrechnen“.
GQA
Varianten der Verteilung von Query-, Key- und Value-Köpfen. GQA lässt mehrere Query-Köpfe gemeinsame Key/Value-Köpfe verwenden.
Beispiel: 8 Query-Köpfe und 2 Key/Value-Köpfe: Je vier Queries teilen sich ein K/V-Paar.
Ausführlich im Kapitel „GQA, FlashAttention und KV-Cache“.
Gradient
Die Liste der Ableitungen des Fehlers nach den Parametern. Sie beschreibt ihre jeweiligen lokalen Einflüsse.
Beispiel: Bei einem einzigen Gewicht ist der Gradient nur eine Zahl, etwa −16.
Ausführlich im Kapitel „Wie Zahlen tatsächlich lernen“.
Gradient Accumulation
Mehrere kleine Beispielgruppen werden nacheinander vorwärts und rückwärts berechnet. Ihre Gradienten sammeln sich vor einem gemeinsamen Parameterupdate.
Beispiel: Vier Microbatches mit je 2 Beispielen können einen Update-Schritt mit effektiv 8 Beispielen bilden.
Ausführlich im Kapitel „Deine erste Trainingsschleife“.
Head
Eine getrennte Attentionberechnung mit eigenen Darstellungen. Mehrere Köpfe können parallel unterschiedliche Mischungen bilden.
Beispiel: Bei Gesamtbreite 128 und 4 Köpfen kann jeder Kopf mit Breite 32 rechnen.
Ausführlich im Kapitel „Kausalität und mehrere Köpfe“.
Hidden State
Eine innerhalb des Netzes berechnete Zahlenliste. Sie ist ein Zwischenwert und kein eigener, von Menschen vorgegebener Zielwert.
Beispiel: Die Darstellung einer Textposition nach dem ersten Transformerblock ist ein Hidden State.
Ausführlich im Kapitel „Aus Neuronen wird ein kleines Netz“.
Inferenz
Inferenz ist das Anwenden eines trainierten Modells. Bei autoregressiver Generierung wird jeweils ein neuer Token angehängt und erneut vorhergesagt.
Beispiel: Aus „Die Katze“ wird erst „Die Katze sitzt“ und anschließend eine längere Folge.
Ausführlich im Kapitel „Aus Scores wird ein Text“.
Kettenregel
Eine Ableitungsregel für hintereinandergeschaltete Funktionen: Die lokalen Änderungsraten entlang eines Weges werden multipliziert.
Beispiel: Wenn h auf w mit Faktor 2 reagiert und die Ausgabe auf h mit Faktor 3, ist der kombinierte Einfluss 6.
Ausführlich im Kapitel „Lernen durch mehrere Schichten“.
Key
Die zum Vergleich verwendete Zahlenliste einer möglichen Informationsquelle.
Beispiel: Query und Key bestimmen einen Score. Der anschließend gemischte Inhalt steht im Value.
Ausführlich im Kapitel „Self-Attention ohne Geheimnisse“.
Korpus
Die Sammlung von Texten, aus der Trainings- oder Prüfdaten erzeugt werden.
Beispiel: Zehn voneinander getrennte Geschichten bilden einen kleinen Korpus.
Ausführlich im Kapitel „Daten sind ein Teil des Modells“.
KV-Cache
Ein KV-Cache speichert bisher berechnete Keys und Values. Prefill liest den Prompt; Decode ergänzt danach neue Tokens einzeln.
Beispiel: Beim nächsten Token werden frühere Keys und Values wiederverwendet, statt sie vollständig neu zu berechnen.
Ausführlich im Kapitel „GQA, FlashAttention und KV-Cache“.
LayerNorm
LayerNorm normalisiert die Komponenten einer Position und lernt danach Skalierung und Verschiebung. Pre-Norm heißt: Normalisierung vor der folgenden Operation.
Beispiel: Im Pre-Norm-Block wird x normalisiert, bevor Attention aufgerufen wird.
Ausführlich im Kapitel „Der vollständige Transformer-Block“.
Lernrate
Eine Einstellung dafür, wie groß ein Lernschritt ausfällt. Sie multipliziert im einfachen Gradientenschritt die Ableitung.
Beispiel: Bei Lernrate 0,05 und Gradient −16 wird aus w = 1 der neue Wert 1,8.
Ausführlich im Kapitel „Wie Zahlen tatsächlich lernen“.
Logarithmus
Hier der natürliche Logarithmus: die Umkehrfunktion von exp. Er fragt, welcher Exponent eine Zahl erzeugt.
Beispiel: Weil exp(0) = 1, gilt log(1) = 0. Für Wahrscheinlichkeiten kleiner als 1 ist log negativ.
Ausführlich im Kapitel „Das Lernziel: Cross-Entropy“.
Logit
Ein zunächst unbeschränkter Zahlenwert für eine mögliche Ausgabe. Erst Softmax macht aus allen Logits zusammen Wahrscheinlichkeiten.
Beispiel: Die Logits [2,1,0] ergeben ungefähr [0,665;0,245;0,090].
Ausführlich im Kapitel „Sprache als Wahrscheinlichkeitsproblem“.
Loss
Eine Zahl, die bewertet, wie unpassend die Vorhersage zum vorgegebenen Ziel ist. Kleiner ist nach diesem Maß besser.
Beispiel: Vorhersage 2, Ziel 6: Der quadratische Fehler ist (2−6)² = 16.
Ausführlich im Kapitel „Wie messen wir eine falsche Antwort?“.
Markov-Kette
Ein schrittweiser Zufallsprozess, dessen nächster Zustand nur vom aktuellen Zustand abhängt.
Beispiel: Das Bigram-Modell wählt den nächsten Token aus der Zeile des zuletzt erzeugten Tokens.
Ausführlich im Kapitel „Dein erstes echtes Sprachmodell“.
Maske
Eine Regel, die festlegt, welche Einträge bei einer Rechnung teilnehmen dürfen. Eine kausale Maske verbietet zukünftige Textpositionen.
Beispiel: Position 2 darf die Positionen 1 und 2 lesen, aber nicht 3.
Ausführlich im Kapitel „Kausalität und mehrere Köpfe“.
Matrix
Eine rechteckige Zahlentabelle mit Zeilen und Spalten.
Beispiel: Eine 3-mal-2-Matrix enthält sechs Zahlen.
Ausführlich im Kapitel „Vektoren, Matrizen und Tensorformen“.
Matrixmultiplikation
Eine Verknüpfung von Zahlentabellen durch Skalarprodukte ihrer Zeilen und Spalten. Die inneren Größen müssen zusammenpassen.
Beispiel: [1,2] mal [[3,4],[5,6]] ergibt [13,16].
Ausführlich im Kapitel „Vektoren, Matrizen und Tensorformen“.
MiB
Binäre Speichereinheiten: 1 MiB = 1024² Bytes; 1 GiB = 1024³ Bytes.
Beispiel: 1.048.576 FP32-Zahlen mit je 4 Bytes belegen 4 MiB.
Ausführlich im Kapitel „Präzision und Trainingsspeicher“.
MLP
Multilayer Perceptron: ein Netz aus aufeinanderfolgenden linearen Schichten mit Aktivierung dazwischen. Im Transformer arbeitet es separat pro Position.
Beispiel: Breite 8 → lineare Schicht auf 32 → Aktivierung → lineare Schicht zurück auf 8.
Ausführlich im Kapitel „Der vollständige Transformer-Block“.
Modell
Eine festgelegte Rechenregel zusammen mit ihren eingestellten Parametern, die aus Eingaben Vorhersagen erzeugt.
Beispiel: Bei Vorhersage = Eingabe × w ist die Regel eine Multiplikation und w der Parameter.
Ausführlich im Kapitel „Was bedeutet: Ein Programm lernt?“.
MoE
Eine Architektur mit mehreren Teilnetzen, von denen pro Token nur ausgewählte Teile verwendet werden.
Beispiel: Ein Auswahlmechanismus leitet eine Positionsdarstellung an wenige von vielen Expertennetzen weiter.
Ausführlich im Kapitel „Was heutige große Systeme zusätzlich brauchen“.
MSE
Mean Squared Error: der Mittelwert der quadrierten Abweichungen zwischen Vorhersagen und Zielwerten.
Beispiel: Einzelfehler 1, 4 und 9 ergeben MSE = 14/3.
Ausführlich im Kapitel „Wie messen wir eine falsche Antwort?“.
Nats
Die Einheit von Informationsmaßen, die mit dem natürlichen Logarithmus berechnet werden. Sie ist keine zusätzliche Modellgröße.
Beispiel: −log(0,5) ergibt ungefähr 0,693 Nats. Mit einem Logarithmus zur Basis 2 wäre dasselbe Informationsmaß 1 Bit.
Ausführlich im Kapitel „Das Lernziel: Cross-Entropy“.
Neuron
Eine Recheneinheit, die Eingaben mit Gewichten multipliziert und die Beiträge samt Bias addiert. Häufig folgt eine Aktivierungsfunktion.
Beispiel: 2 × 1 + 1 × (−1) + 0,5 = 1,5 vor der Aktivierung.
Ausführlich im Kapitel „Ein künstliches Neuron zum Nachrechnen“.
Neuronales Netz
Ein Rechenmodell aus verbundenen Einheiten. Jede Einheit verarbeitet Zahlen; veränderbare Gewichte bestimmen das Ergebnis.
Beispiel: Zwei Eingaben werden von zwei versteckten Neuronen verarbeitet und danach zu einer Ausgabe kombiniert.
Ausführlich im Kapitel „Aus Neuronen wird ein kleines Netz“.
Nichtlinearität
Eine Eigenschaft einer Rechenregel, die sich nicht durch eine einzige gewichtete Summe mit Bias beschreiben lässt.
Beispiel: ReLU hat einen Knick. Keine einzige Gerade kann ihre gesamte Kurve beschreiben.
Ausführlich im Kapitel „Warum Neuronen eine Aktivierungsfunktion brauchen“.
Normalisierung
Eine Rechnung, die die Größenordnung von Werten auf festgelegte Weise anpasst. „Norm“ kann auch die Länge eines Vektors bedeuten; der Kontext entscheidet.
Beispiel: LayerNorm zieht den Mittelwert einer Positionsliste ab und teilt durch ihre geschützte Standardabweichung.
Ausführlich im Kapitel „Der vollständige Transformer-Block“.
One-Hot
Eine Liste mit genau einer 1 und sonst Nullen. Die Position der 1 kennzeichnet eine ausgewählte Kategorie.
Beispiel: Für die zweite von drei Möglichkeiten: [0,1,0].
Ausführlich im Kapitel „Embeddings und geteilte Repräsentationen“.
Optimierer
Eine Regel, die berechnete Gradienten in konkrete Parameteränderungen übersetzt.
Beispiel: Ein einfacher Optimierer zieht Lernrate mal Gradient vom bisherigen Gewicht ab.
Ausführlich im Kapitel „Deine erste Trainingsschleife“.
Padding
Zusätzliche Platzhalter, damit verschieden lange Folgen in ein gemeinsames rechteckiges Zahlenfeld passen. Sie sollen nicht als echte Zieltexte zählen.
Beispiel: Eine kurze Folge wird bis zur Länge der längsten Folge im Batch aufgefüllt.
Ausführlich im Kapitel „Das Lernziel: Cross-Entropy“.
Parameter
Eine Zahl im Modell, die beim Training verändert werden kann. Eingabedaten und feste Einstellungen sind keine trainierbaren Parameter.
Beispiel: Das Gewicht w beginnt bei 1 und wird beim Lernen in Richtung 3 verändert.
Ausführlich im Kapitel „Was bedeutet: Ein Programm lernt?“.
Perplexity
Die Exponentialfunktion des mittleren Tokenfehlers. Bei gleichverteilten Möglichkeiten entspricht sie deren Anzahl.
Beispiel: Vier gleich wahrscheinliche Tokens ergeben Perplexity 4.
Ausführlich im Kapitel „Das Lernziel: Cross-Entropy“.
Pretraining
Das erste breite Training, bei dem das Modell aus vielen Textfolgen nächste Tokens vorhersagt.
Beispiel: Vor einem Frage-Antwort-Training lernt das Grundmodell an allgemeinen Texten.
Ausführlich im Kapitel „Deine erste Trainingsschleife“.
Projektion
Hier eine gelernte lineare Umrechnung einer Zahlenliste in eine neue Liste, gegebenenfalls mit Bias.
Beispiel: Eine lineare Schicht rechnet eine Darstellung mit 128 Komponenten in 320 Logits um.
Ausführlich im Kapitel „Embeddings und geteilte Repräsentationen“.
Prompt
Der Text, den das Modell bei der aktuellen Vorhersage lesen darf. Präfix bezeichnet den bisher gegebenen Anfang einer Folge.
Beispiel: Bei „Die Katze sitzt“ ist dieser gesamte bisherige Text Kontext für den nächsten Token.
Ausführlich im Kapitel „Vom Text zu Token-IDs“.
Präzision
Das Zahlenformat bestimmt Speicherbedarf, Wertebereich und Rundungsgenauigkeit. Float32/FP32 verwendet 32 Bits, FP16 und BF16 jeweils 16 Bits.
Beispiel: Eine Million FP32-Zahlen braucht etwa 4 Millionen Bytes allein für ihre Werte.
Ausführlich im Kapitel „Präzision und Trainingsspeicher“.
Quantisierung
Werte werden mit weniger Abstufungen beziehungsweise weniger Bits dargestellt. Das spart Speicher, kann aber Rundungsfehler erhöhen.
Beispiel: Eine Gewichtstabelle wird in 8-Bit-Werte samt Skalierungsinformationen umgerechnet.
Ausführlich im Kapitel „Präzision und Trainingsspeicher“.
Query
Die Zahlenliste einer lesenden Position, die mit den Keys möglicher Quellen verglichen wird.
Beispiel: Query [1,0] hat mit Key [1,1] das Skalarprodukt 1.
Ausführlich im Kapitel „Self-Attention ohne Geheimnisse“.
RAG
Retrieval sucht passende externe Informationen. RAG fügt solche gefundenen Texte zum Eingabekontext des Sprachmodells hinzu.
Beispiel: Vor einer Antwort werden passende Abschnitte eines Handbuchs gesucht und mitgegeben.
Ausführlich im Kapitel „Was heutige große Systeme zusätzlich brauchen“.
Rechengraph
Eine Darstellung von Rechnungen als verbundene Schritte: Die Ausgabe eines Schritts wird zur Eingabe des nächsten.
Beispiel: Multiplikation → zweite Multiplikation → Abweichung → Quadrat.
Ausführlich im Kapitel „Lernen durch mehrere Schichten“.
Regularisierung
Verfahren, die eine zu spezielle Anpassung an vorhandene Daten begrenzen. Additive Glättung ergänzt bei Zählungen kleine Beiträge auch für ungesehene Fälle.
Beispiel: Aus Zählwerten [0,1,1] werden nach Addition von 1 die Werte [1,2,2].
Ausführlich im Kapitel „Dein erstes echtes Sprachmodell“.
ReLU
Eine einfache Aktivierungsfunktion: negative Werte werden 0, alle anderen bleiben erhalten.
Beispiel: ReLU(−2) = 0 und ReLU(2) = 2.
Ausführlich im Kapitel „Warum Neuronen eine Aktivierungsfunktion brauchen“.
Residualverbindung
Ein direkter Additionsweg, bei dem die ursprüngliche Eingabe zum Ergebnis einer Operation hinzukommt.
Beispiel: [2,5] + [0,3;−0,2] ergibt [2,3;4,8].
Ausführlich im Kapitel „Der vollständige Transformer-Block“.
RLHF
Verfahren, die Bewertungen oder bevorzugte Antworten für weiteres Training nutzen. RLHF verwendet ein Belohnungssignal; DPO nutzt Antwortvergleiche direkt in einem Trainingsziel.
Beispiel: Zu derselben Frage wird Antwort A gegenüber Antwort B bevorzugt; das beeinflusst das weitere Training.
Ausführlich im Kapitel „Was heutige große Systeme zusätzlich brauchen“.
RMSNorm
RMS ist die Wurzel des mittleren Quadrats. RMSNorm teilt Komponenten durch diesen Wert und lernt eine Skalierung, ohne vorher den Mittelwert abzuziehen.
Beispiel: [3,4] hat RMS √12,5 ≈ 3,536.
Ausführlich im Kapitel „RMSNorm, RoPE und SwiGLU“.
RoPE
RoPE kodiert Positionen durch Drehungen von Komponentenpaaren in Queries und Keys. Sinus und Kosinus berechnen die Koordinaten dieser Drehung.
Beispiel: [1,0] wird durch eine Vierteldrehung zu [0,1]. Die Länge bleibt gleich.
Ausführlich im Kapitel „RMSNorm, RoPE und SwiGLU“.
Sampling
Sampling wählt aus einer Verteilung einen Token. Greedy nimmt immer den größten Wert. Top-k beschränkt auf k Kandidaten; Top-p auf eine Menge mit vorgegebener Gesamtwahrscheinlichkeit.
Beispiel: Bei 70 % Sofa und 30 % Dach kann Zufallssampling beide auswählen. Greedy nimmt Sofa.
Ausführlich im Kapitel „Aus Scores wird ein Text“.
Schicht
Eine Gruppe von Recheneinheiten auf derselben Stufe des Netzes.
Beispiel: Zwei Neuronen lesen dieselben Eingaben. Ihre beiden Ausgaben bilden eine versteckte Schicht.
Ausführlich im Kapitel „Aus Neuronen wird ein kleines Netz“.
Seed
Eine Startzahl für einen Pseudozufallsgenerator. Sie hilft, Zufallsentscheidungen bei gleicher Umgebung zu wiederholen.
Beispiel: Mit gleichem Seed kann dieselbe Aufteilung in Trainings- und Prüfdokumente entstehen.
Ausführlich im Kapitel „Daten sind ein Teil des Modells“.
SFT
Weitertraining auf vorgegebenen Eingaben und gewünschten Ausgaben. Hier werden Fragen als Kontext und Antworten als aktive Ziele verwendet.
Beispiel: Zur Frage „Warum schmilzt Eis?“ wird eine sachlich richtige Beispielantwort trainiert.
Ausführlich im Kapitel „Vom Textmodell zum Antwortmodell“.
Skalar
Eine einzelne Zahl, im Unterschied zu einer Liste oder Tabelle.
Beispiel: Die Lernrate 0,01 ist ein Skalar.
Ausführlich im Kapitel „Vektoren, Matrizen und Tensorformen“.
Skalarprodukt
Zwei gleich lange Listen komponentenweise multiplizieren und die Produkte addieren. Das Ergebnis ist eine einzelne Zahl.
Beispiel: [1,2] und [3,4] ergeben 1×3 + 2×4 = 11.
Ausführlich im Kapitel „Vektoren, Matrizen und Tensorformen“.
Softmax
Eine Funktion, die eine Liste von Zahlen in positive Werte mit Summe 1 umrechnet. Höhere Eingabezahlen erhalten höhere Wahrscheinlichkeiten.
Beispiel: Drei gleiche Logits ergeben jeweils Wahrscheinlichkeit 1/3.
Ausführlich im Kapitel „Sprache als Wahrscheinlichkeitsproblem“.
SwiGLU
SwiGLU mischt zwei gelernte Zahlenpfade durch komponentenweise Multiplikation. Einer wird vorher durch SiLU verändert. SiLU(x) = x × Sigmoid(x), Sigmoid(x) = 1/(1+exp(−x)).
Beispiel: Für einen Gate-Wert 1 und einen zweiten Wert 2 entsteht vor der letzten Projektion ungefähr 0,731 × 2 = 1,462.
Ausführlich im Kapitel „RMSNorm, RoPE und SwiGLU“.
Target
Target heißt Zielwert. Beim nächsten-Token-Training ist das Ziel gegenüber der Eingabe um eine Position nach vorn verschoben: der Target-Shift.
Beispiel: Eingaben a,b,c haben Ziele b,c,d.
Ausführlich im Kapitel „Das Lernziel: Cross-Entropy“.
Temperatur
Eine positive Zahl, durch die wir Logits vor Softmax teilen. Sie verändert, wie stark sich die Auswahl auf hohe Scores konzentriert.
Beispiel: Unter 1 wird die Verteilung meist spitzer, über 1 flacher. Gleiche Logits bleiben gleich wahrscheinlich.
Ausführlich im Kapitel „Aus Scores wird ein Text“.
Tensor
Ein geordnetes Zahlenfeld mit einer oder mehreren Achsen; auch eine einzelne Zahl kann als Tensor gespeichert werden.
Beispiel: [2,3,4] als Form bedeutet 2 Gruppen mit je 3 Listen aus jeweils 4 Zahlen.
Ausführlich im Kapitel „Vektoren, Matrizen und Tensorformen“.
Token
Eine Einheit, in die der Tokenizer Text zerlegt. Sie kann ein Zeichen, ein Wortstück oder ein ganzes Wort sein.
Beispiel: Ein Tokenizer könnte „lernen“ in „lern“ und „en“ teilen. Die tatsächliche Zerlegung hängt vom Tokenizer ab.
Ausführlich im Kapitel „Vom Text zu Token-IDs“.
Tokenizer
Das Verfahren zum Zerlegen von Text und Übersetzen der Teile in festgelegte Nummern.
Beispiel: „Katze“ wird in Einheiten zerlegt; jede Einheit erhält ihre Token-ID.
Ausführlich im Kapitel „Vom Text zu Token-IDs“.
Training
Das wiederholte Berechnen von Vorhersagen und Verändern von Parametern anhand von Beispielen und Fehlern.
Beispiel: Vorwärts rechnen → Fehler messen → Gradienten berechnen → Parameter ändern.
Ausführlich im Kapitel „Was bedeutet: Ein Programm lernt?“.
Transponieren
Zeilen und Spalten einer Matrix vertauschen.
Beispiel: Eine Tabelle mit 2 Zeilen und 3 Spalten bekommt 3 Zeilen und 2 Spalten.
Ausführlich im Kapitel „Vektoren, Matrizen und Tensorformen“.
Validierung
Das Prüfen auf getrennten Daten, die nicht für die unmittelbaren Parameterupdates genutzt werden. Damit wählen wir Einstellungen und Trainingsstände.
Beispiel: Trainingsfehler sinkt, Prüffehler steigt: Das Modell passt sich womöglich zu stark den Trainingsbeispielen an.
Ausführlich im Kapitel „Loss lesen und Fehler finden“.
Value
Die Inhaltsliste einer Position, die Attention nach den errechneten Gewichten in das Ergebnis einmischt.
Beispiel: Ein Value 20 trägt bei Gewicht 0,25 genau 5 zur Summe bei.
Ausführlich im Kapitel „Self-Attention ohne Geheimnisse“.
Varianz
Varianz ist der Mittelwert der quadrierten Abstände zum Mittelwert. Die Standardabweichung ist ihre Quadratwurzel.
Beispiel: [1,3] hat Mittelwert 2, Varianz 1 und Standardabweichung 1.
Ausführlich im Kapitel „Der vollständige Transformer-Block“.
Vektor
Eine geordnete Liste von Zahlen. Die Reihenfolge ihrer Einträge zählt.
Beispiel: [0,2; 0,7] kann eine zweikomponentige Darstellung eines Tokens sein.
Ausführlich im Kapitel „Vektoren, Matrizen und Tensorformen“.
Verteilung
Die Zuordnung einer Wahrscheinlichkeit zu jeder möglichen Alternative. Alle Wahrscheinlichkeiten summieren sich auf 1.
Beispiel: Sofa 0,5, Dach 0,3, Meer 0,2.
Ausführlich im Kapitel „Sprache als Wahrscheinlichkeitsproblem“.
Vokabular
Die Sammlung aller Tokenarten mit ihren IDs. V ist die Anzahl dieser Einträge.
Beispiel: Bei V = 320 kann jede Token-ID eine von 320 festgelegten Einheiten auswählen.
Ausführlich im Kapitel „Vom Text zu Token-IDs“.
Warmup
Die Anfangsphase, in der die Lernrate schrittweise bis zu ihrem vorgesehenen Wert steigt.
Beispiel: Über die ersten 100 Schritte steigt sie von einem kleinen Wert zur maximalen Lernrate.
Ausführlich im Kapitel „Deine erste Trainingsschleife“.
Weight Decay
Eine kleine zusätzliche Verkleinerung von Gewichten beim Training. Sie soll übergroße Gewichte begrenzen.
Beispiel: Neben dem eigentlichen Lernschritt wird ein kleiner Anteil des bisherigen Gewichts abgezogen.
Ausführlich im Kapitel „Deine erste Trainingsschleife“.
Weight Tying
Mehrere Rechenstellen verwenden dieselben Parameter. Beim Weight Tying teilen sich Eingabeembedding und Ausgabekopf eine Gewichtstabelle.
Beispiel: Eine Tabelle mit V × D Zahlen wird für den Eingabezugriff und für die Ausgabeprojektion verwendet. Eine zweite solche Tabelle entfällt.
Ausführlich im Kapitel „Embeddings und geteilte Repräsentationen“.
Überanpassung
Das Modell passt immer besser zu seinen Trainingsbeispielen, ohne bei neuen Beispielen entsprechend besser zu werden.
Beispiel: Es vervollständigt gelernte Sätze gut, macht aber bei neuen Sätzen mehr Fehler.