Die Metrik folgt dem Ziel
Wenn dein Ziel einfache Textfortsetzung ist, gehören Validierungs-Loss, grammatische Verständlichkeit und Kohärenz dazu. Wenn dein Ziel Fragebeantwortung ist, müssen sachliche Korrektheit und Aufgabenpassung bewertet werden. Ein Modell kann gutes Deutsch schreiben und die Frage falsch beantworten.
Du kannst mehrere Kriterien berichten, ohne sie in einen angeblich objektiven Intelligenzwert zu pressen. Für den Einstieg reicht eine kleine vorher festgelegte Testbatterie mit manueller Bewertung. Das ist begrenzt, aber überprüfbar.
Baue die Testfragen vor dem letzten Training
Lege mindestens 20 Fragen an, die du nicht zum Training oder zur Hyperparameterauswahl benutzt. Gruppiere sie nach einfachen Fakten, Erklärungen, Textbearbeitung, neuen Formulierungen und fehlender Information. Notiere eine erwartete Antwort oder Bewertungsskizze.
Beispiel: Das Training enthält „Warum schmilzt Eis?“. Eine Testfrage könnte lauten „Was passiert mit einem Eiswürfel, wenn er lange in der warmen Küche liegt?“ Diese Umformulierung prüft mehr als ein wortgleiches Wiederholen, bleibt aber inhaltlich eng verwandt. Für echte Generalisierung brauchst du zusätzlich neue Inhalte oder Aufgabenkompositionen.
Eine einfache Rubrik
Bewerte pro Antwort Verständlichkeit, sachliche Korrektheit und Aufgabenpassung mit 0, 1 oder 2. Notiere den konkreten Fehler. Die Summe ist eine praktische Zusammenfassung dieser Rubrik, keine universelle Maßeinheit.
| Kriterium | 0 | 1 | 2 |
|---|---|---|---|
| Verständlichkeit | Kaum verständlich | Teilweise verständlich | Klarer, zusammenhängender Text |
| Korrektheit | Falsch | Teilweise richtig / wesentliche Lücke | Für die Aufgabe richtig |
| Aufgabenpassung | Geht vorbei | Nur teilweise passend | Beantwortet die konkrete Frage |
Die Browseransicht lässt dich diese Rubrik auf eine Beispielantwort anwenden. Sie verifiziert keine Fakten automatisch. Eine solche Verifikation braucht geeignete Referenzen oder ein klar definiertes lösbares Prüfproblem.
Vermeide Trainingskontamination
Ein Test ist wenig aussagekräftig, wenn seine Fragen oder beinahe identischen Antworten in Trainingsdaten enthalten sind. Prüfe exakte und nahe Übereinstimmungen. Bei frei verfügbaren großen Benchmarks ist Kontamination ein ernstes Thema; für deinen eigenen kleinen Korpus ist die manuelle Rückverfolgung oft noch möglich.
Auch wiederholtes Tuning nach denselben Testfragen macht sie zu einer Entwicklungsmenge. Halte für die abschließende Bewertung einen weiteren Satz zurück, den du nicht laufend anschaust.
Mehrere Samples statt ein Glückstreffer
Wenn du Sampling verwendest, erzeugen Seeds Unterschiede. Bewerte entweder ein festes einheitliches Decodingverfahren oder mehrere Seeds pro Prompt und berichte den Durchschnitt sowie typische Fehler. Du darfst bewusst ein best-of-k-Verfahren testen, musst dann aber k und die Auswahlregel benennen.
Eine Anzeige, die nach zehn misslungenen Versuchen den elften zeigt, ist keine normale Einzelantwortqualität. Sie vermischt Modellfähigkeit und Auswahlaufwand.
Keine automatische Selbstbewertung als Wahrheit
Ein großes Modell kann dir beim Erstellen einer Rubrik oder beim Finden möglicher Fehler helfen. Seine Bewertung ist aber ebenfalls fehleranfällig und kann Stil mit sachlicher Qualität verwechseln. Für die zentralen kleinen Testfragen prüfst du die Referenzantworten selbst.
Für mathematische oder programmatische Aufgaben sind ausführbare Prüfer oft besser als ein bloßes Urteil. Bei einer Funktion kannst du Tests ausführen. Bei einer klaren Rechenaufgabe kannst du die Zahl vergleichen. Bei offenen Erklärungen bleibt mehr Beurteilungsspielraum.
Modellkarte schreiben
Dokumentiere Architektur, Parameterzahl, Tokenizer, Trainingsquellen, verarbeitete Tokenzahl, bekannte Einschränkungen und Messverfahren. Füge Beispiele typischer Fehler hinzu. Das ist keine Werbung für ein Modell, sondern eine Beschreibung seines Einsatzbereichs.
Unser Abschlussmodell kann nach dem kleinen Demolauf vor allem den Ablauf zeigen. Erst wenn größere Daten und getrennte Evaluation einen Nutzen belegen, solltest du darüber hinausgehende Fähigkeiten behaupten. Der Aufwand für das Training allein ist kein Qualitätskriterium.
Ein Exportformat für deine Tests
{"id":"ice-02","prompt":"Was passiert mit Eis in einer warmen Küche?","reference":"Es schmilzt durch Wärmezufuhr.","category":"paraphrase"}Speichere die Antworten mit Checkpointname, Seed, Temperatur und Zeit. Dann kannst du spätere Varianten auf denselben Fragen vergleichen. Ein Modellwechsel ohne gespeicherte alte Ausgaben macht Rückschritte schwer erkennbar.
Was du aus Fehlern lernst
Wiederholt das Modell Muster? Prüfe Sampling und Datendiversität. Ignoriert es die Frage? Prüfe Chatvorlage und SFT-Beispiele. Formuliert es klar, aber falsch? Dann fehlt möglicherweise Wissen oder das Modell überträgt es schlecht. Diese Kategorien führen zu verschiedenen nächsten Experimenten. „Mehr trainieren“ ist nur eine mögliche Reaktion.