Warum ein einzelner guter Versuch nicht genügt
Eine überzeugende Antwort kann Zufall sein. Die Evals-Dokumentation von OpenAI beschreibt deshalb systematische Auswertungen anhand vorbereiteter Daten und Bewertungskriterien. Damit lassen sich Änderungen an Modellen oder Anweisungen nachvollziehbarer vergleichen.
Für den Anfang braucht ein kleines Website-Projekt keine riesige Testsammlung. Wichtig sind typische Aufgaben und einige schwierige Fälle, die das gewünschte Verhalten sichtbar machen.
Ein eigener Satz von zehn Aufgaben
Für eine Hilfeassistenz könnte der Testkatalog Fragen zu Installation, Zugang, fehlenden Informationen und einer unbekannten Funktion enthalten. Ergänze einen Fall, in dem die Quelle keine Antwort enthält. Das gewünschte Ergebnis wäre dann eine ehrliche Begrenzung statt einer erfundenen Anleitung.
Bewerte jede Aufgabe nach wenigen festen Kriterien: Ist die Antwort belegt? Ist sie verständlich? Enthält sie einen brauchbaren nächsten Schritt? Gibt sie private Informationen preis?
Änderungen vergleichbar halten
- Den verwendeten Prompt und die Modellversion festhalten.
- Dieselben Aufgaben vor und nach einer Änderung ausführen.
- Fehler nach Ursache gruppieren.
- Neue reale Problemfälle in den Katalog aufnehmen.
Ein Testkatalog ist kein Beweis für Fehlerfreiheit. Er macht aber sichtbar, ob bekannte Anforderungen weiterhin erfüllt sind. Unsere praktische Empfehlung: Beginne mit den Fragen, die Nutzer tatsächlich stellen, und ergänze bewusst mindestens einen Fall, bei dem das System nicht einfach weiterarbeiten darf.
Quellen & Aktualität
Quellen geprüft am 2026-09-27. Herstellerangaben sind als solche eingeordnet. Produktdetails können sich nach diesem Stand ändern.

