Evaluierungsläufe
Bei Änderungen am Prompt, an Wissensquellen oder am Flow besteht immer das Risiko, dass bisher korrekte Antworten plötzlich falsch oder unvollständig werden. Evaluierungsläufe erkennen solche Regressionen automatisch: Der Agent wird mit allen definierten Evaluierungsfragen getestet und die Antworten werden gegen die Akzeptanzkriterien geprüft.
So sehen Sie auf einen Blick, ob eine Änderung die Antwortqualität verbessert oder verschlechtert hat — ohne jede Frage manuell testen zu müssen.
Evaluierungslauf erstellen
Beim Erstellen eines Evaluierungslaufs wird konfiguriert:
- Agent-Version: Die zu testende Version. Alle verfügbaren Versionen werden gruppiert nach Agent angezeigt, inkl. Status (Entwurf, Aktiv, Inaktiv).
- Kategorien: Eine oder mehrere Kategorien von Evaluierungsfragen. Die Gesamtanzahl der Fragen wird angezeigt.
- Annotation (optional): Eine Notiz zum Evaluierungslauf (z. B. „Test nach Prompt-Änderung" oder „Vergleich mit V3").
Nach dem Erstellen wird eine geschätzte Dauer angezeigt (ca. 10 Sekunden pro Frage).
Die Annotation lässt sich jederzeit nachträglich ändern — über die Bearbeiten-Schaltfläche in der Liste der Evaluierungsläufe. Agent-Version und Kategorien stehen dort nur zur Information und bleiben unveränderlich, damit die Ergebnisse eines Laufs eindeutig zuordenbar bleiben.
Evaluierungslauf starten
Nach dem Erstellen muss der Lauf über die Play-Schaltfläche gestartet werden. Der Bestätigungsdialog weist darauf hin, dass der Lauf Token verbraucht, und enthält die Annotation — sie kann also direkt vor dem Start noch ergänzt oder korrigiert werden. Laufende Evaluierungen können jederzeit gestoppt werden.
Evaluierungslauf wiederholen
Die Play-Schaltfläche eines abgeschlossenen (oder abgebrochenen) Laufs erstellt einen neuen Evaluierungslauf mit derselben Agent-Version und denselben Kategorien und startet ihn sofort. So lässt sich dieselbe Konfiguration nach einer Änderung erneut prüfen, ohne den bisherigen Lauf und dessen Ergebnisse zu verlieren.
Der Dialog ist mit der Annotation des wiederholten Laufs vorbelegt. Passen Sie sie an (z. B. „Test nach Prompt-Änderung" → „Test nach Prompt-Änderung, 2. Durchlauf"), um die beiden Läufe in der Übersicht auseinanderhalten zu können.
Status
| Status | Beschreibung |
|---|---|
| Wartet auf Auslösung | Der Lauf wurde erstellt, aber noch nicht gestartet |
| Laufend | Die Evaluierung wird gerade ausgeführt |
| Abgeschlossen | Die Evaluierung wurde erfolgreich abgeschlossen |
| Nicht abgeschlossen | Die Evaluierung wurde abgebrochen oder ist fehlgeschlagen |
Ergebnisse
Jede Frage wird binär bewertet — Bestanden oder Nicht bestanden. Teilpunkte gibt es nicht. Enthält ein Akzeptanzkriterium mehrere Anforderungen, gilt die Frage nur dann als bestanden, wenn alle erfüllt sind. Die Korrektheit eines Laufs ist der Anteil der bestandenen Fragen.
Nach Abschluss zeigt die Übersicht folgende Metriken:
- Evaluiert: Anzahl der ausgewerteten Fragen
- Korrektheit: Prozentsatz der bestandenen Fragen (Bestanden / Gesamt)
- Aufschlüsselung: Bestanden, Nicht bestanden, Fehler
- Token: Verbrauchte Token, aufgeteilt in Flow-Token (Verarbeitung) und Evaluierungs-Token (Bewertung)
- Dauer: Gesamtdauer des Evaluierungslaufs
Ein Ergebnis mit dem Status Fehler — etwa wenn der Agent keine Antwort liefern konnte — zählt als nicht bestanden und senkt die Korrektheit entsprechend.
Vergleichen Sie die Korrektheit über mehrere Evaluierungsläufe hinweg, um den Einfluss von Änderungen messbar zu machen. Nutzen Sie die Annotation, um Läufe leichter zuordnen zu können.
Als Orientierung hat sich eine Korrektheit von mindestens 70 % bewährt, bevor eine Version aktiviert wird. Der Wert ist ein Richtwert, kein Grenzwert: Aussagekräftiger als die absolute Zahl ist der Vergleich mit dem Lauf der bisher aktiven Version — sinkt die Korrektheit gegenüber dieser, ist das auch oberhalb von 70 % ein Grund, die Änderung noch einmal zu prüfen.
Einzelergebnisse
Jedes einzelne Ergebnis zeigt:
- Die gestellte Frage und die generierte Antwort
- Den Bewertungsstatus: Bestanden, Nicht bestanden oder Fehler
- Die Bewertung der Akzeptanzkriterien mit Begründung — so sehen Sie nicht nur ob, sondern warum eine Antwort nicht bestanden hat
- Die ausgeführten Flow Actions — hilfreich, um nachzuvollziehen, welche Datenquellen oder Pfade der Agent gewählt hat
- Token-Verbrauch aufgeschlüsselt nach Flow- und Evaluierungsmodell
Die Ergebnisse können als Excel-Datei exportiert werden.