Evaluierungsläufe
Bei Änderungen am Prompt, an Wissensquellen oder am Flow besteht immer das Risiko, dass bisher korrekte Antworten plötzlich falsch oder unvollständig werden. Evaluierungsläufe erkennen solche Regressionen automatisch: Der Agent wird mit allen definierten Evaluierungsfragen getestet und die Antworten werden gegen die Akzeptanzkriterien geprüft.
So sehen Sie auf einen Blick, ob eine Änderung die Antwortqualität verbessert oder verschlechtert hat — ohne jede Frage manuell testen zu müssen.
Evaluierungslauf erstellen
Beim Erstellen eines Evaluierungslaufs wird konfiguriert:
- Agent-Version: Die zu testende Version. Alle verfügbaren Versionen werden gruppiert nach Agent angezeigt, inkl. Status (Entwurf, Aktiv, Inaktiv).
- Kategorien: Eine oder mehrere Kategorien von Evaluierungsfragen. Die Gesamtanzahl der Fragen wird angezeigt.
- Annotation (optional): Eine Notiz zum Evaluierungslauf (z. B. „Test nach Prompt-Änderung" oder „Vergleich mit V3").
Nach dem Erstellen wird eine geschätzte Dauer angezeigt (ca. 10 Sekunden pro Frage).
Evaluierungslauf starten
Nach dem Erstellen muss der Lauf über die Play-Schaltfläche gestartet werden. Ein Bestätigungsdialog weist darauf hin, dass der Lauf Token verbraucht. Laufende Evaluierungen können jederzeit gestoppt werden.
Status
| Status | Beschreibung |
|---|---|
| Wartet auf Auslösung | Der Lauf wurde erstellt, aber noch nicht gestartet |
| Laufend | Die Evaluierung wird gerade ausgeführt |
| Abgeschlossen | Die Evaluierung wurde erfolgreich abgeschlossen |
| Nicht abgeschlossen | Die Evaluierung wurde abgebrochen oder ist fehlgeschlagen |
Ergebnisse
Nach Abschluss zeigt die Übersicht folgende Metriken:
- Evaluiert: Anzahl der ausgewerteten Fragen
- Korrektheit: Prozentsatz der bestandenen Fragen (Bestanden / Gesamt)
- Aufschlüsselung: Bestanden, Nicht bestanden, Fehler
- Token: Verbrauchte Token, aufgeteilt in Flow-Token (Verarbeitung) und Evaluierungs-Token (Bewertung)
- Dauer: Gesamtdauer des Evaluierungslaufs
Vergleichen Sie die Korrektheit über mehrere Evaluierungsläufe hinweg, um den Einfluss von Änderungen messbar zu machen. Nutzen Sie die Annotation, um Läufe leichter zuordnen zu können.
Einzelergebnisse
Jedes einzelne Ergebnis zeigt:
- Die gestellte Frage und die generierte Antwort
- Den Bewertungsstatus: Bestanden, Nicht bestanden oder Fehler
- Die Bewertung der Akzeptanzkriterien mit Begründung — so sehen Sie nicht nur ob, sondern warum eine Antwort nicht bestanden hat
- Die ausgeführten Flow Actions — hilfreich, um nachzuvollziehen, welche Datenquellen oder Pfade der Agent gewählt hat
- Token-Verbrauch aufgeschlüsselt nach Flow- und Evaluierungsmodell
Die Ergebnisse können als Excel-Datei exportiert werden.