Zum Hauptinhalt springen

Evaluierungsläufe

Bei Änderungen am Prompt, an Wissensquellen oder am Flow besteht immer das Risiko, dass bisher korrekte Antworten plötzlich falsch oder unvollständig werden. Evaluierungsläufe erkennen solche Regressionen automatisch: Der Agent wird mit allen definierten Evaluierungsfragen getestet und die Antworten werden gegen die Akzeptanzkriterien geprüft.

So sehen Sie auf einen Blick, ob eine Änderung die Antwortqualität verbessert oder verschlechtert hat — ohne jede Frage manuell testen zu müssen.

Evaluierungslauf erstellen

Beim Erstellen eines Evaluierungslaufs wird konfiguriert:

  • Agent-Version: Die zu testende Version. Alle verfügbaren Versionen werden gruppiert nach Agent angezeigt, inkl. Status (Entwurf, Aktiv, Inaktiv).
  • Kategorien: Eine oder mehrere Kategorien von Evaluierungsfragen. Die Gesamtanzahl der Fragen wird angezeigt.
  • Annotation (optional): Eine Notiz zum Evaluierungslauf (z. B. „Test nach Prompt-Änderung" oder „Vergleich mit V3").

Nach dem Erstellen wird eine geschätzte Dauer angezeigt (ca. 10 Sekunden pro Frage).

Evaluierungslauf starten

Nach dem Erstellen muss der Lauf über die Play-Schaltfläche gestartet werden. Ein Bestätigungsdialog weist darauf hin, dass der Lauf Token verbraucht. Laufende Evaluierungen können jederzeit gestoppt werden.

Status

StatusBeschreibung
Wartet auf AuslösungDer Lauf wurde erstellt, aber noch nicht gestartet
LaufendDie Evaluierung wird gerade ausgeführt
AbgeschlossenDie Evaluierung wurde erfolgreich abgeschlossen
Nicht abgeschlossenDie Evaluierung wurde abgebrochen oder ist fehlgeschlagen

Ergebnisse

Nach Abschluss zeigt die Übersicht folgende Metriken:

  • Evaluiert: Anzahl der ausgewerteten Fragen
  • Korrektheit: Prozentsatz der bestandenen Fragen (Bestanden / Gesamt)
    • Aufschlüsselung: Bestanden, Nicht bestanden, Fehler
  • Token: Verbrauchte Token, aufgeteilt in Flow-Token (Verarbeitung) und Evaluierungs-Token (Bewertung)
  • Dauer: Gesamtdauer des Evaluierungslaufs
tipp

Vergleichen Sie die Korrektheit über mehrere Evaluierungsläufe hinweg, um den Einfluss von Änderungen messbar zu machen. Nutzen Sie die Annotation, um Läufe leichter zuordnen zu können.

Einzelergebnisse

Jedes einzelne Ergebnis zeigt:

  • Die gestellte Frage und die generierte Antwort
  • Den Bewertungsstatus: Bestanden, Nicht bestanden oder Fehler
  • Die Bewertung der Akzeptanzkriterien mit Begründung — so sehen Sie nicht nur ob, sondern warum eine Antwort nicht bestanden hat
  • Die ausgeführten Flow Actions — hilfreich, um nachzuvollziehen, welche Datenquellen oder Pfade der Agent gewählt hat
  • Token-Verbrauch aufgeschlüsselt nach Flow- und Evaluierungsmodell

Die Ergebnisse können als Excel-Datei exportiert werden.