Zum Hauptinhalt springen

Evaluierung

Agents liefern nicht immer perfekte Antworten — besonders nach Änderungen am Prompt, an Wissensquellen oder am Flow. Die Evaluierung hilft dabei, die Antwortqualität systematisch zu überwachen, Regressionen frühzeitig zu erkennen und Verbesserungen messbar zu machen.

Evaluierungsfragen

Welche Fragen muss der Agent zuverlässig beantworten können? Hier werden Referenzfragen mit klaren Akzeptanzkriterien definiert — das Fundament für automatisierte Qualitätsprüfungen.

Evaluierungsläufe

Beantwortet der Agent nach einer Änderung noch alles korrekt? Evaluierungsläufe stellen dem Agent automatisiert alle definierten Fragen und prüfen die Antworten gegen die Akzeptanzkriterien. So lassen sich Regressionen nach Prompt- oder Wissensänderungen sofort erkennen.

Die Auswertung realer Konversationen findet in den Chat-Protokollen statt (Workspace-Admins).