Zum Hauptinhalt springen

Evaluierungsfragen

Evaluierungsfragen definieren, welche Fragen ein Agent zuverlässig beantworten können muss. Sie sind die Grundlage für automatisierte Evaluierungsläufe, mit denen die Antwortqualität regelmäßig überprüft werden kann.

Typische Anwendungsfälle:

  • Sicherstellen, dass der Agent häufig gestellte Kundenfragen korrekt beantwortet
  • Prüfen, ob der Agent nach einer Prompt-Änderung noch die gewünschten Antworten liefert
  • Verifizieren, dass neu hinzugefügtes Wissen korrekt abgerufen wird

Kategorien

Evaluierungsfragen werden in Kategorien organisiert (z. B. „Produktfragen", „Richtlinien", „Smalltalk"). Kategorien helfen, Fragen thematisch zu gruppieren und bei Evaluierungsläufen gezielt bestimmte Themenbereiche zu testen.

Für jede Kategorie wird konfiguriert:

  • Titel: Eindeutiger Name der Kategorie

Kategorien können kopiert werden — dabei werden alle zugehörigen Fragen mit kopiert.

Fragen

Für jede Evaluierungsfrage wird konfiguriert:

  • Evaluierungsfrage: Die Frage, die dem Agent gestellt wird (z. B. „Wie sind die Öffnungszeiten am Samstag?").
  • Akzeptanzkriterium (optional): Definiert, was eine korrekte Antwort ausmacht. Dieses Kriterium wird bei einem Evaluierungslauf automatisch geprüft.

Beispiele für gute Akzeptanzkriterien:

  • „Die Antwort muss die Öffnungszeit Samstag 9:00–14:00 enthalten"
  • „Die Antwort darf keine Preise nennen"
  • „Die Antwort muss auf die interne Richtlinie XY verweisen"
tipp

Je präziser das Akzeptanzkriterium formuliert ist, desto aussagekräftiger sind die Ergebnisse. Vage Kriterien wie „gute Antwort" lassen sich nicht automatisiert überprüfen.

Erste Fragen generieren lassen

Einen Fragenkatalog von Null aufzubauen ist mühsam. Lassen Sie einen ersten Satz Fragen von einer KI vorschlagen — als Eingabe genügen die Wissensquellen des Agents oder eine Liste häufiger Anfragen — und prüfen Sie das Ergebnis anschließend Frage für Frage: Streichen Sie, was der Agent nicht beantworten muss, und ergänzen Sie die Akzeptanzkriterien um die konkreten Werte, an denen eine korrekte Antwort erkennbar ist.

CSV-Import

Evaluierungsfragen können per CSV-Datei in eine Kategorie importiert werden.

Empfohlenes Vorgehen:

  1. Laden Sie über Beispiel-Datei herunterladen die Vorlage herunter.
  2. Ersetzen Sie die Beispielzeilen durch Ihre eigenen Fragen und lassen Sie die Kopfzeile unverändert.
  3. Speichern Sie die Datei als CSV mit UTF-8-Kodierung — nur so werden Umlaute und Sonderzeichen korrekt übernommen.
  4. Importieren Sie die Datei über Von CSV-Datei importieren.
  • Trennzeichen: Semikolon (;)
  • Maximale Dateigröße: 15 MB
  • Maximale Einträge: 1.000
  • Erforderliche Spalten: EvaluationQuestion, AcceptanceCriterion
EvaluationQuestion;AcceptanceCriterion
Wie sind die Öffnungszeiten am Samstag?;Die Antwort muss Samstag 9:00–14:00 enthalten
Welche Zahlungsmethoden werden akzeptiert?;Die Antwort muss Kreditkarte und Überweisung nennen
warnung

Die Spaltennamen in der Kopfzeile müssen exakt EvaluationQuestion und AcceptanceCriterion lauten (Groß- und Kleinschreibung ist unerheblich, zusätzliche Leerzeichen sind es nicht). Andere Bezeichnungen — auch deutsche wie „Frage" — werden ignoriert — die betroffenen Zeilen werden verworfen und der Import bricht mit einer Fehlermeldung ab.

CSV-Export

Alle Fragen einer Kategorie können über Als CSV-Datei exportieren heruntergeladen werden. Die exportierte Datei hat dasselbe Format wie der CSV-Import und kann daher unverändert wieder importiert werden — etwa um Evaluierungsfragen in einen anderen Workspace oder Tenant zu übertragen:

  1. Öffnen Sie die Kategorie und exportieren Sie die Fragen über Als CSV-Datei exportieren.
  2. Wechseln Sie in den Ziel-Workspace bzw. Ziel-Tenant.
  3. Importieren Sie die Datei dort in die gewünschte Kategorie über Von CSV-Datei importieren.