Wissen / Retrieval Augmented Generation (RAG)
KI-Modelle kennen nur das, was in ihren Trainingsdaten bis zu einem bestimmten Stichtag enthalten ist. Um ein Modell mit zusätzlichem, firmenspezifischem oder aktuellem Wissen anzureichern, nutzt der AI Hub die Methode der Retrieval-Augmented Generation (RAG).
Dabei werden externe Informationsquellen — z. B. firmeninterne Dokumente, Webseiten oder Daten aus Drittsystemen — in Vektoren umgewandelt und in einer Datenbank gespeichert. Bei einer Benutzeranfrage werden die relevantesten Abschnitte automatisch abgerufen und dem KI-Modell als Kontext übergeben. So kann der Agent auf aktuelles und unternehmensspezifisches Wissen zugreifen, das nicht Teil der ursprünglichen Trainingsdaten ist.
Wissensquellen im Überblick
Der AI Hub bietet drei Möglichkeiten, externes Wissen einzubinden:
Gepflegtes Wissen
Inhalte werden direkt im AI Hub über einen Editor erstellt oder als Dokumente (PDF, Office, etc.) hochgeladen. Ideal für kleinere Themenbereiche oder wenn das Quellsystem keine Schnittstelle besitzt.
- Manuelles Anlegen und Bearbeiten von Inhalten
- Upload von Dokumenten (PDF, DOCX, XLSX, PPTX, u. v. m.)
- CSV-Import und Website-Import
- Konfigurierbare Chunking-Strategie pro Sammlung
Verknüpftes Wissen
Wissen wird automatisch aus externen Systemen synchronisiert und periodisch aktualisiert.
- Webseiten
- Atlassian Jira & Confluence
- GitHub
- Data Push API — für beliebige externe Quellen
Die Synchronisationsfrequenz ist pro Quelle konfigurierbar (täglich, wöchentlich, monatlich oder manuell).
Model Context Protocol (MCP) Verbindungen
Über das MCP-Protokoll können externe Tools und Datenquellen in Echtzeit angebunden werden. Im Gegensatz zu den anderen Wissensquellen werden MCP-Daten nicht vorab als Vektoren gespeichert, sondern bei Bedarf live abgefragt.
Welche Methode wann verwenden?
| Kriterium | Gepflegtes Wissen | Verknüpftes Wissen | MCP-Verbindungen |
|---|---|---|---|
| Datenquelle | Manuelle Pflege, Dokumente | Externe Systeme (Websites, Jira, Confluence, GitHub) | Beliebige Echtzeit-APIs |
| Aktualisierung | Manuell | Automatisch (täglich, wöchentlich, monatlich oder manuell) | Echtzeit |
| Aufwand | Gering | Einmalige Einrichtung | Einrichtung + laufender MCP-Server |
| Geeignet für | Kleine, kuratierte Wissensbasen | Große, sich ändernde Datenbestände | Dynamische Daten, Aktionen |
Verwendung in Agents
Wissensquellen werden im Tab Datenquellen einer Agent-Version aktiviert. Anschließend können sie im Flow über Tool Nodes abgefragt werden.
Verarbeitung und Einbettung
Beim Erstellen oder Aktualisieren von Inhalten werden diese automatisch in Chunks aufgeteilt und als Vektoren in der Datenbank gespeichert. Dieser Vorgang geschieht asynchron im Hintergrund. Pro Wissensquelle kann konfiguriert werden, ob diese als Referenz im Chat angezeigt werden darf.
Die Chunking-Einstellungen (Methode, Größe, Überlappung, Parent-Child-Chunking) beeinflussen direkt die Qualität der Antworten und werden beim Erstellen einer Wissensquelle festgelegt.