RAG-Pipeline bauen: Von den Dokumenten zur belegten Antwort
Eine RAG-Pipeline bauen heißt, ein Sprachmodell mit Ihren eigenen Dokumenten zu verbinden: Vor jeder Antwort sucht das System die passenden Textstellen heraus und gibt sie dem Modell mit. So beantwortet die KI Fragen zu Handbüchern, Verträgen oder Wissensdatenbanken, ohne dass Sie ein Modell trainieren müssen. Das Grundprinzip erklärt RAG einfach erklärt; hier geht es um den Aufbau.
Die zwei Phasen
Eine RAG-Pipeline besteht aus einer Aufbereitungsphase, die einmalig und bei Änderungen läuft, und einer Abfragephase, die bei jeder Frage läuft.
Phase 1: Dokumente aufbereiten
- Laden und bereinigen: Text aus PDFs, Word-Dateien, Webseiten oder Datenbanken holen. Kopf- und Fußzeilen, Seitenzahlen und kaputte Umbrüche entfernen. Der Text-Bereiniger hilft bei Stichproben.
- Zerlegen (Chunking): Lange Texte in Abschnitte teilen, die jeweils ein Thema behandeln. Die Wahl der Größe beeinflusst die Qualität stark; siehe Chunking-Strategien.
- Metadaten anhängen: Quelle, Titel, Datum, Abteilung, Zugriffsrechte. Ohne Metadaten keine Quellenangaben und keine Filter.
- Embeddings berechnen: Jeder Abschnitt wird in einen Zahlenvektor übersetzt, der seine Bedeutung abbildet. Hintergrund: Embeddings erklärt.
- Speichern: Vektoren, Text und Metadaten in einer Vektordatenbank oder einer Datenbank mit Vektorsuche ablegen.
Phase 2: Fragen beantworten
- Die Frage wird ebenfalls in ein Embedding übersetzt.
- Die Suche liefert die ähnlichsten Abschnitte, gefiltert nach Metadaten wie Zugriffsrechten.
- Optional ergänzt eine Stichwortsuche die Treffer (hybride Suche), und ein Reranker sortiert sie neu.
- Die besten Abschnitte kommen mit der Frage in den Prompt.
- Das Modell antwortet und nennt die verwendeten Quellen.
Ein bewährter Prompt
Beantworte die Frage nur anhand der folgenden Auszüge.
Nenne nach jeder Aussage die Quelle in eckigen Klammern.
Wenn die Auszüge die Frage nicht beantworten, sage das deutlich.
<auszuege>
[1] ...
[2] ...
</auszuege>
Frage: ...
Die Nummern in eckigen Klammern verweisen auf die Auszüge, denen Sie in Ihrer Anwendung Titel und Link des Originaldokuments zuordnen. So können Nutzer jede Aussage an der Quelle prüfen. Die klare Erlaubnis, „weiß ich nicht“ zu sagen, senkt erfundene Antworten deutlich. Mehr dazu unter Halluzinationen vermeiden.
Was eine RAG-Pipeline kostet
Kosten entstehen an drei Stellen: einmalig für die Embeddings aller Dokumente, laufend für Speicher und Suche und pro Frage für die Tokens der Antwort. Meist dominieren die Eingabe-Tokens der mitgeschickten Auszüge. Wie viele Abschnitte Sie mitsenden, ist daher eine wichtige Stellschraube. Der RAG-Kosten-Rechner schätzt die Summe für Ihre Dokumentmenge.
Prüfliste vor dem Start
- Werden Zugriffsrechte bei der Suche beachtet, sodass niemand Auszüge aus Dokumenten sieht, die er nicht öffnen dürfte?
- Gibt es einen Testdatensatz mit typischen Fragen und erwarteten Quellen? Siehe LLM-Anwendungen testen.
- Werden geänderte und gelöschte Dokumente auch im Index aktualisiert?
- Lässt sich nachvollziehen, welche Auszüge zu einer Antwort geführt haben?
Ob RAG oder doch ein angepasstes Modell besser passt, klärt Fine-Tuning oder RAG.
Erstellt mit Unterstützung von KI, geprüft und redaktionell verantwortet von Leon Blatz. Allgemeine Information, keine Rechts-, Steuer- oder Finanzberatung.