RAG einfach erklärt: KI mit eigenen Dokumenten nutzen
RAG steht für Retrieval-Augmented Generation und ist der übliche Weg, ein Sprachmodell mit eigenen Dokumenten arbeiten zu lassen: Handbücher, Verträge, Wissensdatenbanken. Statt das Modell neu zu trainieren, sucht man bei jeder Frage die passenden Textstellen heraus und gibt sie mit.
Warum nicht einfach alles in den Prompt?
Bei wenigen Dokumenten geht das, und dank großer Kontextfenster sogar bei ein paar hundert Seiten. Bei tausenden Seiten passt der Bestand aber nicht mehr hinein, und selbst wenn: Jede Frage würde das ganze Archiv kosten. RAG schickt nur die relevanten Abschnitte mit; das ist schneller, günstiger und oft genauer.
Die vier Schritte
- Zerlegen (Chunking): Dokumente werden in Abschnitte von einigen hundert Tokens geteilt, mit etwas Überlappung. Das Werkzeug Text aufteilen zeigt, wie das aussieht.
- Embeddings berechnen: Ein Embedding-Modell wandelt jeden Abschnitt in eine Zahlenreihe um, die seine Bedeutung abbildet. Ähnliche Inhalte bekommen ähnliche Zahlen.
- Speichern: Die Zahlenreihen landen in einer Vektordatenbank, die zu einer Frage sehr schnell die ähnlichsten Abschnitte findet.
- Fragen beantworten: Die Frage wird ebenfalls in Zahlen umgewandelt, die passendsten Abschnitte werden gesucht und zusammen mit der Frage an das Sprachmodell geschickt, das daraus die Antwort formuliert.
Was RAG kostet
Embeddings sind sehr günstig: Tausende Seiten kosten meist nur Cent. Die laufenden Kosten entstehen beim Sprachmodell, weil jede Frage mehrere Abschnitte als Eingabe mitbringt. Bei 20.000 Fragen im Monat mit je sechs Abschnitten à 500 Tokens kommen schnell 60 Millionen Eingabe-Tokens zusammen. Der RAG-Kostenrechner rechnet Ihr Szenario durch, einschließlich Speicherbedarf.
Worauf es für gute Antworten ankommt
- Sinnvolle Abschnitte: lieber an Absätzen und Überschriften teilen als mitten im Satz.
- Die richtige Zahl Treffer: drei bis zehn Abschnitte pro Frage sind üblich.
- Klare Anweisung: „Antworte nur auf Grundlage der Abschnitte; wenn die Antwort dort nicht steht, sag das.“ Das reduziert Halluzinationen deutlich.
- Quellen anzeigen: Wer sieht, aus welchem Dokument eine Antwort stammt, kann sie prüfen.
- Testen: eine Liste echter Fragen mit bekannten Antworten, gegen die jede Änderung geprüft wird.
RAG oder großes Kontextfenster?
Für ein einzelnes Dokument von 50 Seiten braucht niemand RAG: einfach mitgeben, am besten mit Prompt-Caching. RAG lohnt sich ab großen, wachsenden Beständen oder wenn viele Nutzer viele verschiedene Fragen stellen. Wie viel in ein Kontextfenster passt, zeigt der Kontextfenster-Rechner.
Erstellt mit Unterstützung von KI, geprüft und redaktionell verantwortet von Leon Blatz. Allgemeine Information, keine Rechts-, Steuer- oder Finanzberatung.