Reranking erklärt: Wie ein zweiter Durchgang RAG-Treffer verbessert
Reranking ist ein zweiter Sortierschritt in der Suche: Zuerst liefert eine schnelle Suche viele mögliche Treffer, dann bewertet ein genaueres Modell jeden einzelnen in Bezug auf die Frage und sortiert neu. In RAG-Systemen landet so häufiger die wirklich passende Textstelle im Prompt.
Warum die erste Suche nicht reicht
Bei der Vektorsuche werden Frage und Dokumente getrennt in Embeddings übersetzt und dann verglichen. Das ist schnell, weil die Dokument-Embeddings vorab berechnet sind. Der Nachteil: Das Modell sieht Frage und Text nie gemeinsam. Feine Unterschiede, etwa ob ein Abschnitt die Frage wirklich beantwortet oder nur dasselbe Thema streift, gehen verloren.
Wie ein Reranker arbeitet
Ein Reranker, oft ein sogenannter Cross-Encoder, bekommt Frage und Textabschnitt zusammen als Eingabe und gibt eine Relevanzbewertung aus. Weil er beide gleichzeitig liest, erkennt er Zusammenhänge besser. Dafür ist er langsamer: Für jede Kombination aus Frage und Abschnitt ist eine eigene Berechnung nötig. Deshalb wird er nur auf eine Vorauswahl angewendet.
Der typische Ablauf
- Die Suche (Vektor, Stichwort oder hybride Suche) liefert zum Beispiel die 30 bis 100 besten Kandidaten.
- Der Reranker bewertet jeden Kandidaten zusammen mit der Frage.
- Die Kandidaten werden nach dieser Bewertung sortiert.
- Nur die besten wenigen gehen in den Prompt des Sprachmodells.
So kombiniert man die Breite der schnellen Suche mit der Genauigkeit des Rerankers.
Welche Reranker es gibt
- Gehostete Reranking-Schnittstellen: Einige Anbieter von Embedding- und Suchdiensten bieten Reranking als API an, abgerechnet nach Anfragen oder Tokens.
- Offene Modelle: Es gibt frei verfügbare Cross-Encoder, auch mehrsprachige, die Sie selbst betreiben können. Für deutsche Texte sollten Sie gezielt ein mehrsprachiges Modell wählen.
- Sprachmodell als Reranker: Ein kleines, günstiges LLM bewertet die Relevanz per Prompt. Flexibel, aber meist langsamer und teurer als ein spezialisierter Reranker.
Was Reranking kostet
Reranking kostet zusätzliche Rechenzeit und, bei gehosteten Diensten, Geld pro Anfrage. Es kann aber auch sparen: Wenn die richtigen Abschnitte zuverlässig oben stehen, müssen Sie weniger Abschnitte an das Sprachmodell schicken. Weniger Eingabe-Tokens senken die Kosten pro Antwort. Wie sich die Zahl der mitgesendeten Abschnitte auf die Gesamtkosten auswirkt, zeigt der RAG-Kosten-Rechner.
Auf die Antwortzeit achten
Jeder zusätzliche Schritt verlängert die Wartezeit. Bei Chat-Anwendungen sollte das Reranking schnell genug sein, damit Nutzer nicht merklich länger warten. Hilfreich sind eine begrenzte Zahl an Kandidaten und kurze Abschnitte. Die Gesamtwartezeit schätzt der Antwortzeit-Rechner; Hintergründe stehen unter Latenz von KI-Anwendungen.
Wann sich Reranking lohnt
- wenn die richtige Stelle zwar unter den ersten 20 Treffern ist, aber selten unter den ersten drei
- bei großen Dokumentbeständen mit vielen ähnlichen Texten
- wenn falsche Kontexte zu falschen Antworten führen und Genauigkeit wichtiger ist als Tempo
Messen Sie den Effekt mit einem Testdatensatz aus echten Fragen, wie in LLM-Anwendungen testen beschrieben. Den Gesamtaufbau zeigt RAG-Pipeline bauen.
Erstellt mit Unterstützung von KI, geprüft und redaktionell verantwortet von Leon Blatz. Allgemeine Information, keine Rechts-, Steuer- oder Finanzberatung.