RAG-Kostenrechner
Was kostet eine KI mit eigenen Dokumenten? Der RAG-Kostenrechner berechnet Embedding-Kosten, laufende Abfragen und die Größe der Vektordatenbank.
Embedding-Preise Stand 07.10.2026: OpenAI und Google laut eigener Preisseite, Voyage und Mistral laut Vergleichsseiten. Ohne Kosten für den Betrieb der Vektordatenbank, die je nach Anbieter von kostenlos bis zu einigen Euro pro Monat reicht.
Wie RAG-Kosten entstehen
Bei RAG (Retrieval-Augmented Generation) beantwortet ein Sprachmodell Fragen mit Ihren eigenen Dokumenten. Dafür werden die Dokumente einmal in Abschnitte (Chunks) zerlegt und mit einem Embedding-Modell in Zahlenreihen umgewandelt, die in einer Vektordatenbank landen. Bei jeder Frage werden die passendsten Abschnitte gesucht und zusammen mit der Frage an das Sprachmodell geschickt.
Die Embedding-Kosten sind fast immer verschwindend gering; den Großteil der RAG-Kosten verursacht das Sprachmodell, weil bei jeder Frage mehrere Abschnitte mitgeschickt werden. Die größten Hebel sind deshalb ein günstiges Sprachmodell und eine sinnvolle Zahl von Abschnitten pro Frage. Hintergründe im Ratgeber RAG einfach erklärt.
Häufige Fragen
Was kosten Embeddings?
Sehr wenig: Mit OpenAI text-embedding-3-small kosten 5.000 Seiten weniger als 10 Cent. Die Embedding-Preise liegen zwischen etwa 0,02 und 0,20 Dollar je Million Tokens.
Wie viel Speicher braucht die Vektordatenbank?
Pro Abschnitt eine Zahlenreihe mit 1.024 bis 3.072 Werten zu je 4 Byte, also 4 bis 12 KB. 10.000 Chunks belegen damit 40 bis 120 MB, plus den gespeicherten Text.
Wie viele Chunks sollte man pro Frage mitschicken?
Meist 3 bis 10. Mehr Abschnitte erhöhen die Chance, die richtige Stelle zu treffen, kosten aber bei jeder Frage zusätzliche Tokens und können das Modell ablenken.
Wie kann ich RAG berechnen, bevor ich es baue?
Mit Seitenzahl, Abschnittsgröße und erwarteten Fragen pro Monat: Genau diese Werte fragt der Rechner ab. Planen Sie zusätzlich Zeit für das Testen der Antwortqualität ein.
Zum Weiterlesen
- RAG einfach erklärt: KI mit eigenen Dokumenten nutzenRAG einfach erklärt: wie Retrieval-Augmented Generation funktioniert, wofür man Embeddings und Vektordatenbanken braucht und was ein RAG-System kostet.
- Embeddings erklärt: Wie KI Bedeutung in Zahlen fasstEmbeddings erklärt: Wie Texte zu Zahlenreihen werden, warum sich so Bedeutung vergleichen lässt und wofür Sie Embeddings in Suche, RAG und Klassifizierung nutzen.
- KI-API-Kosten senken: Zehn Stellschrauben, die wirklich etwas bringenKI-API-Kosten senken: Wer Sprachmodelle über die API nutzt, zahlt pro Token. Mit diesen zehn Maßnahmen sinkt die Rechnung oft um die Hälfte, ohne schlechtere Ergebnisse.
Das könnte auch helfen
Systemprompt-Kostenrechnerneu
Was kostet Ihr Systemprompt im Jahr? Mit und ohne Prompt-Caching, für alle Modelle.
ÖffnenKI-Preiskalkulationneu
Was muss Ihr KI-Produkt pro Nutzer kosten? KI-Kosten, Marge und Preis für ein SaaS-Angebot.
ÖffnenReasoning-Kostenrechnerneu
Was kostet das Nachdenken von Reasoning-Modellen? Denk-Tokens und Mehrkosten pro Anfrage.
ÖffnenBudget-Rechner
Wie viele Anfragen schaffe ich mit 50 € im Monat? Für alle 36 Modelle.
ÖffnenÜbersetzungskosten-Rechner
Was kostet eine Übersetzung mit KI im Vergleich zum Übersetzungsbüro? Pro Wort und Dokument.
ÖffnenKostenrechner
Monatskosten für alle Modelle aus Tokenmengen und Anfragen, mit Caching, Batch und Teilen-Link.
Öffnen