RAG-Kostenrechner

Was kostet eine KI mit eigenen Dokumenten? Der RAG-Kostenrechner berechnet Embedding-Kosten, laufende Abfragen und die Größe der Vektordatenbank.

Dokumente
Abfragen
–

 

Embedding-Preise Stand 07.10.2026: OpenAI und Google laut eigener Preisseite, Voyage und Mistral laut Vergleichsseiten. Ohne Kosten für den Betrieb der Vektordatenbank, die je nach Anbieter von kostenlos bis zu einigen Euro pro Monat reicht.

Wie RAG-Kosten entstehen

Bei RAG (Retrieval-Augmented Generation) beantwortet ein Sprachmodell Fragen mit Ihren eigenen Dokumenten. Dafür werden die Dokumente einmal in Abschnitte (Chunks) zerlegt und mit einem Embedding-Modell in Zahlenreihen umgewandelt, die in einer Vektordatenbank landen. Bei jeder Frage werden die passendsten Abschnitte gesucht und zusammen mit der Frage an das Sprachmodell geschickt.

Die Embedding-Kosten sind fast immer verschwindend gering; den Großteil der RAG-Kosten verursacht das Sprachmodell, weil bei jeder Frage mehrere Abschnitte mitgeschickt werden. Die größten Hebel sind deshalb ein günstiges Sprachmodell und eine sinnvolle Zahl von Abschnitten pro Frage. Hintergründe im Ratgeber RAG einfach erklärt.

Fragen

Häufige Fragen

Was kosten Embeddings?

Sehr wenig: Mit OpenAI text-embedding-3-small kosten 5.000 Seiten weniger als 10 Cent. Die Embedding-Preise liegen zwischen etwa 0,02 und 0,20 Dollar je Million Tokens.

Wie viel Speicher braucht die Vektordatenbank?

Pro Abschnitt eine Zahlenreihe mit 1.024 bis 3.072 Werten zu je 4 Byte, also 4 bis 12 KB. 10.000 Chunks belegen damit 40 bis 120 MB, plus den gespeicherten Text.

Wie viele Chunks sollte man pro Frage mitschicken?

Meist 3 bis 10. Mehr Abschnitte erhöhen die Chance, die richtige Stelle zu treffen, kosten aber bei jeder Frage zusätzliche Tokens und können das Modell ablenken.

Wie kann ich RAG berechnen, bevor ich es baue?

Mit Seitenzahl, Abschnittsgröße und erwarteten Fragen pro Monat: Genau diese Werte fragt der Rechner ab. Planen Sie zusätzlich Zeit für das Testen der Antwortqualität ein.

Ratgeber

Zum Weiterlesen

Alle Artikel
  1. RAG einfach erklärt: KI mit eigenen Dokumenten nutzenRAG einfach erklärt: wie Retrieval-Augmented Generation funktioniert, wofür man Embeddings und Vektordatenbanken braucht und was ein RAG-System kostet.
  2. Embeddings erklärt: Wie KI Bedeutung in Zahlen fasstEmbeddings erklärt: Wie Texte zu Zahlenreihen werden, warum sich so Bedeutung vergleichen lässt und wofür Sie Embeddings in Suche, RAG und Klassifizierung nutzen.
  3. KI-API-Kosten senken: Zehn Stellschrauben, die wirklich etwas bringenKI-API-Kosten senken: Wer Sprachmodelle über die API nutzt, zahlt pro Token. Mit diesen zehn Maßnahmen sinkt die Rechnung oft um die Hälfte, ohne schlechtere Ergebnisse.
Weitere Werkzeuge

Das könnte auch helfen

Alle 65 Werkzeuge