Kosten für Embeddings: Was Vektorsuche und RAG wirklich kosten
Kosten für Embeddings sind meist der kleinste Posten in einem RAG-System, werden aber oft falsch eingeschätzt. Die Umwandlung von Text in Vektoren ist sehr günstig. Teurer werden die Speicherung in der Vektordatenbank, das erneute Einlesen nach Änderungen und vor allem die Sprachmodell-Anfragen, die mit den gefundenen Abschnitten gefüttert werden.
Was Embedding-Modelle kosten
Embedding-Modelle werden wie Sprachmodelle je Million Tokens abgerechnet, aber nur für die Eingabe. Eine Ausgabe im üblichen Sinn gibt es nicht, das Ergebnis ist ein Zahlenvektor. Laut den Preisseiten und Vergleichsseiten liegen die Preise bei:
- OpenAI text-embedding-3-small: rund 0,02 Dollar je Million Tokens
- Voyage 3.5: rund 0,06 Dollar
- Mistral Embed: rund 0,10 Dollar
- OpenAI text-embedding-3-large: rund 0,13 Dollar
- Gemini Embedding 2: rund 0,20 Dollar
Zum Vergleich: Eine Million Tokens entsprechen grob mehreren tausend Seiten Text. Selbst eine umfangreiche Wissensdatenbank lässt sich deshalb für wenige Dollar einmal komplett umwandeln. Was Embeddings technisch sind, erklärt Embeddings erklärt.
Die drei Kostenblöcke
- Indexierung: Alle Dokumente werden in Abschnitte (Chunks) zerlegt und einmal in Vektoren umgewandelt. Durch Überlappung zwischen den Abschnitten fallen etwas mehr Tokens an als der Originaltext hat.
- Abfragen: Jede Nutzerfrage wird ebenfalls in einen Vektor umgewandelt. Da Fragen kurz sind, kostet das fast nichts.
- Speicherung: Die Vektordatenbank berechnet Speicher und Rechenleistung, je nach Anbieter pauschal, nach Datenmenge oder nach Abfragen.
Was oft unterschätzt wird
- Neu-Indexierung: Ändern sich Dokumente häufig oder wechseln Sie das Embedding-Modell, muss alles neu umgewandelt werden. Vektoren verschiedener Modelle sind nicht kompatibel.
- Dimensionen: Größere Vektoren (etwa 3.072 statt 1.024 Werte) brauchen mehr Speicher in der Datenbank. Bei Millionen von Abschnitten macht das einen spürbaren Unterschied.
- Die Antwort: Die gefundenen Abschnitte gehen als Eingabe an ein Sprachmodell. Fünf Abschnitte à 500 Tokens bedeuten 2.500 zusätzliche Eingabe-Tokens je Frage. Dieser Posten übersteigt die Embedding-Kosten meist um ein Vielfaches.
Ein Rechenbeispiel
Ein Unternehmen hat 20.000 Seiten Handbücher, grob 10 Millionen Tokens. Die einmalige Umwandlung mit einem kleinen Embedding-Modell kostet wenige Cent bis wenige Dollar. Bei 1.000 Fragen am Tag mit je 2.500 Tokens Kontext für das Sprachmodell fallen dagegen 75 Millionen Eingabe-Tokens im Monat an. Je nach Modell sind das zweistellige bis dreistellige Beträge. Den ganzen Ablauf rechnet der RAG-Kostenrechner durch.
So wählen Sie das Embedding-Modell
Der Preis ist bei Embeddings selten das entscheidende Kriterium. Wichtiger sind:
- Qualität auf Deutsch: Testen Sie mit echten Fragen, ob die richtigen Abschnitte gefunden werden.
- Datenschutz: Auch beim Umwandeln verlassen die Texte Ihr Haus. Für vertrauliche Dokumente braucht es einen passenden Vertrag oder ein lokal betriebenes Modell.
- Langfristige Verfügbarkeit: Wird das Modell abgekündigt, müssen Sie neu indexieren.
Wie gut zwei Texte zueinander passen, lässt sich mit dem Werkzeug Kosinus-Ähnlichkeit berechnen nachvollziehen. Einen Überblick über Datenbanken gibt Vektordatenbanken erklärt.
Kosten senken
Indexieren Sie nur Dokumente, die tatsächlich gebraucht werden, und entfernen Sie Dubletten vorher. Lesen Sie bei Änderungen nur die betroffenen Abschnitte neu ein statt der ganzen Sammlung. Für große Mengen lohnt sich die Batch-Schnittstelle, die viele Anbieter auch für Embeddings anbieten.
Erstellt mit Unterstützung von KI, geprüft und redaktionell verantwortet von Leon Blatz. Allgemeine Information, keine Rechts-, Steuer- oder Finanzberatung.