Vektordatenbank Speicherbedarf berechnen
Vektordatenbank Speicherbedarf berechnen: Anzahl der Embeddings mal Dimensionen und Bytes je Wert, dazu HNSW-Index, Metadaten und Replikate.
| Posten | je Vektor | gesamt | Anteil |
|---|
Alles läuft in Ihrem Browser. Eingaben verlassen Ihr Gerät nicht.
Wovon der Speicher abhängt
Den Vektordatenbank Speicherbedarf berechnet man im Kern mit Anzahl × Dimensionen × Bytes je Wert. Eine Million Embeddings mit 1.536 Embedding-Dimensionen in float32 belegen 1.000.000 × 1.536 × 4 Byte, also gut 6 GB. Dazu kommen Index-Overhead, IDs, Metadaten wie Quelltext oder Dateiname und gegebenenfalls Replikate für Ausfallsicherheit. Das Werkzeug rechnet alle Posten einzeln aus und zeigt, welcher Teil den Speicher dominiert.
HNSW (Hierarchical Navigable Small World) ist der verbreitetste Index in Qdrant, Weaviate, Milvus, pgvector und vielen anderen. Er speichert für jeden Vektor Verbindungen zu Nachbarn: in der untersten Ebene bis zu 2 × M, in höheren Ebenen bis zu M, jeweils als 4-Byte-Verweis. Bei M = 16 sind das gut 130 Byte je Vektor, bei kleinen Vektoren ein spürbarer Anteil. Die Berechnung folgt dem Speichermodell der Bibliothek hnswlib. IVF teilt die Vektoren in Listen um Zentren auf und braucht kaum Zusatzspeicher, ist aber bei gleicher Trefferquote meist langsamer.
Sparen lässt sich vor allem beim Format: float16 halbiert den Bedarf, int8 viertelt ihn, binäre Quantisierung braucht nur ein Zweiunddreißigstel. Product Quantization zerlegt jeden Vektor in Teilstücke und speichert je Stück nur die Nummer eines Codebuch-Eintrags, oft 32 bis 128 Byte je Vektor. Weil die Suchqualität dabei sinkt, behalten viele Systeme die float32-Originale auf der SSD und bewerten die besten Treffer damit neu (Rescoring). Was die Erzeugung der Embeddings kostet, berechnet der RAG-Kostenrechner.
Anleitung: Vektordatenbank Speicherbedarf in 5 Schritten
- Bei „Anzahl Vektoren“ die Zahl der Chunks oder Dokumente eintragen.
- Bei „Dimensionen“ den Wert des Embedding-Modells wählen, etwa 768, 1536 oder 3072.
- Unter „Speicherformat“ float32, float16, int8, binär oder Product Quantization wählen.
- Index (HNSW mit Parameter M oder flach), Metadaten je Vektor und Replikate festlegen.
- Speicherbedarf gesamt, Arbeitsspeicher für den Index und die Aufteilung ablesen.
Typische Anwendungsfälle
- RAG-Projekt planen: Vorab abschätzen, ob eine Million Chunks in den Arbeitsspeicher eines Servers passen.
- Kosten senken: Vergleichen, wie viel int8- oder binäre Quantisierung gegenüber float32 spart.
- Tarif wählen: Den Speicherbedarf mit den Grenzen gehosteter Vektordatenbanken abgleichen.
Häufige Fragen
Wie viel Speicher brauchen eine Million Embeddings?
Mit 768 Dimensionen in float32 rund 3 GB, mit 1.536 Dimensionen rund 6 GB und mit 3.072 Dimensionen rund 12 GB, jeweils ohne Index und Metadaten.
Was bedeutet der HNSW-Parameter M?
M legt fest, mit wie vielen Nachbarn jeder Vektor im Graphen verbunden ist. Größere Werte verbessern die Trefferquote, brauchen aber mehr Speicher und längere Indexierung. Üblich sind 12 bis 48.
Lohnt sich int8 oder binäre Quantisierung?
Für große Bestände oft ja. int8 verliert meist wenig Qualität. Binäre Quantisierung funktioniert vor allem bei hochdimensionalen Modellen und in Kombination mit Rescoring gut.
Zählt das Werkzeug den Speicher des Quelltexts mit?
Nur über das Feld Metadaten je Vektor. Tragen Sie dort die durchschnittliche Größe von Text und Feldern ein, die die Datenbank zusammen mit dem Vektor speichert.
Muss der ganze Index in den Arbeitsspeicher?
Bei HNSW meist ja, damit Suchen schnell sind. Manche Datenbanken halten Vektoren auf SSD und nur Graph oder komprimierte Vektoren im Arbeitsspeicher, etwa mit DiskANN-ähnlichen Verfahren.
Kann ich Dimensionen einfach abschneiden?
Nur bei Modellen, die dafür trainiert wurden (Matryoshka-Embeddings). Dort lassen sich die ersten Dimensionen verwenden, bei anderen Modellen sinkt die Suchqualität stark.
Zum Weiterlesen
- Was sind Tokens? Einfach erklärtTokens sind die Rechen- und Abrechnungseinheit von Sprachmodellen. Was ein Token ist, wie viele ein deutscher Text hat und warum das Geld kostet.
- Kontextfenster erklärt: Wie viel Text ein Modell auf einmal verarbeitetDas Kontextfenster begrenzt, wie viel ein KI-Modell gleichzeitig lesen und schreiben kann. Was die Zahl bedeutet, wo die Grenzen liegen und wie man damit umgeht.
- Warum deutsche Texte mehr Tokens brauchen als englischeDeutsche Texte brauchen meist 20 bis 50 Prozent mehr Tokens als englische. Woran das liegt, was es kostet und was man dagegen tun kann.
Das könnte auch helfen
Antwortzeit-Rechnerneu
Wie lange dauert eine KI-Antwort? Wartezeit aus Antwortlänge, Geschwindigkeit und Nachdenken.
Öffnenmax_tokens-Rechnerneu
Welches max_tokens für 500 Wörter? Ausgabelimit passend zur gewünschten Antwortlänge setzen.
ÖffnenTemperatur-Simulator
Sehen, wie Temperatur, Top-p und Top-k die Wortwahl eines Sprachmodells verändern.
ÖffnenModell-Finder
Welches KI-Modell passt? Aufgabe, Kontext und Budget angeben, passende Modelle nach Preis erhalten.
ÖffnenToken-Zähler
Tokens eines Textes oder einer Datei (PDF, Word, TXT) zählen, mit Kosten für alle Modelle.
ÖffnenKontextfenster-Rechner
Passt mein Dokument ins Kontextfenster? Seiten oder Wörter eingeben, für alle Modelle prüfen.
Öffnen