LLM VRAM Rechner: GPU-Speicher für lokale Modelle

Der LLM VRAM Rechner schätzt den Grafikspeicher für ein lokales LLM: Gewichte je nach Quantisierung, KV-Cache für die Kontextlänge und Overhead.

–

 

Aufteilung
PostenGBGiBAnteil

Alles läuft in Ihrem Browser. Eingaben verlassen Ihr Gerät nicht.

Wie sich der Grafikspeicher zusammensetzt

Der LLM VRAM Rechner schätzt, wie viel GPU-Speicher ein lokales LLM braucht. Drei Posten zählen: Die Gewichte belegen Parameter mal Bits pro Gewicht geteilt durch acht Byte. Ein 8B-Modell braucht in FP16 also rund 16 GB, in 4-Bit-Quantisierung nur gut 5 GB. Dazu kommt der KV-Cache, der für jedes Token im Kontext Schlüssel und Werte aller Layer speichert: 2 × Layer × KV-Köpfe × Kopfdimension × Bytes je Wert. Der dritte Posten ist der Overhead für Laufzeitumgebung, CUDA-Kontext, Aktivierungen und Puffer.

So können Sie VRAM berechnen, bevor Sie ein Modell in Ollama, LM Studio, llama.cpp oder vLLM starten. Die Beispielarchitekturen enthalten die Werte aus den Konfigurationsdateien der Modelle; für andere Modelle tragen Sie Layer (num_hidden_layers), KV-Köpfe (num_key_value_heads) und Kopfdimension selbst ein. Bei Mixture-of-Experts-Modellen wie Mixtral müssen alle Experten im Speicher liegen, auch wenn pro Token nur ein Teil rechnet. Wie schnell das Modell danach antwortet, schätzt der Rechner Tokens pro Sekunde.

Grenzen: Das Ergebnis ist eine Schätzung. vLLM reserviert standardmäßig einen festen Anteil des Grafikspeichers für den KV-Cache, llama.cpp legt Puffer je nach Batch-Größe an, und Modelle mit Sliding Window Attention brauchen weniger Cache. Planen Sie etwa 1 bis 2 GB Reserve ein, besonders wenn der Bildschirm an derselben Grafikkarte hängt.

Anleitung: LLM VRAM Rechner in 5 Schritten

  1. Unter „Modell“ eine Beispielarchitektur wählen oder Parameter, Layer, KV-Köpfe und Kopfdimension selbst eintragen.
  2. Bei „Gewichte“ die Genauigkeit wählen, etwa FP16, 8 Bit oder GGUF Q4_K_M.
  3. „Kontextlänge“, „Gleichzeitige Anfragen“ und die Genauigkeit des KV-Cache festlegen.
  4. Im Feld „Overhead“ den Zuschlag für Laufzeit und Aktivierungen anpassen und unter „Vorhandener Grafikspeicher“ die eigene GPU wählen.
  5. Gesamtbedarf und Aufteilung ablesen und mit „Ergebnis kopieren“ übernehmen.

Typische Anwendungsfälle

  • Grafikkarte kaufen: Vor dem Kauf prüfen, ob 16 oder 24 GB für ein 14B- oder 32B-Modell in 4 Bit reichen.
  • Ollama oder llama.cpp einrichten: Abschätzen, wie lang der Kontext sein darf, bevor das Modell in den Arbeitsspeicher ausweicht.
  • Server planen: Für vLLM mit mehreren gleichzeitigen Nutzern den zusätzlichen Speicher für den KV-Cache einplanen.
  • Quantisierung wählen: Vergleichen, ob 8 Bit noch passt oder 4 Bit nötig ist.
Fragen

Häufige Fragen

Wie viel VRAM braucht ein 7B- oder 8B-Modell?

In FP16 etwa 15 bis 17 GB nur für die Gewichte. Mit 4-Bit-Quantisierung (Q4_K_M) sind es rund 5 GB, mit KV-Cache für 8.000 Tokens und Overhead etwa 6 bis 7 GB. Damit läuft es auf vielen Grafikkarten mit 8 GB.

Wie viel VRAM braucht ein 70B-Modell?

In FP16 rund 140 GB, also mehrere Rechenzentrums-GPUs. In 4 Bit sind es etwa 40 bis 43 GB, was auf zwei Karten mit 24 GB oder einem Mac mit viel gemeinsamem Speicher läuft.

Warum braucht ein langer Kontext so viel zusätzlichen Speicher?

Der KV-Cache wächst linear mit der Kontextlänge und der Zahl gleichzeitiger Anfragen. Bei Llama 3.1 8B belegt jedes Token in FP16 128 KiB, bei 128.000 Tokens sind das rund 16 GiB.

Was bringt ein quantisierter KV-Cache?

FP8 halbiert den Cache gegenüber FP16, q4_0 in llama.cpp viertelt ihn ungefähr. Die Qualität leidet bei FP8 meist kaum, bei 4 Bit kann sie bei langen Kontexten spürbar sinken.

Kann ich ein Modell teilweise auf die CPU auslagern?

Ja. llama.cpp und darauf aufbauende Programme können einen Teil der Layer im Arbeitsspeicher rechnen (--n-gpu-layers). Das funktioniert, ist aber deutlich langsamer, weil der Arbeitsspeicher eine viel geringere Bandbreite hat.

Zählt der Speicher mehrerer Grafikkarten zusammen?

Weitgehend ja, wenn die Software das Modell auf mehrere GPUs verteilt (Tensor- oder Pipeline-Parallelität). Jede Karte braucht aber einen eigenen Grundbedarf für die Laufzeitumgebung.

Ratgeber

Zum Weiterlesen

Alle Artikel
  1. Was sind Tokens? Einfach erklärtTokens sind die Rechen- und Abrechnungseinheit von Sprachmodellen. Was ein Token ist, wie viele ein deutscher Text hat und warum das Geld kostet.
  2. Kontextfenster erklärt: Wie viel Text ein Modell auf einmal verarbeitetDas Kontextfenster begrenzt, wie viel ein KI-Modell gleichzeitig lesen und schreiben kann. Was die Zahl bedeutet, wo die Grenzen liegen und wie man damit umgeht.
  3. Warum deutsche Texte mehr Tokens brauchen als englischeDeutsche Texte brauchen meist 20 bis 50 Prozent mehr Tokens als englische. Woran das liegt, was es kostet und was man dagegen tun kann.
Weitere Werkzeuge

Das könnte auch helfen

Alle 558 Werkzeuge