LLM Tokens pro Sekunde schätzen: lokales Modell
LLM Tokens pro Sekunde grob berechnen: Aus Speicherbandbreite, aktiven Parametern und Quantisierung ergibt sich, wie schnell ein lokales Modell schreibt.
| Modellgröße | Bytes je Token | Tokens/s | 500 Tokens in |
|---|
Alles läuft in Ihrem Browser. Eingaben verlassen Ihr Gerät nicht.
Warum die Speicherbandbreite entscheidet
Wie viele LLM Tokens pro Sekunde ein lokales LLM schafft, hängt bei der Token-Generierung vor allem von der Speicherbandbreite ab. Für jedes neue Token muss die Hardware alle aktiven Gewichte einmal aus dem Speicher lesen. Die Obergrenze ist deshalb Bandbreite geteilt durch die Bytes je Token: Eine RTX 4090 mit 1.008 GB/s und ein 8B-Modell in Q4_K_M (rund 4,9 GB) ergeben theoretisch etwa 200 Tokens pro Sekunde. In der Praxis erreichen gute Programme 60 bis 80 Prozent davon; das regelt das Feld Effizienz.
Diese Abschätzung der Inferenz-Geschwindigkeit erklärt, warum Apple Silicon mit großem gemeinsamem Speicher bei großen Modellen gut abschneidet: Ein M2 Ultra mit 800 GB/s kann ein 70B-Modell in 4 Bit laden, das auf keine einzelne Spielegrafikkarte passt. Ebenso erklärt sie, warum Mixture-of-Experts-Modelle schnell sind: Gezählt werden nur die aktiven Parameter je Token. Läuft ein Teil der Layer im normalen Arbeitsspeicher, bestimmt dessen viel geringere Bandbreite das Tempo.
Grenzen: Die Rechnung gilt für die Ausgabe einzelner Tokens bei einer Anfrage. Das Einlesen des Prompts (Prefill) ist rechenbegrenzt und meist viel schneller. Mehrere gleichzeitige Anfragen teilen sich das Lesen der Gewichte, der Gesamtdurchsatz steigt dadurch. Die Bandbreiten sind Herstellerangaben; gemessene Werte liegen darunter. Den Speicherbedarf prüfen Sie mit dem LLM-VRAM-Rechner.
Anleitung: LLM Tokens pro Sekunde in 4 Schritten
- Unter „Hardware“ Grafikkarte, Apple-Silicon-Chip oder Arbeitsspeicher wählen oder die Bandbreite in GB/s selbst eintragen.
- Bei „Aktive Parameter (Milliarden)“ die Modellgröße eintragen, bei Mixture-of-Experts nur die aktiven Parameter.
- Die Quantisierung wählen und die „Effizienz“ anpassen, falls eigene Messwerte vorliegen.
- Tokens pro Sekunde und die Dauer für eine Antwort der gewählten Länge ablesen.
Typische Anwendungsfälle
- Hardware vergleichen: Einschätzen, ob ein Mac mit viel Arbeitsspeicher oder eine Grafikkarte schneller antwortet.
- Erwartungen klären: Vor dem Download wissen, ob ein 70B-Modell auf dem eigenen Rechner flüssig lesbar antwortet.
- Mixture-of-Experts einordnen: Verstehen, warum Modelle mit wenigen aktiven Parametern trotz großer Datei schnell sind.
Häufige Fragen
Wie viele Tokens pro Sekunde sind angenehm?
Menschen lesen etwa 4 bis 8 Wörter pro Sekunde, das entspricht grob 6 bis 12 Tokens. Ab etwa 10 Tokens pro Sekunde wirkt eine Antwort flüssig, für Programmierhilfen und Agenten ist mehr deutlich angenehmer.
Warum ist mein Modell viel langsamer als berechnet?
Häufige Ursachen: Ein Teil der Layer liegt im Arbeitsspeicher, weil der Grafikspeicher nicht reicht, der Kontext ist sehr lang, oder die Software nutzt die Hardware nicht voll. Prüfen Sie in Ollama mit ollama ps, ob das Modell vollständig auf der GPU läuft.
Lohnt sich eine zweite Grafikkarte für mehr Geschwindigkeit?
Bei Aufteilung nach Layern rechnen die Karten nacheinander, die Geschwindigkeit steigt kaum, aber größere Modelle passen. Erst Tensor-Parallelität, etwa in vLLM, nutzt die Bandbreite beider Karten gleichzeitig.
Woher stammen die Bandbreiten?
Aus den technischen Daten der Hersteller. Bei Apple hängt die Bandbreite von der Chip-Variante ab, beim Arbeitsspeicher von Takt und Zahl der Kanäle: DDR5-5600 mit zwei Kanälen ergibt 5.600 × 8 Byte × 2 = 89,6 GB/s.
Warum ist die Verarbeitung des Prompts schneller als die Ausgabe?
Beim Einlesen des Prompts werden viele Tokens gleichzeitig berechnet, dabei begrenzt vor allem die Rechenleistung. Bei der Ausgabe entsteht ein Token nach dem anderen, und für jedes müssen alle Gewichte erneut aus dem Speicher gelesen werden.
Hilft eine schnellere CPU bei Modellen im Arbeitsspeicher?
Nur begrenzt. Meist bremst die Speicherbandbreite. Mehr Speicherkanäle und schnellerer Speicher bringen mehr als zusätzliche Kerne.
Zum Weiterlesen
- Was sind Tokens? Einfach erklärtTokens sind die Rechen- und Abrechnungseinheit von Sprachmodellen. Was ein Token ist, wie viele ein deutscher Text hat und warum das Geld kostet.
- Kontextfenster erklärt: Wie viel Text ein Modell auf einmal verarbeitetDas Kontextfenster begrenzt, wie viel ein KI-Modell gleichzeitig lesen und schreiben kann. Was die Zahl bedeutet, wo die Grenzen liegen und wie man damit umgeht.
- Warum deutsche Texte mehr Tokens brauchen als englischeDeutsche Texte brauchen meist 20 bis 50 Prozent mehr Tokens als englische. Woran das liegt, was es kostet und was man dagegen tun kann.
Das könnte auch helfen
Antwortzeit-Rechnerneu
Wie lange dauert eine KI-Antwort? Wartezeit aus Antwortlänge, Geschwindigkeit und Nachdenken.
Öffnenmax_tokens-Rechnerneu
Welches max_tokens für 500 Wörter? Ausgabelimit passend zur gewünschten Antwortlänge setzen.
ÖffnenTemperatur-Simulator
Sehen, wie Temperatur, Top-p und Top-k die Wortwahl eines Sprachmodells verändern.
ÖffnenModell-Finder
Welches KI-Modell passt? Aufgabe, Kontext und Budget angeben, passende Modelle nach Preis erhalten.
ÖffnenToken-Zähler
Tokens eines Textes oder einer Datei (PDF, Word, TXT) zählen, mit Kosten für alle Modelle.
ÖffnenKontextfenster-Rechner
Passt mein Dokument ins Kontextfenster? Seiten oder Wörter eingeben, für alle Modelle prüfen.
Öffnen