Rate Limits erklärt: Wie viele Anfragen KI-APIs erlauben

2 Min. LesezeitStand 08.10.2026Mit KI erstellt · redaktionell geprüft

Rate Limits begrenzen, wie viele Anfragen und Tokens eine Anwendung in einem Zeitraum an eine KI-API schicken darf. Wird die Grenze überschritten, lehnt der Anbieter weitere Anfragen mit dem Fehler 429 ab. Für Anwendungen mit vielen Nutzern oder großen Batch-Aufgaben sind Rate Limits oft der eigentliche Engpass, nicht die Kosten.

Die wichtigsten Grenzen

  • RPM (Requests per Minute): Anfragen pro Minute.
  • TPM (Tokens per Minute): Tokens pro Minute. Manche Anbieter trennen hier Eingabe- und Ausgabe-Tokens.
  • RPD oder TPD: Grenzen pro Tag, vor allem bei kostenlosen Stufen.
  • Gleichzeitige Anfragen: Manche Dienste begrenzen, wie viele Anfragen parallel laufen dürfen.

Die Grenzen gelten in der Regel je Modell und je Organisation beziehungsweise Projekt. Ein großes Modell hat oft niedrigere Grenzen als ein kleines.

Stufen: Limits wachsen mit den Ausgaben

OpenAI und Anthropic ordnen Konten in Stufen ein. Neue Konten starten mit niedrigen Grenzen. Mit steigenden Gesamtausgaben und zunehmendem Kontoalter steigt das Konto automatisch in höhere Stufen auf. Bei Google hängen die Grenzen davon ab, ob Sie die kostenlose Stufe oder ein bezahltes Konto nutzen, und ebenfalls von den bisherigen Ausgaben. Die aktuellen Werte für Ihr Konto zeigen die Konsolen der Anbieter.

Wichtig für die Planung: Wer eine Anwendung mit vielen Nutzern starten will, sollte früh prüfen, ob die eigene Stufe reicht. Für höhere Grenzen kann man bei den Anbietern auch direkt anfragen.

Was bei einem 429-Fehler passiert

Die API antwortet mit dem Statuscode 429 und meist mit einem Hinweis, wann wieder Anfragen möglich sind. Die Antworten enthalten oft Kopfzeilen mit den verbleibenden Anfragen und Tokens. Ihre Anwendung sollte damit so umgehen:

  1. Die Anfrage nicht sofort wiederholen, sondern kurz warten.
  2. Die Wartezeit bei jedem weiteren Versuch verlängern (exponentielles Backoff), mit etwas Zufall, damit nicht alle Anfragen gleichzeitig wiederkommen.
  3. Nach einer festen Zahl an Versuchen aufgeben und den Fehler melden.

Sinnvolle Wartezeiten berechnet der Retry-Backoff-Rechner. Andere Fehlercodes erklärt die Übersicht KI-API-Fehlercodes, das Vorgehen beschreibt der Ratgeber API-Fehler behandeln.

Durchsatz planen

Bevor eine große Aufgabe startet, lohnt eine kurze Rechnung: Wie viele Anfragen mit wie vielen Tokens sollen in welcher Zeit durchlaufen? Ein Beispiel: 50.000 Dokumente mit je 2.000 Tokens ergeben 100 Millionen Tokens. Bei einer Grenze von 2 Millionen Tokens pro Minute dauert das mindestens 50 Minuten, in der Praxis länger. Der Durchsatz-Rechner zeigt, wie lange eine Aufgabe bei Ihren Grenzen braucht.

Wege um die Grenzen

  • Batch-Schnittstelle: Batch-Anfragen haben bei den großen Anbietern eigene, meist deutlich höhere Grenzen und kosten die Hälfte. Mehr in Batch-API-Rabatt nutzen.
  • Tokens sparen: Kürzere Prompts und Caching entlasten auch die TPM-Grenze, je nach Anbieter zählen gecachte Tokens nicht oder geringer.
  • Warteschlange: Anfragen gleichmäßig verteilen statt in Spitzen schicken.
  • Ausweichmodell: Bei Überlastung auf ein anderes Modell oder einen anderen Anbieter umschalten.

Prüfen Sie Ihre aktuellen Grenzen vor jedem größeren Start, denn die Anbieter passen Stufen und Werte regelmäßig an.

Erstellt mit Unterstützung von KI, geprüft und redaktionell verantwortet von Leon Blatz. Allgemeine Information, keine Rechts-, Steuer- oder Finanzberatung.

Durchsatz-RechnerWie lange 10.000 Anfragen bei Rate Limits dauern und was der Engpass ist.
Öffnen

Auch hilfreich: JSON formatieren · JSON reparieren

Weiterlesen

Weitere Artikel

  1. Ausgabenlimits für KI-APIs setzen: So schützen Sie sich vor hohen RechnungenAusgabenlimits für KI-APIs setzen: wie Sie bei OpenAI, Anthropic und Google Grenzen und Warnungen einrichten und warum Limits in der Anwendung nötig sind.
  2. Cached-Input-Preise: So zahlen Sie für wiederholte Eingaben nur einen BruchteilCached-Input-Preise im Vergleich: was gecachte Eingabe-Tokens bei Claude, GPT, Gemini und DeepSeek kosten und wie Sie Prompts für hohe Trefferquoten aufbauen.
  3. Batch-API-Rabatt nutzen: Rechnung, Anbieter und GrenzenBatch-API-Rabatt richtig nutzen: was OpenAI, Anthropic, Google und Mistral gewähren, welche Aufgaben passen, wie Sie die Ersparnis rechnen und Fehler vermeiden.