Rate-Limit-Header lesen

Rate-Limit-Header lesen und verstehen: x-ratelimit- und anthropic-ratelimit-Header zerlegen, verbleibende Anfragen und Tokens sehen und retry-after richtig deuten.

–

 

Erkannte Header
HeaderWertBedeutungAuswertung

Alles läuft in Ihrem Browser. Eingaben verlassen Ihr Gerät nicht.

Limits der API richtig deuten

Mit diesem Werkzeug können Sie Rate-Limit-Header lesen, die KI-APIs bei jeder Antwort mitschicken. OpenAI meldet mit x-ratelimit-limit-requests, x-ratelimit-remaining-requests und x-ratelimit-reset-requests das Anfragelimit, mit den entsprechenden -tokens-Headern das Tokenlimit. Die Reset-Werte sind Dauern wie 1s oder 6m0s. Anthropic nutzt Header nach dem Muster anthropic-ratelimit-requests-limit, getrennt für Anfragen, Tokens, Eingabe- und Ausgabe-Tokens, und gibt den Reset als Zeitpunkt im Format RFC 3339 an. Daneben erkennt das Werkzeug die allgemeinen Header RateLimit-Limit, RateLimit-Remaining und RateLimit-Reset sowie x-ratelimit-Varianten mit Unix-Zeitstempel, wie sie viele andere APIs verwenden.

Für jeden Header zeigt die Tabelle die Bedeutung, den Anteil der verbleibenden Anfragen und den Zeitpunkt, zu dem das Limit zurückgesetzt wird, in Ihrer Ortszeit. Besonders wichtig ist retry-after: Nach RFC 9110 steht dort entweder eine Zahl von Sekunden oder ein HTTP-Datum. Kommt eine Antwort mit Status 429, sollte Ihr Programm mindestens so lange warten. Das Werkzeug fasst oben zusammen, welches Limit knapp ist und wann wieder Kapazität frei wird.

Die Header beschreiben den Stand zum Zeitpunkt der Antwort. Bei parallelen Anfragen sinken die Werte schneller, als ein einzelner Client sieht. Planen Sie die Last deshalb mit dem Durchsatz-Rechner und nutzen Sie für Wiederholungen ein Backoff mit Zufallsanteil, das der Retry-Backoff-Rechner zeigt. Die Bedeutung der Fehlercodes erklärt die Seite KI-API-Fehlercodes.

Anleitung: Rate-Limit-Header in 4 Schritten

  1. Die Antwort-Header einer API-Antwort in das Feld „Antwort-Header“ einfügen, je Zeile ein Header.
  2. Optional den „Antwortzeitpunkt“ anpassen; ohne Angabe gilt der Date-Header oder die aktuelle Zeit.
  3. Die Tabelle lesen: Sie zeigt je Header Bedeutung, Wert und berechnete Zeitpunkte.
  4. Die Empfehlung oben übernehmen, wie lange Ihr Programm vor dem nächsten Versuch warten sollte.

Typische Anwendungsfälle

  • Einen Fehler 429 untersuchen und herausfinden, ob das Anfrage- oder das Token-Limit erreicht ist.
  • Die Drosselung in einem eigenen Client richtig einstellen, statt fest zu warten.
  • Prüfen, ob die vom Anbieter gemeldeten Limits zur gebuchten Stufe passen.
  • Bei Anthropic zwischen Eingabe- und Ausgabe-Token-Limit unterscheiden.
Fragen

Häufige Fragen

Welches Limit greift zuerst?

Das, dessen remaining-Wert zuerst 0 erreicht. Bei kurzen Anfragen ist es meist das Anfragelimit, bei langen Prompts das Tokenlimit. Die Zusammenfassung nennt das knappste Limit.

Warum sind Tokens und Anfragen getrennt begrenzt?

Anbieter begrenzen sowohl die Zahl der Aufrufe pro Minute als auch die verarbeitete Textmenge. Ein Aufruf mit 100.000 Tokens belastet die Server viel stärker als einer mit 100 Tokens.

Muss ich retry-after beachten?

Ja. Wer früher erneut anfragt, bekommt meist wieder einen Fehler 429 und verlängert die Sperre unter Umständen. Die offiziellen SDKs berücksichtigen den Header bei ihren automatischen Wiederholungen.

Welche Header-Formate kann ich einfügen?

Zeilen im Format Name: Wert, etwa aus curl -i, aus den Entwicklertools des Browsers oder aus einem Log. Groß- und Kleinschreibung der Namen spielt keine Rolle.

Wie sehe ich die Header überhaupt?

Mit curl -i oder curl -D - werden Antwort-Header mit ausgegeben. In den Entwicklertools des Browsers stehen sie im Reiter Netzwerk. Die offiziellen SDKs bieten Zugriff auf die rohe Antwort mit Headern.

Was bedeutet ein Reset-Wert wie 6m0s?

OpenAI gibt die Zeit bis zum Zurücksetzen als Dauer an: 6m0s heißt sechs Minuten, 20ms zwanzig Millisekunden. Anthropic nennt dagegen einen festen Zeitpunkt im Format RFC 3339.

Ratgeber

Zum Weiterlesen

Alle Artikel
  1. RAG einfach erklärt: KI mit eigenen Dokumenten nutzenRAG einfach erklärt: wie Retrieval-Augmented Generation funktioniert, wofür man Embeddings und Vektordatenbanken braucht und was ein RAG-System kostet.
  2. Structured Outputs: Zuverlässig JSON von KI-ModellenStructured Outputs erklärt: Wie Sie mit JSON-Schema garantiert gültiges JSON von OpenAI, Claude und Gemini bekommen, statt kaputte Antworten nachträglich zu reparieren.
  3. Prompt Injection: Wie Angriffe auf KI-Systeme funktionierenPrompt Injection erklärt: wie versteckte Anweisungen in E-Mails, Dokumenten und Websites KI-Assistenten und Agenten manipulieren und welche Schutzmaßnahmen wirken.
Weitere Werkzeuge

Das könnte auch helfen

Alle 558 Werkzeuge