Durchsatz-Rechner für Rate Limits

Wie lange dauert es, 10.000 Dokumente durch ein KI-Modell zu schicken? Rate Limits eingeben und sehen, was der Engpass ist und wie lange es dauert.

–

 

Grenzeerlaubt Anfragen pro Minute

Ihre tatsächlichen Grenzen stehen in der Konsole Ihres Anbieters; sie steigen meist mit dem bisherigen Umsatz. Die Dauer einer Anfrage wird als eine Sekunde Vorlauf plus Ausgabelänge geteilt durch die Geschwindigkeit geschätzt.

Was die Geschwindigkeit begrenzt

API-Anbieter begrenzen, wie viele Anfragen und Tokens Sie pro Minute schicken dürfen. Dazu kommt, wie viele Anfragen Ihr Programm gleichzeitig offen hält. Die kleinste dieser Grenzen bestimmt das Tempo. Der Rechner zeigt, welche das ist und wie lange ein Stapel Anfragen damit dauert.

Liegt der Engpass bei den Tokens pro Minute, hilft eine höhere Stufe beim Anbieter oder kürzere Prompts. Liegt er bei den gleichzeitigen Anfragen, hilft mehr Parallelität im eigenen Programm. Wenn das Ergebnis nicht sofort gebraucht wird, ist die Batch-Verarbeitung oft die bessere Wahl: Sie umgeht die normalen Grenzen und kostet die Hälfte.

Fragen

Häufige Fragen

Was sind RPM und TPM?

RPM steht für Anfragen pro Minute (requests per minute), TPM für Tokens pro Minute. Viele Anbieter begrenzen Eingabe- und Ausgabe-Tokens getrennt. Die Werte stehen in der Konsole Ihres Kontos.

Warum hilft mehr Parallelität nicht immer?

Wenn bereits ein Rate Limit des Anbieters greift, bringen mehr gleichzeitige Anfragen nichts, sie werden nur abgewiesen. Der Rechner zeigt, welche Grenze zuerst erreicht wird.

Wann ist die Batch-API besser?

Wenn Ergebnisse nicht sofort gebraucht werden, etwa bei nächtlichen Auswertungen. Sie kostet bei Anthropic, OpenAI, Google und Mistral die Hälfte und läuft unabhängig von den normalen Minutengrenzen.

Wie berechne ich den API-Durchsatz?

Der API-Durchsatz ist die kleinste von vier Grenzen: Anfragen pro Minute (RPM), Eingabe- und Ausgabe-Tokens pro Minute (TPM) und die Zahl gleichzeitiger Anfragen geteilt durch deren Dauer. Der Rechner zeigt alle vier und markiert den Engpass.

Ratgeber

Zum Weiterlesen

Alle Artikel
  1. RAG einfach erklärt: KI mit eigenen Dokumenten nutzenRAG einfach erklärt: wie Retrieval-Augmented Generation funktioniert, wofür man Embeddings und Vektordatenbanken braucht und was ein RAG-System kostet.
  2. Structured Outputs: Zuverlässig JSON von KI-ModellenStructured Outputs erklärt: Wie Sie mit JSON-Schema garantiert gültiges JSON von OpenAI, Claude und Gemini bekommen, statt kaputte Antworten nachträglich zu reparieren.
  3. Prompt Injection: Wie Angriffe auf KI-Systeme funktionierenPrompt Injection erklärt: wie versteckte Anweisungen in E-Mails, Dokumenten und Websites KI-Assistenten und Agenten manipulieren und welche Schutzmaßnahmen wirken.
Weitere Werkzeuge

Das könnte auch helfen

Alle 65 Werkzeuge