Durchsatz-Rechner für Rate Limits
Wie lange dauert es, 10.000 Dokumente durch ein KI-Modell zu schicken? Rate Limits eingeben und sehen, was der Engpass ist und wie lange es dauert.
| Grenze | erlaubt Anfragen pro Minute |
|---|
Ihre tatsächlichen Grenzen stehen in der Konsole Ihres Anbieters; sie steigen meist mit dem bisherigen Umsatz. Die Dauer einer Anfrage wird als eine Sekunde Vorlauf plus Ausgabelänge geteilt durch die Geschwindigkeit geschätzt.
Was die Geschwindigkeit begrenzt
API-Anbieter begrenzen, wie viele Anfragen und Tokens Sie pro Minute schicken dürfen. Dazu kommt, wie viele Anfragen Ihr Programm gleichzeitig offen hält. Die kleinste dieser Grenzen bestimmt das Tempo. Der Rechner zeigt, welche das ist und wie lange ein Stapel Anfragen damit dauert.
Liegt der Engpass bei den Tokens pro Minute, hilft eine höhere Stufe beim Anbieter oder kürzere Prompts. Liegt er bei den gleichzeitigen Anfragen, hilft mehr Parallelität im eigenen Programm. Wenn das Ergebnis nicht sofort gebraucht wird, ist die Batch-Verarbeitung oft die bessere Wahl: Sie umgeht die normalen Grenzen und kostet die Hälfte.
Häufige Fragen
Was sind RPM und TPM?
RPM steht für Anfragen pro Minute (requests per minute), TPM für Tokens pro Minute. Viele Anbieter begrenzen Eingabe- und Ausgabe-Tokens getrennt. Die Werte stehen in der Konsole Ihres Kontos.
Warum hilft mehr Parallelität nicht immer?
Wenn bereits ein Rate Limit des Anbieters greift, bringen mehr gleichzeitige Anfragen nichts, sie werden nur abgewiesen. Der Rechner zeigt, welche Grenze zuerst erreicht wird.
Wann ist die Batch-API besser?
Wenn Ergebnisse nicht sofort gebraucht werden, etwa bei nächtlichen Auswertungen. Sie kostet bei Anthropic, OpenAI, Google und Mistral die Hälfte und läuft unabhängig von den normalen Minutengrenzen.
Wie berechne ich den API-Durchsatz?
Der API-Durchsatz ist die kleinste von vier Grenzen: Anfragen pro Minute (RPM), Eingabe- und Ausgabe-Tokens pro Minute (TPM) und die Zahl gleichzeitiger Anfragen geteilt durch deren Dauer. Der Rechner zeigt alle vier und markiert den Engpass.
Zum Weiterlesen
- RAG einfach erklärt: KI mit eigenen Dokumenten nutzenRAG einfach erklärt: wie Retrieval-Augmented Generation funktioniert, wofür man Embeddings und Vektordatenbanken braucht und was ein RAG-System kostet.
- Structured Outputs: Zuverlässig JSON von KI-ModellenStructured Outputs erklärt: Wie Sie mit JSON-Schema garantiert gültiges JSON von OpenAI, Claude und Gemini bekommen, statt kaputte Antworten nachträglich zu reparieren.
- Prompt Injection: Wie Angriffe auf KI-Systeme funktionierenPrompt Injection erklärt: wie versteckte Anweisungen in E-Mails, Dokumenten und Websites KI-Assistenten und Agenten manipulieren und welche Schutzmaßnahmen wirken.
Das könnte auch helfen
JSON formatierenneu
JSON formatieren, prüfen und minifizieren, mit Fehlerstelle und Tokenzahl.
ÖffnenJSON reparierenneu
Kaputtes JSON aus KI-Antworten reparieren: Codeblöcke, Kommas, Anführungszeichen.
ÖffnenBatch-Datei-Generatorneu
Aus einer Vorlage und einer Liste viele Prompts erzeugen, als JSONL für die Batch-APIs.
ÖffnenAPI-Anfrage-Generatorneu
Fertige cURL-Anfragen für die APIs von OpenAI, Anthropic und Google erzeugen.
ÖffnenPrompt-Injection-Prüferneu
Fremde Texte vor der KI-Verarbeitung auf versteckte Anweisungen und Tricks prüfen.
ÖffnenJSON-Schema-Generator
Aus einem JSON-Beispiel ein JSON Schema für strukturierte Ausgaben von KI-Modellen erzeugen.
Öffnen