Batch-API-Rabatt nutzen: Rechnung, Anbieter und Grenzen
Der Batch-API-Rabatt halbiert die Kosten für Anfragen, die nicht sofort beantwortet werden müssen. OpenAI, Anthropic, Google und Mistral bieten eine solche Schnittstelle an. Wie die Batch-Verarbeitung Schritt für Schritt abläuft, beschreibt der Ratgeber Batch-Verarbeitung. Hier geht es um die Entscheidung: Wann lohnt sich der Rabatt, wie groß ist er wirklich, und wo liegen die Grenzen?
Das Prinzip
Statt jede Anfrage einzeln zu schicken und sofort eine Antwort zu bekommen, reichen Sie viele Anfragen gesammelt ein. Der Anbieter verarbeitet sie, wenn seine Rechenzentren Kapazität frei haben, und liefert die Ergebnisse innerhalb eines Zeitfensters, meist 24 Stunden. Im Gegenzug sinkt der Preis je Token um 50 Prozent, für Eingabe und Ausgabe.
DeepSeek bietet statt einer Batch-Schnittstelle einen Rabatt außerhalb der Hauptzeit; Details stehen in DeepSeek-API-Kosten.
Welche Aufgaben passen
Die Faustregel: Alles, worauf kein Mensch direkt wartet.
- Produkttexte, Übersetzungen und Zusammenfassungen in großer Zahl
- Klassifizierung von Tickets, Bewertungen oder Umfrageantworten
- Daten aus Dokumenten auslesen
- Embeddings für eine Wissensdatenbank erzeugen
- Testläufe: Hunderte Fragen mit einem neuen Prompt oder Modell auswerten
- nächtliche Berichte und Auswertungen
Nicht geeignet sind Chats, Kundenservice in Echtzeit und Agenten, deren nächster Schritt vom Ergebnis des vorigen abhängt.
Die Ersparnis richtig rechnen
Ein Beispiel: 200.000 Kundenbewertungen sollen klassifiziert werden, je 600 Tokens Eingabe und 50 Tokens Ausgabe. Das sind 120 Millionen Eingabe- und 10 Millionen Ausgabe-Tokens. Mit einem Modell zu 2 Dollar Eingabe und 10 Dollar Ausgabe je Million kostet das regulär rund 340 Dollar, per Batch rund 170 Dollar.
Noch mehr bringt die Kombination mit Caching: Die gleichbleibende Anweisung am Anfang jeder Anfrage kann zusätzlich zum Cache-Preis abgerechnet werden, sofern der Anbieter das im Batch unterstützt. Beides zusammen rechnet der Spar-Rechner. Oft ist aber der Wechsel auf ein kleineres Modell der größere Hebel; klassifizieren können auch kleine Modelle gut.
Grenzen und Stolpersteine
- Wartezeit: Die Frist ist eine Obergrenze. Meist geht es schneller, garantiert ist das nicht.
- Größenlimits: Anzahl der Anfragen und Dateigröße je Batch sind begrenzt. Große Aufgaben werden auf mehrere Batches verteilt.
- Fehler einzeln behandeln: Einzelne Anfragen können fehlschlagen. Ordnen Sie Ergebnisse über eine eindeutige ID zu und wiederholen Sie nur die fehlerhaften.
- Ablaufende Ergebnisse: Ergebnisdateien werden nur eine begrenzte Zeit aufbewahrt.
- Nicht alle Funktionen: Manche Modelle oder Zusatzfunktionen sind im Batch nicht verfügbar. Prüfen Sie das vorher.
So starten Sie
- Prompt mit 20 Beispielen im normalen Modus testen und verbessern.
- Ausgabeformat festlegen, am besten als JSON, damit Ergebnisse automatisch weiterverarbeitet werden können.
- Batch-Datei erstellen, etwa mit dem Batch-Datei-Generator, und mit JSONL prüfen kontrollieren.
- Kleinen Batch mit 100 Anfragen einreichen, Ergebnisse prüfen, dann den Rest.
Batch und Rate Limits
Ein Nebeneffekt der Batch-Verarbeitung: Sie läuft bei den großen Anbietern über eigene Kontingente und belastet die Grenzen für normale Anfragen nicht. Laufende Anwendungen bleiben so auch während großer Auswertungen erreichbar. Mehr dazu in Rate Limits erklärt.
Erstellt mit Unterstützung von KI, geprüft und redaktionell verantwortet von Leon Blatz. Allgemeine Information, keine Rechts-, Steuer- oder Finanzberatung.