Eval-Kosten berechnen: LLM-Evaluierung
Eval-Kosten für LLM-Tests berechnen: Testfälle, Läufe und Modelle ergeben die Kosten je Durchlauf, inklusive Bewertung durch ein Modell und Batch-Rabatt.
| Modell | Antworten | Bewertung | Gesamt |
|---|
Alles läuft in Ihrem Browser. Eingaben verlassen Ihr Gerät nicht.
Was eine Evaluierung kostet
Eval-Kosten entstehen, wenn Sie Sprachmodelle systematisch mit Testfällen prüfen. Eine LLM-Evaluierung besteht aus einer Sammlung von Eingaben, zu denen das Modell antwortet, und einer Bewertung dieser Antworten. Die Kosten ergeben sich aus Testfälle mal Läufe mal Modelle mal Tokens. Der Rechner zeigt sie je Modell und für einen kompletten Durchlauf.
Für die Bewertung nutzen viele Teams LLM-as-a-Judge: Ein meist starkes Modell erhält die Aufgabe, die Antwort und ein Bewertungsraster und vergibt eine Note. Die Bewertung liest dabei Testfall und Antwort und ist deshalb oft teurer als die Antwort selbst. Weil Evals nicht sofort fertig sein müssen, eignen sie sich gut für die Batch-Schnittstellen der Anbieter mit Batch-Rabatt von 50 %. Für einen Modellvergleich mit drei Kandidaten verdreifachen sich die Antwortkosten; das Bewertungsmodell bleibt gleich.
Grenzen: Der Rechner nimmt durchschnittliche Tokens je Fall an. Bei Reasoning-Modellen kommen interne Denk-Tokens hinzu, die als Ausgabe berechnet werden; erhöhen Sie dafür die Ausgabe-Tokens. Menschliche Bewertung, die für wichtige Entscheidungen weiterhin dazugehört, ist nicht enthalten. Ein Raster für die Bewertung erstellt das Bewertungsraster für KI-Antworten.
Anleitung: Eval-Kosten in 4 Schritten
- Zahl der „Testfälle“ und „Läufe je Testfall“ eintragen.
- Tokens je Testfall für Eingabe und Ausgabe festlegen und die zu testenden Modelle anhaken.
- Optional „Bewertung durch ein Modell (LLM-as-a-Judge)“ aktivieren und das Bewertungsmodell wählen.
- Batch-Rabatt und Durchläufe pro Monat einstellen und die Tabelle je Modell vergleichen.
Typische Anwendungsfälle
- Vor einem Modellwechsel die Kosten eines Vergleichstests mit mehreren Kandidaten schätzen.
- Regressionstests für Prompts in der CI planen, die bei jeder Änderung laufen.
- Budget für eine automatische Qualitätsbewertung mit einem Bewertungsmodell festlegen.
- Entscheiden, wie viele Läufe je Testfall sich bei nicht deterministischen Antworten lohnen.
Häufige Fragen
Ist LLM-as-a-Judge zuverlässig?
Für viele Aufgaben gut genug, um Varianten zu vergleichen, aber nicht fehlerfrei. Prüfen Sie stichprobenartig, ob die Bewertungen mit menschlichen Urteilen übereinstimmen.
Welches Modell eignet sich als Bewerter?
Meist ein starkes Modell, oft aus einer anderen Familie als die getesteten, damit es eigene Antworten nicht bevorzugt. Das kostet mehr, macht die Bewertung aber verlässlicher.
Lohnt sich die Batch-Schnittstelle für Evals?
Ja, weil Evals selten in Sekunden fertig sein müssen. Die Batch-Verarbeitung kostet bei Anthropic, OpenAI, Google und Mistral die Hälfte.
Wie viele Testfälle braucht eine Evaluierung?
Für einen ersten Vergleich reichen oft 50 bis 200 gut gewählte Fälle, die typische und schwierige Anfragen abdecken. Wichtiger als die Zahl ist, dass die Fälle Ihre echten Anfragen widerspiegeln.
Warum mehrere Läufe je Testfall?
Weil Sprachmodelle bei gleicher Eingabe unterschiedlich antworten können. Mehrere Läufe zeigen die Streuung und machen Vergleiche zwischen Modellen belastbarer.
Zum Weiterlesen
- KI-API-Kosten senken: Zehn Stellschrauben, die wirklich etwas bringenKI-API-Kosten senken: Wer Sprachmodelle über die API nutzt, zahlt pro Token. Mit diesen zehn Maßnahmen sinkt die Rechnung oft um die Hälfte, ohne schlechtere Ergebnisse.
- ChatGPT API Kosten: Was die OpenAI-API wirklich kostetChatGPT API Kosten verständlich erklärt: Preise aller GPT-Modelle in Euro, Rechenbeispiele für typische Anwendungen und Tipps, wie die Rechnung klein bleibt.
- Claude vs. ChatGPT: Unterschiede bei Preis, Kontext und EinsatzClaude vs. ChatGPT im Vergleich: API-Preise in Euro, Kontextfenster, Tokenizer, Abos und typische Stärken. Sachlich, mit aktuellen Zahlen und Rechenbeispielen.
Das könnte auch helfen
Systemprompt-Kostenrechnerneu
Was kostet Ihr Systemprompt im Jahr? Mit und ohne Prompt-Caching, für alle Modelle.
ÖffnenKI-Preiskalkulationneu
Was muss Ihr KI-Produkt pro Nutzer kosten? KI-Kosten, Marge und Preis für ein SaaS-Angebot.
ÖffnenReasoning-Kostenrechnerneu
Was kostet das Nachdenken von Reasoning-Modellen? Denk-Tokens und Mehrkosten pro Anfrage.
ÖffnenBudget-Rechner
Wie viele Anfragen schaffe ich mit 50 € im Monat? Für alle 36 Modelle.
ÖffnenÜbersetzungskosten-Rechner
Was kostet eine Übersetzung mit KI im Vergleich zum Übersetzungsbüro? Pro Wort und Dokument.
ÖffnenRAG-Kostenrechner
Was kostet eine KI mit eigenen Dokumenten? Embeddings, Abfragen und Vektordatenbank berechnen.
Öffnen