LLM-Nutzung auswerten

LLM-Nutzung auswerten: Fügen Sie API-Logs ein und erhalten Sie Eingabe-, Cache-, Ausgabe- und Reasoning-Tokens sowie Kosten je Modell für OpenAI, Claude und Gemini.

–

 

Verbrauch je Modell
ModellAufrufeEingabeCache gelesenCache geschriebenAusgabedavon ReasoningKosten

Alles läuft in Ihrem Browser. Eingaben verlassen Ihr Gerät nicht.

Token-Verbrauch aus Logs zusammenrechnen

Mit diesem Werkzeug können Sie die LLM-Nutzung auswerten, die in Ihren eigenen API-Logs steht. Jede Antwort einer KI-API enthält ein Objekt mit den usage Tokens des Aufrufs: bei OpenAI Chat Completions etwa prompt_tokens und completion_tokens, bei der Responses API und bei Anthropic input_tokens und output_tokens, bei Google Gemini usageMetadata mit promptTokenCount. Das Werkzeug sucht diese Objekte in beliebigem Text, auch mitten in Log-Zeilen, und ordnet sie dem Modell zu, das im selben Eintrag steht.

Heraus kommt der Token-Verbrauch je Modell mit Eingabe, gelesenen und geschriebenen Cache-Tokens, Ausgabe und dem Anteil der Reasoning-Tokens sowie die Kosten je Modell nach den Listenpreisen der Modelldatenbank dieser Website. Dabei werden die Unterschiede der Anbieter beachtet: Bei OpenAI und Gemini sind gecachte Tokens in der Eingabe enthalten, bei Anthropic werden sie getrennt gemeldet. Geschriebene Cache-Tokens berechnet das Werkzeug bei Anthropic mit dem 1,25-fachen Eingabepreis, wie er für den Cache mit fünf Minuten Laufzeit gilt. So können Sie API-Logs auswerten und mit der Rechnung vergleichen.

Grenzen: Das Werkzeug kann nur zählen, was in den Logs steht. Fehlt das Modell in einem Eintrag, wird der Preis des gewählten Ersatzmodells verwendet. Sondertarife, Batch-Rabatte, Aufpreise für langen Kontext und Preisänderungen im Zeitraum werden nicht berücksichtigt. Ergebnisdateien der Batch-API werten Sie mit Batch-Ergebnisse auswerten aus, künftige Kosten schätzt der KI-Kostenrechner.

Anleitung: LLM-Nutzung auswerten in 4 Schritten

  1. Log-Zeilen oder API-Antworten in das Feld „Logs oder Antworten“ einfügen oder eine Datei wählen.
  2. Im Feld „Preis für unbekannte Modelle“ das Modell wählen, mit dem nicht zuordenbare Einträge berechnet werden.
  3. Die Tabelle nach Modellen lesen: Aufrufe, Eingabe-, Cache-, Ausgabe- und Reasoning-Tokens sowie Kosten.
  4. Mit „Tabelle als CSV“ die Auswertung für eine Tabellenkalkulation übernehmen.

Typische Anwendungsfälle

  • Am Monatsende die Kosten aus eigenen Logs mit der Rechnung des Anbieters abgleichen.
  • Herausfinden, welches Modell in einer Anwendung den größten Teil der Kosten verursacht.
  • Prüfen, ob Prompt-Caching wirkt, indem man den Anteil der Cache-Tokens ansieht.
  • Den Anteil der Reasoning-Tokens an der Ausgabe sichtbar machen.
Fragen

Häufige Fragen

Muss jede Zeile gültiges JSON sein?

Nein. Das Werkzeug sucht in jeder Zeile nach JSON-Objekten und wertet alle aus, die ein usage-Feld enthalten. Präfixe wie Zeitstempel oder Log-Level stören nicht.

Wie werden Modellnamen mit Datum zugeordnet?

Ein Name wie gpt-4o-mini-2024-07-18 wird dem Eintrag gpt-4o-mini der Preisliste zugeordnet. Es zählt der längste passende Anfang des Namens.

Werden Reasoning-Tokens extra berechnet?

Sie werden als Ausgabe-Tokens berechnet. Bei OpenAI sind sie in completion_tokens enthalten, bei Gemini kommen die thoughtsTokenCount zur Ausgabe hinzu.

Bleiben meine Logs auf meinem Rechner?

Ja. Die Datei wird nur im Browser gelesen, nichts wird übertragen.

Welche Formate erkennt das Werkzeug?

OpenAI Chat Completions (prompt_tokens, completion_tokens), OpenAI Responses (input_tokens, output_tokens), Anthropic (input_tokens, cache_read_input_tokens …) und Google Gemini (usageMetadata). Die Objekte dürfen in beliebigen Log-Zeilen stehen.

Werden Streaming-Ereignisse doppelt gezählt?

Das kann passieren, wenn ein Log sowohl Zwischenstände als auch die Endsumme enthält. Fügen Sie dann nur die abschließenden Ereignisse oder die vollständigen Antworten ein.

Ratgeber

Zum Weiterlesen

Alle Artikel
  1. RAG einfach erklärt: KI mit eigenen Dokumenten nutzenRAG einfach erklärt: wie Retrieval-Augmented Generation funktioniert, wofür man Embeddings und Vektordatenbanken braucht und was ein RAG-System kostet.
  2. Structured Outputs: Zuverlässig JSON von KI-ModellenStructured Outputs erklärt: Wie Sie mit JSON-Schema garantiert gültiges JSON von OpenAI, Claude und Gemini bekommen, statt kaputte Antworten nachträglich zu reparieren.
  3. Prompt Injection: Wie Angriffe auf KI-Systeme funktionierenPrompt Injection erklärt: wie versteckte Anweisungen in E-Mails, Dokumenten und Websites KI-Assistenten und Agenten manipulieren und welche Schutzmaßnahmen wirken.
Weitere Werkzeuge

Das könnte auch helfen

Alle 558 Werkzeuge