Antwortzeit-Rechner

Der Antwortzeit-Rechner zeigt, wie lange ein KI-Modell für eine Antwort braucht: Latenz, Denkphase und Tokens pro Sekunde, mit und ohne Streaming.

–

 

GeschwindigkeitErstes WortFertig

Woraus sich die Antwortzeit zusammensetzt

Die Antwortzeit eines Sprachmodells setzt sich aus drei Teilen zusammen: der Latenz bis zum ersten Token (Netzwerk, Warteschlange, Lesen der Eingabe), einer möglichen Denkphase bei Reasoning-Modellen und dem Schreiben der Antwort mit einer bestimmten Zahl an Tokens pro Sekunde.

Mit Streaming sehen Nutzer die Antwort schon während sie entsteht; gefühlt zählt dann vor allem die Wartezeit bis zum ersten Wort. Ohne Streaming warten sie auf die vollständige Antwort. Für Chats ist Streaming deshalb fast immer die bessere Wahl, für die Weiterverarbeitung per Programm ist es egal.

Fragen

Häufige Fragen

Wie schnell sind KI-Modelle?

Große Modelle schreiben etwa 30 bis 80 Tokens pro Sekunde, kleine 100 bis 250, auf Spezial-Hardware auch mehrere Hundert. Auf Deutsch entspricht ein Wort etwa 1,45 Tokens.

Was ist die Latenz bis zum ersten Token?

Die Zeit von der Anfrage bis zum ersten ausgegebenen Token (Time to First Token). Sie liegt meist zwischen 0,3 und 2 Sekunden, bei langen Eingaben und Reasoning deutlich darüber.

Wie verkürze ich die Wartezeit?

Streaming einschalten, kürzere Antworten anfordern, ein schnelleres Modell wählen und Reasoning nur bei Bedarf nutzen. Prompt-Caching verkürzt bei langen Eingaben auch die Zeit bis zum ersten Token.

Ratgeber

Zum Weiterlesen

Alle Artikel
  1. Latenz von KI-Anwendungen: So antworten Modelle schnellerLatenz von KI-Anwendungen verringern: Woraus sich die Antwortzeit zusammensetzt und mit welchen Mitteln wie Streaming, kleineren Modellen und Caching sie spürbar sinkt.
  2. Was sind Tokens? Einfach erklärtTokens sind die Rechen- und Abrechnungseinheit von Sprachmodellen. Was ein Token ist, wie viele ein deutscher Text hat und warum das Geld kostet.
  3. Kontextfenster erklärt: Wie viel Text ein Modell auf einmal verarbeitetDas Kontextfenster begrenzt, wie viel ein KI-Modell gleichzeitig lesen und schreiben kann. Was die Zahl bedeutet, wo die Grenzen liegen und wie man damit umgeht.
Weitere Werkzeuge

Das könnte auch helfen

Alle 65 Werkzeuge