LLM selbst hosten Kosten: API oder eigene GPUs?

LLM selbst hosten Kosten gegen eine KI-API rechnen: GPU-Preis, Durchsatz und Auslastung ergeben Monatskosten und den Break-even bei Ihrem Token-Volumen.

Eigene GPUs

–

 

Tokens pro MonatAPIselbst hosten (Server)günstiger

Mit „Beispielwert“ markierte Preise sind nur Platzhalter: Tragen Sie die aktuellen Preise Ihres Anbieters ein. Modellpreise stammen aus unserer Modellübersicht (US-Dollar-Listenpreise, umgerechnet in Euro).

Alles läuft in Ihrem Browser. Eingaben verlassen Ihr Gerät nicht.

Break-even zwischen API und eigenen GPUs

Was kostet es, ein LLM selbst zu hosten, im Vergleich zur API? LLM selbst hosten Kosten bestehen vor allem aus festen Posten: Eine gemietete GPU kostet pro Stunde, ob sie rechnet oder wartet. Die API-Kosten dagegen wachsen mit jedem Token. Self-Hosting lohnt sich deshalb erst ab einem bestimmten Volumen, dem Break-even. Der Rechner ermittelt ihn aus GPU pro Stunde, dem gemessenen Durchsatz Ihres Servers und der Auslastung.

Die Auslastung ist der häufigste Rechenfehler. Ein Server, der rund um die Uhr läuft, aber nur tagsüber Anfragen bekommt, ist im Mittel vielleicht zu 30 bis 50 % ausgelastet. Die Kapazität je Server ist dann entsprechend kleiner, die Kosten je Token höher. Reicht ein Server nicht, rechnet der Rechner mit weiteren; die Zahl steht in der Tabelle in Klammern. Dazu kommen Betrieb, Überwachung und Personal, die bei API-Kosten im Preis enthalten sind.

Grenzen: Der Durchsatz hängt stark von Modell, Hardware, Inferenz-Software, Kontextlänge und Verhältnis von Eingabe zu Ausgabe ab; messen Sie ihn mit Ihren Anfragen. Der Rechner fasst Eingabe- und Ausgabe-Tokens zu einem Durchsatz zusammen, obwohl Eingaben deutlich schneller verarbeitet werden. Die GPU-Preise sind Beispielwerte. Ein selbst gehostetes offenes Modell ist zudem nicht automatisch so gut wie das Vergleichsmodell; Kosten für Training und einzelne Läufe rechnet der GPU-Kosten-Rechner.

Anleitung: LLM selbst hosten Kosten in 4 Schritten

  1. Ihr Volumen in „Tokens pro Monat (Mio.)“ und den Anteil der Ausgabe-Tokens eintragen.
  2. Das API-Modell wählen, mit dem Sie vergleichen möchten.
  3. GPU-Preis je Stunde, GPUs je Server, gemessenen Durchsatz, Auslastung und Betriebsstunden eintragen.
  4. Betriebskosten ergänzen und Break-even sowie die Tabelle für verschiedene Volumen ablesen.

Typische Anwendungsfälle

  • Abwägen, ob ein offenes Modell auf gemieteten Cloud-GPUs günstiger ist als eine API.
  • Für Datenschutzgründe abschätzen, was der Betrieb im eigenen Rechenzentrum mindestens kostet.
  • Zeigen, ab welchem Wachstum sich eigene Hardware lohnt.
  • Die Wirkung schlechter Auslastung auf die Kosten je Token sichtbar machen.
Fragen

Häufige Fragen

Ab wann lohnt sich Self-Hosting?

Erst bei hohem, gleichmäßigem Volumen und guter Auslastung, oder wenn Datenschutz, Latenz oder Unabhängigkeit wichtiger sind als die Kosten. Der Rechner zeigt die Volumengrenze für Ihre Werte.

Was gehört zu den Betriebskosten?

Einrichtung und Pflege der Inferenz-Software, Überwachung, Updates, Sicherheit und Bereitschaft. Selbst bei gemieteten GPUs ist das oft ein relevanter Teil einer Personalstelle.

Kann ich auch eigene Hardware rechnen?

Ja, rechnen Sie den Kaufpreis über die Nutzungsdauer plus Strom und Rechenzentrum auf einen Preis je GPU-Stunde um und tragen Sie ihn ein.

Wie messe ich den Durchsatz meines Servers?

Mit einem Lasttest, der Ihre typischen Anfragen parallel an den Inferenz-Server schickt, und der Messung der verarbeiteten Tokens pro Sekunde. Gängige Inferenz-Server wie vLLM bringen dafür eigene Benchmark-Skripte mit.

Ist ein selbst gehostetes Modell gleich gut wie die API?

Nicht automatisch. Offene Modelle, die auf einer oder wenigen GPUs laufen, sind meist kleiner als die stärksten API-Modelle. Vergleichen Sie die Qualität mit eigenen Testfällen, bevor Sie nur die Kosten gegenüberstellen.

Ratgeber

Zum Weiterlesen

Alle Artikel
  1. KI-API-Kosten senken: Zehn Stellschrauben, die wirklich etwas bringenKI-API-Kosten senken: Wer Sprachmodelle über die API nutzt, zahlt pro Token. Mit diesen zehn Maßnahmen sinkt die Rechnung oft um die Hälfte, ohne schlechtere Ergebnisse.
  2. ChatGPT API Kosten: Was die OpenAI-API wirklich kostetChatGPT API Kosten verständlich erklärt: Preise aller GPT-Modelle in Euro, Rechenbeispiele für typische Anwendungen und Tipps, wie die Rechnung klein bleibt.
  3. Claude vs. ChatGPT: Unterschiede bei Preis, Kontext und EinsatzClaude vs. ChatGPT im Vergleich: API-Preise in Euro, Kontextfenster, Tokenizer, Abos und typische Stärken. Sachlich, mit aktuellen Zahlen und Rechenbeispielen.
Weitere Werkzeuge

Das könnte auch helfen

Alle 558 Werkzeuge