GPU mieten: Kosten für den Betrieb eigener KI-Modelle

2 Min. LesezeitStand 08.10.2026Mit KI erstellt · redaktionell geprüft

Wer ein offenes Sprachmodell selbst betreiben oder feinabstimmen will, kann eine GPU mieten statt Hardware zu kaufen. Cloud-Anbieter und spezialisierte GPU-Dienste vermieten Grafikkarten stunden- oder monatsweise. Ob das günstiger ist als eine API, hängt vor allem davon ab, wie gut die gemietete GPU ausgelastet ist.

Wann eigene Modelle überhaupt Sinn ergeben

  • Daten dürfen nicht zu einem KI-Anbieter, auch nicht mit Vertrag zur Auftragsverarbeitung.
  • Sie brauchen ein spezielles, feinabgestimmtes Modell, das kein Anbieter so betreibt.
  • Sie haben sehr hohe, gleichmäßige Mengen an Anfragen.
  • Sie wollen unabhängig von Preisänderungen und Abkündigungen der Anbieter sein.

Die Abwägung beschreibt der Ratgeber Open-Weight oder API.

Wie GPU-Miete abgerechnet wird

  1. Auf Abruf je Stunde: flexibel, aber der teuerste Stundenpreis. Gut für Tests und Feinabstimmung.
  2. Unterbrechbare Instanzen: deutlich günstiger, können aber jederzeit vom Anbieter beendet werden. Geeignet für Batch-Aufgaben, die neu starten können.
  3. Reserviert oder monatlich: günstigerer Preis gegen feste Laufzeit. Sinnvoll für Dauerbetrieb.
  4. Serverlos: Abrechnung nach tatsächlicher Rechenzeit, mit Wartezeit beim Kaltstart.

Die Stundenpreise unterscheiden sich stark nach GPU-Typ, Anbieter und Region und ändern sich oft. Vergleichen Sie aktuelle Angebote, bevor Sie rechnen.

Welche GPU Sie brauchen

Entscheidend ist der Grafikspeicher (VRAM). Das Modell muss samt Zwischenspeicher für das Kontextfenster hineinpassen. Als grobe Orientierung: Ein Modell mit 7 bis 9 Milliarden Parametern läuft komprimiert auf einer Karte mit 8 bis 16 GB, ein Modell mit 70 Milliarden Parametern braucht auch komprimiert 40 GB und mehr, oft also eine große Rechenzentrums-GPU oder mehrere Karten. Wie Komprimierung den Speicherbedarf senkt, erklärt Quantisierung erklärt. Sehr große offene Modelle mit Hunderten Milliarden Parametern benötigen mehrere Rechenzentrums-GPUs zugleich.

Die Rechnung gegen die API

Die gemietete GPU kostet je Stunde, egal ob sie arbeitet oder wartet. Die API kostet nur je Token. Daraus folgt die wichtigste Regel: Bei geringer oder schwankender Auslastung ist die API fast immer günstiger. Erst wenn eine GPU über viele Stunden am Tag gleichmäßig ausgelastet ist, kann sich die Miete rechnen.

So vergleichen Sie:

  1. Messen oder schätzen Sie, wie viele Tokens pro Stunde Ihr Modell auf der gewählten GPU verarbeitet.
  2. Teilen Sie den Stundenpreis durch die Tokens pro Stunde. Das ergibt Ihren Preis je Million Tokens bei voller Auslastung.
  3. Korrigieren Sie um die realistische Auslastung. Bei 25 Prozent Auslastung vervierfacht sich der Preis.
  4. Vergleichen Sie mit dem API-Preis eines vergleichbar starken Modells auf den Modellseiten.

Kosten, die oft fehlen

  • Speicher für Modellgewichte und Daten
  • Datenübertragung aus der Cloud
  • Arbeitszeit für Einrichtung, Updates, Überwachung und Sicherheit
  • Reserve für Lastspitzen oder Ausfälle

Feinabstimmung als Sonderfall

Für eine Feinabstimmung braucht man die GPU nur für Stunden oder Tage. Hier ist stundenweise Miete meist die richtige Wahl. Was eine Feinabstimmung insgesamt kostet, schätzt der Fine-Tuning-Kostenrechner, ob sie überhaupt nötig ist, klärt Fine-Tuning oder RAG.

Wichtig für den Datenschutz: Auch bei gemieteten GPUs liegen die Daten beim Cloud-Anbieter. Ein Vertrag zur Auftragsverarbeitung und die Wahl einer Region in der EU sind deshalb ebenso nötig wie bei einer API.

Erstellt mit Unterstützung von KI, geprüft und redaktionell verantwortet von Leon Blatz. Allgemeine Information, keine Rechts-, Steuer- oder Finanzberatung.

Fine-Tuning-KostenrechnerTraining und Nutzung eines angepassten Modells in Euro berechnen.
Öffnen

Auch hilfreich: Systemprompt-Kostenrechner · KI-Preiskalkulation

Weiterlesen

Weitere Artikel

  1. Eigener KI-Server: Was er kostet und wann er sich lohntEigener KI-Server im Unternehmen: Anschaffung, Strom, Betrieb und Abschreibung im Vergleich zur API. Für wen sich lokale KI-Hardware lohnt und für wen nicht.
  2. Was kostet ein KI-Chatbot für die Website? Kosten realistisch planenWas kostet ein KI-Chatbot für die Website? Fertige Lösung oder Eigenbau, Kosten pro Gespräch, Einrichtung und Pflege, mit Rechenweg und Kostentreibern.
  3. Wie sich KI-Preise entwickeln: Preisverfall, Erhöhungen und PlanungWie sich KI-Preise entwickeln: warum neue Modelle oft günstiger sind, wann Preise doch steigen, was Aktionspreise bedeuten und wie Sie Budgets robust planen.