KI lokal ausführen: Sprachmodelle auf dem eigenen Rechner

2 Min. LesezeitStand 07.10.2026Mit KI erstellt · redaktionell geprüft

Wer KI lokal ausführen will, braucht keine Cloud: Sprachmodelle laufen auch auf dem eigenen Rechner. Dann verlassen keine Daten das Gerät, und es fallen keine Kosten pro Anfrage an. Dafür brauchen Sie passende Hardware und müssen mit kleineren Modellen auskommen.

Was Sie brauchen

Entscheidend ist der Speicher, in den das Modell passen muss: bei Grafikkarten der Grafikspeicher (VRAM), bei Apple-Rechnern mit M-Chips der gemeinsame Arbeitsspeicher. Als Faustregel gilt für ein auf 4 Bit komprimiertes Modell:

ModellgrößeSpeicherbedarf etwaGeeignet für
3 bis 4 Mrd. Parameter3 bis 4 GBLaptop, einfache Aufgaben
7 bis 9 Mrd. Parameter5 bis 7 GBGrafikkarte mit 8 GB, Alltagsaufgaben
12 bis 14 Mrd. Parameter9 bis 11 GBGrafikkarte mit 12 bis 16 GB
27 bis 32 Mrd. Parameter18 bis 22 GBGrafikkarte mit 24 GB oder Mac mit 32 GB
70 Mrd. Parameter40 bis 45 GBMac mit 64 GB oder mehrere Grafikkarten

Dazu kommt Speicher für das Kontextfenster: Je länger der Text, desto mehr. Bei Mixture-of-Experts-Modellen zählt für den Speicher die Gesamtzahl der Parameter, für die Geschwindigkeit nur die aktiven.

Programme für den Einstieg

  • Ollama: lädt und startet Modelle mit einem Befehl, bietet eine Schnittstelle wie die großen Anbieter. Gut für Entwickler.
  • LM Studio: Programm mit Oberfläche zum Suchen, Laden und Chatten. Gut für den Einstieg ohne Kommandozeile.
  • llama.cpp: die Technik unter vielen dieser Programme, für alle, die alles selbst einstellen wollen.

Modelle finden Sie bei Hugging Face. Achten Sie auf die Lizenz: Apache 2.0 und MIT erlauben fast jede Nutzung, andere Lizenzen schränken kommerzielle Nutzung ein.

Wann sich lokale KI lohnt

  • Daten dürfen das Gerät oder das Firmennetz nicht verlassen.
  • Sie arbeiten ohne Internet, etwa unterwegs oder in abgeschotteten Netzen.
  • Sie verarbeiten große Mengen einfacher Aufgaben, bei denen ein kleines Modell reicht.
  • Sie wollen lernen und ausprobieren, ohne für jede Anfrage zu zahlen.

Grenzen

Lokale Modelle sind kleiner als die Spitzenmodelle in der Cloud. Bei komplexem Schlussfolgern, langen Dokumenten und Programmieren liegen sie meist deutlich zurück. Strom und Hardware kosten ebenfalls Geld. Ob die API für Ihren Fall günstiger ist, klärt der Ratgeber Open-Weight-Modelle oder API; passende Cloud-Modelle findet der Modell-Finder.

Erstellt mit Unterstützung von KI, geprüft und redaktionell verantwortet von Leon Blatz. Allgemeine Information, keine Rechts-, Steuer- oder Finanzberatung.

Modell-FinderWelches KI-Modell passt? Aufgabe, Kontext und Budget angeben, passende Modelle nach Preis erhalten.
Öffnen

Auch hilfreich: Antwortzeit-Rechner · max_tokens-Rechner

Weiterlesen

Weitere Artikel

  1. Model Context Protocol (MCP) einfach erklärtMCP einfach erklärt: Das Model Context Protocol verbindet KI-Assistenten mit Werkzeugen und Daten. So funktionieren MCP-Server, Clients und Sicherheit.
  2. KI-Agenten absichern: Rechte, Freigaben und ProtokolleKI-Agenten absichern: Mit minimalen Rechten, Freigaben durch Menschen, Schutz vor Prompt Injection und lückenlosen Protokollen bleiben Agenten kontrollierbar.
  3. Texte mit KI klassifizieren: E-Mails, Tickets und Feedback sortierenTexte mit KI klassifizieren: E-Mails, Tickets und Feedback automatisch sortieren, mit festen Kategorien, JSON-Ausgabe, kleinen Modellen und Qualitätskontrolle.