KI lokal ausführen: Sprachmodelle auf dem eigenen Rechner
Wer KI lokal ausführen will, braucht keine Cloud: Sprachmodelle laufen auch auf dem eigenen Rechner. Dann verlassen keine Daten das Gerät, und es fallen keine Kosten pro Anfrage an. Dafür brauchen Sie passende Hardware und müssen mit kleineren Modellen auskommen.
Was Sie brauchen
Entscheidend ist der Speicher, in den das Modell passen muss: bei Grafikkarten der Grafikspeicher (VRAM), bei Apple-Rechnern mit M-Chips der gemeinsame Arbeitsspeicher. Als Faustregel gilt für ein auf 4 Bit komprimiertes Modell:
| Modellgröße | Speicherbedarf etwa | Geeignet für |
|---|---|---|
| 3 bis 4 Mrd. Parameter | 3 bis 4 GB | Laptop, einfache Aufgaben |
| 7 bis 9 Mrd. Parameter | 5 bis 7 GB | Grafikkarte mit 8 GB, Alltagsaufgaben |
| 12 bis 14 Mrd. Parameter | 9 bis 11 GB | Grafikkarte mit 12 bis 16 GB |
| 27 bis 32 Mrd. Parameter | 18 bis 22 GB | Grafikkarte mit 24 GB oder Mac mit 32 GB |
| 70 Mrd. Parameter | 40 bis 45 GB | Mac mit 64 GB oder mehrere Grafikkarten |
Dazu kommt Speicher für das Kontextfenster: Je länger der Text, desto mehr. Bei Mixture-of-Experts-Modellen zählt für den Speicher die Gesamtzahl der Parameter, für die Geschwindigkeit nur die aktiven.
Programme für den Einstieg
- Ollama: lädt und startet Modelle mit einem Befehl, bietet eine Schnittstelle wie die großen Anbieter. Gut für Entwickler.
- LM Studio: Programm mit Oberfläche zum Suchen, Laden und Chatten. Gut für den Einstieg ohne Kommandozeile.
- llama.cpp: die Technik unter vielen dieser Programme, für alle, die alles selbst einstellen wollen.
Modelle finden Sie bei Hugging Face. Achten Sie auf die Lizenz: Apache 2.0 und MIT erlauben fast jede Nutzung, andere Lizenzen schränken kommerzielle Nutzung ein.
Wann sich lokale KI lohnt
- Daten dürfen das Gerät oder das Firmennetz nicht verlassen.
- Sie arbeiten ohne Internet, etwa unterwegs oder in abgeschotteten Netzen.
- Sie verarbeiten große Mengen einfacher Aufgaben, bei denen ein kleines Modell reicht.
- Sie wollen lernen und ausprobieren, ohne für jede Anfrage zu zahlen.
Grenzen
Lokale Modelle sind kleiner als die Spitzenmodelle in der Cloud. Bei komplexem Schlussfolgern, langen Dokumenten und Programmieren liegen sie meist deutlich zurück. Strom und Hardware kosten ebenfalls Geld. Ob die API für Ihren Fall günstiger ist, klärt der Ratgeber Open-Weight-Modelle oder API; passende Cloud-Modelle findet der Modell-Finder.
Erstellt mit Unterstützung von KI, geprüft und redaktionell verantwortet von Leon Blatz. Allgemeine Information, keine Rechts-, Steuer- oder Finanzberatung.