Ollama Einstieg: Lokale KI-Modelle auf dem eigenen Rechner
Der Ollama Einstieg ist der wohl einfachste Weg, offene Sprachmodelle lokal zu betreiben. Ollama lädt Modelle mit einem Befehl herunter, startet sie auf dem eigenen Rechner und stellt eine lokale Schnittstelle bereit, die sich wie eine Cloud-API ansprechen lässt. Daten verlassen dabei den Rechner nicht.
Installation und erstes Modell
- Ollama für Windows, macOS oder Linux von der offiziellen Website installieren.
- Ein Terminal öffnen und ein Modell starten:
ollama run MODELLNAME. Beim ersten Mal wird es heruntergeladen. - Direkt im Terminal chatten. Mit
ollama listsehen Sie geladene Modelle, mitollama pullladen Sie weitere, mitollama rmentfernen Sie sie.
Welche Modelle verfügbar sind, zeigt die Modellbibliothek von Ollama. Viele Modelle gibt es in mehreren Größen und Quantisierungsstufen.
Welche Hardware Sie brauchen
Entscheidend ist der Speicher: Das Modell muss in den Arbeitsspeicher der Grafikkarte oder, langsamer, in den normalen Arbeitsspeicher passen. Faustregel: Je mehr Parameter und je höher die Genauigkeit, desto mehr Speicher. Quantisierte Modelle mit 4 Bit brauchen grob einen halben bis einen Gigabyte pro Milliarde Parameter, zuzüglich Speicher für den Kontext. Kleine Modelle mit wenigen Milliarden Parametern laufen auf aktuellen Laptops, große Modelle brauchen leistungsstarke Grafikkarten oder Rechner mit viel gemeinsamem Speicher. Hintergründe erklärt Quantisierung erklärt.
Die lokale API nutzen
Ollama läuft als Dienst und ist standardmäßig unter http://localhost:11434 erreichbar. Neben der eigenen Schnittstelle gibt es einen OpenAI-kompatiblen Endpunkt. Bestehender Code für das OpenAI-SDK funktioniert damit oft nach Änderung der Basis-Adresse:
from openai import OpenAI
client = OpenAI(base_url="http://localhost:11434/v1", api_key="ollama")
r = client.chat.completions.create(
model="MODELLNAME",
messages=[{"role": "user", "content": "Fasse diesen Text zusammen: ..."}],
)
print(r.choices[0].message.content)
Der Schlüssel ist hier nur ein Platzhalter; lokal ist keine Anmeldung nötig. Mehr zum Grundgerüst steht unter KI mit Python nutzen.
Kontextlänge beachten
Lokale Modelle starten oft mit einer begrenzten Kontextlänge, die unter dem liegt, was das Modell eigentlich kann. Längere Kontexte lassen sich einstellen, kosten aber zusätzlichen Speicher. Werden lange Dokumente stillschweigend abgeschnitten, wirken Antworten unvollständig. Ob ein Text hineinpasst, schätzt der Kontextfenster-Rechner.
Wofür lokale Modelle sinnvoll sind
- vertrauliche Daten, die das Haus nicht verlassen sollen
- Entwicklung und Tests ohne API-Kosten
- Offline-Einsatz
- einfache Aufgaben wie Klassifizieren, Extrahieren, Umformulieren
- Embeddings für eine lokale Suche
Im Team lässt sich Ollama auch auf einem gemeinsamen Rechner im internen Netz betreiben. Dann sollten Sie den Zugriff absichern, denn die lokale Schnittstelle hat von Haus aus keine Anmeldung. Machen Sie den Dienst nicht ungeschützt im Internet erreichbar.
Grenzen
Modelle, die auf normaler Hardware laufen, sind bei schwierigen Aufgaben wie komplexem Programmieren, langen Analysen oder mehrstufigem Denken meist deutlich schwächer als große Cloud-Modelle. Die Antwortgeschwindigkeit hängt stark von der Hardware ab. Prüfen Sie außerdem die Lizenz jedes Modells, bevor Sie es geschäftlich nutzen. Einen breiteren Überblick über Werkzeuge und Kosten geben KI lokal ausführen und Open-Weight oder API.
Erstellt mit Unterstützung von KI, geprüft und redaktionell verantwortet von Leon Blatz. Allgemeine Information, keine Rechts-, Steuer- oder Finanzberatung.