Ollama Einstieg: Lokale KI-Modelle auf dem eigenen Rechner

2 Min. LesezeitStand 08.10.2026Mit KI erstellt · redaktionell geprüft

Der Ollama Einstieg ist der wohl einfachste Weg, offene Sprachmodelle lokal zu betreiben. Ollama lädt Modelle mit einem Befehl herunter, startet sie auf dem eigenen Rechner und stellt eine lokale Schnittstelle bereit, die sich wie eine Cloud-API ansprechen lässt. Daten verlassen dabei den Rechner nicht.

Installation und erstes Modell

  1. Ollama für Windows, macOS oder Linux von der offiziellen Website installieren.
  2. Ein Terminal öffnen und ein Modell starten: ollama run MODELLNAME. Beim ersten Mal wird es heruntergeladen.
  3. Direkt im Terminal chatten. Mit ollama list sehen Sie geladene Modelle, mit ollama pull laden Sie weitere, mit ollama rm entfernen Sie sie.

Welche Modelle verfügbar sind, zeigt die Modellbibliothek von Ollama. Viele Modelle gibt es in mehreren Größen und Quantisierungsstufen.

Welche Hardware Sie brauchen

Entscheidend ist der Speicher: Das Modell muss in den Arbeitsspeicher der Grafikkarte oder, langsamer, in den normalen Arbeitsspeicher passen. Faustregel: Je mehr Parameter und je höher die Genauigkeit, desto mehr Speicher. Quantisierte Modelle mit 4 Bit brauchen grob einen halben bis einen Gigabyte pro Milliarde Parameter, zuzüglich Speicher für den Kontext. Kleine Modelle mit wenigen Milliarden Parametern laufen auf aktuellen Laptops, große Modelle brauchen leistungsstarke Grafikkarten oder Rechner mit viel gemeinsamem Speicher. Hintergründe erklärt Quantisierung erklärt.

Die lokale API nutzen

Ollama läuft als Dienst und ist standardmäßig unter http://localhost:11434 erreichbar. Neben der eigenen Schnittstelle gibt es einen OpenAI-kompatiblen Endpunkt. Bestehender Code für das OpenAI-SDK funktioniert damit oft nach Änderung der Basis-Adresse:

from openai import OpenAI

client = OpenAI(base_url="http://localhost:11434/v1", api_key="ollama")
r = client.chat.completions.create(
    model="MODELLNAME",
    messages=[{"role": "user", "content": "Fasse diesen Text zusammen: ..."}],
)
print(r.choices[0].message.content)

Der Schlüssel ist hier nur ein Platzhalter; lokal ist keine Anmeldung nötig. Mehr zum Grundgerüst steht unter KI mit Python nutzen.

Kontextlänge beachten

Lokale Modelle starten oft mit einer begrenzten Kontextlänge, die unter dem liegt, was das Modell eigentlich kann. Längere Kontexte lassen sich einstellen, kosten aber zusätzlichen Speicher. Werden lange Dokumente stillschweigend abgeschnitten, wirken Antworten unvollständig. Ob ein Text hineinpasst, schätzt der Kontextfenster-Rechner.

Wofür lokale Modelle sinnvoll sind

  • vertrauliche Daten, die das Haus nicht verlassen sollen
  • Entwicklung und Tests ohne API-Kosten
  • Offline-Einsatz
  • einfache Aufgaben wie Klassifizieren, Extrahieren, Umformulieren
  • Embeddings für eine lokale Suche

Im Team lässt sich Ollama auch auf einem gemeinsamen Rechner im internen Netz betreiben. Dann sollten Sie den Zugriff absichern, denn die lokale Schnittstelle hat von Haus aus keine Anmeldung. Machen Sie den Dienst nicht ungeschützt im Internet erreichbar.

Grenzen

Modelle, die auf normaler Hardware laufen, sind bei schwierigen Aufgaben wie komplexem Programmieren, langen Analysen oder mehrstufigem Denken meist deutlich schwächer als große Cloud-Modelle. Die Antwortgeschwindigkeit hängt stark von der Hardware ab. Prüfen Sie außerdem die Lizenz jedes Modells, bevor Sie es geschäftlich nutzen. Einen breiteren Überblick über Werkzeuge und Kosten geben KI lokal ausführen und Open-Weight oder API.

Erstellt mit Unterstützung von KI, geprüft und redaktionell verantwortet von Leon Blatz. Allgemeine Information, keine Rechts-, Steuer- oder Finanzberatung.

Kontextfenster-RechnerPasst mein Dokument ins Kontextfenster? Seiten oder Wörter eingeben, für alle Modelle prüfen.
Öffnen

Auch hilfreich: Antwortzeit-Rechner · max_tokens-Rechner

Weiterlesen

Weitere Artikel

  1. Kontext komprimieren: Lange KI-Gespräche schlank haltenKontext komprimieren in langen Gesprächen: mit Zusammenfassungen, gekürzten Werkzeugergebnissen und Gedächtnisdateien Kosten senken und Qualität halten.
  2. Semantisches Caching: Ähnliche KI-Anfragen nur einmal bezahlenSemantisches Caching erklärt: wie ein Cache über Embeddings ähnliche Fragen erkennt, wann das Kosten und Wartezeit spart und welche Risiken es birgt.
  3. Modell-Routing: Anfragen automatisch auf passende KI-Modelle verteilenModell-Routing erklärt: einfache Anfragen an günstige, schwierige an starke KI-Modelle schicken. Welche Router-Arten es gibt und wie Sie die Qualität sichern.