Small Language Models: Wann kleine Sprachmodelle die bessere Wahl sind
Small Language Models, kurz SLM, sind kleine Sprachmodelle mit meist wenigen Milliarden Parametern. Sie sind weniger vielseitig als die großen Spitzenmodelle, laufen aber schneller, kosten deutlich weniger und passen teils sogar auf Laptops und Smartphones. Für viele klar umrissene Aufgaben reichen sie völlig aus.
Was ein kleines Sprachmodell ausmacht
Eine feste Grenze gibt es nicht. Als klein gelten meist Modelle, die mit überschaubarer Hardware betrieben werden können, etwa einer einzelnen Grafikkarte oder einem modernen Notebook. Was eine Parameterzahl konkret bedeutet, erklärt der Beitrag Parameter eines Sprachmodells. Dazu zählen offene Modellreihen verschiedener Hersteller wie Microsoft (Phi), Google (Gemma), Meta (Llama) oder Mistral sowie Anbieter wie Alibaba (Qwen). Auch die API-Anbieter haben kleine Varianten im Programm, etwa die Mini-, Nano-, Flash- oder Haiku-Modelle.
Warum kleine Modelle so gut geworden sind
- Bessere Trainingsdaten: sorgfältig gefilterte und teils synthetische Daten.
- Destillation: Kleine Modelle lernen von großen, siehe Distillation erklärt.
- Längeres Training: Kleine Modelle werden heute mit sehr viel mehr Daten trainiert als früher üblich.
- Quantisierung: Mit weniger Bits gespeichert, brauchen sie wenig Speicher.
Wofür kleine Sprachmodelle gut geeignet sind
- Texte klassifizieren und Daten extrahieren, etwa Rechnungsfelder oder Kategorien
- kurze Zusammenfassungen und Umformulierungen
- einfache Fragen zu bereitgestellten Dokumenten
- Vorfilterung: entscheiden, ob eine Anfrage an ein großes Modell weitergeht
- Anwendungen auf dem Gerät, die offline funktionieren oder Daten nicht weitergeben sollen
Grenzen
Kleine Modelle haben weniger Weltwissen und halluzinieren bei Faktenfragen eher. Bei komplexen, mehrstufigen Aufgaben, langen Dokumenten und anspruchsvollem Programmieren liegen sie deutlich hinter den großen Modellen. Auch die Qualität in Deutsch kann schwanken. Testen Sie deshalb mit echten Beispielen aus Ihrem Anwendungsfall.
Kosten und Betrieb
Bei den API-Anbietern sind kleine Modelle oft um ein Vielfaches günstiger als die Spitzenmodelle derselben Familie:
| Modell | Eingabe / 1 Mio. | Ausgabe / 1 Mio. | Kontext |
|---|---|---|---|
| GPT-5.4 nano | 0,18 € | 1,12 € | 400.000 |
| GPT-5.4 mini | 0,67 € | 4,03 € | 400.000 |
| Gemini 3.5 Flash-Lite | 0,27 € | 2,24 € | 1.000.000 |
| Claude Haiku 4.5 | 0,89 € | 4,47 € | 200.000 |
| Claude Opus 5.5 | 3,58 € | 17,89 € | 1.000.000 |
Listenpreise Stand 07.10.2026, umgerechnet zum EZB-Kurs vom 07.10.2026.
Was ein Wechsel auf ein kleineres Modell bei Ihrem Volumen spart, rechnet der Modellwechsel-Rechner aus.
Lokal betreiben
Ein großer Vorteil offener kleiner Modelle: Sie laufen auf eigener Hardware. Daten verlassen dann das Unternehmen nicht, und es fallen keine Tokenkosten an, dafür Kosten für Hardware, Strom und Betreuung. Werkzeuge wie Ollama oder LM Studio machen den Einstieg einfach. Eine Anleitung bietet der Ratgeber KI lokal ausführen.
Klein und groß kombinieren
In der Praxis bewährt sich oft eine Mischung: Ein kleines Modell erledigt die Masse einfacher Anfragen, schwierige Fälle gehen an ein großes Modell. Wie Sie die passende Größe je Aufgabe finden, beschreibt der Ratgeber Kleines oder großes Modell?
Kleine Modelle richtig testen
Bevor Sie umsteigen, lohnt ein kurzer Vergleich mit echten Daten. Sammeln Sie 20 bis 50 typische Anfragen, lassen Sie sie vom bisherigen und vom kleinen Modell bearbeiten und bewerten Sie die Ergebnisse nach festen Kriterien. Oft zeigt sich, dass ein klarerer Prompt oder zwei Beispiele die Lücke zum großen Modell schließen. Hilfreich dafür ist der Few-Shot-Generator.
Erstellt mit Unterstützung von KI, geprüft und redaktionell verantwortet von Leon Blatz. Allgemeine Information, keine Rechts-, Steuer- oder Finanzberatung.