Modell-Routing: Anfragen automatisch auf passende KI-Modelle verteilen
Modell-Routing verteilt Anfragen automatisch auf unterschiedliche Sprachmodelle: Einfache Aufgaben gehen an ein kleines, günstiges Modell, schwierige an ein großes. Weil die Preisunterschiede zwischen Modellklassen groß sind, lässt sich so oft viel sparen, ohne dass die Qualität spürbar leidet.
Warum sich das lohnt
Viele Anwendungen bestehen zum großen Teil aus Routineanfragen: kurze Fragen, Klassifizieren, Umformulieren. Dafür ist ein Spitzenmodell überdimensioniert. Wie groß die Preisspanne ist, zeigt ein Vergleich zwischen einem kleinen und einem großen Modell:
| Modell | Eingabe / 1 Mio. | Ausgabe / 1 Mio. | Kontext |
|---|---|---|---|
| GPT-6 Luna | 0,089 € | 0,45 € | 1.050.000 |
| GPT-5.5 | 4,47 € | 26,84 € | 1.000.000 |
| Claude Haiku 4.5 | 0,89 € | 4,47 € | 200.000 |
| Claude Opus 5.5 | 3,58 € | 17,89 € | 1.000.000 |
Listenpreise Stand 07.10.2026, umgerechnet zum EZB-Kurs vom 07.10.2026.
Was ein Wechsel für Ihren Verbrauch bedeutet, rechnet der Modellwechsel-Rechner aus. Grundsätzliches zur Wahl der Modellgröße steht unter Kleines oder großes Modell.
Arten von Routern
- Regelbasiert: feste Regeln nach Aufgabentyp, Eingabelänge, Kanal oder Nutzergruppe. Zum Beispiel: Zusammenfassungen ans kleine Modell, Vertragsanalysen ans große. Einfach, transparent, gut zu testen.
- Klassifizierer: ein kleines Modell oder ein trainierter Klassifizierer schätzt die Schwierigkeit jeder Anfrage und entscheidet. Flexibler, aber selbst eine Fehlerquelle.
- Kaskade: zuerst antwortet das günstige Modell. Ist das Ergebnis unsicher, ungültig oder schlecht bewertet, wird die Anfrage an das größere Modell weitergegeben.
- Ausfallrouting: Ist ein Anbieter überlastet oder nicht erreichbar, geht die Anfrage an ein Ersatzmodell. Das erhöht die Verfügbarkeit.
Kaskaden sinnvoll prüfen
Damit eine Kaskade funktioniert, braucht es ein verlässliches Signal, wann das kleine Modell nicht reicht. Geeignet sind:
- ungültiges JSON oder fehlende Pflichtfelder
- die eigene Angabe des Modells, unsicher zu sein, wenn Sie es dazu auffordern
- eine kurze Prüfung durch ein Bewertungsmodell
- Regeln wie „Antwort ohne Quellenangabe“
Ein Beispiel aus dem Kundenservice: Ein kleines Modell ordnet jede Anfrage einer Kategorie zu und beantwortet Standardfragen anhand der Wissensbasis. Findet es keine passende Quelle oder geht es um Beschwerden und Vertragsfragen, übernimmt das größere Modell oder ein Mensch. So landen nur die schwierigen Fälle beim teuren Modell.
Beachten Sie: Bei einer Eskalation zahlen Sie beide Aufrufe. Eine Kaskade lohnt sich nur, wenn das kleine Modell den Großteil der Anfragen allein schafft.
Fallstricke
- Unterschiedliches Verhalten: Modelle reagieren verschieden auf denselben Prompt. Prompts müssen gegebenenfalls je Modell angepasst werden.
- Uneinheitliche Antworten: Nutzer merken, wenn Stil und Qualität schwanken.
- Prompt Caching: Wechselnde Modelle teilen keinen Cache, die Ersparnis des Cachings kann sinken.
- Datenschutz: Jeder Anbieter im Routing braucht eine geprüfte Vereinbarung zur Auftragsverarbeitung, wenn personenbezogene Daten verarbeitet werden.
So führen Sie Routing ein
- Anfragen protokollieren und nach Typ gruppieren.
- Für jede Gruppe testen, ob ein günstigeres Modell ausreicht; siehe LLM-Anwendungen testen.
- Mit einfachen Regeln starten, erst später einen lernenden Router einsetzen.
- Kosten und Qualität je Route überwachen.
Wichtig ist, die Routing-Entscheidung selbst zu protokollieren. Nur so lässt sich später nachvollziehen, ob eine schlechte Antwort am Modell lag oder an einer falschen Zuordnung, und ob der Router mit der Zeit zu viele Anfragen an das teure Modell schickt.
Weitere Sparhebel wie semantisches Caching lassen sich mit Routing kombinieren. Welche Modelle wofür stark sind, zeigt die Übersicht Modelle.
Erstellt mit Unterstützung von KI, geprüft und redaktionell verantwortet von Leon Blatz. Allgemeine Information, keine Rechts-, Steuer- oder Finanzberatung.