Attention-Mechanismus erklärt: Wie Sprachmodelle Zusammenhänge erkennen

2 Min. LesezeitStand 08.10.2026Mit KI erstellt · redaktionell geprüft

Der Attention-Mechanismus ist das Herzstück der Transformer-Modelle. Er sorgt dafür, dass ein Sprachmodell bei jedem Wort berechnet, welche anderen Wörter im Text dafür wichtig sind. So weiß das Modell, worauf sich ein „sie“ oder ein „dort“ bezieht, auch wenn der Bezug mehrere Sätze zurückliegt.

Ein einfaches Beispiel

Nehmen Sie den Satz: „Die Bank am See war frisch gestrichen, deshalb setzte sich Anna nicht darauf.“ Für das Wort „Bank“ sind „See“ und „gestrichen“ wichtig, denn sie zeigen, dass es um eine Sitzbank geht und nicht um ein Geldinstitut. Für „darauf“ ist „Bank“ entscheidend. Genau diese Gewichtungen lernt Self-Attention: Jedes Token schaut auf alle anderen und verteilt seine Aufmerksamkeit.

Query, Key und Value

Technisch erzeugt das Modell für jedes Token drei Vektoren:

  • Query: Wonach sucht dieses Token gerade?
  • Key: Welche Information biete ich anderen Tokens an?
  • Value: Welchen Inhalt gebe ich weiter, wenn ich ausgewählt werde?

Das Modell vergleicht die Query eines Tokens mit den Keys aller anderen. Je besser sie zusammenpassen, desto höher das Gewicht. Anschließend werden die Values entsprechend dieser Gewichte gemischt. Das Ergebnis ist eine neue Darstellung des Tokens, die den Kontext enthält. Die Vergleiche funktionieren ähnlich wie die Ähnlichkeitsmessung bei Embeddings, die Sie mit dem Werkzeug Kosinus-Ähnlichkeit nachvollziehen können.

Multi-Head-Attention

Ein Modell rechnet nicht nur eine Attention, sondern viele parallel, sogenannte Köpfe. Jeder Kopf kann auf andere Zusammenhänge achten: einer auf grammatische Bezüge, ein anderer auf Namen, ein dritter auf die Satzstellung. Was genau ein Kopf lernt, ist nicht festgelegt und lässt sich nur teilweise untersuchen. Die Ergebnisse aller Köpfe werden zusammengeführt und an die nächste Schicht weitergegeben.

Warum lange Kontexte teuer sind

Beim klassischen Attention-Mechanismus vergleicht jedes Token sich mit jedem anderen. Verdoppelt sich die Textlänge, vervierfacht sich grob die Zahl der Vergleiche. Deshalb waren Kontextfenster früher klein. Heutige Modelle verarbeiten durch effizientere Verfahren und Zwischenspeicher teils eine Million Tokens und mehr. Trotzdem gilt: Lange Eingaben kosten Rechenzeit und Geld. Wie viel Text in ein Modell passt, zeigt der Kontextfenster-Rechner.

Was das für Ihre Prompts bedeutet

  • Klare Struktur hilft: Überschriften, Abschnitte und Markierungen wie XML-Tags machen es dem Modell leichter, relevante Stellen zu finden.
  • Wichtiges nicht verstecken: In sehr langen Eingaben werden Informationen in der Mitte manchmal weniger beachtet. Die eigentliche Frage gehört deshalb oft ans Ende, nach dem Material.
  • Unnötiges weglassen: Weniger Ballast lenkt die Aufmerksamkeit auf das Wesentliche und spart Tokens.
  • Bezüge eindeutig machen: Statt „das Dokument oben“ besser „der Vertrag in Abschnitt 2“.

Mehr zum Umgang mit langen Eingaben lesen Sie unter Kontextfenster erklärt und Context Engineering. Den Gesamtaufbau des Modells beschreibt der Beitrag Transformer-Architektur erklärt.

Attention und Halluzinationen

Attention entscheidet, welche Teile des Kontexts in die Antwort einfließen. Steht die gesuchte Information klar im mitgegebenen Material, findet das Modell sie meist zuverlässig. Fehlt sie, füllt das Modell die Lücke mit dem, was nach seinem Training wahrscheinlich klingt. Deshalb hilft der Zusatz „Antworte nur auf Grundlage des Textes oben und sage, wenn etwas dort nicht steht“ spürbar gegen erfundene Details.

Erstellt mit Unterstützung von KI, geprüft und redaktionell verantwortet von Leon Blatz. Allgemeine Information, keine Rechts-, Steuer- oder Finanzberatung.

Kontextfenster-RechnerPasst mein Dokument ins Kontextfenster? Seiten oder Wörter eingeben, für alle Modelle prüfen.
Öffnen

Auch hilfreich: Antwortzeit-Rechner · max_tokens-Rechner

Weiterlesen

Weitere Artikel

  1. Was ist ein Prompt? Bedeutung, Bestandteile und BeispieleWas ist ein Prompt? Die Eingabe an eine KI erklärt: Bestandteile eines guten Prompts, Unterschied zum Systemprompt und Beispiele für bessere Ergebnisse.
  2. Was ist Inferenz bei KI? Vom trainierten Modell zur AntwortWas ist Inferenz bei KI? Der Unterschied zwischen Training und Inferenz, warum Antworten Zeit und Geld kosten und wie Sie Inferenzkosten senken.
  3. Parameter eines Sprachmodells: Was die Milliarden-Zahlen bedeutenParameter eines Sprachmodells erklärt: Was Parameter sind, was 8B oder 70B bedeutet, wie Modellgröße Qualität, Speicherbedarf und Kosten beeinflusst.