KI-Glossar

58 Begriffe rund um KI-Modelle, kurz und verständlich erklärt: von Agent über Kontextfenster und Prompt-Caching bis Zero-Shot.

A

Agent
Ein KI-System, das eine Aufgabe in mehreren Schritten selbstständig bearbeitet: Es plant, ruft Werkzeuge auf (etwa eine Suche oder ein Programm), prüft Zwischenergebnisse und macht weiter, bis das Ziel erreicht ist. Agenten verbrauchen deutlich mehr Tokens als ein einzelner Chat, weil jeder Schritt den bisherigen Verlauf erneut mitschickt.
AI Act (KI-Verordnung)
Die Verordnung (EU) 2024/1689, das europäische KI-Gesetz. Sie teilt KI-Systeme nach Risiko ein, verbietet einzelne Praktiken, stellt strenge Regeln für Hochrisiko-KI auf und verlangt Transparenz bei Chatbots und Deepfakes. Die Pflichten gelten schrittweise; nach der Änderung durch die Verordnung (EU) 2026/1744 reichen die letzten Fristen für Hochrisiko-KI bis 2028. Überblick im Ratgeber EU AI Act.
API
Programmierschnittstelle, über die Software ein KI-Modell direkt anspricht, statt über ein Chatfenster. Abgerechnet wird pro Token, getrennt nach Eingabe und Ausgabe. Was das kostet, zeigt der Kostenrechner.
Attention (Aufmerksamkeit)
Der Mechanismus im Transformer, mit dem ein Modell für jedes Token abwägt, welche anderen Tokens im Kontext gerade wichtig sind. Er ist der Grund, warum Sprachmodelle Zusammenhänge über lange Texte hinweg erfassen können, und auch, warum sehr lange Kontexte rechenintensiv sind.
Ausgabe-Tokens
Die Tokens, die ein Modell als Antwort erzeugt. Sie kosten bei fast allen Anbietern vier- bis fünfmal so viel wie Eingabe-Tokens, weil das Modell sie einzeln nacheinander berechnen muss. Kurze Antworten sind deshalb der einfachste Sparhebel.

B

Batch-API
Ein Abrechnungsweg für Anfragen, die nicht sofort beantwortet werden müssen. Man schickt viele Anfragen gesammelt und erhält die Ergebnisse innerhalb von Stunden. Dafür gibt es bei Anthropic, OpenAI, Google und Mistral meist 50 Prozent Rabatt. Der Spar-Rechner zeigt die Ersparnis.
Benchmark
Ein standardisierter Test, mit dem Modelle verglichen werden, etwa bei Mathematik, Programmieren oder Textverständnis. Benchmarks sind ein Anhaltspunkt, ersetzen aber keinen Test mit den eigenen Aufgaben, weil Modelle auf bekannte Tests hin optimiert sein können.

C

Chain of Thought
Eine Technik, bei der das Modell vor der Antwort Zwischenschritte formuliert. Bei älteren Modellen half die Aufforderung „Denke Schritt für Schritt“ spürbar. Aktuelle Modelle mit eingebautem Nachdenken (Reasoning) tun das ohnehin; die Anweisung ist dort meist überflüssig.
Copilot Credits
Die Abrechnungseinheit von Microsoft Copilot Studio. Jeder Vorgang eines Agenten kostet eine feste Zahl an Credits, etwa 1 für eine klassische und 2 für eine generative Antwort. Gekauft werden sie als Kapazitätspaket oder per Pay-as-you-go. Umrechnung in Euro im Copilot-Credits-Rechner.
Copilot Studio
Microsofts Werkzeug zum Bauen eigener KI-Agenten auf Basis der Power Platform. Agenten nutzen Wissensquellen wie SharePoint, führen Aktionen über Konnektoren aus und werden in Teams, Microsoft 365 Copilot oder auf Websites veröffentlicht. Mehr im Bereich Copilot Studio.

D

Dataverse
Die Datenplattform der Microsoft Power Platform. Copilot Studio speichert dort Agenten, Gesprächsdaten und hochgeladene Dateien; Dataverse-Tabellen lassen sich außerdem als Wissensquelle eines Agenten nutzen.
Deepfake
Ein mit KI erzeugtes oder verändertes Bild, Video oder Tondokument, das echte Personen, Orte oder Ereignisse täuschend echt darstellt. Nach der KI-Verordnung müssen Deepfakes seit dem 2. August 2026 als künstlich gekennzeichnet werden; passende Hinweise erzeugt der KI-Kennzeichnung-Generator.
Destillation
Ein Verfahren, bei dem ein kleines Modell lernt, die Antworten eines großen Modells nachzuahmen. So entstehen günstige, schnelle Modelle, die für viele Aufgaben fast so gut sind wie ihre großen Vorbilder.
DLP-Richtlinie
Data Loss Prevention: Regeln, die verhindern, dass Daten in falsche Systeme gelangen. In der Power Platform legen DLP-Richtlinien fest, welche Konnektoren, Wissensquellen und Kanäle Copilot-Studio-Agenten nutzen dürfen.

E

Eingabe-Tokens
Alles, was an das Modell geschickt wird: Systemprompt, Gesprächsverlauf, Dokumente, Werkzeugbeschreibungen und die eigentliche Frage. In Chats wächst die Eingabe mit jeder Runde, weil der ganze Verlauf erneut mitgeht. Zählen lässt sie sich mit dem Token-Zähler.
Embedding
Eine Zahlenreihe (Vektor), die die Bedeutung eines Textes abbildet. Ähnliche Texte bekommen ähnliche Vektoren. Embeddings sind die Grundlage für semantische Suche und für RAG, also das Heraussuchen passender Dokumentstellen.

F

Feinabstimmung (Fine-Tuning)
Das Nachtrainieren eines fertigen Modells mit eigenen Beispielen, damit es einen bestimmten Stil oder ein Format zuverlässiger trifft. Für Wissen ist Fine-Tuning selten der richtige Weg; dafür eignet sich RAG besser.
Few-Shot-Prompting
Man gibt im Prompt einige Beispiele für Eingabe und gewünschte Ausgabe mit. Das Modell erkennt das Muster und wendet es auf den neuen Fall an. Besonders hilfreich bei festen Formaten. Jedes Beispiel kostet allerdings bei jeder Anfrage Tokens.
Function Calling (Tool Use)
Die Fähigkeit eines Modells, statt einer Textantwort einen strukturierten Aufruf eines Werkzeugs zu erzeugen, etwa „suche_wetter(ort='Freiburg')“. Die Anwendung führt das Werkzeug aus und gibt das Ergebnis zurück. Die Werkzeugbeschreibungen zählen als Eingabe-Tokens.

G

Generative Orchestrierung
Arbeitsweise von Copilot-Studio-Agenten, bei der ein Sprachmodell anhand von Beschreibungen selbst entscheidet, welche Wissensquellen, Themen und Werkzeuge es für eine Anfrage nutzt. Gegenstück ist die klassische Orchestrierung über Trigger-Phrasen.
Guardrails
Schutzregeln rund um ein KI-System, die unerwünschte Eingaben oder Ausgaben abfangen, zum Beispiel vertrauliche Daten, beleidigende Inhalte oder Antworten außerhalb des Themas. Sie können im Prompt, im Modell selbst oder als eigene Prüfschicht umgesetzt werden.

H

Halluzination
Eine überzeugend formulierte, aber falsche Aussage des Modells, etwa erfundene Zahlen, Quellen oder Urteile. Halluzinationen lassen sich reduzieren, indem man Material mitgibt, das Modell anweist, Unsicherheit offen zu sagen, und Ergebnisse prüft.
Hochrisiko-KI
KI-Systeme, die die KI-Verordnung als besonders riskant einstuft, etwa für Personalauswahl, Kreditprüfung, Bildung oder kritische Infrastruktur. Für sie gelten strenge Pflichten zu Risikomanagement, Dokumentation, Datenqualität und menschlicher Aufsicht, nach der Fristverschiebung von 2026 für eigenständige Systeme ab dem 2. Dezember 2027.

I

Inferenz
Das Ausführen eines trainierten Modells, also das eigentliche Beantworten einer Anfrage. Die API-Preise der Anbieter sind Inferenzkosten: Sie bezahlen die Rechenzeit, die Ihre Anfrage verursacht.

J

Jailbreak
Der Versuch, ein Modell durch geschickte Formulierungen dazu zu bringen, seine Sicherheitsregeln zu umgehen. Anbieter trainieren ihre Modelle laufend dagegen; für eigene Anwendungen sind zusätzliche Guardrails sinnvoll.

K

Kapazitätspaket
Monatliches Kontingent an Copilot Credits für Copilot Studio, das für den ganzen Mandanten gekauft und auf Umgebungen verteilt wird. Nicht verbrauchte Credits verfallen am Monatsende. Ob ein Paket günstiger ist als Pay-as-you-go, zeigt der Copilot-Studio-Kostenrechner.
KI-Kompetenz
Nach Art. 4 der KI-Verordnung müssen Anbieter und Betreiber von KI-Systemen Maßnahmen ergreifen, um die KI-Kompetenz ihrer Beschäftigten zu fördern. Seit der Änderung vom 27. Juli 2026 ist klargestellt, dass kein bestimmtes Kompetenzniveau garantiert werden muss; Details im Ratgeber KI-Kompetenz.
Kontextfenster
Die maximale Menge an Tokens, die ein Modell in einer Anfrage verarbeiten kann, Eingabe und Ausgabe zusammen. Aktuelle Modelle schaffen 128.000 bis über eine Million Tokens. Mehr im Artikel Kontextfenster erklärt.

L

Latenz
Die Wartezeit bis zur Antwort. Sie hängt von der Modellgröße, der Länge der Eingabe, der Länge der Antwort und davon ab, ob das Modell vorher nachdenkt. Kleine Modelle und Streaming sorgen für gefühlt schnellere Antworten.
LLM (Large Language Model)
Ein großes Sprachmodell, das auf riesigen Textmengen trainiert wurde und Text versteht und erzeugt. GPT, Claude, Gemini, DeepSeek, Grok und Mistral sind LLMs. Eine Übersicht mit Preisen steht unter Modelle.

M

MCP (Model Context Protocol)
Ein offener Standard, über den KI-Anwendungen einheitlich auf externe Werkzeuge und Datenquellen zugreifen, zum Beispiel auf Kalender, Datenbanken oder Dateiablagen. Statt jede Anbindung einzeln zu bauen, spricht die Anwendung einen MCP-Server an.
Multimodal
Ein Modell, das neben Text auch andere Eingaben versteht, etwa Bilder, PDFs, Audio oder Video. Bilder werden intern ebenfalls in Tokens umgerechnet; was das kostet, zeigt der Bild-Token-Rechner.

O

Open-Weight-Modell
Ein Modell, dessen Gewichte veröffentlicht sind, sodass man es auf eigener Hardware betreiben kann. Das bringt Kontrolle über Daten und Kosten, verlangt aber eigene Rechenleistung und Betrieb.

P

Parameter
Die gelernten Zahlenwerte eines Modells, oft in Milliarden angegeben. Mehr Parameter bedeuten meist mehr Fähigkeiten, aber auch höhere Kosten pro Anfrage. Viele Anbieter nennen die Parameterzahl ihrer Modelle nicht mehr.
Pay-as-you-go
Abrechnung nach tatsächlichem Verbrauch ohne Vorauszahlung. In Copilot Studio werden Copilot Credits dabei über ein Azure-Abonnement berechnet; pro Credit ist das teurer als ein Kapazitätspaket, verfällt aber nicht.
Prompt
Die Eingabe an ein Sprachmodell: Aufgabe, Kontext, Material und Vorgaben zur Form. Wie ein guter Prompt aufgebaut ist, steht im Ratgeber Gute Prompts schreiben; fertige Beispiele liefern die Prompt-Vorlagen.
Prompt Injection
Ein Angriff, bei dem versteckte Anweisungen in Texten, Webseiten oder Dokumenten das Modell dazu bringen sollen, etwas anderes zu tun als vorgesehen. Wer Modelle mit fremden Inhalten arbeiten lässt, sollte deren Rechte begrenzen und Ergebnisse prüfen.
Prompt-Caching
Wiederkehrende Teile eines Prompts, etwa ein langer Systemprompt oder ein Dokument, werden beim Anbieter zwischengespeichert. Bei späteren Anfragen kosten diese Tokens nur einen Bruchteil, oft ein Zehntel. Voraussetzung: Der gleichbleibende Teil steht am Anfang. Siehe Spar-Rechner.
Prompt-Engineering
Das gezielte Formulieren und Testen von Prompts, damit ein Modell zuverlässig gute Ergebnisse liefert. Im Kern geht es um klare Aufgaben, ausreichend Kontext, passende Beispiele und eindeutige Formatvorgaben. Der Prompt-Prüfer hilft beim Überarbeiten.

Q

Quantisierung
Das Speichern der Modellgewichte mit geringerer Genauigkeit, etwa 8 oder 4 Bit statt 16 Bit. Das Modell wird kleiner und schneller, verliert aber meist etwas Qualität. Vor allem beim Betrieb auf eigener Hardware üblich.

R

RAG (Retrieval-Augmented Generation)
Ein Verfahren, bei dem vor der Antwort passende Stellen aus eigenen Dokumenten herausgesucht und dem Modell mitgegeben werden. So antwortet es auf Basis aktueller, eigener Informationen und halluziniert weniger, ohne dass man das ganze Archiv in den Kontext laden muss.
Rate Limit
Die Obergrenze, wie viele Anfragen oder Tokens man pro Minute an eine API schicken darf. Wer sie überschreitet, erhält eine Fehlermeldung und muss kurz warten. Die Grenzen steigen meist mit dem bisherigen Umsatz beim Anbieter.
Reasoning (Nachdenken)
Modelle, die vor der eigentlichen Antwort intern überlegen. Das verbessert Ergebnisse bei Mathematik, Programmierung und Analysen deutlich. Die Denk-Tokens werden meist als Ausgabe-Tokens abgerechnet, auch wenn man sie nicht sieht.

S

Streaming
Die Antwort wird Stück für Stück übertragen, während das Modell sie erzeugt, statt am Ende komplett. Die Gesamtdauer ändert sich nicht, aber man sieht sofort etwas. Kosten entstehen genauso wie ohne Streaming.
Strukturierte Ausgabe
Das Modell antwortet garantiert in einem vorgegebenen Format, zum Beispiel als JSON nach einem festen Schema. Das ist ideal, wenn die Antwort maschinell weiterverarbeitet wird, und spart oft Tokens gegenüber Fließtext.
Systemprompt
Eine Anweisung, die vor dem Gespräch steht und Rolle, Ton und Regeln festlegt, zum Beispiel für einen Kundenservice-Bot. Sie wird bei jeder Anfrage mitgeschickt und kostet entsprechend. Lange Systemprompts lohnen sich zu cachen. Eine Vorlage gibt es unter Systemprompt für einen Assistenten.

T

Temperatur
Ein Einstellwert, der steuert, wie zufällig ein Modell formuliert. Niedrige Werte liefern vorhersehbare, gleichbleibende Antworten, hohe Werte mehr Abwechslung. Bei manchen aktuellen Modellen ist der Wert fest vorgegeben.
Thema (Topic)
Ein fest gebauter Gesprächsablauf in Copilot Studio, etwa „Urlaub beantragen“, mit Fragen, Bedingungen und Nachrichten. Im klassischen Modus startet ein Thema, wenn die Nutzereingabe zu seinen Trigger-Phrasen passt.
Token
Die kleinste Einheit, in der Sprachmodelle Text verarbeiten und abrechnen: ein Wort, ein Wortteil oder ein Satzzeichen. Ein deutsches Wort entspricht im Schnitt etwa 1,3 bis 1,6 Tokens. Ausführlich im Artikel Was sind Tokens?
Tokenizer
Das Verfahren, das Text in Tokens zerlegt. Jeder Anbieter hat einen eigenen, deshalb hat derselbe Text bei verschiedenen Modellen unterschiedlich viele Tokens. Der Token-Zähler zeigt die Zerlegung Token für Token.
Top-p
Ein Einstellwert, der festlegt, aus wie vielen wahrscheinlichen Wörtern das Modell beim nächsten Schritt auswählt. Wie die Temperatur steuert er die Vielfalt der Antworten. Meist reicht es, nur einen der beiden Werte anzupassen.
Transformer
Die Architektur, auf der praktisch alle heutigen Sprachmodelle beruhen. Sie wurde 2017 vorgestellt und verarbeitet Text mithilfe von Attention parallel statt Wort für Wort, was das Training auf riesigen Datenmengen erst möglich gemacht hat.
Trigger-Phrase
Beispielsatz, an dem Copilot Studio im klassischen Modus erkennt, welches Thema eine Nutzereingabe meint. Bewährt sind 5 bis 10 unterschiedliche, kurze Formulierungen je Thema. Überschneidungen findet der Trigger-Phrasen-Prüfer.

U

Umgebung (Power Platform)
Ein abgegrenzter Bereich der Power Platform mit eigener Region, eigenen Daten, Berechtigungen und Regeln. Copilot-Studio-Agenten leben in einer Umgebung; üblich ist eine Trennung in Entwicklung, Test und Produktion.

V

Vektordatenbank
Eine Datenbank, die Embeddings speichert und sehr schnell die ähnlichsten Einträge zu einer Anfrage findet. Sie ist das Herzstück vieler RAG-Anwendungen, etwa eines Chatbots, der auf Firmendokumente zugreift.

W

Wissensquelle
Inhalt, aus dem ein KI-Agent Antworten erzeugt, etwa eine SharePoint-Bibliothek, hochgeladene Dateien, eine Website oder eine Datenbank. In Copilot Studio gelten je Quellenart eigene Grenzen; prüfen lässt sich das mit dem Wissensquellen-Check.
Wissensstichtag (Knowledge Cutoff)
Der Zeitpunkt, bis zu dem die Trainingsdaten eines Modells reichen. Ereignisse danach kennt das Modell nicht, es sei denn, es bekommt sie über eine Websuche oder mitgelieferte Dokumente.

Z

Zero-Shot-Prompting
Das Modell bekommt eine Aufgabe ohne Beispiele und soll sie allein aus der Beschreibung lösen. Aktuelle Modelle sind darin sehr gut; Beispiele (Few-Shot) helfen vor allem bei ungewöhnlichen Formaten.