KI-Trainingsdaten: Woher das Wissen von Sprachmodellen stammt

2 Min. LesezeitStand 08.10.2026Mit KI erstellt · redaktionell geprüft

KI-Trainingsdaten sind die Texte, Bilder, Programmcodes und anderen Inhalte, aus denen ein Modell lernt. Ihr Umfang, ihre Qualität und ihre Zusammensetzung bestimmen maßgeblich, was ein Modell kann, welche Sprachen es beherrscht und welche Verzerrungen es übernimmt.

Woher die Daten stammen

Große Sprachmodelle werden typischerweise mit einer Mischung aus mehreren Quellen trainiert:

  • Öffentliche Webseiten: gesammelt durch Web-Crawling, also automatisches Abrufen von Seiten.
  • Bücher und wissenschaftliche Texte, soweit verfügbar oder lizenziert.
  • Programmcode aus öffentlichen Quellen.
  • Lizenzierte Inhalte, etwa aus Verträgen mit Verlagen oder Plattformen.
  • Synthetische Daten, die andere Modelle erzeugt haben, siehe Synthetische Daten.
  • Von Menschen erstellte Beispiele für das Nachtraining, etwa Musterantworten und Bewertungen.

Welche Quellen genau verwendet wurden, legen die großen Anbieter nur teilweise offen.

Vom Rohmaterial zum Datensatz

Rohdaten aus dem Netz sind voller Dubletten, Werbung, Spam und fehlerhafter Texte. Bevor daraus ein Datensatz wird, durchlaufen sie mehrere Schritte:

  1. Dubletten entfernen, damit häufig kopierte Texte nicht übergewichtet werden.
  2. Minderwertige Inhalte herausfiltern, oft mit Hilfe anderer Modelle.
  3. Persönliche Daten und problematische Inhalte reduzieren.
  4. Die Mischung festlegen: wie viel Code, wie viel Fachtext, welche Sprachen.

Die Datenqualität gilt inzwischen als einer der wichtigsten Hebel für bessere Modelle. Gut aufbereitete Daten bringen oft mehr als einfach mehr Daten.

Vortraining und Nachtraining

Im Vortraining lernt das Modell aus riesigen Textmengen, das nächste Token vorherzusagen. Dabei entstehen Sprachgefühl und Weltwissen. Im Nachtraining kommen kleinere, sorgfältig erstellte Datensätze zum Einsatz: Beispieldialoge, Bewertungen von Antworten durch Menschen und Regeln für sicheres Verhalten. Mehr dazu unter RLHF erklärt.

Folgen für die Praxis

  • Wissensstand: Was nach dem Ende der Datensammlung passiert ist, kennt das Modell nicht. Siehe Wissensstichtag.
  • Sprachen: Englisch ist meist stark überrepräsentiert. Deutsch funktioniert gut, seltene Sprachen und Dialekte schlechter.
  • Verzerrungen: Einseitigkeiten in den Daten spiegeln sich in den Antworten; mehr dazu im Beitrag Bias in KI.
  • Ihre Eingaben: Ob Chat-Eingaben zum Training genutzt werden, hängt vom Tarif und den Einstellungen ab. Business-Tarife und APIs schließen das in der Regel aus.

Rechtliche Fragen und eigene Inhalte schützen

Ob und in welchem Umfang urheberrechtlich geschützte Werke für das Training verwendet werden dürfen, ist teils noch Gegenstand von Gerichtsverfahren. In der EU erlaubt das Urheberrecht Text und Data Mining grundsätzlich, Rechteinhaber können aber einen maschinenlesbaren Nutzungsvorbehalt erklären. Anbieter von KI-Modellen mit allgemeinem Verwendungszweck müssen nach der KI-Verordnung seit August 2025 unter anderem eine Zusammenfassung der Trainingsinhalte veröffentlichen. Dies ist keine Rechtsberatung; Hintergründe im Ratgeber KI und Urheberrecht.

Wer seine Website nicht für KI-Training freigeben möchte, kann KI-Crawler per robots.txt ausschließen. Der robots.txt-Generator für KI-Crawler erstellt die passenden Einträge, der TDM-Vorbehalt-Generator den Text für den Nutzungsvorbehalt.

Für Unternehmen gilt außerdem: Eigene Daten fließen nicht automatisch in ein Modell. Wer ein Modell mit firmeneigenem Wissen nutzen will, gibt die Dokumente in der Regel zur Laufzeit mit, etwa über RAG, oder trainiert per Fine-Tuning nach. Welcher Weg passt, erklärt der Ratgeber Fine-Tuning oder RAG?

Erstellt mit Unterstützung von KI, geprüft und redaktionell verantwortet von Leon Blatz. Allgemeine Information, keine Rechts-, Steuer- oder Finanzberatung.

robots.txt-Generator für KI-CrawlerGPTBot, ClaudeBot und andere KI-Crawler gezielt sperren, Suche erlauben.
Öffnen

Auch hilfreich: KI-Richtlinie-Generator · KI-Kennzeichnung-Generator

Weiterlesen

Weitere Artikel

  1. Wissensstichtag bei KI: Warum ChatGPT und Co. nicht alles Aktuelle kennenWissensstichtag bei KI erklärt: Was der Knowledge Cutoff ist, warum Modelle aktuelle Ereignisse nicht kennen und wie Websuche und eigene Quellen helfen.
  2. Warum KI jedes Mal anders antwortet: Zufall, Temperatur und KontextWarum KI jedes Mal anders antwortet: Sampling, Temperatur, Verlauf und Modellupdates erklärt. Und wie Sie Antworten gleichmäßiger und verlässlicher machen.
  3. Was ist AGI? Allgemeine künstliche Intelligenz nüchtern betrachtetWas ist AGI? Was allgemeine künstliche Intelligenz bedeutet, warum es keine einheitliche Definition gibt und wie weit heutige Sprachmodelle davon entfernt sind.