Synthetische Daten: Wenn KI ihre eigenen Trainings- und Testdaten erzeugt
Synthetische Daten sind künstlich erzeugte Daten, die echten Daten in Aufbau und Eigenschaften ähneln, aber nicht aus realen Vorgängen stammen. Sie werden heute in großem Umfang für das Training von KI-Modellen genutzt und helfen Unternehmen, Anwendungen zu testen, ohne echte Kundendaten zu verwenden.
Wie synthetische Daten entstehen
- Mit Sprachmodellen: Ein Modell schreibt Beispieltexte, Dialoge, Fragen und Antworten oder Aufgaben mit Lösungen.
- Mit statistischen Verfahren: Tabellendaten werden so erzeugt, dass Verteilungen und Zusammenhänge der Originaldaten erhalten bleiben.
- Mit Simulationen: etwa für Fahrzeuge, Robotik oder Produktionsanlagen.
- Durch Abwandlung: Vorhandene Daten werden verändert, etwa umformuliert oder übersetzt. Das nennt man Datenaugmentation.
Wofür KI-Anbieter sie nutzen
Hochwertige Texte aus dem Internet sind begrenzt. Synthetische Daten ergänzen sie gezielt dort, wo echte Beispiele fehlen: bei schwierigen Matheaufgaben, Programmcode mit Tests, seltenen Sprachen oder langen Arbeitsabläufen für Agenten. Auch bei der Distillation erzeugt ein großes Modell Beispiele, aus denen ein kleineres lernt. Mehr zu den übrigen Quellen im Beitrag KI-Trainingsdaten.
Nutzen für Unternehmen
- Testdaten generieren: realistische, aber erfundene Kundenanfragen, um einen Chatbot zu prüfen.
- Evaluierung: Prüffälle für Prompts und Modelle, siehe Evals für Prompts.
- Fine-Tuning: Beispielpaare für ein spezialisiertes Modell.
- Datenschutz: Entwicklung und Tests ohne echte personenbezogene Daten.
- Seltene Fälle: Randfälle und Fehlerszenarien, die in echten Daten kaum vorkommen.
Risiken und Grenzen
- Fehler werden vervielfältigt: Was das erzeugende Modell falsch macht, steckt auch in den Daten.
- Zu wenig Vielfalt: Modelle erzeugen gern ähnliche Beispiele. Echte Daten sind unordentlicher.
- Model Collapse: Forschungsarbeiten zeigen, dass Modelle schlechter werden können, wenn sie wiederholt fast nur mit Ausgaben anderer Modelle trainiert werden. Seltene Inhalte gehen dabei verloren.
- Kein Freibrief beim Datenschutz: Wenn synthetische Daten zu nah an echten Datensätzen liegen, können sich Rückschlüsse auf Personen ergeben.
- Nutzungsbedingungen: Manche Anbieter beschränken, ob ihre Ausgaben zum Training konkurrierender Modelle verwendet werden dürfen.
Testdaten selbst erstellen
Ein Prompt für einen kleinen Testdatensatz könnte so aussehen:
Erzeuge 20 erfundene Kundenanfragen an einen Fahrradhändler.
Mische: Reparatur, Lieferstatus, Rückgabe, Beschwerde, Sonstiges.
Variiere Länge, Tonfall und Rechtschreibung.
Keine echten Namen oder Adressen.
Ausgabe als JSONL mit den Feldern "text" und "kategorie".
Prüfen Sie die Ausgabe anschließend: Ist das Format gültig, sind die Kategorien sinnvoll verteilt, gibt es Dubletten? Der JSONL-Prüfer findet Formatfehler, das Werkzeug Doppelte Zeilen entfernen beseitigt Wiederholungen.
Gute Praxis
- Synthetische Daten mit echten Beispielen mischen, wenn möglich.
- Stichproben von Menschen prüfen lassen.
- Für Tests eigene, getrennte Daten verwenden, nicht dieselben wie für das Training.
- Dokumentieren, wie die Daten entstanden sind.
Für den Einstieg reicht oft ein kleiner Datensatz: 50 bis 100 gut gemischte Beispiele zeigen bereits, ob ein Chatbot oder ein Klassifizierungs-Prompt in die richtige Richtung arbeitet. Erweitern Sie den Bestand gezielt dort, wo Fehler auftreten, statt einfach tausende ähnliche Beispiele zu erzeugen. So bleibt der Datensatz überschaubar, und jede Ergänzung hat einen klaren Zweck.
Erstellt mit Unterstützung von KI, geprüft und redaktionell verantwortet von Leon Blatz. Allgemeine Information, keine Rechts-, Steuer- oder Finanzberatung.