Diffusionsmodelle erklärt: Wie KI-Bildgeneratoren Bilder aus Rauschen formen
Diffusionsmodelle sind die Technik hinter den meisten KI-Bildgeneratoren. Sie erzeugen Bilder, indem sie aus zufälligem Rauschen Schritt für Schritt ein klares Motiv herausarbeiten, gesteuert durch Ihre Textbeschreibung. Das Verfahren wird auch für Videos und Audio eingesetzt.
Das Prinzip in zwei Richtungen
Ein Diffusion Model lernt im Training eine scheinbar seltsame Aufgabe: Rauschen entfernen.
- Vorwärts: Zu einem echten Bild wird schrittweise Rauschen hinzugefügt, bis nur noch Pixelsalat übrig ist.
- Rückwärts: Das Modell lernt, aus einem verrauschten Bild vorherzusagen, wie es ein bisschen weniger verrauscht aussähe.
Hat das Modell das an sehr vielen Bildern gelernt, kann es mit reinem Rauschen beginnen und in vielen kleinen Schritten ein neues Bild erzeugen, das es so nie gesehen hat.
Wie der Text das Bild steuert
Damit nicht irgendein Bild entsteht, wird der Prompt in einen Zahlenvektor übersetzt, ähnlich wie bei Embeddings. Bei jedem Schritt der Entrauschung berücksichtigt das Modell diese Beschreibung. Trainiert wurde es mit Bildern und dazugehörigen Bildbeschreibungen. So hat es gelernt, welche Bildmerkmale zu Wörtern wie „Leuchtturm“, „Aquarell“ oder „Abendlicht“ passen.
Latente Diffusion: der Trick für Tempo
Bilder mit vielen Millionen Pixeln direkt zu entrauschen, wäre sehr aufwendig. Viele Modelle arbeiten deshalb in einem komprimierten Zwischenraum, dem latenten Raum. Erst am Ende wird das Ergebnis in ein echtes Bild umgerechnet. Dieses Verfahren machte Stable Diffusion bekannt und ermöglichte Bildgenerierung auf handelsüblichen Grafikkarten.
Diffusion und Sprachmodelle
Nicht jeder Bildgenerator ist ein reines Diffusionsmodell. Manche Systeme kombinieren Diffusion mit Transformer-Bausteinen, andere erzeugen Bilder direkt in einem multimodalen Sprachmodell. Für Nutzer ist der Unterschied vor allem spürbar bei der Textdarstellung im Bild und beim Befolgen langer Anweisungen, wo neuere Systeme deutlich besser geworden sind. Mehr zu Modellen, die mehrere Medien verarbeiten, im Beitrag Multimodale KI.
Gute Bild-Prompts
- Motiv: Was ist zu sehen, und was tut es?
- Stil: Foto, Illustration, Aquarell, 3D-Grafik.
- Licht und Stimmung: Morgenlicht, Studiobeleuchtung, düster.
- Bildaufbau: Nahaufnahme, Vogelperspektive, Querformat.
- Ausschlüsse: Was nicht im Bild sein soll, sofern das Werkzeug das unterstützt.
Der Bild-Prompt-Generator setzt diese Bausteine zusammen. Mehr Tipps im Ratgeber Bild-Prompts schreiben.
Rechte und Kennzeichnung
Ob KI-Bilder urheberrechtlich geschützt sind und ob Trainingsdaten rechtmäßig genutzt wurden, ist in Teilen noch offen. Seit dem 2. August 2026 gelten die Transparenzpflichten nach Art. 50 der KI-Verordnung: Anbieter müssen erzeugte Inhalte maschinenlesbar kennzeichnen, und wer Deepfakes veröffentlicht, muss sie als künstlich erzeugt offenlegen. Dies ist keine Rechtsberatung. Passende Hinweistexte erstellt der KI-Kennzeichnung-Generator.
Warum gleiche Prompts verschiedene Bilder ergeben
Jede Bildgenerierung startet mit anderem Zufallsrauschen. Deshalb liefert derselbe Prompt jedes Mal ein anderes Bild. Manche Werkzeuge erlauben, den Startwert, englisch Seed, festzuhalten. Dann lassen sich kleine Änderungen am Prompt gezielt vergleichen, weil der Ausgangspunkt gleich bleibt. Auch die Zahl der Entrauschungsschritte beeinflusst Qualität und Dauer: Mehr Schritte bringen mehr Details, kosten aber Zeit.
Erstellt mit Unterstützung von KI, geprüft und redaktionell verantwortet von Leon Blatz. Allgemeine Information, keine Rechts-, Steuer- oder Finanzberatung.