Diffusionsmodelle erklärt: Wie KI-Bildgeneratoren Bilder aus Rauschen formen

2 Min. LesezeitStand 08.10.2026Mit KI erstellt · redaktionell geprüft

Diffusionsmodelle sind die Technik hinter den meisten KI-Bildgeneratoren. Sie erzeugen Bilder, indem sie aus zufälligem Rauschen Schritt für Schritt ein klares Motiv herausarbeiten, gesteuert durch Ihre Textbeschreibung. Das Verfahren wird auch für Videos und Audio eingesetzt.

Das Prinzip in zwei Richtungen

Ein Diffusion Model lernt im Training eine scheinbar seltsame Aufgabe: Rauschen entfernen.

  1. Vorwärts: Zu einem echten Bild wird schrittweise Rauschen hinzugefügt, bis nur noch Pixelsalat übrig ist.
  2. Rückwärts: Das Modell lernt, aus einem verrauschten Bild vorherzusagen, wie es ein bisschen weniger verrauscht aussähe.

Hat das Modell das an sehr vielen Bildern gelernt, kann es mit reinem Rauschen beginnen und in vielen kleinen Schritten ein neues Bild erzeugen, das es so nie gesehen hat.

Wie der Text das Bild steuert

Damit nicht irgendein Bild entsteht, wird der Prompt in einen Zahlenvektor übersetzt, ähnlich wie bei Embeddings. Bei jedem Schritt der Entrauschung berücksichtigt das Modell diese Beschreibung. Trainiert wurde es mit Bildern und dazugehörigen Bildbeschreibungen. So hat es gelernt, welche Bildmerkmale zu Wörtern wie „Leuchtturm“, „Aquarell“ oder „Abendlicht“ passen.

Latente Diffusion: der Trick für Tempo

Bilder mit vielen Millionen Pixeln direkt zu entrauschen, wäre sehr aufwendig. Viele Modelle arbeiten deshalb in einem komprimierten Zwischenraum, dem latenten Raum. Erst am Ende wird das Ergebnis in ein echtes Bild umgerechnet. Dieses Verfahren machte Stable Diffusion bekannt und ermöglichte Bildgenerierung auf handelsüblichen Grafikkarten.

Diffusion und Sprachmodelle

Nicht jeder Bildgenerator ist ein reines Diffusionsmodell. Manche Systeme kombinieren Diffusion mit Transformer-Bausteinen, andere erzeugen Bilder direkt in einem multimodalen Sprachmodell. Für Nutzer ist der Unterschied vor allem spürbar bei der Textdarstellung im Bild und beim Befolgen langer Anweisungen, wo neuere Systeme deutlich besser geworden sind. Mehr zu Modellen, die mehrere Medien verarbeiten, im Beitrag Multimodale KI.

Gute Bild-Prompts

  • Motiv: Was ist zu sehen, und was tut es?
  • Stil: Foto, Illustration, Aquarell, 3D-Grafik.
  • Licht und Stimmung: Morgenlicht, Studiobeleuchtung, düster.
  • Bildaufbau: Nahaufnahme, Vogelperspektive, Querformat.
  • Ausschlüsse: Was nicht im Bild sein soll, sofern das Werkzeug das unterstützt.

Der Bild-Prompt-Generator setzt diese Bausteine zusammen. Mehr Tipps im Ratgeber Bild-Prompts schreiben.

Rechte und Kennzeichnung

Ob KI-Bilder urheberrechtlich geschützt sind und ob Trainingsdaten rechtmäßig genutzt wurden, ist in Teilen noch offen. Seit dem 2. August 2026 gelten die Transparenzpflichten nach Art. 50 der KI-Verordnung: Anbieter müssen erzeugte Inhalte maschinenlesbar kennzeichnen, und wer Deepfakes veröffentlicht, muss sie als künstlich erzeugt offenlegen. Dies ist keine Rechtsberatung. Passende Hinweistexte erstellt der KI-Kennzeichnung-Generator.

Warum gleiche Prompts verschiedene Bilder ergeben

Jede Bildgenerierung startet mit anderem Zufallsrauschen. Deshalb liefert derselbe Prompt jedes Mal ein anderes Bild. Manche Werkzeuge erlauben, den Startwert, englisch Seed, festzuhalten. Dann lassen sich kleine Änderungen am Prompt gezielt vergleichen, weil der Ausgangspunkt gleich bleibt. Auch die Zahl der Entrauschungsschritte beeinflusst Qualität und Dauer: Mehr Schritte bringen mehr Details, kosten aber Zeit.

Erstellt mit Unterstützung von KI, geprüft und redaktionell verantwortet von Leon Blatz. Allgemeine Information, keine Rechts-, Steuer- oder Finanzberatung.

Bild-Prompt-GeneratorBildprompts für Midjourney, DALL-E und Co. aus Motiv, Stil, Licht und Perspektive zusammenbauen.
Öffnen

Auch hilfreich: Few-Shot-Generator · Prompt-Baukasten

Weiterlesen

Weitere Artikel

  1. Spracherkennung mit KI: Wie Speech-to-Text funktioniert und wo es hilftSpracherkennung mit KI: Wie Speech-to-Text funktioniert, wie gut Transkription auf Deutsch klappt, typische Fehlerquellen und Tipps zu Datenschutz und Kosten.
  2. Text-to-Speech erklärt: Wie KI-Stimmen entstehen und wofür sie taugenText-to-Speech erklärt: Wie KI-Stimmen natürlich klingen, wofür Sprachausgabe sinnvoll ist, was beim Stimmenklonen gilt und welche Kennzeichnung nötig ist.
  3. KI-Videogenerierung: Wie Text-zu-Video funktioniert und wo die Grenzen liegenKI-Videogenerierung erklärt: Wie Videos aus Text oder Bildern entstehen, wofür sie sich eignen, wo die Grenzen liegen und welche Kennzeichnungspflichten gelten.