Self-Consistency-Prompting: Mehrere Antworten, ein besseres Ergebnis
Self-Consistency-Prompting ist eine Technik, bei der ein Sprachmodell dieselbe Aufgabe mehrmals unabhängig löst und am Ende die häufigste Antwort gewählt wird. Die Idee: Ein einzelner Lösungsweg kann sich verirren, aber wenn mehrere Wege zum selben Ergebnis führen, ist es wahrscheinlicher richtig. Die Methode wurde in der Forschung vorgestellt, um Chain-of-Thought-Prompting zuverlässiger zu machen.
So funktioniert Self-Consistency
- Das Modell bekommt eine Aufgabe mit der Bitte, schrittweise zu denken.
- Die Aufgabe wird mehrfach gestellt, zum Beispiel fünfmal, mit etwas Zufall in der Textgenerierung, damit unterschiedliche Lösungswege entstehen.
- Aus jedem Durchlauf wird nur die Endantwort entnommen.
- Die Antwort, die am häufigsten vorkommt, gilt als Ergebnis.
Wichtig ist der Zufall in Schritt 2. Mit Temperatur null liefert ein Modell oft immer denselben Weg, und die Mehrheitsentscheidung bringt nichts. Was die Temperatur bewirkt, erklärt der Ratgeber Temperatur und Top-p.
Wofür die Technik geeignet ist
Self-Consistency eignet sich für Aufgaben mit einer eindeutigen Endantwort:
- Rechen- und Logikaufgaben,
- Klassifizierungen, etwa Kategorie einer Kundenanfrage,
- Ja/Nein-Entscheidungen, etwa ob ein Vertrag eine bestimmte Klausel enthält,
- Datenextraktion mit festen Feldern.
Für offene Aufgaben wie Texte schreiben passt die Methode nicht direkt, weil es keine „häufigste“ Antwort gibt. Dort kann man stattdessen mehrere Entwürfe erzeugen und das Modell oder einen Menschen den besten auswählen lassen.
Self-Consistency im Chat anwenden
Auch ohne Programmierung lässt sich die Idee nutzen. Stellen Sie eine kritische Frage in drei neuen Chats oder lassen Sie die Antwort mehrmals neu generieren. Stimmen die Ergebnisse überein, ist das ein gutes Zeichen. Weichen sie ab, ist die Frage für das Modell offenbar schwierig, und Sie sollten genauer prüfen. Diese Abweichung ist selbst eine nützliche Information: Sie zeigt Unsicherheit, die eine einzelne Antwort verbirgt.
Umsetzung über die API
In Anwendungen wird die Technik meist so umgesetzt: Ein Programm schickt dieselbe Anfrage mehrmals, liest aus jeder Antwort das Endergebnis aus, etwa ein Feld in JSON, und zählt die Stimmen. Bei Gleichstand kann ein weiterer Durchlauf entscheiden oder der Fall an einen Menschen gehen. Damit das Auslesen zuverlässig klappt, sollte das Endergebnis in einem festen Format stehen; siehe Ausgabeformat im Prompt.
Kosten und Nutzen abwägen
Fünf Durchläufe kosten etwa fünfmal so viele Tokens, bei Reasoning-Modellen mit langen Denkphasen entsprechend mehr. Was das für Ihre Anfragen bedeutet, rechnet der Kostenrechner aus; für Modelle mit Denk-Tokens hilft der Reasoning-Kostenrechner. Sinnvoll ist die Technik deshalb vor allem dort, wo Fehler teuer sind und Antworten automatisiert weiterverarbeitet werden.
Self-Consistency und Reasoning-Modelle
Moderne Reasoning-Modelle denken vor der Antwort intern ausführlich nach und prüfen dabei teils selbst mehrere Wege. Für sie ist der Zusatznutzen von Self-Consistency oft geringer als bei einfachen Modellen. Ob es sich lohnt, zeigt nur ein Test mit Ihren Aufgaben. Mehr zu diesen Modellen im Ratgeber Reasoning-Modelle. Eine verwandte Technik, bei der Lösungswege nicht nur parallel erzeugt, sondern verzweigt und bewertet werden, ist das Tree-of-Thought-Prompting.
Erstellt mit Unterstützung von KI, geprüft und redaktionell verantwortet von Leon Blatz. Allgemeine Information, keine Rechts-, Steuer- oder Finanzberatung.