OpenAI veröffentlicht 722 Mathe-Manuskripte eines internen Modells
OpenAI hat 722 mathematische Manuskripte in einem öffentlichen GitHub-Verzeichnis veröffentlicht. Sie stammen von einem internen, noch nicht veröffentlichten Modell, das rund 4.000 Probleme bearbeitet hat.
Die Arbeiten verteilen sich auf 372 Ergebnisfamilien. Pro Ergebnis rechnete das Modell im Schnitt etwa drei Stunden. Zu zehn Familien gibt es gekürzte Zusammenfassungen des Lösungswegs. Zwei Ergebnisse, darunter eines zur Riemannschen Zetafunktion, liefen außerhalb des Standardverfahrens, ein Text wurde von Menschen sprachlich überarbeitet.
OpenAI beschreibt das Projekt als Nebenprodukt der Modellbewertung: Die bisherigen Mathematik-Tests seien ausgereizt gewesen. Nicht alle Beweise sind im Beweisassistenten Lean formalisiert, und OpenAI weist selbst darauf hin, dass ungeprüfte Ergebnisse Fehler enthalten könnten. Laut Scientific American entstand der Großteil aus einem einzigen Auftrag an einen Agenten. Der Informatiker Scott Aaronson verweist auf einen Lean-geprüften Beweis im Umfeld der Unique-Games-Vermutung.
Die Ergebnisse zeigen, wie weit Reasoning-Modelle inzwischen kommen, aber auch, dass Prüfung unverzichtbar bleibt. Wie solche Modelle arbeiten, erklärt Reasoning-Modelle; zu ihren Grenzen beim Rechnen siehe Kann KI rechnen?.
Quellen
Eigene Zusammenfassung auf Grundlage der genannten Quellen, erstellt mit Unterstützung von KI, geprüft und redaktionell verantwortet von Leon Blatz. Illustration: Tokenlabor, per Programm gezeichnet, kein KI-Bild.


