OpenAI hat auf GitHub eine Sammlung von 722 mathematischen Studien veröffentlicht, die von einem internen KI-Modell erzeugt wurden, das das Unternehmen bisher nicht zur öffentlichen Nutzung freigegeben hat. Die Sammlung umfasst 372 Ergebnisfamilien, darunter Versuche, seit Langem ungelöste offene Probleme zu bearbeiten, wie die unabhängige Advisory Group on Mathematics and Artificial Intelligence (AGMAI) bewertet.
Die Veröffentlichung dieser Arbeiten bedeutet jedoch nicht, dass sie als endgültige mathematische Leistungen anerkannt sind. OpenAI erklärt, dass sich die Ergebnisse in unterschiedlichen Prüfphasen befinden und einige informelle Studien Fehler enthalten können. Alle benötigen eine Überprüfung durch die mathematische Gemeinschaft und eine Bestätigung über die üblichen akademischen Kanäle.
Von etwa 4.000 Problemen zu 722 Studien
Das Modell wurde während des Bewertungsprozesses mit etwa 4.000 mathematischen Problemen getestet. Nach einer Auswahl der Ergebnisse anhand ihrer Bedeutung entschied sich OpenAI für die veröffentlichte Sammlung, die aus 372 Familien und 722 Studien besteht. Das Unternehmen gibt an, dass die Erzeugung eines einzelnen Ergebnisses im Durchschnitt Rechenleistung erforderte, die etwa drei Stunden der den Nutzern von ChatGPT Pro zur Verfügung stehenden Denkzeit entspricht.
Um die Überprüfbarkeit zu verbessern, veröffentlichte OpenAI zusätzliche Daten zu 10 Problemen, darunter kurze Zusammenfassungen des Argumentationsverlaufs, Schätzungen der verwendeten Rechenleistung und die Anzahl der Probleme, deren Bearbeitung versucht wurde. Die Beispiele stammen aus verschiedenen Bereichen, darunter eine Schranke für die Irrationalität der Zahl π, Mahler-Vermutungen, die Kaplansky-Vermutung zur direkten Endlichkeit sowie das dreidimensionale relativistische Vlasov-Maxwell-System.
Die Verifikation mit Lean ist nicht umfassend
Ein bedeutender Teil der veröffentlichten Beweise wurde mit Lean überprüft, einem System zur mathematischen Verifikation, mit dem ein Computer die logische Konsistenz eines Beweises testen kann. Dennoch verfügt derzeit nicht jede Studie der Sammlung über eine formale Verifikation mit Lean.
OpenAI beabsichtigt, das GitHub-Repository zu aktualisieren, sobald die formalen Prüfungen abgeschlossen sind. Das Unternehmen erklärt, dass die meisten Ergebnisse nach einem einheitlichen Verfahren erzeugt wurden, wobei es Ausnahmen gibt: Eine der Studien zur Nullstellenfreiheit der Riemannschen Zetafunktion wurde auf andere Weise erstellt, und ihr Text wurde von einem Menschen zur Verbesserung der Lesbarkeit redigiert.
Warum ist diese Nachricht wichtig?
Der grundlegende Wert der Sammlung liegt nicht nur in der Anzahl der Studien, sondern auch darin, eine neue Methode zur Erzeugung überprüfbarer mathematischer Ergebnisse zu testen. Die Bereitstellung der Dateien, der Daten zu den Rechenkosten, der Zusammenfassungen der Argumentation und der teilweisen automatischen Verifikation liefert Forschern die Elemente, die sie benötigen, um zu bewerten, ob das Modell Entdeckungen erzeugt, die sich erneut überprüfen lassen, oder lediglich überzeugend wirkende Texte.
Gleichzeitig bestehen klare Einschränkungen: Die Verifikation ist unvollständig, die menschliche und akademische Begutachtung ist noch nicht abgeschlossen, und die Ergebnisse des Modells stellen derzeit weder ein Forschern zugängliches System noch ein öffentliches Produkt dar. AGMAI fordert KI-Unternehmen auf, mathematische Ergebnisse über akademische Kanäle zu veröffentlichen, die verwendeten Modelle, Kosten und Methoden offenzulegen und Entdeckungen nicht in ein rein marketingorientiertes Instrument zu verwandeln.
OpenAI kündigte außerdem an, Workshops, Konferenzen und spezielle Programme zu finanzieren, um wichtige von künstlicher Intelligenz erzeugte Ergebnisse zu verstehen, parallel zu den Arbeiten an einer verantwortungsvollen Bereitstellung des internen Modells. Daher stellt die aktuelle Sammlung einen experimentellen Schritt zur Dokumentation automatisch erzeugter wissenschaftlicher Ergebnisse dar und kein endgültiges Urteil über die mathematischen Fähigkeiten des Modells.