OpenAI publiceerde 722 wiskundige manuscripten geproduceerd door een nog niet vrijgegeven intern grensmodel, waarbij de volledige collectie in een openbare GitHub-repository werd geplaatst onder een Apache-2.0-licentie. De release, aangekondigd op 6 oktober 2026 in een onderzoekspost met de titel "Sharing AI progress in Maths", is een van de grootste stortplaatsen van door AI gegenereerde wiskundige resultaten tot nu toe, en wordt geleverd met formele Lean proof-checks, verkorte redeneringssamenvattingen en ongebruikelijke details over hoeveel rekenkracht elk resultaat verbruikt.

De zet komt terecht in een veld dat al op scherp staat. De New York Times meldde dat de release een wiskundige gemeenschap nog meer in beroering bracht die maanden heeft geworsteld met AI-systemen die serieuze onderzoeksresultaten opleverden, terwijl Scientific American OpenAI beschreef als het loslaten van "honderden meer wiskundige resultaten op een veld dat al in shock was". Voor lezers die de laatste AI-onderzoeksontwikkelingen volgen, is de release een testcase voor hoe grenslaboratoria door machines gegenereerde wetenschap delen zonder kredietconflicten te veroorzaken.

Wat zit er in de repository

De collectie bevindt zich in de openai/math-repository op GitHub. Volgens de README bestaat de inhoud uit wiskundige manuscripten en ondersteunende bewijsartefacten geproduceerd door een intern OpenAI-model, samengesteld als onderdeel van modelontwikkelingsevaluaties van open onderzoeksproblemen. De huidige catalogus bevat 722 manuscripten, georganiseerd in 372 families, waarbij een familie gerelateerde artikelen groepeert die een hoofdresultaat, begeleidende argumenten, consequenties of alternatieve bewijzen kunnen bevatten, elk ingedeeld naar wiskundige discipline.

Een preprint-directory bevat pdf's, bronbestanden en citatie- en bouwinstructies per manuscript. Een Lean-bibliotheek catalogiseert de formele proefdrukken samen met de bijbehorende papieren en verificatieconfiguraties. Niet elk manuscript is geformaliseerd: veel resultaten bevatten bijbehorende formalisaties in Lean, de programmeertaal waarmee computers proefdrukken regel voor regel kunnen controleren, maar de README waarschuwt dat sommige niet-geformaliseerde resultaten problemen kunnen bevatten. OpenAI zegt dat het dergelijke problemen snel zal oplossen, en dat het zich ertoe zal verbinden de openbare releasegeschiedenis van de collectie te behouden, correcties en herzieningen als nieuwe versies vast te leggen en tegelijkertijd eerdere versies toegankelijk te houden. Elke manuscriptdirectory bevat ook een BibTeX-blok voor citatie.

Hoe de resultaten werden geproduceerd

De overgrote meerderheid van de resultaten kwam voort uit één vaste procedure waarbij gebruik werd gemaakt van een nog niet vrijgegeven intern OpenAI-model. In de loop van de evaluatie kreeg het model ongeveer 4.000 problemen voorgelegd. OpenAI meldt dat het gemiddelde gepubliceerde resultaat het equivalent van ongeveer drie uur aan ChatGPT Pro-denkcomputers in beslag nam, een niveau van transparantie dat nog steeds zeldzaam is in de branche. Het bedrijf zegt dat het deze evaluaties heeft uitgebreid nadat de prestaties op de bestaande wiskundige benchmarks verzadigd waren, en dat sommige resultaten voortbouwen op eerdere resultaten van zijn eigen modellen. Door een passend significantieniveau te vereisen en de ruwe output in families en manuscripten te aggregeren, ontstond de gepubliceerde catalogus.

Twee genoemde uitzonderingen weken af ​​van die procedure: werkzaamheden voor het vaststellen van een nulvrij gebied voor de Riemann-zetafunctie, waarbij de beschrijving de Re(s)> 11/12-regio door mensen bewerkt voor leesbaarheid, en een bewijs van het Hodge-vermoeden voor CM-abelse variëteiten. Beide zijn serieuze reguliere wiskunde, en beide zullen nu te maken krijgen met kritisch onderzoek door de gemeenschap.

Er worden ook tien verkorte samenvattingen van de redenering van het model gepubliceerd. Ze behandelen resultaten waaronder de irrationaliteitsexponent van pi, de symmetrische en algemene vermoedens van Mahler, het isomorfisme van vrije groepsfactoren, quasipolynomiale grenzen voor rekenkundige progressies, Kaplansky's vermoeden van directe eindigheid in karakteristiek twee, de Mezard-Parisi-formule voor verdunde spinglazen, spontane magnetisatie in de kwantum Heisenberg-ferromagneet en het driedimensionale relativistische Vlasov-Maxwell-systeem.

Een adviesgroep heeft geholpen de vrijgave vorm te geven

OpenAI zegt dat het de onafhankelijke adviesgroep voor wiskunde en kunstmatige intelligentie van het Institute for Advanced Study heeft geraadpleegd bij het ontwikkelen van best practices voor het delen van resultaten. Die groep publiceerde haar aanbevelingen voor verantwoorde vrijgave op 29 september 2026, na ontvangst van meer dan 600 antwoorden van de wiskundige gemeenschap. De aanbevelingen zijn bot: "we onderschrijven deze praktijk niet, en we vragen hen te stoppen met het testen van geavanceerde wiskundige problemen op propriëtaire modellen." De groep dringt er bij laboratoria op aan om resultaten te deponeren in wetenschappelijke opslagplaatsen die geen AI-laboratorium beheert, om persistente citeerbare identificatiegegevens toe te wijzen, om de modelnaam, de gebruikte aanwijzingen en samengevatte redeneerketens openbaar te maken, en om het vrijgeven van resultaten niet als marketinginstrumenten te behandelen.

De release van OpenAI is duidelijk een poging om aan dat raamwerk te voldoen in plaats van het te trotseren. Of de gemeenschap het accepteert, is een andere vraag. In het onderzoek van de adviesgroep werd specifiek gevraagd naar een scenario waarin een laboratorium het bestaan ​​van veel resultaten aankondigt zonder details te verstrekken, en de aanbevelingen die naar voren kwamen weerspiegelen een diepe bezorgdheid over aankondigingen die de verificatie te boven gaan.

De verificatielast verschuift naar wiskundigen

De praktische uitdaging ligt nu bij werkende wiskundigen. Formele Lean-proofs kunnen mechanisch worden gecontroleerd en de aanwezigheid ervan verlaagt de kans op fouten aanzienlijk. Maar manuscripten zonder formalisering, die de README zelf als potentieel gebrekkig bestempelt, vereisen traditionele peer review, en 722-manuscripten gaan veel verder dan wat de gemeenschap snel kan verwerken. Er is ook de kwestie van prioriteit en eer: wiskundigen die jarenlang aan deze problemen hebben gewerkt, zullen precies willen weten wat er aan het model werd gevraagd, wat het werd gegeven en of er enig menselijk resultaat in was verwerkt. OpenAI's publicatie van promptsamenvattingen en rekenstatistieken is bedoeld om een ​​aantal van deze vragen vooraf te beantwoorden.

De release bevat ook een sjabloon dat concurrenten mogelijk moeten volgen. Anthropic, Google DeepMind en andere laboratoria met grensmodellen die wiskunde op onderzoeksniveau kunnen uitvoeren, worden nu geconfronteerd met een de facto norm, verwoord door de adviesgroep, dat resultaten die verborgen zijn in bedrijfseigen modellen ofwel met de volledige herkomst moeten worden vrijgegeven, ofwel helemaal niet moeten worden geplaagd.

Voorlopig is de repository live, zijn de formaliseringsinspanningen aan de gang en worden correcties openbaar gemaakt. Of dit het standaard draaiboek wordt voor door AI gegenereerde wiskunde, of een nieuw brandpunt in een steeds groter wordend conflict tussen laboratoria en de onderzoeksgemeenschappen waar ze gebruik van maken, zal afhangen van hoe de komende weken van onderzoek zullen verlopen.

Blijf de AI-curve een stap voor

Door AI gegenereerde wetenschap evolueert van persbericht naar peer review. Volg het laatste AI-nieuws op aibuzzwire.news voor berichtgeving over elke belangrijke onderzoeksrelease, modellancering en beleidswijziging.

Lees meer AI-nieuws →