De problemen die Astra hielp oplossen hadden "al minstens tien jaar, en in de meeste gevallen veel langer, geen vooruitgang geboekt op hun centrale resultaten", schreef OpenAI. De resultaten bestrijken gebieden als hoogdimensionale meetkunde, coderingstheorie, rekenkundige circuitcomplexiteit, groepentheorie, kwantumcomplexiteit, roostercryptografie en extreme combinatoriek – terrein waar vooruitgang normaal gesproken in jaren wordt gemeten en niet in afzonderlijke onderzoeksruns.
Geverifieerde bewijzen, niet alleen antwoorden
Wat de output van Astra scheidt van een chatbot die naar wiskunde gokt, is verificatie. OpenAI zei dat menselijke onderzoekers hetzelfde model gebruikten om argumenten als manuscripten voor te bereiden, en Astra formaliseerde vervolgens elk argument als een Lean-certificaat. Lean is een open-source bewijsassistent die wiskundige argumenten machinaal kan controleren, wat betekent dat andere wiskundigen de resultaten niet op geloof hoeven te vertrouwen; ze kunnen binnen enkele seconden onafhankelijk door software worden geverifieerd.
Dat onderscheid is van belang. Een taalmodel kan een plausibel ogend bewijs opleveren dat een subtiele, fatale fout bevat. Door elk argument naar Lean te vertalen, zette OpenAI een marketingclaim om in een controleerbaar artefact. Volgens BleepingComputer, die de details rapporteerde, omvatten de specifieke vorderingen een bewijs dat het bestaan van niet-sofische groepen aantoont, waarmee een belangrijke open vraag in de groepentheorie wordt opgelost; een weerlegging van het starheidsvermoeden van Connes; nieuwe grenzen voor hoogdimensionale bolverpakking; en resultaten die verschillende problemen oplossen die oorspronkelijk door de productieve wiskundige Paul Erdős waren gesteld.
OpenAI merkte op dat het totale aantal tokens dat nodig is om deze oplossingen te vinden bij de huidige API-tarieven grofweg $2.000 zou kosten – een opvallend datapunt over de computervoetafdruk van moderne wiskundige ontdekkingen, en een die grensverleggend onderzoek binnen het bereik van goed gefinancierde academische teams plaatst in plaats van alleen de laboratoria zelf.
Wiskundigen reageren
Thomas Bloom, een wiskundige aan de Universiteit van Manchester die de Erdős-probleemreferentiesite erdosproblems.com beheert, noemde de resultaten "groot nieuws" op X, volgens The Decoder. Hij achtte ze belangrijker dan een tegenvoorbeeld van het vermoeden van de eenheidsafstand dat in mei werd gepubliceerd. "Misschien niet groter dan een bewijs van eenheidsafstand zou zijn geweest, maar in termen van constructies is dit groot", schreef Bloom.Bloom verzette zich ook tegen het idee dat AI wiskundigen vervangt, met het argument dat deze bewering weinig zin heeft als het systeem voortborduurt op meer dan een eeuw aan theorie, is gebouwd door wiskundigen en is getraind in alles wat wiskundigen ooit hebben geschreven.
Noam Brown, een onderzoeker achter de test-time redeneertechnologie waar Astra op vertrouwt, was meer afgemeten. "Helaas (nog) geen problemen met de millenniumprijzen", postte hij op X, verwijzend naar de zeven beroemde problemen waarvoor het Clay Mathematics Institute elk $ 1 miljoen biedt - er is er slechts één opgelost sinds de prijzen in 2000 werden aangekondigd.Niet iedereen was onder de indruk. AI-criticus Gary Marcus noemde het model "geweldig - maar enorm oververkocht" in een Substack-post, een bekende lijn van scepsis wanneer een grenslaboratorium een mijlpaal claimt. De spanning tussen echte technische prestaties en een promotioneel kader zal waarschijnlijk bepalen hoe de Astra wordt ontvangen.
Een nieuwe modelfamilie voor lange taken
De informatie bevestigde onafhankelijk dat Astra een nieuwe modelfamilie is die is gebouwd voor langdurige werklasten. OpenAI beschrijft het als een systeem waarmee meerdere AI-agenten kunnen samenwerken aan verschillende delen van een groter probleem – een ontwerp dat volledig gericht is op taken die uren of dagen duren in plaats van seconden, zoals het bewijzen van een stelling of het reconstrueren van een grote codebase.
BleepingComputer meldde dat OpenAI nog niet heeft besloten of het model zal worden verzonden als GPT-5.7, GPT-6 of onder een andere naam. CEO Sam Altman heeft Astra al tentoongesteld in Washington, D.C., zo meldde The Decoder, waarmee hij aangeeft dat het bedrijf het systeem als volwassen genoeg beschouwt om aan beleidsmakers voor te leggen.
Een hindernis voor de overheid
Misschien wel het meest consequente detail is de regelgeving. Volgens The Decoder zal de Astra een van de eerste modellen zijn die een gepland beoordelingsproces van de Amerikaanse overheid zal doorlopen, waarvoor officiële goedkeuring vereist is voordat deze publiekelijk wordt vrijgegeven. Dat voegt een laagje politieke onzekerheid toe aan de lanceringstijdlijn waarmee eerdere vlaggenschipmodellen nooit te maken kregen – en verhoogt de inzet voor de manier waarop OpenAI de mogelijkheden van Astra karakteriseert.
Het debuut komt ook te midden van een felle race met open gewicht. Dagen eerder bracht Thinking Machines Lab zijn Inkling-Small-model met open gewicht uit, en Chinese laboratoria blijven grenssystemen met open gewicht pushen. Astra signaleert de weddenschap van OpenAI dat bedrijfseigen, grootschalige redenering – geverifieerd door tools als Lean – de weg naar de grootste doorbraken blijft.
Voorlopig blijft Astra onuitgebracht. Maar zijn wiskundige debuut heeft het gesprek al opnieuw vormgegeven over wat grensverleggende AI-systemen kunnen bijdragen aan pure wetenschap, en hoe nauwkeurig het publiek de beweringen die ermee gepaard gaan nauwkeurig moet onderzoeken.
Blijf AI een stap voor
Wilt u op de hoogte blijven van ontwikkelingen zoals de Astra en de bredere race van grensmodellen? Maak een bladwijzer van onze hub voor de nieuwste AI-ontwikkelingen.
Lees meer AI-nieuws →