Problemen som Astra hjälpte till att knäcka hade inte sett "inga framsteg på sina centrala resultat på minst ett decennium, och i de flesta fall mycket längre", skrev OpenAI. Resultaten spänner över områden inklusive högdimensionell geometri, kodningsteori, aritmetisk kretskomplexitet, gruppteori, kvantkomplexitet, gitterkryptografi och extrem kombinatorik - territorium där framsteg normalt mäts i år, inte enstaka forskningskörningar.
Verifierade bevis, inte bara svar
Det som skiljer Astras utdata från en chatbot som gissar på matematik är verifiering. OpenAI sa att mänskliga forskare använde samma modell för att förbereda argument som manuskript, och Astra formaliserade sedan varje argument som ett Lean-certifikat. Lean är en öppen källkodsassistent som kan maskinkontrollera matematiska argument, vilket innebär att andra matematiker inte behöver ta resultaten på tro – de kan verifieras oberoende av programvara på några sekunder.
Den skillnaden spelar roll. En språkmodell kan producera ett trovärdigt bevis som innehåller ett subtilt, fatalt fel. Genom att översätta varje argument till Lean omvandlade OpenAI ett marknadsföringspåstående till en kontrollbar artefakt. Enligt BleepingComputer, som rapporterade detaljerna, inkluderar de specifika framstegen ett bevis på att det finns icke-sociala grupper, vilket löser en stor öppen fråga inom gruppteorin; ett motbevis för Connes stelhet gissning; nya gränser för högdimensionell sfärförpackning; och resultat som löser flera problem som ursprungligen ställdes av den produktive matematikern Paul Erdős.
OpenAI noterade att det totala antalet tokens som krävs för att hitta dessa lösningar skulle kosta ungefär $2 000 med nuvarande API-priser – en slående datapunkt om beräkningsfotavtrycket för moderna matematiska upptäckter, och en som placerar forskning på gränsöverskridande nivå inom räckhåll för välfinansierade akademiska team snarare än bara labben själva.
Matematiker reagerar
Thomas Bloom, en matematiker vid University of Manchester som driver Erdős-problemreferenssidan erdosproblems.com, kallade resultaten "stora nyheter" på X, enligt The Decoder. Han gav dem mer betydelse än ett motexempel till gissningen om enhetsavstånd som publicerades i maj. "Kanske inte större än ett bevis på enhetsavstånd skulle ha varit, men när det gäller konstruktioner är det här stort", skrev Bloom.Bloom tryckte också tillbaka mot inramningen att AI ersätter matematiker, och hävdade att påståendet inte är meningsfullt när systemet bygger på mer än ett sekel av teori, byggdes av matematiker och tränades på allt matematiker någonsin har skrivit.
Noam Brown, en forskare bakom testtidsresonemangstekniken Astra förlitar sig på, var mer mätt. "Tyvärr inga problem med millenniepriset (ännu)," skrev han på X, med hänvisning till de sju berömda problem som Clay Mathematics Institute erbjuder 1 miljon dollar var för - bara ett har lösts sedan priserna tillkännagavs 2000.Alla var inte imponerade. AI-kritikern Gary Marcus kallade modellen "fantastisk - men enormt översåld" i ett Substack-inlägg, en bekant linje av skepsis när ett gränslabb gör anspråk på en milstolpe. Spänningen mellan genuina tekniska prestationer och marknadsföringsinramning kommer sannolikt att definiera hur Astra tas emot.
En ny modellfamilj för långa uppgifter
Informationen bekräftade oberoende att Astra är en ny modellfamilj byggd för långvarig arbetsbelastning. OpenAI beskriver det som ett system som låter flera AI-agenter samarbeta kring olika delar av ett större problem – en design som helt och hållet är inriktad på uppgifter som tar timmar eller dagar snarare än sekunder, som att bevisa ett teorem eller omstrukturera en stor kodbas.
BleepingComputer rapporterade att OpenAI inte har beslutat om modellen kommer att skickas som GPT-5.7, GPT-6 eller under annat namn. VD Sam Altman har redan visat upp Astra i Washington, D.C., rapporterade The Decoder, och signalerade att företaget ser systemet som tillräckligt moget för att ställas inför beslutsfattare.
Ett hinder för regeringens granskning
Den kanske mest betydelsefulla detaljen är reglering. Enligt The Decoder kommer Astra att vara bland de första modellerna att gå igenom en planerad granskningsprocess av den amerikanska regeringen som kräver officiellt godkännande innan offentlig publicering. Det lägger till ett lager av politisk osäkerhet till lanseringstidslinjen som tidigare flaggskeppsmodeller aldrig stått inför – och höjer insatserna för hur OpenAI karakteriserar Astras kapacitet.
Debuten kommer också mitt i ett hårt lopp i öppen vikt. Dagar tidigare släppte Thinking Machines Lab sin Inkling-Small öppenviktsmodell, och kinesiska labb fortsätter att driva på öppna gränssystem. Astra signalerar OpenAI:s satsning på att proprietära, storskaliga resonemang – verifierade av verktyg som Lean – förblir vägen till de största genombrotten.
Än så länge är Astra ännu inte släppt. Men dess matematiska debut har redan omformulerat samtalet om vilka frontier AI-system kan bidra till ren vetenskap, och hur noggrant allmänheten bör granska de påståenden som åtföljer dem.
Ligg före AI
Vill du hänga med i utvecklingen som Astra och det bredare frontier-modellloppet? Bokmärk vårt nav för den senaste AI-utvecklingen.
Läs mer AI-nyheter →