Bara en dag efter att OpenAI gjorde sin mest kraftfulla modell allmänt tillgänglig, säger företaget att systemet har producerat ett fullständigt bevis på Cycle Double Cover Conjecture - ett berömt öppet problem inom grafteorin som har motstått matematiker i ungefär ett halvt sekel.
OpenAI-forskaren Ethan Knight tillkännagav resultatet den 10 juli 2026 och publicerade att GPT-5.6 Sol Ultra "producerade ett bevis på den 50-åriga Cycle Double Cover Conjecture med hjälp av 64 subagenter på knappt en timme." Påståendet klättrade snabbt till toppen av Hacker News, och drog hundratals kommentarer från matematiker och ingenjörer som diskuterade om beviset håller.
För alla som följer den senaste AI-utvecklingen är resultatet en slående demonstration av vart gränsmodeller är på väg – och en påminnelse om att deras matematiska påståenden fortfarande måste kontrolleras på gammaldags sätt.
Vad är Cycle Double Cover-förmodan?
Gissningen sitter i en gren av matematiken som kallas grafteori. Enkelt uttryckt ställer den en bedrägligt enkel fråga: kan kanterna på en "brolös" graf - en utan kant vars borttagning skulle dela isär den - alltid täckas av en samling cykler så att varje enskild kant visas exakt två gånger?
Problemet ställdes oberoende av flera matematiker under åren, inklusive Paul Seymour 1979 och George Szekeres 1973, med tidigare rötter i arbete av W. T. Tutte och av Alon Itai och Michael Rodeh. Trots sitt enkla uttalande blev det ett av de mest kända olösta problemen på området, och delresultat var kända endast för speciella klasser av grafer.
Enligt bevisanteckningen OpenAI som publicerats reducerar argumentet problemet till slinglösa kubiska grafer, och lutar sig sedan mot ett klassiskt resultat - nowhere-nollflödessatsen över gruppen F32 (motsvarande Tuttes 8-flödessats) - och ett nyckelsteg i linjär algebra som omvandlar en kantmärkning till den struktur som behövs för en cykel dubbel. Skrivningen är bara några sidor lång och, särskilt, använder "ingen matematik utvecklad under de senaste 30 åren", som en Hacker News-kommentator observerade.
Hur GPT-5.6 Sol Ultra närmade sig det
Det som skiljer detta resultat från vanliga chatbot-svar är hur modellen distribuerades. GPT-5.6 Sol Ultra körde i OpenAI:s "multiagent v2"-läge och skapade ett system med upp till 64 samarbetande subagenter som utforskade olika bevisstrategier parallellt. OpenAI släppte hela uppmaningen tillsammans med beviset, och gav en sällsynt titt på instruktionerna som gavs till systemet.
Uppmaningen instruerade modellen att "använda multiagent v2 aggressivt och dynamiskt", för att upprätthålla en "mångsidig portfölj av tillvägagångssätt" och att distribuera motstridiga agenter för att granska alla kandidatbevis för vanliga fallgropar - såsom stängda stigar som maskerar sig som cykler eller oavsiktliga cirkulära resonemang. Det sa till och med att systemet skulle "lägga minst 8 timmar på detta innan man ens tänkte återvända eller ge upp", även om den sista körningen enligt uppgift slutfördes på mindre än en timme.
I provanteckningens avsnitt "Statement of AI use" är OpenAI explicit: "Beviset i denna not beror helt och hållet på GPT 5.6 Sol Ultra och uppskrivningen med Codex (med GPT 5.6 Sol)."
Inte alla är övertygade än
Det matematiska samhället har reagerat med en blandning av spänning och försiktighet - och den skepsisen är välplacerad. Från och med publiceringen har beviset inte verifierats formellt i en korrekturassistent som Lean, och det har inte heller godkänts i traditionell peer review.
På Hacker News noterade flera kommentatorer att korta, eleganta bevis på kända gissningar förtjänar en extra noggrann granskning. "Det är ett mycket kort bevis som inte använder någon matematik utvecklad under de senaste 30 åren", skrev en användare. "Vilket inte nödvändigtvis gör det fel, men i avsaknad av mekanisering i Lean eller ordentlig peer review tycker jag att det är för tidigt att lägga upp det här."
Andra påpekade att grafteorins ledande formella bevisbibliotek ännu inte är tillräckligt mogna för att kontrollera forskningsresultat av detta slag, vilket innebär att verifiering kan behöva komma från mänskliga experter som läser argumentet rad för rad. OpenAI själv inramade tillkännagivandet som en del av ett bredare mönster: "Mer test-tidsberäkning leder till större intelligens," sa företaget och signalerade att multiagent-metoden - inte detta enda resultat - är den verkliga historien som det vill berätta.
Varför det är viktigt
Även om Cycle Double Cover-beviset i slutändan behöver korrigeras, signalerar avsnittet en meningsfull förändring i vad stora språkmodeller kan göra i ren matematik. Frontier AI-system har tidigare producerat nya forskningsresultat inom specialiserade domäner – inklusive andra nya påståenden om lösta problem inom geometri och kombinatorik – men att attackera en namngiven, decennier gammal gissning med en samordnad svärm av resonerande agenter höjer ribban avsevärt.
För forskare är takeaway tvåfaldigt. För det första verkar multiagentreceptet - många oberoende försök, korspollinering av idéer och kontradiktorisk revision - vara en genuint användbar mall för svår problemlösning. För det andra är verifieringsflaskhalsen nu helt och hållet på människor: modellen kan generera kandidatbevis snabbare än samhället kan kontrollera dem.
Den spänningen kommer sannolikt att definiera nästa fas av AI-assisterad matematik. Som en kommentator uttryckte det, om detta bevis håller, "någon är på väg att starta en lista" över andra långvariga problem att kasta på nästa generations modeller.
För närvarande kommer matematiker att läsa den tre sidor långa anteckningen noggrant - pennan i handen - medan resten av AI-industrin tittar på om GPT-5.6s timslånga ansträngning blir en del av det permanenta matematiska rekordet.
Ligg före AI
Besök AI Buzz Wires hemsida för mer om genombrott för gränsmodeller och AI-forskning.
Läs fler AI-nyheter →



