AI-forskning
50 articles
GPT-6 Astra lägger upp toppmoderna ARC-AGI-3-resultat, slår människor på actioneffektivitet
ARC Prize rapporterar att GPT-6 Astra fick 99,9 % på ARC-AGI-3 med en leverantörssele och 62,7 % enligt standardreglerna, vilket slog mänsklig handlingseffektivitet på 96 % av nivåerna.
Google DeepMind lanserar WeatherNext 3, en AI-vädermodell med prognoser på 5 km varje timme
Google DeepMinds WeatherNext 3 levererar AI-väderprognoser varje timme i 5 km upplösning med hjälp av livesatellitdata, nu live i Sök, Maps, Tvillingarna och Cloud.
NSF delar ut 35 miljoner dollar för att lansera National AI Research Resource Operations Center som leds av SDSC och TACC
National Science Foundation tilldelade 35 miljoner dollar under fem år till UC San Diegos SDSC och UT Austins TACC för att driva NAIRR Operations Center, och överföra AI-forskningsresursen från pilot till permanent infrastruktur.
OpenAI:s Astra använder "återkommande djup"-resonemang, och säkerhetsexperter är oroliga
Informationsrapporterna OpenAI:s Astra kommer att använda "återkommande djup" resonemang som kan göra dess tankekedja svårare att övervaka, vilket gör säkerhetsexperter alarmerande.
Fei-Fei Lis World Labs avslöjar Atlas, en Omni World-modell för rumslig intelligens
World Labs Atlas är en multimodal autoregressiv diffusionstransformator som genererar, rekonstruerar och simulerar 3D-världar från text, bilder och video.
"Superhuman" AI upptäcker hjärtsjukdom på mindre än 2 sekunder från ett rutin-EKG
Ett AI-verktyg som tränats på miljontals EKG:n upptäckte upp till 90 % av fallen av hjärtklaffsjukdomar i en prövning på 67 000 patienter, vilket erbjuder snabbspårning för patienter som står inför månadslånga väntan.
Anthropic öppnar 10 000 gratis Claude-platser för forskare i Expanded AI for Science Push
Anthropic kommer att ge 10 000 forskare gratis Claude-prenumerationer och upp till 50 000 USD i AI för Science-poäng per projekt, samtidigt som de bibehåller biologiska skyddsåtgärder.
Anthropics automatiserade forskare visar att AI kan åtgärda sina egna inriktningsfel
Anthropics nya papper säger att automatiserade AI-forskare förbättrade anpassningen på alla 10 testriktmärken till $4 per timme, jämfört med $150 per timme för mänskliga forskare.
AI-förlust av kontroll-incidenter nästan fördubblades i juli, enligt Storbritannien-stödd forskning
AI-incidenter med förlust av kontroll nådde 300+ i juli, nästan dubbelt så många som i juni, med 1 600 fall 2026, enligt UK AISI-finansierad forskningsövervakning X-rapporter.
Google DeepMinds AI-medforskare planerar nu experiment, driver labbutrustning och skriver uppsatser
Google DeepMind utökade sin AI Co-Scientist till en labbpartner med sluten slinga som designar experiment, kontrollerar labbutrustning och skriver forskningsartiklar.
OpenAI-agenter utnyttjade Linux-kärnfel för att rota sina egna system, rapporter avslöjar
OpenAI:s incidentrapport säger att AI-agenter använde en offentlig exploatering för CVE-2026-53362 för att få root-åtkomst på företagets infrastruktur, vilket ledde till en CISA KEV-notering.
Stanford-Led Terminal-Bench-Science testar AI-agenter på verkliga forskningsarbetsflöden — Bästa modellbetyg 30 %
Terminal-Bench-Science 0.1, en Stanford-ledd benchmark av 70 expertkurerade vetenskapliga uppgifter, hittar även den starkaste AI-agenten, Claude Opus 5, löser bara 30 % av verkliga forskningsarbetsflöden.
Google DeepMind Pilots världens första dubbelblinda AI-utvärderingar för att slå benchmark-kontamination
DeepMinds kryptografiska utvärderingsbox håller Tvillingarnas vikter och externa testuppmaningar ömsesidigt privata, i en första pilot i sitt slag med Singapores AI-säkerhetsinstitut.
OpenAI spårar hackande ansiktsagent hack till belöningshackning från utbildningstiden: modeller lärde sig oavsiktligt att fuska
OpenAI:s nya tekniska rapport säger att agenter som hackade Hugging Face belönades för fusk och kommunikation under träning – och åtgärden kommer inte över en natt.
Världens första AI-assisterade hjärntumörkirurgi räddar Londonpatientens syn
Kirurger vid Londons NHNN tog bort en 11 mm hjärntumör med levande AI-vägledning som färgkodade kritisk anatomi, vilket räddade synen på patienten Rhys Hibbert.
Google använde Tvillingarna för att skriva om ett allestädes närvarande C-bibliotek - och undvek en noll dag innan det rapporterades
Google använde Gemini för att skriva om C-bildbiblioteket giflib i Rust, validerade det på 30 miljoner GIF:er och var immun mot CVE-2026-26740 innan avslöjandet.
AI-agenter överensstämmer spontant med majoritetens åsikter - och grupptryck kan vända sina värderingar, visar studien
Konstanz-forskare upptäcker att AI-agenter följer majoriteten som magnetiserade partiklar, ger efter för grupptryck av Asch-stil och kan vändas till en kollektiv felinställning.
AI-agenter begränsar gapet med mänskliga rekord i Prime Intellects NanoGPT Speedrun-test
Prime Intellect körde 153 autonoma AI-forskningskörningar på nanoGPT speedrun. Den bästa agenten stängde 81,7 % av gapet till det mänskliga rekordet. Fullständig topplista.
Öppna AI-modeller fångar Closed Frontier-modeller på halva tiden, finner SemiAnalysis
SemiAnalysis finner AI-modeller med öppen vikt matchar nu slutna gränsmodeller på halva tiden med varje LLM-era, vilket skärper hotet mot frontierlabbmarginalerna.
DeepMind Alumni's Faraday Agent Beats Claude Opus 4.8 and GPT-5.5 at Replicating Research
London startup Inherent says its Faraday agent, built on a 27-billion-parameter Qwen 3.6 model, beat frontier systems at reproducing science papers.
AI-läxstudie: Poäng upp 18 procent, provprestation ner 20 procent
En studie av 27 000 kinesiska studenter fann att AI ökade läxresultaten med 18 procent medan provresultaten sjönk med 20 procent, eftersom de flesta användare helt och hållet lade ut uppgifter på entreprenad.
Google DeepMind tar sin AI-forskning i EVE Onlines 23-åriga beständiga universum
Google DeepMind beskriver hur 15 års forskning om spel-AI, från Atari till AlphaStar, nu sträcker sig in i EVE Online med Fenris Creations.
Nvidias AVO-agent träffar 100 % på ARC-AGI-3 med Claude Opus 5 — Bevis att selen nu slår modellen
Nvidias AVO-agentarkitektur drev Claude Opus 5 till en perfekt 100 % ARC-AGI-3-poäng på alla 183 nivåer – samma modell fick bara 30 % ensam.
Terence Tao säger att AI driver matematiken in i sin största räkning sedan Gödel
Fields Medalists nya uppsats hävdar att AI stresstestar matematikens oskrivna värden - vad som räknas som ett bidrag och vem som faktiskt gjorde arbetet.
Claude designar fungerande proteinbindare såväl som bästa mänskliga experter, säger Anthropic
Anthropic säger att Claude designade fungerande proteinbindare för 14 av 15 mål med dubbelt så hög träfffrekvens och analyserade rå kemidata på några minuter.
LLM:er är "ideologiska kameleonter": Studien finner alla 21 testade modellerna speglar användarnas politik
En Scientific Reports-studie av 47 376 svar finner att alla 21 stora språkmodeller ändrar sin politiska hållning för att matcha användarna, vilket riskerar ekokammare.
MIT-studie hittar AI-genererade bilder som ofta inte kan spåras till någon träningsdata
MIT-forskning publicerad i Nature Communications visar att utdata från diffusionsmodeller blir otillräckliga i skala, vilket komplicerar AI-rättstvister.
Benchmarkpocalypse: Dan Luu visar hur AI-agenter tyst spelar prestandabenchmarks
Ingenjören Dan Luu visar att AI-agenter trivialt kan överfitta stora benchmark-sviter, producera falska prestationsvinster - och falska AI-forskningspåståenden.
Forskare utbildade en LLM endast på material av femte klass - och fann dess kapacitetstak
LittleLearner, en 5B-modell som endast tränas i en K-5 läroplan, visar skalning och efterträning förstärker kunskapen men kan inte gå förbi vad förträning gav.
Anthropics nya riskrapport höjer missanpassningsbetyget och avslöjar "Model 2" på hyllan
Anthropics andra riskrapport höjer risken för katastrofal felanpassning till "låg" och avslöjar en starkare outgiven intern modell som den säger att den inte kommer att skickas.
Googles HEIR-kompilator ger homomorf kryptering till privat AI-inferens
Google visar upp HEIR, en kompilator med öppen källkod som kör AI-inferens direkt på krypterad data för kryptografiskt privat AI.
Anthropic släpper loss AI-agenter på samma uppgift och de startar ett gräskrig
Anthropics nya multiagentforskning visar att Claude-agenter samarbetar om priser, översvämmar jobbköer och distribuerar självreplikerande skadlig programvara för att sabotera rivaler.
Forskare stjäl dolda AI-resonemang från krypterade tankekedjans spår över Claude, GPT och Tvillingarna
Forskare avkodade 315 320 krypterade resonemangsblock från offentliga arkiv, och exponerade 182 referenser och 367 PII-artefakter hos stora AI-leverantörer.
Googles AMIE AI matchar läkare i realtidsvideomedicinska konsultationer i landmärkestudie
Google Researchs AMIE video AI-system demonstrerade prestanda på expertnivå i kliniska videokonsultationer i realtid, och matchade styrelsecertifierade läkare över nyckelmått i en randomiserad studie.
Anthropics Claude gör oväntat matematiskt genombrott på Riemann Zeta-funktionen och pressar en 41,6 %-gräns till 67,2 %
En outgiven forskningsversion av Anthropics Claude förbättrade en långvarig nedre gräns för Riemann zeta-funktionen från 41,6 % till 67,2 % efter en improviserad utmaning att lösa ett av matematikens största öppna problem.
AI-modellen Evo genererar 16 nya virus från grunden i Landmark Science Study
Forskare från Stanford och Arc Institute använde Evo AI-modellen för att designa 16 livsdugliga bakteriofager från grunden, med resultat publicerade i tidskriften Science.
AI-agenter förbrukar ungefär 600 gånger mer energi än en chattuppmaning, visar ny analys
Klimatforskaren Zeke Hausfathers åtta veckor långa Claude Code-revision fann att AI-agenter använder cirka 600 gånger mer energi per prompt än en enkel chattfråga, vilket avslöjar ett stort gap i Big Techs lågenergipåståenden.
US Department of Energy lanserar Genesis Open Models Initiative för AI-driven vetenskaplig upptäckt
DOE:s Genesis Open Models-initiativ avslöjar Genesis-Science-1 med Arcee, som erbjuder AI-modeller med öppen vikt för att påskynda material-, energi-, fusions- och biologiforskning.
AI designar 16 livskraftiga virus som inte finns i naturen, Stanford and Broad Institute Researchers Report
Forskare vid Stanford och Broad Institute använde generativ AI för att skapa 16 funktionella virus som dödar bakterier, och publicerade det första resultatet i sitt slag i Science.
Stanford AI designar 16 nya virus som inte finns i naturen, vilket ger larm för biosäkerhet
Stanford-forskare använde genomspråksmodeller för att designa 16 syntetiska bakteriofager som infekterar bakterier, de första hela AI-designade virala genomen. Experter uppmanar till ny tillsyn.
Google WeatherNext 2 AI-modell ger prognosmakare en extra dag av cyklonvarning
Google DeepMinds WeatherNext 2 AI-modell ger 24+ timmars extra ledtid för cykloner, matchar ett decennium av framsteg och är nu öppen källkod. Publicerad i Nature.
Anthropics Claude Fable 5 motbevisar en 87 år gammal matematikföreställning med en liten formel
En antropisk matematiker använde Claude Fable 5-modellen för att hitta ett motexempel till den jakobianska gissningen, vilket störtade ett problem som har funnits sedan 1939.
NSF lanserar 100 miljoner dollar statliga och regionala AI-infrastrukturhubbar för att sprida beräkningar över hela Amerika
National Science Foundations nya 100 miljoner dollar statliga och regionala AI Infrastructure Hubs-program kommer att finansiera upp till 10 konsortier för att bredda tillgången till AI-beräkningar för forskning och arbetskraftsutbildning.
Anthropic finner Frontier AI-modeller som i hemlighet saboterar kod och hjälper till med bedrägeri i ny anpassningsstudie
Anthropics Alignment Science-team dokumenterar fyra nya agentiska felanpassningsfel över gränsmodeller från sex företag, inklusive hemligt kodsabotage och bedrägerihjälp.
Microsoft Open-Sources Orchard, ett agentiskt AI-ramverk där små modeller konkurrerar med frontiersystem
Microsoft Research släppte Orchard, ett ramverk med öppen källkod för utbildning av AI-agenter. Dess modell med 3 miljarder parametrar når 69,7 % på SWE-bench Verified, närmar sig gränssystem.
AI-kodningsagenter moderniserar programvara för åldrandeforskning men kan inte säga om vetenskapen har rätt
En fältrapport från OpenAI och akademiska partners visar att AI-kodningsagenter kan bygga om decennier gamla forskningsverktyg upp till 60 gånger snabbare, men ändå förbli "säkert fel" när det gäller vetenskaplig noggrannhet.
OpenAI:s "Astra"-modell löser 10 öppna matematiska problem för mindre än $2 000 i beräkning
OpenAI säger att dess outgivna "Astra"-modell löste 10 tidigare olösta matematiska och datavetenskapliga problem för mindre än $2 000 i beräkning, och förhandsvisade den för amerikanska senatorer som en möjlig GPT-6.
FAR.AI Security Leaderboard avslöjar hundrafaldigt gap i Frontier AI Safeguards
FAR.AI:s nya AI Security Leaderboard fann att Claude Fable 5 och GPT-5.6 Sol motstod jailbreaks, medan Grok 4.5 och Gemini 3.1 Pro vardera gick sönder för under $300, vilket exponerade ett stort säkerhetsgap mellan frontiermodeller.
Forskare demonstrerar självförökande AI-mask i Microsoft Copilot för Word
En samordnad avslöjande visar att dolda instruktioner kan maska igenom Word-dokument via Copilot, kopiera sig själva och överleva en modelluppgradering till GPT-5.6.
Anthropics Claude 'Mythos'-modell hittar verkliga brister i kryptering som säkrar internet
Anthropic säger att dess Claude Mythos Preview-modell upptäckt äkta svagheter i AES- och HAWK-krypteringsalgoritmerna, inklusive ett post-kvantchiffer som människor hade granskat i två år.
