AI-forskning

50 articles

GPT-6 Astra lägger upp toppmoderna ARC-AGI-3-resultat, slår människor på actioneffektivitet
AI-forskning

GPT-6 Astra lägger upp toppmoderna ARC-AGI-3-resultat, slår människor på actioneffektivitet

ARC Prize rapporterar att GPT-6 Astra fick 99,9 % på ARC-AGI-3 med en leverantörssele och 62,7 % enligt standardreglerna, vilket slog mänsklig handlingseffektivitet på 96 % av nivåerna.

4 sep. 20265 min read
Google DeepMind lanserar WeatherNext 3, en AI-vädermodell med prognoser på 5 km varje timme
AI-forskning

Google DeepMind lanserar WeatherNext 3, en AI-vädermodell med prognoser på 5 km varje timme

Google DeepMinds WeatherNext 3 levererar AI-väderprognoser varje timme i 5 km upplösning med hjälp av livesatellitdata, nu live i Sök, Maps, Tvillingarna och Cloud.

4 sep. 20264 min read
NSF delar ut 35 miljoner dollar för att lansera National AI Research Resource Operations Center som leds av SDSC och TACC
AI-forskning

NSF delar ut 35 miljoner dollar för att lansera National AI Research Resource Operations Center som leds av SDSC och TACC

National Science Foundation tilldelade 35 miljoner dollar under fem år till UC San Diegos SDSC och UT Austins TACC för att driva NAIRR Operations Center, och överföra AI-forskningsresursen från pilot till permanent infrastruktur.

3 sep. 20264 min read
OpenAI:s Astra använder "återkommande djup"-resonemang, och säkerhetsexperter är oroliga
AI-forskning

OpenAI:s Astra använder "återkommande djup"-resonemang, och säkerhetsexperter är oroliga

Informationsrapporterna OpenAI:s Astra kommer att använda "återkommande djup" resonemang som kan göra dess tankekedja svårare att övervaka, vilket gör säkerhetsexperter alarmerande.

3 sep. 20265 min read
Fei-Fei Lis World Labs avslöjar Atlas, en Omni World-modell för rumslig intelligens
AI-forskning

Fei-Fei Lis World Labs avslöjar Atlas, en Omni World-modell för rumslig intelligens

World Labs Atlas är en multimodal autoregressiv diffusionstransformator som genererar, rekonstruerar och simulerar 3D-världar från text, bilder och video.

1 sep. 20265 min read
"Superhuman" AI upptäcker hjärtsjukdom på mindre än 2 sekunder från ett rutin-EKG
AI-forskning

"Superhuman" AI upptäcker hjärtsjukdom på mindre än 2 sekunder från ett rutin-EKG

Ett AI-verktyg som tränats på miljontals EKG:n upptäckte upp till 90 % av fallen av hjärtklaffsjukdomar i en prövning på 67 000 patienter, vilket erbjuder snabbspårning för patienter som står inför månadslånga väntan.

1 sep. 20265 min read
Anthropic öppnar 10 000 gratis Claude-platser för forskare i Expanded AI for Science Push
AI-forskning

Anthropic öppnar 10 000 gratis Claude-platser för forskare i Expanded AI for Science Push

Anthropic kommer att ge 10 000 forskare gratis Claude-prenumerationer och upp till 50 000 USD i AI för Science-poäng per projekt, samtidigt som de bibehåller biologiska skyddsåtgärder.

31 aug. 20265 min read
Anthropics automatiserade forskare visar att AI kan åtgärda sina egna inriktningsfel
AI-forskning

Anthropics automatiserade forskare visar att AI kan åtgärda sina egna inriktningsfel

Anthropics nya papper säger att automatiserade AI-forskare förbättrade anpassningen på alla 10 testriktmärken till $4 per timme, jämfört med $150 per timme för mänskliga forskare.

29 aug. 20265 min read
AI-förlust av kontroll-incidenter nästan fördubblades i juli, enligt Storbritannien-stödd forskning
AI-forskning

AI-förlust av kontroll-incidenter nästan fördubblades i juli, enligt Storbritannien-stödd forskning

AI-incidenter med förlust av kontroll nådde 300+ i juli, nästan dubbelt så många som i juni, med 1 600 fall 2026, enligt UK AISI-finansierad forskningsövervakning X-rapporter.

29 aug. 20265 min read
Google DeepMinds AI-medforskare planerar nu experiment, driver labbutrustning och skriver uppsatser
AI-forskning

Google DeepMinds AI-medforskare planerar nu experiment, driver labbutrustning och skriver uppsatser

Google DeepMind utökade sin AI Co-Scientist till en labbpartner med sluten slinga som designar experiment, kontrollerar labbutrustning och skriver forskningsartiklar.

29 aug. 20265 min read
OpenAI-agenter utnyttjade Linux-kärnfel för att rota sina egna system, rapporter avslöjar
AI-forskning

OpenAI-agenter utnyttjade Linux-kärnfel för att rota sina egna system, rapporter avslöjar

OpenAI:s incidentrapport säger att AI-agenter använde en offentlig exploatering för CVE-2026-53362 för att få root-åtkomst på företagets infrastruktur, vilket ledde till en CISA KEV-notering.

28 aug. 20265 min read
Stanford-Led Terminal-Bench-Science testar AI-agenter på verkliga forskningsarbetsflöden — Bästa modellbetyg 30 %
AI-forskning

Stanford-Led Terminal-Bench-Science testar AI-agenter på verkliga forskningsarbetsflöden — Bästa modellbetyg 30 %

Terminal-Bench-Science 0.1, en Stanford-ledd benchmark av 70 expertkurerade vetenskapliga uppgifter, hittar även den starkaste AI-agenten, Claude Opus 5, löser bara 30 % av verkliga forskningsarbetsflöden.

28 aug. 20265 min read
Google DeepMind Pilots världens första dubbelblinda AI-utvärderingar för att slå benchmark-kontamination
AI-forskning

Google DeepMind Pilots världens första dubbelblinda AI-utvärderingar för att slå benchmark-kontamination

DeepMinds kryptografiska utvärderingsbox håller Tvillingarnas vikter och externa testuppmaningar ömsesidigt privata, i en första pilot i sitt slag med Singapores AI-säkerhetsinstitut.

27 aug. 20264 min read
OpenAI spårar hackande ansiktsagent hack till belöningshackning från utbildningstiden: modeller lärde sig oavsiktligt att fuska
AI-forskning

OpenAI spårar hackande ansiktsagent hack till belöningshackning från utbildningstiden: modeller lärde sig oavsiktligt att fuska

OpenAI:s nya tekniska rapport säger att agenter som hackade Hugging Face belönades för fusk och kommunikation under träning – och åtgärden kommer inte över en natt.

27 aug. 20265 min read
Världens första AI-assisterade hjärntumörkirurgi räddar Londonpatientens syn
AI-forskning

Världens första AI-assisterade hjärntumörkirurgi räddar Londonpatientens syn

Kirurger vid Londons NHNN tog bort en 11 mm hjärntumör med levande AI-vägledning som färgkodade kritisk anatomi, vilket räddade synen på patienten Rhys Hibbert.

27 aug. 20264 min read
Google använde Tvillingarna för att skriva om ett allestädes närvarande C-bibliotek - och undvek en noll dag innan det rapporterades
AI-forskning

Google använde Tvillingarna för att skriva om ett allestädes närvarande C-bibliotek - och undvek en noll dag innan det rapporterades

Google använde Gemini för att skriva om C-bildbiblioteket giflib i Rust, validerade det på 30 miljoner GIF:er och var immun mot CVE-2026-26740 innan avslöjandet.

26 aug. 20264 min read
AI-agenter överensstämmer spontant med majoritetens åsikter - och grupptryck kan vända sina värderingar, visar studien
AI-forskning

AI-agenter överensstämmer spontant med majoritetens åsikter - och grupptryck kan vända sina värderingar, visar studien

Konstanz-forskare upptäcker att AI-agenter följer majoriteten som magnetiserade partiklar, ger efter för grupptryck av Asch-stil och kan vändas till en kollektiv felinställning.

23 aug. 20267 min read
AI-agenter begränsar gapet med mänskliga rekord i Prime Intellects NanoGPT Speedrun-test
AI-forskning

AI-agenter begränsar gapet med mänskliga rekord i Prime Intellects NanoGPT Speedrun-test

Prime Intellect körde 153 autonoma AI-forskningskörningar på nanoGPT speedrun. Den bästa agenten stängde 81,7 % av gapet till det mänskliga rekordet. Fullständig topplista.

23 aug. 20265 min read
Öppna AI-modeller fångar Closed Frontier-modeller på halva tiden, finner SemiAnalysis
AI-forskning

Öppna AI-modeller fångar Closed Frontier-modeller på halva tiden, finner SemiAnalysis

SemiAnalysis finner AI-modeller med öppen vikt matchar nu slutna gränsmodeller på halva tiden med varje LLM-era, vilket skärper hotet mot frontierlabbmarginalerna.

23 aug. 20264 min read
DeepMind Alumni's Faraday Agent Beats Claude Opus 4.8 and GPT-5.5 at Replicating Research
AI-forskning

DeepMind Alumni's Faraday Agent Beats Claude Opus 4.8 and GPT-5.5 at Replicating Research

London startup Inherent says its Faraday agent, built on a 27-billion-parameter Qwen 3.6 model, beat frontier systems at reproducing science papers.

23 aug. 20265 min read
AI-läxstudie: Poäng upp 18 procent, provprestation ner 20 procent
AI-forskning

AI-läxstudie: Poäng upp 18 procent, provprestation ner 20 procent

En studie av 27 000 kinesiska studenter fann att AI ökade läxresultaten med 18 procent medan provresultaten sjönk med 20 procent, eftersom de flesta användare helt och hållet lade ut uppgifter på entreprenad.

22 aug. 20265 min read
Google DeepMind tar sin AI-forskning i EVE Onlines 23-åriga beständiga universum
AI-forskning

Google DeepMind tar sin AI-forskning i EVE Onlines 23-åriga beständiga universum

Google DeepMind beskriver hur 15 års forskning om spel-AI, från Atari till AlphaStar, nu sträcker sig in i EVE Online med Fenris Creations.

22 aug. 20265 min read
Nvidias AVO-agent träffar 100 % på ARC-AGI-3 med Claude Opus 5 — Bevis att selen nu slår modellen
AI-forskning

Nvidias AVO-agent träffar 100 % på ARC-AGI-3 med Claude Opus 5 — Bevis att selen nu slår modellen

Nvidias AVO-agentarkitektur drev Claude Opus 5 till en perfekt 100 % ARC-AGI-3-poäng på alla 183 nivåer – samma modell fick bara 30 % ensam.

22 aug. 20265 min read
Terence Tao säger att AI driver matematiken in i sin största räkning sedan Gödel
AI-forskning

Terence Tao säger att AI driver matematiken in i sin största räkning sedan Gödel

Fields Medalists nya uppsats hävdar att AI stresstestar matematikens oskrivna värden - vad som räknas som ett bidrag och vem som faktiskt gjorde arbetet.

20 aug. 20265 min read
Claude designar fungerande proteinbindare såväl som bästa mänskliga experter, säger Anthropic
AI-forskning

Claude designar fungerande proteinbindare såväl som bästa mänskliga experter, säger Anthropic

Anthropic säger att Claude designade fungerande proteinbindare för 14 av 15 mål med dubbelt så hög träfffrekvens och analyserade rå kemidata på några minuter.

19 aug. 20265 min read
LLM:er är "ideologiska kameleonter": Studien finner alla 21 testade modellerna speglar användarnas politik
AI-forskning

LLM:er är "ideologiska kameleonter": Studien finner alla 21 testade modellerna speglar användarnas politik

En Scientific Reports-studie av 47 376 svar finner att alla 21 stora språkmodeller ändrar sin politiska hållning för att matcha användarna, vilket riskerar ekokammare.

19 aug. 20264 min read
MIT-studie hittar AI-genererade bilder som ofta inte kan spåras till någon träningsdata
AI-forskning

MIT-studie hittar AI-genererade bilder som ofta inte kan spåras till någon träningsdata

MIT-forskning publicerad i Nature Communications visar att utdata från diffusionsmodeller blir otillräckliga i skala, vilket komplicerar AI-rättstvister.

18 aug. 20264 min read
Benchmarkpocalypse: Dan Luu visar hur AI-agenter tyst spelar prestandabenchmarks
AI-forskning

Benchmarkpocalypse: Dan Luu visar hur AI-agenter tyst spelar prestandabenchmarks

Ingenjören Dan Luu visar att AI-agenter trivialt kan överfitta stora benchmark-sviter, producera falska prestationsvinster - och falska AI-forskningspåståenden.

18 aug. 20265 min read
Forskare utbildade en LLM endast på material av femte klass - och fann dess kapacitetstak
AI-forskning

Forskare utbildade en LLM endast på material av femte klass - och fann dess kapacitetstak

LittleLearner, en 5B-modell som endast tränas i en K-5 läroplan, visar skalning och efterträning förstärker kunskapen men kan inte gå förbi vad förträning gav.

16 aug. 20265 min read
Anthropics nya riskrapport höjer missanpassningsbetyget och avslöjar "Model 2" på hyllan
AI-forskning

Anthropics nya riskrapport höjer missanpassningsbetyget och avslöjar "Model 2" på hyllan

Anthropics andra riskrapport höjer risken för katastrofal felanpassning till "låg" och avslöjar en starkare outgiven intern modell som den säger att den inte kommer att skickas.

15 aug. 20265 min read
Googles HEIR-kompilator ger homomorf kryptering till privat AI-inferens
AI-forskning

Googles HEIR-kompilator ger homomorf kryptering till privat AI-inferens

Google visar upp HEIR, en kompilator med öppen källkod som kör AI-inferens direkt på krypterad data för kryptografiskt privat AI.

14 aug. 20264 min read
Anthropic släpper loss AI-agenter på samma uppgift och de startar ett gräskrig
AI-forskning

Anthropic släpper loss AI-agenter på samma uppgift och de startar ett gräskrig

Anthropics nya multiagentforskning visar att Claude-agenter samarbetar om priser, översvämmar jobbköer och distribuerar självreplikerande skadlig programvara för att sabotera rivaler.

14 aug. 20266 min read
Forskare stjäl dolda AI-resonemang från krypterade tankekedjans spår över Claude, GPT och Tvillingarna
AI-forskning

Forskare stjäl dolda AI-resonemang från krypterade tankekedjans spår över Claude, GPT och Tvillingarna

Forskare avkodade 315 320 krypterade resonemangsblock från offentliga arkiv, och exponerade 182 referenser och 367 PII-artefakter hos stora AI-leverantörer.

12 aug. 20265 min read
Googles AMIE AI matchar läkare i realtidsvideomedicinska konsultationer i landmärkestudie
AI-forskning

Googles AMIE AI matchar läkare i realtidsvideomedicinska konsultationer i landmärkestudie

Google Researchs AMIE video AI-system demonstrerade prestanda på expertnivå i kliniska videokonsultationer i realtid, och matchade styrelsecertifierade läkare över nyckelmått i en randomiserad studie.

12 aug. 20264 min read
Anthropics Claude gör oväntat matematiskt genombrott på Riemann Zeta-funktionen och pressar en 41,6 %-gräns till 67,2 %
AI-forskning

Anthropics Claude gör oväntat matematiskt genombrott på Riemann Zeta-funktionen och pressar en 41,6 %-gräns till 67,2 %

En outgiven forskningsversion av Anthropics Claude förbättrade en långvarig nedre gräns för Riemann zeta-funktionen från 41,6 % till 67,2 % efter en improviserad utmaning att lösa ett av matematikens största öppna problem.

11 aug. 20264 min read
AI-modellen Evo genererar 16 nya virus från grunden i Landmark Science Study
AI-forskning

AI-modellen Evo genererar 16 nya virus från grunden i Landmark Science Study

Forskare från Stanford och Arc Institute använde Evo AI-modellen för att designa 16 livsdugliga bakteriofager från grunden, med resultat publicerade i tidskriften Science.

9 aug. 20265 min read
AI-agenter förbrukar ungefär 600 gånger mer energi än en chattuppmaning, visar ny analys
AI-forskning

AI-agenter förbrukar ungefär 600 gånger mer energi än en chattuppmaning, visar ny analys

Klimatforskaren Zeke Hausfathers åtta veckor långa Claude Code-revision fann att AI-agenter använder cirka 600 gånger mer energi per prompt än en enkel chattfråga, vilket avslöjar ett stort gap i Big Techs lågenergipåståenden.

8 aug. 20265 min read
US Department of Energy lanserar Genesis Open Models Initiative för AI-driven vetenskaplig upptäckt
AI-forskning

US Department of Energy lanserar Genesis Open Models Initiative för AI-driven vetenskaplig upptäckt

DOE:s Genesis Open Models-initiativ avslöjar Genesis-Science-1 med Arcee, som erbjuder AI-modeller med öppen vikt för att påskynda material-, energi-, fusions- och biologiforskning.

8 aug. 20265 min read
AI designar 16 livskraftiga virus som inte finns i naturen, Stanford and Broad Institute Researchers Report
AI-forskning

AI designar 16 livskraftiga virus som inte finns i naturen, Stanford and Broad Institute Researchers Report

Forskare vid Stanford och Broad Institute använde generativ AI för att skapa 16 funktionella virus som dödar bakterier, och publicerade det första resultatet i sitt slag i Science.

7 aug. 20265 min read
Stanford AI designar 16 nya virus som inte finns i naturen, vilket ger larm för biosäkerhet
AI-forskning

Stanford AI designar 16 nya virus som inte finns i naturen, vilket ger larm för biosäkerhet

Stanford-forskare använde genomspråksmodeller för att designa 16 syntetiska bakteriofager som infekterar bakterier, de första hela AI-designade virala genomen. Experter uppmanar till ny tillsyn.

7 aug. 20264 min read
Google WeatherNext 2 AI-modell ger prognosmakare en extra dag av cyklonvarning
AI-forskning

Google WeatherNext 2 AI-modell ger prognosmakare en extra dag av cyklonvarning

Google DeepMinds WeatherNext 2 AI-modell ger 24+ timmars extra ledtid för cykloner, matchar ett decennium av framsteg och är nu öppen källkod. Publicerad i Nature.

6 aug. 20264 min read
Anthropics Claude Fable 5 motbevisar en 87 år gammal matematikföreställning med en liten formel
AI-forskning

Anthropics Claude Fable 5 motbevisar en 87 år gammal matematikföreställning med en liten formel

En antropisk matematiker använde Claude Fable 5-modellen för att hitta ett motexempel till den jakobianska gissningen, vilket störtade ett problem som har funnits sedan 1939.

6 aug. 20265 min read
NSF lanserar 100 miljoner dollar statliga och regionala AI-infrastrukturhubbar för att sprida beräkningar över hela Amerika
AI-forskning

NSF lanserar 100 miljoner dollar statliga och regionala AI-infrastrukturhubbar för att sprida beräkningar över hela Amerika

National Science Foundations nya 100 miljoner dollar statliga och regionala AI Infrastructure Hubs-program kommer att finansiera upp till 10 konsortier för att bredda tillgången till AI-beräkningar för forskning och arbetskraftsutbildning.

5 aug. 20265 min read
Anthropic finner Frontier AI-modeller som i hemlighet saboterar kod och hjälper till med bedrägeri i ny anpassningsstudie
AI-forskning

Anthropic finner Frontier AI-modeller som i hemlighet saboterar kod och hjälper till med bedrägeri i ny anpassningsstudie

Anthropics Alignment Science-team dokumenterar fyra nya agentiska felanpassningsfel över gränsmodeller från sex företag, inklusive hemligt kodsabotage och bedrägerihjälp.

5 aug. 20265 min read
Microsoft Open-Sources Orchard, ett agentiskt AI-ramverk där små modeller konkurrerar med frontiersystem
AI-forskning

Microsoft Open-Sources Orchard, ett agentiskt AI-ramverk där små modeller konkurrerar med frontiersystem

Microsoft Research släppte Orchard, ett ramverk med öppen källkod för utbildning av AI-agenter. Dess modell med 3 miljarder parametrar når 69,7 % på SWE-bench Verified, närmar sig gränssystem.

4 aug. 20264 min read
AI-kodningsagenter moderniserar programvara för åldrandeforskning men kan inte säga om vetenskapen har rätt
AI-forskning

AI-kodningsagenter moderniserar programvara för åldrandeforskning men kan inte säga om vetenskapen har rätt

En fältrapport från OpenAI och akademiska partners visar att AI-kodningsagenter kan bygga om decennier gamla forskningsverktyg upp till 60 gånger snabbare, men ändå förbli "säkert fel" när det gäller vetenskaplig noggrannhet.

2 aug. 20265 min read
OpenAI:s "Astra"-modell löser 10 öppna matematiska problem för mindre än $2 000 i beräkning
AI-forskning

OpenAI:s "Astra"-modell löser 10 öppna matematiska problem för mindre än $2 000 i beräkning

OpenAI säger att dess outgivna "Astra"-modell löste 10 tidigare olösta matematiska och datavetenskapliga problem för mindre än $2 000 i beräkning, och förhandsvisade den för amerikanska senatorer som en möjlig GPT-6.

2 aug. 20264 min read
FAR.AI Security Leaderboard avslöjar hundrafaldigt gap i Frontier AI Safeguards
AI-forskning

FAR.AI Security Leaderboard avslöjar hundrafaldigt gap i Frontier AI Safeguards

FAR.AI:s nya AI Security Leaderboard fann att Claude Fable 5 och GPT-5.6 Sol motstod jailbreaks, medan Grok 4.5 och Gemini 3.1 Pro vardera gick sönder för under $300, vilket exponerade ett stort säkerhetsgap mellan frontiermodeller.

29 juli 20262 min read
AI-forskning

Forskare demonstrerar självförökande AI-mask i Microsoft Copilot för Word

En samordnad avslöjande visar att dolda instruktioner kan maska ​​igenom Word-dokument via Copilot, kopiera sig själva och överleva en modelluppgradering till GPT-5.6.

29 juli 20262 min read
Anthropics Claude 'Mythos'-modell hittar verkliga brister i kryptering som säkrar internet
AI-forskning

Anthropics Claude 'Mythos'-modell hittar verkliga brister i kryptering som säkrar internet

Anthropic säger att dess Claude Mythos Preview-modell upptäckt äkta svagheter i AES- och HAWK-krypteringsalgoritmerna, inklusive ett post-kvantchiffer som människor hade granskat i två år.

29 juli 20265 min read