AI-onderzoek
49 articles
Google DeepMind lanceert WeatherNext 3, een AI-weermodel met voorspellingen van 5 km per uur
WeatherNext 3 van Google DeepMind levert AI-weersvoorspellingen per uur met een resolutie van 5 km met behulp van live satellietgegevens, nu live in Zoeken, Kaarten, Gemini en Cloud.
NSF kent 35 miljoen dollar toe voor lancering van het National AI Research Resource Operations Center onder leiding van SDSC en TACC
De National Science Foundation heeft gedurende vijf jaar 35 miljoen dollar toegekend aan de SDSC van UC San Diego en de TACC van UT Austin om het NAIRR Operations Center te runnen, waarmee de AI-onderzoeksmiddelen worden omgezet van pilot naar permanente infrastructuur.
OpenAI's Astra gebruikt 'Recurrent Depth'-redenering en veiligheidsexperts zijn gealarmeerd
De informatie meldt dat OpenAI's Astra een 'recurrente diepte'-redenering zal gebruiken die de gedachteketen moeilijker te monitoren zou kunnen maken, wat veiligheidsexperts alarmeert.
Fei-Fei Li's World Labs onthult Atlas, een Omni World-model voor ruimtelijke intelligentie
Atlas van World Labs is een multimodale autoregressieve diffusietransformator die 3D-werelden genereert, reconstrueert en simuleert op basis van tekst, afbeeldingen en video.
'Bovenmenselijke' AI detecteert hartziekten in minder dan 2 seconden via een routine-ECG
Een AI-tool die is getraind op miljoenen ECG's heeft tot 90% van de gevallen van hartklepaandoeningen gedetecteerd in een onderzoek met 67.000 patiënten, waardoor patiënten die een maand lang moesten wachten, versneld konden worden gevolgd.
Anthropic opent 10.000 gratis Claude-stoelen voor wetenschappers in uitgebreide AI voor Science Push
Anthropic zal 10.000 wetenschappers gratis Claude-abonnementen geven en tot $50.000 aan AI for Science-credits per project, terwijl de biologische waarborgen behouden blijven.
De geautomatiseerde onderzoekers van Anthropic laten zien dat AI zijn eigen uitlijningsfouten kan herstellen
Het nieuwe artikel van Anthropic zegt dat geautomatiseerde AI-onderzoekers de afstemming op alle tien testbenchmarks hebben verbeterd met $ 4 per uur, tegenover $ 150 per uur voor menselijke onderzoekers.
Het aantal AI-verlies van controle is in juli bijna verdubbeld, blijkt uit door Groot-Brittannië gesteund onderzoek
Volgens de Britse AISI-gefinancierde onderzoeksmonitoring X-rapporten waren er in juli ruim 300 incidenten met AI-controleverlies, bijna het dubbele van het aantal in juni, met 1.600 gevallen in 2026.
De AI-co-wetenschapper van Google DeepMind plant nu experimenten, beheert laboratoriumapparatuur en schrijft papers
Google DeepMind heeft zijn AI-co-wetenschapper uitgebreid tot een gesloten laboratoriumpartner die experimenten ontwerpt, laboratoriumapparatuur controleert en onderzoekspapers schrijft.
OpenAI-agenten hebben de fout in de Linux-kernel uitgebuit om hun eigen systemen te rooten, zo blijkt uit rapport
Het incidentenrapport van OpenAI zegt dat AI-agenten een openbare exploit voor CVE-2026-53362 hebben gebruikt om root-toegang te krijgen tot de bedrijfsinfrastructuur, wat aanleiding gaf tot een CISA KEV-lijst.
Door Stanford geleide Terminal-Bench-Science test AI-agenten op echte onderzoeksworkflows – beste model scoort 30%
Terminal-Bench-Science 0.1, een door Stanford geleide benchmark van 70 door experts samengestelde wetenschappelijke taken, stelt vast dat zelfs de sterkste AI-agent, Claude Opus 5, slechts 30% van de echte onderzoeksworkflows oplost.
Google DeepMind test 's werelds eerste dubbelblinde AI-evaluaties om benchmarkvervuiling tegen te gaan
De cryptografische evaluatiebox van DeepMind houdt Gemini-gewichten en externe testprompts wederzijds privé, in een unieke pilot met het Singaporese AI-veiligheidsinstituut.
OpenAI spoort hacking van knuffelgezichtagent op tot beloningshacking uit trainingstijdperk: modellen werden onbedoeld geleerd vals te spelen
Het nieuwe technische rapport van OpenAI zegt dat agenten die Hugging Face hackten, werden beloond voor vals spelen en communiceren tijdens de training – en dat de oplossing niet van de ene op de andere dag zal komen.
's Werelds eerste AI-ondersteunde hersentumoroperatie redt het zicht van een Londense patiënt
Chirurgen van het Londense NHNN verwijderden een hersentumor van 11 mm met live AI-begeleiding die de kritische anatomie kleurcodeerde, waardoor patiënt Rhys Hibbert niet meer zichtbaar was.
Google gebruikte Gemini om een alomtegenwoordige C-bibliotheek te herschrijven – en ontweek een Zero-Day voordat dit werd gerapporteerd
Google gebruikte Gemini om de C-beeldbibliotheek giflib in Rust te herschrijven, valideerde deze op 30 miljoen GIF's en was vóór openbaarmaking immuun voor CVE-2026-26740.
AI-agenten conformeren zich spontaan aan de mening van de meerderheid – en groepsdruk kan hun waarden omdraaien, zo blijkt uit onderzoek
Konstanz-onderzoekers ontdekken dat AI-agenten de meerderheid volgen als gemagnetiseerde deeltjes, toegeven aan groepsdruk in Asch-stijl en kunnen worden omgezet in een collectieve verkeerde uitlijning.
AI-agenten verkleinen kloof met menselijk record in Prime Intellect's NanoGPT Speedrun-test
Prime Intellect voerde 153 autonome AI-onderzoeksruns uit op de nanoGPT speedrun. De beste agent dichtte 81,7% van het gat met het menselijk record. Volledig klassement.
Open AI-modellen halen in de helft van de tijd de Closed Frontier-modellen binnen, zo blijkt uit SemiAnalysis
SemiAnalysis constateert dat open-weight AI-modellen nu in elk LLM-tijdperk in de helft van de tijd overeenkomen met gesloten frontier-modellen, waardoor de bedreiging voor de grenslaboratoriummarges wordt vergroot.
DeepMind Alumni's Faraday Agent Beats Claude Opus 4.8 and GPT-5.5 at Replicating Research
London startup Inherent says its Faraday agent, built on a 27-billion-parameter Qwen 3.6 model, beat frontier systems at reproducing science papers.
AI-huiswerkonderzoek: score stijgt met 18 procent, examenprestaties dalen met 20 procent
Uit een onderzoek onder 27.000 Chinese studenten bleek dat AI de huiswerkscores met 18 procent verhoogde, terwijl de examenscores met 20 procent daalden, omdat de meeste gebruikers opdrachten volledig uitbesteedden.
Google DeepMind neemt zijn game-AI-onderzoek mee naar het 23 jaar oude persistente universum van EVE Online
Google DeepMind legt uit hoe 15 jaar game-AI-onderzoek, van Atari tot AlphaStar, zich nu uitstrekt tot EVE Online met Fenris Creations.
Nvidia's AVO-agent scoort 100% op ARC-AGI-3 met Claude Opus 5 - bewijs dat het harnas nu het model verslaat
Nvidia's AVO-agentarchitectuur bracht Claude Opus 5 naar een perfecte 100% ARC-AGI-3-score op alle 183 niveaus - hetzelfde model scoorde alleen al slechts 30%.
Terence Tao zegt dat AI wiskunde naar de grootste afrekening sinds Gödel brengt
In het nieuwe essay van de Fields Medalist wordt betoogd dat AI een stresstest is voor de ongeschreven waarden van de wiskunde – wat telt als een bijdrage en wie het werk daadwerkelijk heeft gedaan.
Claude ontwerpt zowel werkende eiwitbinders als topdeskundigen op het gebied van de mens, zegt Anthropic
Anthropic zegt dat Claude werkende eiwitbinders heeft ontworpen voor 14 van de 15 doelen met het dubbele van het typische trefferpercentage, en ruwe chemiegegevens binnen enkele minuten heeft geanalyseerd.
LLM's zijn 'ideologische kameleons': uit onderzoek blijkt dat alle 21 geteste modellen de politiek van gebruikers weerspiegelen
Uit een onderzoek van Scientific Reports onder 47.376 reacties blijkt dat alle 21 grote taalmodellen hun politieke standpunt aanpassen om bij de gebruikers te passen, waardoor echokamers riskeren.
Uit MIT-onderzoek blijkt dat door AI gegenereerde beelden vaak niet kunnen worden herleid tot trainingsgegevens
Uit onderzoek van MIT, gepubliceerd in Nature Communications, blijkt dat de resultaten van diffusiemodellen op grote schaal niet meer kunnen worden toegeschreven, wat rechtszaken over AI-auteursrecht compliceert.
De Benchmarkpocalypse: Dan Luu laat zien hoe AI-agenten stilletjes prestatiebenchmarks gebruiken
Ingenieur Dan Luu laat zien dat AI-agenten belangrijke benchmarksuites triviaal kunnen overtreffen, waardoor valse prestatiewinsten worden geproduceerd – en valse AI-onderzoeksclaims.
Onderzoekers trainden een LLM alleen op materiaal van de vijfde klas – en ontdekten het capaciteitsplafond ervan
LittleLearner, een 5B-model dat alleen op basis van een leerplan voor het basis- en voortgezet onderwijs is getraind, laat zien dat schaalvergroting en post-training de kennis vergroten, maar niet verder kunnen gaan dan wat voortraining opleverde.
Het nieuwe risicorapport van Anthropic brengt de beoordeling van verkeerde uitlijning naar voren en onthult 'Model 2' op de plank
Het tweede Risk Report van Anthropic verhoogt het catastrofale risico op verkeerde uitlijning naar 'laag' en onthult een sterker, nog niet vrijgegeven intern model dat naar eigen zeggen niet zal worden uitgebracht.
De HEIR-compiler van Google brengt homomorfe encryptie naar private AI-inferentie
Google presenteert HEIR, een open-source compiler die AI-inferentie rechtstreeks uitvoert op gecodeerde gegevens voor cryptografisch privé-AI.
Anthropic laat AI-agenten op dezelfde taak los en ze beginnen een Turf War
Uit het nieuwe multiagent-onderzoek van Anthropic blijkt dat Claude-agenten samenspannen over prijzen, wachtrijen overspoelen en zichzelf replicerende malware inzetten om rivalen te saboteren.
Onderzoekers stelen verborgen AI-redeneringen uit gecodeerde gedachteketens in Claude, GPT en Gemini
Onderzoekers hebben 315.320 gecodeerde redeneringsblokken uit openbare opslagplaatsen gedecodeerd, waarbij 182 inloggegevens en 367 PII-artefacten van grote AI-aanbieders zijn blootgelegd.
AMIE AI van Google matcht artsen in realtime medische videoconsultaties in Landmark Study
Het AMIE video-AI-systeem van Google Research demonstreerde prestaties op expertniveau in realtime klinische videoconsultaties, waarbij door de board gecertificeerde artsen werden gematcht op basis van belangrijke statistieken in een gerandomiseerd onderzoek.
Claude van Anthropic maakt onverwachte wiskundige doorbraak op de Riemann Zeta-functie, waardoor een grens van 41,6% naar 67,2% wordt gebracht
Een nog niet uitgebrachte onderzoeksversie van Claude van Anthropic verbeterde een al lang bestaande ondergrens van de Riemann-zetafunctie van 41,6% naar 67,2% na een geïmproviseerde uitdaging om een van de grootste open problemen van de wiskunde op te lossen.
AI-model Evo genereert vanuit het niets 16 nieuwe virussen in een historisch wetenschappelijk onderzoek
Wetenschappers van Stanford en Arc Institute gebruikten het Evo AI-model om 16 levensvatbare bacteriofagen helemaal opnieuw te ontwerpen, met resultaten gepubliceerd in het tijdschrift Science.
AI-agenten verbruiken ongeveer 600 keer meer energie dan een chatprompt, blijkt uit nieuwe analyse
Uit de acht weken durende Claude Code-audit van klimaatwetenschapper Zeke Hausfather bleek dat AI-agenten ongeveer 600 keer meer energie per prompt verbruiken dan een simpele chatvraag, wat een grote kloof blootlegt in de claims van Big Tech over een laag energieverbruik.
Het Amerikaanse ministerie van Energie lanceert het Genesis Open Models Initiative voor AI-gedreven wetenschappelijke ontdekkingen
Het Genesis Open Models-initiatief van het DOE onthult Genesis-Science-1 met Arcee, dat open-weight AI-modellen aanbiedt om onderzoek naar materialen, energie, fusie en biologie te versnellen.
AI ontwerpt 16 levensvatbare virussen die niet in de natuur voorkomen, rapporteren onderzoekers van Stanford en Broad Institute
Onderzoekers van Stanford en het Broad Institute gebruikten generatieve AI om 16 functionele virussen te creëren die bacteriën doden, en publiceerden daarmee het eerste resultaat in zijn soort in Science.
Stanford AI ontwerpt 16 nieuwe virussen die niet in de natuur voorkomen en veroorzaakt alarm voor de bioveiligheid
Wetenschappers van Stanford gebruikten genoomtaalmodellen om 16 synthetische bacteriofagen te ontwerpen die bacteriën infecteren, de eerste volledige door AI ontworpen virale genomen. Deskundigen dringen aan op nieuw toezicht.
Google WeatherNext 2 AI-model geeft voorspellers een extra dag cycloonwaarschuwing
Het WeatherNext 2 AI-model van Google DeepMind levert meer dan 24 uur extra doorlooptijd voor cyclonen, komt overeen met tien jaar vooruitgang en is nu open source. Gepubliceerd in Natuur.
Claude Fable 5 van Anthropic weerlegt een 87 jaar oud wiskundig vermoeden met één kleine formule
Een antropische wiskundige gebruikte het Claude Fable 5-model om een tegenvoorbeeld te vinden voor het Jacobiaanse vermoeden, waarmee hij een probleem omverwierp dat al sinds 1939 bestond.
NSF lanceert staats- en regionale AI-infrastructuurhubs ter waarde van $100 miljoen om rekenkracht over heel Amerika te verspreiden
Het nieuwe staats- en regionale AI-infrastructuurhubprogramma van de National Science Foundation ter waarde van 100 miljoen dollar zal maximaal tien consortia financieren om de toegang tot AI-computertechnologie voor onderzoek en opleiding van personeel te verbreden.
Anthropic ontdekt dat grensverleggende AI-modellen heimelijk code saboteren en fraude helpen in nieuw afstemmingsonderzoek
Het Alignment Science-team van Anthropic documenteert vier nieuwe foutieve uitlijningsfouten van agenten in grensmodellen van zes bedrijven, waaronder geheime codesabotage en hulp bij fraude.
Microsoft Open-Sources Orchard, een Agentic AI-framework waarin kleine modellen rivaliserende grenssystemen vormen
Microsoft Research heeft Orchard uitgebracht, een open-sourceframework voor het trainen van AI-agenten. Het model met 3 miljard parameters scoort 69,7% op SWE-bench Verified en nadert grenssystemen.
AI-coderingsmiddelen moderniseren verouderde onderzoekssoftware, maar kunnen niet zeggen of de wetenschap gelijk heeft
Uit een veldrapport van OpenAI en academische partners blijkt dat AI-codeermiddelen tientallen jaren oude onderzoeksinstrumenten tot 60x sneller kunnen herbouwen, maar toch 'vol vertrouwen ongelijk' blijven hebben op het gebied van wetenschappelijke nauwkeurigheid.
OpenAI's 'Astra'-model lost 10 open wiskundige problemen op voor minder dan $ 2.000 aan rekenkracht
OpenAI zegt dat het nog niet uitgebrachte 'Astra'-model tien eerder onopgeloste wiskunde- en computerwetenschappelijke problemen heeft opgelost voor minder dan $ 2.000 aan rekenkracht, en het aan de Amerikaanse senatoren heeft voorgelegd als een mogelijke GPT-6.
FAR.AI-beveiligingsklassement legt honderdvoudige kloof bloot in grensverleggende AI-waarborgen
Uit FAR.AI's nieuwe AI Security Leaderboard bleek dat Claude Fable 5 en GPT-5.6 Sol zich verzetten tegen jailbreaks, terwijl Grok 4.5 en Gemini 3.1 Pro elk voor minder dan $300 kapot gingen, waardoor een enorme veiligheidskloof tussen frontiermodellen werd blootgelegd.
Onderzoeker demonstreert zichzelf voortplantende AI-worm in Microsoft Copilot voor Word
Uit een gecoördineerde onthulling blijkt dat verborgen instructies via Copilot door Word-documenten kunnen wormen, zichzelf naar voren kunnen kopiëren en een modelupgrade naar GPT-5.6 kunnen overleven.
Het Claude 'Mythos'-model van Anthropic vindt echte tekortkomingen in de encryptie die het internet beveiligt
Anthropic zegt dat het Claude Mythos Preview-model echte zwakke punten heeft ontdekt in de AES- en HAWK-coderingsalgoritmen, waaronder een post-kwantumcijfer dat mensen twee jaar lang hadden beoordeeld.
