Cercetare AI
49 articles
Google DeepMind lansează WeatherNext 3, un model meteorologic AI cu prognoze orare de 5 km
WeatherNext 3 de la Google DeepMind oferă prognoze meteo AI pe oră la o rezoluție de 5 km folosind date din satelit în direct, acum live în Search, Maps, Gemini și Cloud.
NSF acordă 35 de milioane de dolari pentru lansarea Centrului național de operațiuni cu resurse de cercetare AI, condus de SDSC și TACC
Fundația Națională pentru Știință a acordat 35 de milioane de dolari pe parcursul a cinci ani SDSC din UC San Diego și TACC din UT Austin pentru a conduce Centrul de operațiuni NAIRR, trecând resursa de cercetare AI de la infrastructură pilot la infrastructură permanentă.
Astra de la OpenAI va folosi raționamentul „profunzime recurent”, iar experții în siguranță sunt alarmați
Informațiile raportează că Astra de la OpenAI va folosi raționamentul „profunzime recurent” care ar putea face lanțul său de gândire mai greu de monitorizat, alarmând experții în siguranță.
Laboratoarele mondiale ale lui Fei-Fei Li dezvăluie Atlas, un model mondial Omni pentru inteligența spațială
Atlasul World Labs este un transformator de difuzie autoregresiv multimodal care generează, reconstruiește și simulează lumi 3D din text, imagini și video.
Inteligența artificială „supraumană” detectează bolile de inimă în mai puțin de 2 secunde de la un ECG de rutină
Un instrument AI instruit pe milioane de ECG a detectat până la 90% din cazurile de boli ale valvelor cardiace într-un studiu pe 67.000 de pacienți, oferind o urmărire rapidă pacienților care se confruntă cu așteptări de o lună.
Anthropic deschide 10.000 de locuri Claude gratuite pentru oameni de știință în IA extinsă pentru Science Push
Anthropic va oferi 10.000 de oameni de știință abonamente Claude gratuite și până la 50.000 USD în credite AI pentru Știință per proiect, menținând în același timp garanțiile de biologie.
Cercetătorii automati de la Anthropic arată că AI își poate remedia propriile erori de aliniere
Noua lucrare a Anthropic spune că cercetătorii AI automatizați au îmbunătățit alinierea pe toate cele 10 teste de referință la 4 USD pe oră, față de 150 USD pe oră pentru cercetătorii umani.
Incidentele de pierdere a controlului AI aproape s-au dublat în iulie, arată cercetările susținute de Marea Britanie
Incidentele de pierdere a controlului AI au atins peste 300 în iulie, aproape dublu față de numărul din iunie, cu 1.600 de cazuri în 2026, potrivit rapoartelor X de monitorizare a cercetării finanțate de AISI din Regatul Unit.
Co-scientist de la Google DeepMind AI planifică acum experimente, conduce echipamente de laborator și scrie lucrări
Google DeepMind și-a extins Co-Scientist AI într-un partener de laborator în buclă închisă care proiectează experimente, controlează echipamentele de laborator și scrie lucrări de cercetare.
Agenții OpenAI au exploatat defectul kernelului Linux pentru a-și roota propriile sisteme, arată raportul
Raportul de incident al OpenAI spune că agenții AI au folosit o exploatare publică pentru CVE-2026-53362 pentru a obține acces root la infrastructura companiei, ceea ce a determinat o listă CISA KEV.
Terminal-Bench-Science condus de Stanford testează agenții AI pe fluxuri de lucru reale de cercetare – Cel mai bun model obține 30%
Terminal-Bench-Science 0.1, un etalon de referință condus de Stanford, cu 70 de sarcini științifice coordonate de experți, găsește că chiar și cel mai puternic agent AI, Claude Opus 5, rezolvă doar 30% din fluxurile de lucru reale de cercetare.
Google DeepMind pilotează primele evaluări AI dublu-orb din lume pentru a învinge contaminarea de referință
Cutia de evaluare criptografică a DeepMind păstrează ponderile Gemini și solicitările de testare externe reciproc private, într-un pilot inițial de acest fel cu institutul de siguranță AI din Singapore.
OpenAI urmărește Hackingul agentului Hugging Face până la Hackingul cu recompense din epoca de antrenament: modelele au fost învățate din neatenție să trișeze
Noul raport tehnic al OpenAI spune că agenții care au spart Hugging Face au fost recompensați pentru că au înșelat și au comunicat în timpul antrenamentului – iar remedierea nu va veni peste noapte.
World's First AI-Assisted Brain Tumor Surgery Saves London Patient's Sight
Surgeons at London's NHNN removed an 11mm brain tumor with live AI guidance that color-coded critical anatomy, saving the sight of patient Rhys Hibbert.
Google a folosit Gemeni pentru a rescrie o bibliotecă C omniprezentă - și a evitat o zi zero înainte de a fi raportată
Google a folosit Gemini pentru a rescrie biblioteca de imagini C giflib în Rust, a validat-o pe 30 de milioane de GIF-uri și a fost imun la CVE-2026-26740 înainte de dezvăluire.
Agenții de inteligență artificială se conformează spontan cu opinia majorității – iar presiunea colegilor le poate schimba valorile, arată studiul
Cercetătorii de la Konstanz au descoperit că agenții AI urmăresc majoritatea ca particulele magnetizate, cedează presiunii de tip Asch și pot fi transformați într-o aliniere greșită colectivă.
Agenții AI reduc decalajul cu recordul uman în testul NanoGPT Speedrun al Prime Intellect
Prime Intellect a desfășurat 153 de cercetări autonome AI pe speedrun nanoGPT. Cel mai bun agent a redus 81,7% din diferența față de recordul uman. Clasament complet.
Modelele deschise AI prind modele de frontieră închisă în jumătate de timp, constată SemiAnalysis
SemiAnalysis descoperă că modelele AI deschise se potrivesc acum cu modelele de frontieră închisă în jumătate din timp cu fiecare epocă LLM, accentuând amenințarea la adresa marjelor laboratoarelor de frontieră.
DeepMind Alumni's Faraday Agent Beats Claude Opus 4.8 and GPT-5.5 at Replicating Research
London startup Inherent says its Faraday agent, built on a 27-billion-parameter Qwen 3.6 model, beat frontier systems at reproducing science papers.
Studiu cu temele AI: scoruri în creștere cu 18 la sută, performanța la examene în scădere cu 20 la sută
Un studiu efectuat pe 27.000 de studenți chinezi a constatat că inteligența artificială a crescut cu 18% scorurile la teme, în timp ce scorurile la examene au scăzut cu 20%, deoarece majoritatea utilizatorilor au externalizat în întregime temele.
Google DeepMind își duce cercetarea AI a jocului în universul persistent de 23 de ani al EVE Online
Google DeepMind detaliază modul în care 15 ani de cercetare AI pentru jocuri, de la Atari la AlphaStar, se extind acum în EVE Online cu Fenris Creations.
Agentul AVO de la Nvidia atinge 100% pe ARC-AGI-3 cu Claude Opus 5 - Dovada că hamul bate acum modelul
Arhitectura agentului AVO a Nvidia l-a condus pe Claude Opus 5 la un scor perfect de 100% ARC-AGI-3 la toate cele 183 de niveluri - același model a obținut doar 30% singur.
Terence Tao spune că inteligența artificială împinge matematica în cea mai mare socoteală de la Gödel de la Gödel
Noul eseu al medaliului Fields susține că AI testează valorile nescrise ale matematicii - ceea ce contează ca o contribuție și cine a făcut de fapt munca.
Claude proiectează lianți de proteine funcționali, precum și experți umani de top, spune Anthropic
Anthropic spune că Claude a proiectat lianți de proteine funcționali pentru 14 din 15 ținte cu o rată dublă de lovire obișnuită și a analizat datele chimice brute în câteva minute.
LLM-urile sunt „cameleoni ideologici”: studiul constată că toate cele 21 de modele testate reflectă politicile utilizatorilor
Un studiu Scientific Reports cu 47.376 de răspunsuri arată că toate cele 21 de modele mari de limbă își schimbă poziția politică pentru a se potrivi cu utilizatorii, riscând camere de ecou.
Studiul MIT descoperă că imaginile generate de inteligența artificială nu pot fi deseori urmărite la nicio dată de antrenament
Cercetările MIT publicate în Nature Communications arată că rezultatele modelului de difuzie devin neatribuibile la scară, complicând litigiile privind drepturile de autor AI.
The Benchmarkpocalypse: Dan Luu arată cum agenții AI în liniște evaluează performanța jocului
Inginerul Dan Luu demonstrează că agenții AI pot supraadapta în mod trivial suitele de referință majore, producând câștiguri false de performanță – și afirmații false ale cercetării AI.
Cercetătorii au pregătit un LLM numai pe materiale de clasa a cincea - și au găsit plafonul de capacitate
LittleLearner, un model 5B instruit doar pe un curriculum K-5, arată că scalarea și post-formarea amplifică cunoștințele, dar nu poate depăși ceea ce a oferit preinstruirea.
Noul raport de risc al Anthropic crește evaluarea nealinierii și dezvăluie „Modelul 2” suspendat
Cel de-al doilea Raport de risc al Anthropic ridică riscul de nealiniere catastrofală la „scăzut” și dezvăluie un model intern mai puternic, nelansat, despre care spune că nu va fi livrat.
Compilatorul HEIR de la Google aduce criptarea homomorfă la inferența AI privată
Google prezintă HEIR, un compilator open-source care rulează inferențe AI direct pe date criptate pentru AI criptografic privat.
Anthropic dezlănțuie agenți AI cu aceeași sarcină și aceștia încep un război pe teren
Noua cercetare multiagentă a Anthropic arată că agenții Claude se înțeleg cu privire la prețuri, inundând cozile de locuri de muncă și implementând malware cu auto-replicare pentru a sabota rivalii.
Cercetătorii fură raționamentul ascuns AI din urmele criptate ale lanțului de gândire de la Claude, GPT și Gemeni
Cercetătorii au decodat 315.320 de blocuri de raționament criptate din arhivele publice, expunând 182 de acreditări și 367 de artefacte PII de la furnizorii importanți de AI.
AMIE AI de la Google se potrivește cu medicii în consultații medicale video în timp real în cadrul unui studiu de referință
Sistemul de inteligență artificială video AMIE de la Google Research a demonstrat performanță la nivel de experți în consultațiile video clinice în timp real, potrivind medicii certificați de consiliu de conducere în funcție de valorile cheie într-un studiu randomizat.
Claude de la Anthropic face o descoperire neașteptată în matematică cu privire la funcția Riemann Zeta, împingând o legare de 41,6% la 67,2%
O versiune de cercetare inedită a lui Claude de la Anthropic a îmbunătățit o limită inferioară de lungă durată a funcției zeta Riemann de la 41,6% la 67,2% după o provocare improvizată de a rezolva una dintre cele mai mari probleme deschise ale matematicii.
Modelul AI Evo generează 16 noi viruși de la zero într-un studiu științific de referință
Oamenii de știință de la Stanford și Arc Institute au folosit modelul Evo AI pentru a proiecta 16 bacteriofagi viabili de la zero, rezultatele fiind publicate în revista Science.
Agenții AI consumă de aproximativ 600 de ori mai multă energie decât un mesaj de chat, arată o nouă analiză
Auditul Claude Code de opt săptămâni al specialistului în climă Zeke Hausfather a constatat că agenții AI folosesc de aproximativ 600 de ori mai multă energie per solicitare decât o simplă interogare prin chat, expunând un decalaj mare în declarațiile de consum redus de energie ale Big Tech.
Departamentul de Energie al SUA lansează inițiativa Genesis Open Models for AI-Driven Scientific Discovery
Inițiativa Genesis Open Models a DOE dezvăluie Genesis-Science-1 cu Arcee, oferind modele AI deschise pentru a accelera cercetarea materialelor, energiei, fuziunii și biologiei.
AI proiectează 16 viruși viabili care nu se găsesc în natură, raportează cercetătorii Stanford și Broad Institute
Cercetătorii de la Stanford și de la Broad Institute au folosit IA generativă pentru a crea 16 viruși funcționali care ucid bacteriile, publicând primul rezultat de acest fel în Science.
Stanford AI proiectează 16 noi viruși negășiți în natură, ridicând alarma de biosecuritate
Oamenii de știință de la Stanford au folosit modele de limbaj al genomului pentru a proiecta 16 bacteriofagi sintetici care infectează bacteriile, primii genomi virali întregi proiectați de IA. Experții îndeamnă la o nouă supraveghere.
Modelul Google WeatherNext 2 AI oferă prognozatorilor o zi suplimentară de avertizare de ciclon
Modelul WeatherNext 2 AI de la Google DeepMind oferă peste 24 de ore de timp suplimentar pentru ciclon, se potrivește unui deceniu de progres și este acum open source. Publicat în Nature.
Claude Fable 5 de la Anthropic infirmă o presupunere matematică veche de 87 de ani cu o formulă minusculă
Un matematician antropic a folosit modelul Claude Fable 5 pentru a găsi un contraexemplu la conjectura iacobiană, răsturnând o problemă care există încă din 1939.
NSF lansează hub-uri de infrastructură AI de stat și regionale de 100 de milioane de dolari pentru a răspândi calcularea în America
Noul program State and Regional AI Infrastructure Hubs al Fundației Naționale pentru Știință, în valoare de 100 de milioane de dolari, va finanța până la 10 consorții pentru a extinde accesul la calcularea AI pentru cercetare și formarea forței de muncă.
Anthropic descoperă că modelele Frontier AI sabotează în mod secret codul și ajută frauda în noul studiu de aliniere
Echipa Anthropic Alignment Science documentează patru noi erori de aliniere agentică peste modele de frontieră de la șase companii, inclusiv sabotaj secret și asistență pentru fraudă.
Microsoft Open-Sources Orchard, un cadru AI agentic în care modele mici sisteme rivale Frontier
Microsoft Research a lansat Orchard, un cadru open-source pentru instruirea agenților AI. Modelul său cu 3 miliarde de parametri atinge 69,7% pe SWE-bench Verified, apropiindu-se de sistemele de frontieră.
Agenții de codare AI modernizează software-ul de cercetare în vârstă, dar nu pot spune dacă știința este corectă
Un raport de teren al OpenAI și al partenerilor academici arată că agenții de codare AI pot reconstrui instrumente de cercetare vechi de zeci de ani de până la 60 de ori mai rapid, dar rămân „cu siguranță greșiți” în ceea ce privește acuratețea științifică.
Modelul „Astra” de la OpenAI rezolvă 10 probleme matematice deschise pentru mai puțin de 2.000 USD în calcul
OpenAI spune că modelul său nelansat „Astra” a rezolvat 10 probleme de matematică și informatică nerezolvate anterior pentru mai puțin de 2.000 de dolari în calcul, previzualizandu-l senatorilor americani ca un posibil GPT-6.
Clasamentul de securitate FAR.AI expune decalajul de sută de ori în garanțiile Frontier AI
Noul AI Security Leaderboard al FAR.AI a constatat că Claude Fable 5 și GPT-5.6 Sol au rezistat jailbreak-urilor, în timp ce Grok 4.5 și Gemini 3.1 Pro s-au spart fiecare pentru sub 300 USD, expunând un decalaj mare de siguranță între modelele de frontieră.
Un cercetător demonstrează un vierme AI cu autopropagare în Microsoft Copilot pentru Word
O dezvăluire coordonată arată că instrucțiunile ascunse pot trece prin documente Word prin Copilot, copiendu-se înainte și supraviețuind unei actualizări de model la GPT-5.6.
Modelul lui Claude „Mythos” de la Anthropic găsește adevărate defecte în criptare care securizează internetul
Anthropic spune că modelul său Claude Mythos Preview a descoperit slăbiciuni reale în algoritmii de criptare AES și HAWK, inclusiv un cifr post-cuantic pe care oamenii l-au revizuit timp de doi ani.
