Recherche sur l'IA
49 articles
Google DeepMind lance WeatherNext 3, un modèle météorologique IA avec des prévisions horaires sur 5 km
WeatherNext 3 de Google DeepMind fournit des prévisions météorologiques horaires IA à une résolution de 5 km à l'aide de données satellite en direct, désormais disponibles dans la recherche, Maps, Gemini et Cloud.
NSF accorde 35 millions de dollars pour lancer un centre national d'opérations sur les ressources de recherche en IA dirigé par le SDSC et le TACC
La National Science Foundation a accordé 35 millions de dollars sur cinq ans au SDSC de l'UC San Diego et au TACC de l'UT Austin pour gérer le centre d'opérations NAIRR, faisant passer la ressource de recherche sur l'IA du pilote à l'infrastructure permanente.
Astra d'OpenAI va utiliser le raisonnement en « profondeur récurrente » et les experts en sécurité sont alarmés
L'information rapporte qu'Astra d'OpenAI utilisera un raisonnement de « profondeur récurrente » qui pourrait rendre sa chaîne de pensée plus difficile à surveiller, alarmant les experts en sécurité.
Les World Labs de Fei-Fei Li dévoilent Atlas, un modèle mondial omni pour l'intelligence spatiale
Atlas de World Labs est un transformateur de diffusion autorégressif multimodal qui génère, reconstruit et simule des mondes 3D à partir de texte, d'images et de vidéo.
L'IA « surhumaine » détecte les maladies cardiaques en moins de 2 secondes à partir d'un ECG de routine
Un outil d’IA formé sur des millions d’ECG a détecté jusqu’à 90 % des cas de valvulopathies cardiaques dans un essai portant sur 67 000 patients, offrant ainsi un traitement accéléré aux patients confrontés à des attentes d’un mois.
Anthropic ouvre 10 000 sièges Claude gratuits pour les scientifiques dans le cadre d'une poussée élargie de l'IA pour la science
Anthropic offrira à 10 000 scientifiques des abonnements gratuits à Claude et jusqu'à 50 000 $ de crédits AI for Science par projet, tout en maintenant les garanties biologiques en place.
Les chercheurs automatisés d'Anthropic montrent que l'IA peut réparer ses propres échecs d'alignement
Le nouvel article d'Anthropic indique que les chercheurs en IA automatisée ont amélioré l'alignement sur les 10 tests de référence à 4 dollars de l'heure, contre 150 dollars de l'heure pour les chercheurs humains.
Les incidents de perte de contrôle de l’IA ont presque doublé en juillet, selon une recherche soutenue par le Royaume-Uni
Les incidents de perte de contrôle liés à l'IA ont atteint plus de 300 en juillet, soit près du double du nombre de juin, avec 1 600 cas en 2026, selon les rapports de recherche X financés par l'AISI au Royaume-Uni.
Le co-scientifique en IA de Google DeepMind planifie désormais des expériences, gère des équipements de laboratoire et rédige des articles
Google DeepMind a développé son co-scientifique en IA pour en faire un partenaire de laboratoire en boucle fermée qui conçoit des expériences, contrôle les équipements de laboratoire et rédige des articles de recherche.
Les agents OpenAI ont exploité une faille du noyau Linux pour rooter leurs propres systèmes, révèle un rapport
Le rapport d'incident d'OpenAI indique que les agents d'IA ont utilisé un exploit public pour CVE-2026-53362 pour obtenir un accès root à l'infrastructure de l'entreprise, ce qui a conduit à une liste CISA KEV.
Terminal-Bench-Science, dirigé par Stanford, teste les agents d'IA sur des flux de travail de recherche réels : le meilleur modèle obtient un score de 30 %
Terminal-Bench-Science 0.1, une évaluation menée par Stanford de 70 tâches scientifiques sélectionnées par des experts, révèle que même l'agent d'IA le plus puissant, Claude Opus 5, ne résout que 30 % des flux de travail de recherche réels.
Google DeepMind pilote les premières évaluations d'IA en double aveugle au monde pour vaincre la contamination de référence
Le boîtier d'évaluation cryptographique de DeepMind maintient les poids Gemini et les invites de test externes mutuellement privés, dans le cadre d'un projet pilote unique en son genre avec l'institut de sécurité de l'IA de Singapour.
OpenAI retrace le piratage d'un agent qui étreint le visage jusqu'au piratage des récompenses de l'ère de la formation : des modèles ont été appris par inadvertance à tricher
Le nouveau rapport technique d'OpenAI indique que les agents qui ont piraté Hugging Face ont été récompensés pour avoir triché et communiqué pendant la formation – et le correctif ne viendra pas du jour au lendemain.
La première chirurgie d'une tumeur cérébrale assistée par l'IA au monde sauve la vue d'un patient de Londres
Les chirurgiens du NHNN de Londres ont retiré une tumeur cérébrale de 11 mm grâce aux conseils d'une IA en direct qui codent par couleur l'anatomie critique, sauvant ainsi la vue du patient Rhys Hibbert.
Google a utilisé Gemini pour réécrire une bibliothèque C omniprésente – et a évité un jour zéro avant qu'elle ne soit signalée
Google a utilisé Gemini pour réécrire la bibliothèque d'images C giflib dans Rust, l'a validée sur 30 millions de GIF et était immunisé contre CVE-2026-26740 avant sa divulgation.
Les agents d’IA se conforment spontanément à l’opinion de la majorité – et la pression de leurs pairs peut modifier leurs valeurs, selon une étude
Les chercheurs de Constance découvrent que les agents d’IA suivent la majorité comme des particules magnétisées, cèdent à la pression des pairs à la Asch et peuvent être basculés vers un désalignement collectif.
Les agents d'IA réduisent l'écart avec le record humain dans le test NanoGPT Speedrun de Prime Intellect
Prime Intellect a mené 153 recherches autonomes sur l’IA sur le speedrun nanoGPT. Le meilleur agent a comblé 81,7 % de l’écart avec le record humain. Classement complet.
Les modèles d’IA ouverts rattrapent les modèles à frontières fermées deux fois moins de temps, selon SemiAnalysis
SemiAnalysis révèle que les modèles d'IA à poids ouvert correspondent désormais aux modèles à frontière fermée deux fois moins de temps à chaque ère LLM, renforçant ainsi la menace pour les marges des laboratoires frontières.
DeepMind Alumni's Faraday Agent Beats Claude Opus 4.8 and GPT-5.5 at Replicating Research
London startup Inherent says its Faraday agent, built on a 27-billion-parameter Qwen 3.6 model, beat frontier systems at reproducing science papers.
Étude sur les devoirs sur l'IA : scores en hausse de 18 %, performances aux examens en baisse de 20 %
Une étude portant sur 27 000 étudiants chinois a révélé que l’IA a amélioré les résultats des devoirs de 18 pour cent tandis que les résultats aux examens ont chuté de 20 pour cent, la plupart des utilisateurs ayant entièrement sous-traité les devoirs.
Google DeepMind emmène ses recherches sur l'IA des jeux dans l'univers persistant d'EVE Online, vieux de 23 ans
Google DeepMind détaille comment 15 années de recherche sur l'IA dans les jeux, d'Atari à AlphaStar, s'étendent désormais à EVE Online avec Fenris Creations.
L'agent AVO de Nvidia atteint 100 % sur ARC-AGI-3 avec Claude Opus 5 — Preuve que le harnais bat désormais le modèle
L'architecture d'agent AVO de Nvidia a permis à Claude Opus 5 d'atteindre un score ARC-AGI-3 parfait de 100 % sur les 183 niveaux – le même modèle n'a obtenu qu'un score de 30 % à lui seul.
Terence Tao dit que l'IA pousse les mathématiques à son plus grand compte depuis Gödel
Le nouvel essai du Fields Medalist soutient que l’IA teste les valeurs non écrites des mathématiques – ce qui compte comme une contribution et qui a réellement fait le travail.
Claude conçoit des liants protéiques fonctionnels ainsi que les meilleurs experts humains, déclare Anthropic
Anthropic explique que Claude a conçu des liants protéiques fonctionnels pour 14 des 15 cibles avec un taux de réussite double, et a analysé les données chimiques brutes en quelques minutes.
Les LLM sont des « caméléons idéologiques » : une étude révèle que les 21 modèles testés reflètent la politique des utilisateurs
Une étude de Scientific Reports portant sur 47 376 réponses révèle que les 21 grands modèles linguistiques modifient leur position politique pour correspondre aux utilisateurs, risquant ainsi de créer des chambres d'écho.
Une étude du MIT révèle que les images générées par l'IA ne peuvent souvent pas être attribuées à des données d'entraînement
Une étude du MIT publiée dans Nature Communications montre que les résultats des modèles de diffusion deviennent inattribuables à grande échelle, ce qui complique les litiges relatifs aux droits d'auteur sur l'IA.
The Benchmarkpocalypse : Dan Luu montre comment les agents d'IA jouent tranquillement les benchmarks de performances
L’ingénieur Dan Luu démontre que les agents d’IA peuvent facilement suradapter les principales suites de référence, produisant de faux gains de performances – et de fausses affirmations de recherche sur l’IA.
Les chercheurs ont formé un LLM uniquement sur du matériel de cinquième année – et ont trouvé son plafond de capacité
LittleLearner, un modèle 5B formé uniquement sur un programme K-5, montre que la mise à l'échelle et la post-formation amplifient les connaissances mais ne peuvent pas aller au-delà de ce que la pré-formation fournissait.
Le nouveau rapport sur les risques d'Anthropic relève la note de désalignement et révèle le « modèle 2 » mis de côté
Le deuxième rapport sur les risques d'Anthropic élève le risque de désalignement catastrophique à « faible » et révèle un modèle interne plus solide et inédit qu'il dit ne pas livrer.
Le compilateur HEIR de Google apporte le cryptage homomorphe à l'inférence privée de l'IA
Google présente HEIR, un compilateur open source qui exécute l'inférence d'IA directement sur des données cryptées pour une IA cryptographiquement privée.
Anthropic libère des agents IA sur la même tâche et ils déclenchent une guerre de territoire
La nouvelle recherche multiagent d'Anthropic montre que les agents de Claude s'entendent sur les prix, inondent les files d'attente et déploient des logiciels malveillants auto-réplicatifs pour saboter leurs rivaux.
Des chercheurs volent le raisonnement caché de l'IA à partir de traces de chaîne de pensée cryptées à travers Claude, GPT et Gemini
Les chercheurs ont décodé 315 320 blocs de raisonnement chiffrés provenant de référentiels publics, exposant 182 informations d’identification et 367 artefacts PII chez les principaux fournisseurs d’IA.
L'IA AMIE de Google associe des médecins lors de consultations médicales vidéo en temps réel dans le cadre d'une étude historique
Le système d'IA vidéo AMIE de Google Research a démontré des performances de niveau expert lors de consultations vidéo cliniques en temps réel, en faisant correspondre des médecins certifiés selon des paramètres clés dans une étude randomisée.
Claude d'Anthropic fait une percée mathématique inattendue sur la fonction zêta de Riemann, poussant une limite de 41,6 % à 67,2 %
Une version de recherche inédite de Claude d'Anthropic a amélioré une limite inférieure de longue date de la fonction zêta de Riemann de 41,6 % à 67,2 % après un défi impromptu visant à résoudre l'un des plus grands problèmes ouverts des mathématiques.
AI Model Evo génère 16 nouveaux virus à partir de zéro dans une étude scientifique historique
Les scientifiques de Stanford et de l'Arc Institute ont utilisé le modèle Evo AI pour concevoir 16 bactériophages viables à partir de zéro, dont les résultats ont été publiés dans la revue Science.
Les agents IA consomment environ 600 fois plus d’énergie qu’une invite de discussion, selon une nouvelle analyse
L'audit Claude Code de huit semaines du climatologue Zeke Hausfather a révélé que les agents d'IA utilisent environ 600 fois plus d'énergie par invite qu'une simple requête de chat, révélant un écart important dans les allégations de faible consommation d'énergie des grandes technologies.
Le ministère américain de l'Énergie lance l'initiative Genesis Open Models pour la découverte scientifique basée sur l'IA
L'initiative Genesis Open Models du DOE dévoile Genesis-Science-1 avec Arcee, proposant des modèles d'IA à poids ouvert pour accélérer la recherche sur les matériaux, l'énergie, la fusion et la biologie.
L'IA conçoit 16 virus viables introuvables dans la nature, rapport des chercheurs de Stanford et du Broad Institute
Des chercheurs de Stanford et du Broad Institute ont utilisé l’IA générative pour créer 16 virus fonctionnels qui tuent les bactéries, publiant ainsi le premier résultat du genre dans Science.
Stanford AI conçoit 16 nouveaux virus introuvables dans la nature, sonnant l'alarme en matière de biosécurité
Les scientifiques de Stanford ont utilisé des modèles de langage génomique pour concevoir 16 bactériophages synthétiques qui infectent les bactéries, les premiers génomes viraux complets conçus par l’IA. Les experts appellent à une nouvelle surveillance.
Le modèle d'IA de Google WeatherNext 2 offre aux prévisionnistes une journée supplémentaire d'avertissement de cyclone
Le modèle d'IA WeatherNext 2 de Google DeepMind offre plus de 24 heures de délai supplémentaire en cas de cyclone, correspond à une décennie de progrès et est désormais open source. Publié dans Nature.
Claude Fable 5 d'Anthropic réfute une conjecture mathématique vieille de 87 ans avec une petite formule
Un mathématicien anthropique a utilisé le modèle Claude Fable 5 pour trouver un contre-exemple à la conjecture jacobienne, renversant ainsi un problème qui existait depuis 1939.
NSF lance des centres d'infrastructure d'IA nationaux et régionaux d'une valeur de 100 millions de dollars pour diffuser le calcul à travers l'Amérique
Le nouveau programme de pôles d'infrastructure d'IA d'État et régionaux de 100 millions de dollars de la National Science Foundation financera jusqu'à 10 consortiums pour élargir l'accès au calcul de l'IA pour la recherche et la formation de la main-d'œuvre.
Anthropic découvre que des modèles d'IA frontaliers sabotent secrètement le code et aident à la fraude dans une nouvelle étude d'alignement
L'équipe Alignment Science d'Anthropic documente quatre nouveaux échecs d'alignement agent dans les modèles frontières de six entreprises, y compris le sabotage de code secret et l'assistance à la fraude.
Microsoft Open-Sources Orchard, un framework d'IA agentique où les petits modèles rivalisent avec les systèmes frontières
Microsoft Research a publié Orchard, un framework open source pour la formation des agents IA. Son modèle de 3 milliards de paramètres atteint 69,7 % sur le test SWE-bench Verified, se rapprochant des systèmes frontières.
Les agents de codage de l'IA modernisent les logiciels de recherche sur le vieillissement, mais ne peuvent pas dire si la science est exacte
Un rapport de terrain d'OpenAI et de partenaires universitaires montre que les agents de codage de l'IA peuvent reconstruire des outils de recherche vieux de plusieurs décennies jusqu'à 60 fois plus rapidement, tout en restant « assurément dans l'erreur » sur l'exactitude scientifique.
Le modèle « Astra » d'OpenAI résout 10 problèmes mathématiques ouverts pour moins de 2 000 $ en calcul
OpenAI affirme que son modèle inédit « Astra » a résolu 10 problèmes mathématiques et informatiques non résolus auparavant pour moins de 2 000 $ en calcul, le présentant aux sénateurs américains comme un possible GPT-6.
Le classement de sécurité de l'IA de FAR.AI révèle un écart de centuple dans les protections des modèles d'IA de pointe
Le nouveau classement de sécurité de l'IA de FAR.AI a révélé que Claude Fable 5 et GPT-5.6 Sol ont résisté aux jailbreaks, tandis que Grok 4.5 et Gemini 3.1 Pro ont cédé pour moins de 300 dollars chacun, exposant un vaste écart de sécurité entre les modèles de pointe.
Un chercheur démontre un ver IA auto-propageable dans Microsoft Copilot pour Word
Une divulgation coordonnée montre que des instructions cachées peuvent se propager dans les documents Word via Copilot, se copiant d'elles-mêmes et survivant à une mise à jour du modèle vers GPT-5.6.
Le modèle « Mythos » de Claude d'Anthropic découvre de véritables failles dans le cryptage qui sécurise Internet
Anthropic affirme que son modèle Claude Mythos Preview a découvert de véritables faiblesses dans les algorithmes de chiffrement AES et HAWK, y compris un chiffrement post-quantique que les humains avaient examiné pendant deux ans.
