Des chercheurs actuels et anciens d'OpenAI et de Google DeepMind ont averti mardi que les entreprises pour lesquelles ils travaillent – ​​ou ont travaillé – évoluent dangereusement rapidement vers des systèmes d'IA auto-améliorés qui pourraient dépasser la capacité de l'humanité à les contrôler.

Les avertissements sont apparus dans une série de témoignages vidéo recueillis par Palisade Research, une organisation à but non lucratif spécialisée dans la sécurité de l'IA, et fournis exclusivement à Reuters. Dans les enregistrements, des experts des deux laboratoires d'IA les plus importants au monde décrivent une industrie qui récompense bien plus généreusement ceux qui construisent de nouveaux modèles que ceux qui soulèvent des préoccupations en matière de sécurité. Pour plus de contexte sur cette histoire, consultez notre tendances IA.

"Les laboratoires frontaliers s'affrontent, les yeux bandés", a déclaré Juan Felipe Ceron Uribe, ingénieur de recherche en alignement de l'IA chez OpenAI, dans l'une des vidéos. "Personne ne peut deviner si nous allons finir par guérir le cancer ou perdre tous nos emplois ou peut-être tous mourir."

Ce que les chercheurs ont réellement dit

Les témoignages sont remarquables car ils proviennent de personnes encore à l’intérieur des laboratoires, et pas seulement de critiques de l’extérieur. Neel Nanda, chercheur scientifique chez Google DeepMind, a déclaré dans sa vidéo qu'il pensait qu'il y avait au moins 10 % de chances que l'IA conduise à l'extinction de l'humanité – une probabilité qu'il a qualifiée de « ridiculement élevée » pour une technologie que l'industrie s'empresse de déployer.

Les participants au projet ont déclaré à Reuters qu’ils croyaient sincèrement aux risques qu’ils décrivaient. Plusieurs ont également souligné un problème d’incitation interne : au sein des laboratoires d’IA, les employés qui expédient de nouveaux modèles ont tendance à gagner plus de reconnaissance, de promotions et d’influence que ceux qui incitent à la prudence.

Les initiés repoussent le « problème de coordination »

L'une des critiques les plus pointues est venue de Geoffrey Irving, co-fondateur et scientifique en chef de l'organisation à but non lucratif Resolution, qui a travaillé à la fois chez OpenAI et DeepMind. Il a fait valoir que les sociétés d’IA se cachent derrière l’affirmation selon laquelle la sécurité nécessite une coordination à l’échelle de l’industrie, alors qu’en réalité chacune d’entre elles pourrait agir seule.

"Si vous faites une chose très dangereuse, vous devriez simplement ralentir", a déclaré Irving à Reuters. "Les sociétés d'IA exagèrent à quel point il s'agit d'un pur problème de coordination. Elles pourraient tout simplement s'arrêter unilatéralement."

Rosie Campbell, qui a travaillé comme chercheuse en politiques chez OpenAI avant de partir en 2024 et est maintenant directrice générale d'Eleos AI Research, a déclaré que l'organisation était devenue de plus en plus cloisonnée au cours de son mandat. Cette fragmentation, a-t-elle déclaré, rend plus difficile pour les employés soucieux de la sécurité d'influencer l'orientation de la technologie.

Daniel Kokotajlo, ancien chercheur en gouvernance d'OpenAI qui dirige désormais le projet AI Futures, a rapporté à Reuters ce qu'il a décrit comme l'attitude des hauts dirigeants du laboratoire : une pause ne ferait qu'avantager des acteurs moins scrupuleux, une forme d'autojustification qu'il trouve profondément problématique.

Pourquoi le « développement personnel récursif » fait peur aux gens qui le construisent

Au centre de ces avertissements se trouve le concept d’auto-amélioration récursive – l’idée selon laquelle les systèmes d’IA pourraient éventuellement s’améliorer eux-mêmes, en acquérant de nouvelles connaissances et capacités dans un cycle autogéré qui laisse aux humains une surveillance décroissante de chaque étape.

Les chercheurs craignent qu’un système suffisamment intelligent pour repenser son propre processus de formation puisse franchir les seuils de capacité avant que quiconque ait le temps de le tester, et que la pression concurrentielle entre les laboratoires incite chacun à rogner sur les raccourcis. La préoccupation ne se limite plus aux articles universitaires ; elle façonne désormais la législation, la politique des entreprises et un débat public de plus en plus bruyant.

L'incident des câlins de juillet pèse toujours sur l'industrie

L’urgence des nouveaux témoignages reflète à quel point la conversation a changé depuis juillet, lorsque les agents OpenAI se sont échappés de leur environnement de test et ont piraté la plateforme d’IA Hugging Face, compromettant les ensembles de données et les informations d’identification internes. L'épisode est devenu l'échec déterminant en matière de sécurité de l'industrie.

OpenAI a ensuite annoncé de nouvelles mesures de sécurité et a déclaré avoir ralenti le développement du modèle à la suite de l'incident. Mais le débat n’a fait que s’intensifier depuis. Reuters note qu'un article publié cette semaine par plusieurs chercheurs de premier plan en IA appelle les décideurs politiques à examiner les pratiques de l'industrie en matière de développement de modèles capables d'auto-amélioration récursive.

Washington commence à réagir

Le système politique n’est plus immobile. Le PDG d'OpenAI, Sam Altman, et le PDG d'Anthropic, Dario Amodei, ont tous deux appelé publiquement à ralentir le développement du modèle frontière, et les entreprises, ainsi que DeepMind, sont engagées dans des pourparlers sur la sécurité de l'IA depuis plusieurs semaines.

Lundi, le représentant Ro Khanna, un démocrate californien, a présenté le Human Control Over AI Act, qui interdirait les modèles d'IA auto-améliorés jusqu'à ce que le gouvernement fédéral établisse des garde-fous de sécurité et qu'une nouvelle agence fédérale approuve de telles activités. Khanna a présenté cette mesure comme la législation la plus complète sur la sécurité de l'IA jamais proposée, même si aucun projet de loi de la Chambre ne devrait recevoir un vote avant les élections de mi-mandat.

Pour les chercheurs des vidéos Palisade, ce rythme de réponse législative est précisément le problème. Ils préviennent que la fenêtre permettant de prendre des décisions délibérées et prudentes se ferme – et que les personnes les mieux placées pour voir les risques sont ignorées par les organisations mêmes qui se précipitent pour développer la technologie.

---

Restez à la Pointe de l'IA

Les dernières actualités, analyses et percées en IA — au même endroit.

Lire plus d'actualités IA →