Une coalition dirigée par Biohub, le ministère américain de l'Énergie et les National Institutes of Health a annoncé un engagement de 1,8 milliard de dollars pour générer et partager ouvertement les données nécessaires à la formation de modèles prédictifs d'IA en biologie – ce que les chercheurs appellent la recherche d'une « cellule virtuelle ».
L'annonce, faite mercredi à Redwood City, en Californie, rassemble des agences fédérales, des organismes philanthropiques et trois des organisations d'IA les plus importantes au monde dans ce que Biohub décrit comme le plus grand engagement coordonné à ce jour pour générer des données biologiques prêtes pour l'IA. Pour plus de contexte sur cette histoire, consultez notre couverture de l'industrie de l'IA.
Qui paie pour quoi
Le chiffre de 1,8 milliard de dollars combine l’argent, les données, les calculs et les nouvelles technologies de mesure de plusieurs partenaires :
- Biohub ancre cet effort avec son engagement fondateur de 500 millions de dollars. Sur ce montant, 400 millions de dollars soutiennent de nouvelles technologies de mesure qui élargissent ce que les biologistes peuvent réellement observer : la tomographie cryoélectronique, qui résout les détails quasi atomiques à l'intérieur de la cellule, ainsi que la microscopie avancée conçue pour imager les cellules à des échelles et à des vitesses que les flux de travail de laboratoire actuels ne peuvent pas approcher.
- Le ministère de l'Énergie investira plus de 500 millions de dollars sur cinq ans dans les mesures, la modélisation et le calcul en laboratoire par l'intermédiaire de son Bureau des sciences.
- Le NIH coordonnera la contribution des ensembles de données, des référentiels et des bases de connaissances développés grâce à un investissement fédéral antérieur de plus de 500 millions de dollars, Biohub travaillant aux côtés de l'agence pour normaliser ces ensembles de données pour la formation des modèles d'IA.
- Google DeepMind, Isomorphic Labs et Meta investissent collectivement 300 millions de dollars dans la Virtual Biology Initiative, l'effort international — annoncé pour la première fois en avril 2026 — que l'expansion d'aujourd'hui officialise.
Le résultat sera une ressource ouverte pour la communauté mondiale de la recherche, et non un ensemble de données exclusives enfermé dans une seule entreprise.
Une expansion, pas un début
L'annonce d'aujourd'hui formalise et étend l'initiative de biologie virtuelle, qui a été annoncée pour la première fois en avril 2026 avec pour mandat de coordonner la génération de données entre les institutions et les disciplines scientifiques. Le lancement d'avril a établi le cadre ; les nouveaux engagements le remplissent d’argent fédéral, de données fédérales et d’investissements du secteur privé.
La division du travail compte. Le DOE apporte une capacité informatique de classe mondiale et des instruments de laboratoire nationaux. Le NIH apporte des ensembles de données standardisés accumulés au cours de décennies de recherche financée par le gouvernement fédéral – le genre de données biologiques longitudinales organisées qu’aucun laboratoire ou entreprise ne pourrait régénérer. Biohub, l'organisme de recherche soutenu par la philanthropie technologique, fait office de centre d'intégration qui normalisera ces sources dans des formats sur lesquels les modèles d'IA peuvent réellement s'entraîner.
Le grand défi « Cellule virtuelle »
L'objectif déclaré de l'initiative est de permettre aux scientifiques de mener des expériences numériquement : pour prédire comment une cellule réagit à un médicament, à une perturbation génétique ou à un état pathologique avant de toucher une pipette.
"Un modèle prédictif précis de la biologie pourrait considérablement accélérer la découverte scientifique en permettant aux scientifiques de réaliser des expériences numériquement", a déclaré Alex Rives, responsable scientifique de Biohub, dans l'annonce. "Les connaissances qui en découleront pourraient permettre une bien meilleure compréhension de la maladie et ouvrir de toutes nouvelles voies de guérison."
"En raison de ce potentiel, la création d'une cellule virtuelle est l'un des défis les plus importants de la prochaine ère scientifique", a ajouté Rives. "Cela nécessitera des efforts coordonnés de génération de données à l'échelle nationale et internationale, c'est pourquoi ces partenaires se réunissent."
Pourquoi les données, et pas seulement les modèles, constituent le goulot d'étranglement
L'IA en biologie a produit des résultats marquants – la famille AlphaFold de DeepMind a démontré que les réseaux neuronaux peuvent prédire les structures des protéines avec une précision expérimentale – mais ces systèmes ont été formés sur des décennies de données publiques conservées. Les problèmes de pointe, depuis la prévision de la réaction de cellules entières aux interventions jusqu’à la modélisation des interactions cellulaires, nécessitent des données qui n’existent pas encore sous une forme prête pour l’IA.
C’est l’écart que vise l’initiative. Plutôt que de publier un autre modèle, les partenaires financent l'infrastructure peu glamour de la science : étendre les données sur la réponse cellulaire à des interventions portant sur bien plus de types et de conditions cellulaires que ceux qui ont encore été étudiés, construire et valider des technologies pour étudier les cellules et leurs interactions à plus grande échelle, plus rapidement et plus précisément, et assembler des référentiels partagés que les laboratoires extérieurs peuvent réellement utiliser.
L'expansion a également une dimension défensive. Sur Hacker News, où l'annonce a attiré beaucoup d'attention, les commentateurs ont comparé l'engagement en matière de données ouvertes avec la suppression par l'administration américaine actuelle des ensembles de données de recherche auparavant publics des serveurs gouvernementaux – une tension entre la science ouverte à la frontière et le repli ailleurs.
Ce que cela signifie pour l'IA dans la découverte de médicaments
Pour l’industrie pharmaceutique et biotechnologique, le message est que les données fondamentales deviennent un service public partagé. Isomorphic Labs, la société de conception de médicaments d'Alphabet, et Meta – qui mène ses propres recherches fondamentales sur l'IA et ses propres travaux sur la structure des protéines – parient tous deux que des données mieux partagées accéléreront les modèles de chacun, y compris les leurs.
Si l'initiative réussit, les résultats à court terme seront des ensembles de données étendus sur la réponse cellulaire couvrant beaucoup plus de types et de conditions de cellules, ainsi qu'une technologie de mesure validée qui raccourcira le chemin entre l'hypothèse et les données d'entraînement de haute qualité. Le prix à long terme est une simulation suffisamment bonne pour trier numériquement les médicaments candidats avant la première expérience en laboratoire humide.
La communauté scientifique est explicitement invitée à participer : l'annonce de Biohub se termine par un appel ouvert à la « communauté scientifique mondiale » pour qu'elle rejoigne le projet.
Pour en savoir plus sur la façon dont l'apprentissage automatique remodèle les sciences de la vie, consultez la couverture de la recherche sur l'IA d'AI Buzz Wire.
---
Restez à la Pointe de l'IALes dernières actualités, analyses et percées en IA — au même endroit.
Lire plus d'actualités IA →