Una coalición liderada por Biohub, el Departamento de Energía de EE. UU. y los Institutos Nacionales de Salud anunciaron un compromiso de 1.800 millones de dólares para generar y compartir abiertamente los datos necesarios para entrenar modelos predictivos de biología con IA, lo que los investigadores llaman la búsqueda de una "célula virtual".
El anuncio, realizado el miércoles en Redwood City, California, reúne a agencias federales, filantropía y tres de las organizaciones de IA más destacadas del mundo en lo que Biohub describe como el mayor compromiso coordinado para generar datos biológicos listos para IA hasta la fecha. Para más contexto sobre esta historia, consulta nuestra últimos avances en IA.
¿Quién paga por qué?
La cifra de 1.800 millones de dólares combina dinero, datos, computación y nueva tecnología de medición de varios socios:
- Biohub sustenta el esfuerzo con su compromiso inicial de 500 millones de dólares. De esa cantidad, 400 millones de dólares respaldan nuevas tecnologías de medición que amplían lo que los biólogos realmente pueden observar: tomografía crioelectrónica, que resuelve detalles casi atómicos dentro de la célula, junto con microscopía avanzada diseñada para obtener imágenes de células a escalas y velocidades que los flujos de trabajo de laboratorio actuales no pueden alcanzar.
- El Departamento de Energía invertirá más de $500 millones durante cinco años en mediciones, modelos y cálculos de laboratorio a través de su Oficina de Ciencias.
- Los NIH coordinarán la contribución de conjuntos de datos, repositorios y bases de conocimiento desarrollados a través de más de $500 millones en inversiones federales anteriores, con Biohub trabajando junto con la agencia para estandarizar esos conjuntos de datos para el entrenamiento de modelos de IA.
- Google DeepMind, Isomorphic Labs y Meta están invirtiendo colectivamente 300 millones de dólares en la Iniciativa de Biología Virtual, el esfuerzo internacional, anunciado por primera vez en abril de 2026, que formaliza la expansión de hoy.
El resultado será un recurso abierto para la comunidad de investigación global, no un conjunto de datos patentado encerrado dentro de una sola empresa.
Una expansión, no un comienzo
El anuncio de hoy formaliza y amplía la Iniciativa de Biología Virtual, que se anunció por primera vez en abril de 2026 con el mandato de coordinar la generación de datos entre instituciones y disciplinas científicas. El lanzamiento de abril estableció el marco; los nuevos compromisos lo llenan de dinero federal, datos federales e inversiones del sector privado.
La división del trabajo importa. El DOE aporta capacidad informática de clase mundial e instrumentación de laboratorio nacional. Los NIH aportan conjuntos de datos estandarizados acumulados a lo largo de décadas de investigación financiada con fondos federales: el tipo de datos biológicos longitudinales seleccionados que ningún laboratorio o empresa podría regenerar por sí solo. Biohub, la organización de investigación respaldada por filantropía tecnológica, actúa como centro integrador que normalizará estas fuentes en formatos en los que los modelos de IA realmente puedan entrenar.
El gran desafío de la 'célula virtual'
El objetivo declarado de la iniciativa es hacer posible que los científicos realicen experimentos digitalmente: predecir cómo responde una célula a un fármaco, una perturbación genética o una enfermedad antes de tocar una pipeta.
"Un modelo predictivo preciso de biología podría acelerar drásticamente el descubrimiento científico al permitir a los científicos realizar experimentos digitalmente", dijo Alex Rives, director científico de Biohub, en el anuncio. "Los conocimientos que se deriven de esto podrían desbloquear una comprensión mucho mayor de las enfermedades y abrir caminos completamente nuevos para las curas".
"Debido a este potencial, la creación de una célula virtual es uno de los desafíos más importantes para la próxima era de la ciencia", añadió Rives. "Se requerirán esfuerzos coordinados de generación de datos a escala nacional e internacional, razón por la cual estos socios se están uniendo".
Por qué los datos, no sólo los modelos, son el cuello de botella
La IA en biología ha producido resultados históricos: la familia AlphaFold de DeepMind demostró que las redes neuronales pueden predecir estructuras de proteínas con precisión experimental, pero esos sistemas se entrenaron con décadas de datos públicos seleccionados. Los problemas fronterizos, desde predecir cómo responden células enteras a las intervenciones hasta modelar interacciones celulares, requieren datos que en gran medida aún no existen en forma lista para la IA.
Ésa es la brecha a la que apunta la iniciativa. En lugar de lanzar otro modelo, los socios están financiando la poco glamorosa infraestructura de la ciencia: expandir los datos de respuesta celular a intervenciones en muchos más tipos y condiciones de células de las que se han estudiado hasta ahora, construir y validar tecnologías para estudiar las células y sus interacciones a mayor escala, velocidad y precisión, y ensamblar repositorios compartidos que los laboratorios externos realmente puedan usar.
La ampliación también tiene una dimensión defensiva. En Hacker News, donde el anuncio llamó mucho la atención, los comentaristas contrastaron el compromiso de datos abiertos con la eliminación por parte de la actual administración estadounidense de conjuntos de datos de investigación previamente públicos de los servidores gubernamentales: una tensión entre la ciencia abierta en la frontera y la reducción en otros lugares.
Qué significa para la IA en el descubrimiento de fármacos
Para la industria farmacéutica y biotecnológica, el mensaje es que los datos fundamentales se están convirtiendo en una utilidad pública compartida. Isomorphic Labs, la empresa de diseño de fármacos de Alphabet, y Meta, que tiene su propia investigación fundamental de IA y trabajo sobre estructuras de proteínas, están apostando a que unos datos mejor compartidos acelerarán los modelos de todos, incluido el suyo propio.
Si la iniciativa tiene éxito, los resultados a corto plazo serán conjuntos de datos de respuesta celular ampliados que cubrirán muchos más tipos y condiciones de células, además de una tecnología de medición validada que acorta el camino desde la hipótesis hasta los datos de entrenamiento de alta calidad. El premio a largo plazo es una simulación lo suficientemente buena como para clasificar digitalmente los candidatos a fármacos antes del primer experimento en laboratorio húmedo.
Se invita explícitamente a participar a la comunidad científica: el anuncio de Biohub se cierra con una convocatoria abierta para que la "comunidad científica mundial" se una al proyecto.
Para obtener más información sobre cómo el aprendizaje automático está remodelando las ciencias biológicas, consulte la cobertura de investigación de IA de AI Buzz Wire.
---
Mantente al Día con la IALas últimas noticias, análisis y avances de inteligencia artificial, en un solo lugar.
Leer más noticias de IA →