Uma coligação liderada pela Biohub, o Departamento de Energia dos EUA e os Institutos Nacionais de Saúde anunciaram um compromisso de 1,8 mil milhões de dólares para gerar e partilhar abertamente os dados necessários para treinar modelos de biologia preditivos de IA – o que os investigadores chamam de busca de uma “célula virtual”.

O anúncio, feito quarta-feira em Redwood City, Califórnia, reúne agências federais, filantropia e três das organizações de IA mais proeminentes do mundo no que a Biohub descreve como o maior compromisso coordenado para gerar dados biológicos prontos para IA até o momento. Para mais contexto sobre esta história, confira nossa atualizações de inteligência artificial.

Quem está pagando pelo quê

O valor de US$ 1,8 bilhão combina dinheiro, dados, computação e novas tecnologias de medição de vários parceiros:

  • Biohub ancora o esforço com seu compromisso fundador de US$ 500 milhões. Desse total, 400 milhões de dólares apoiam novas tecnologias de medição que ampliam o que os biólogos podem realmente observar: tomografia crioeletrônica, que resolve detalhes quase atômicos dentro da célula, juntamente com microscopia avançada projetada para gerar imagens de células em escalas e velocidades que os atuais fluxos de trabalho de laboratório não conseguem alcançar.
  • O Departamento de Energia investirá mais de US$ 500 milhões ao longo de cinco anos em medição, modelagem e computação laboratorial por meio de seu Escritório de Ciência.
  • O NIH coordenará a contribuição de conjuntos de dados, repositórios e bases de conhecimento desenvolvidos através de mais de US$ 500 milhões em investimentos federais anteriores, com a Biohub trabalhando junto com a agência para padronizar esses conjuntos de dados para treinamento de modelos de IA.
  • Google DeepMind, Isomorphic Labs e Meta estão investindo coletivamente US$ 300 milhões na Virtual Biology Initiative, o esforço internacional — anunciado pela primeira vez em abril de 2026 — que a expansão de hoje formaliza.

O resultado será um recurso aberto para a comunidade de pesquisa global, e não um conjunto de dados proprietário trancado dentro de uma única empresa.

Uma expansão, não um começo

O anúncio de hoje formaliza e amplia a Iniciativa de Biologia Virtual, que foi anunciada pela primeira vez em abril de 2026 com o mandato de coordenar a geração de dados entre instituições e disciplinas científicas. O lançamento em abril estabeleceu a estrutura; os novos compromissos preenchem-no com dinheiro federal, dados federais e investimento do sector privado.

A divisão do trabalho é importante. O DOE traz capacidade computacional de classe mundial e instrumentação laboratorial nacional. O NIH traz conjuntos de dados padronizados acumulados ao longo de décadas de pesquisas financiadas pelo governo federal – o tipo de dados biológicos longitudinais com curadoria que nenhum laboratório ou empresa poderia regenerar. Biohub, a organização de pesquisa apoiada pela filantropia tecnológica, atua como o centro integrador que normalizará essas fontes em formatos nos quais os modelos de IA podem realmente treinar.

O Grande Desafio da 'Célula Virtual'

O objetivo declarado da iniciativa é permitir que os cientistas realizem experimentos digitalmente: prever como uma célula responde a um medicamento, uma perturbação genética ou um estado de doença antes de tocar uma pipeta.

“Um modelo preditivo preciso da biologia poderia acelerar dramaticamente a descoberta científica, permitindo que os cientistas realizassem experimentos digitalmente”, disse Alex Rives, chefe de ciência da Biohub, no anúncio. “Os insights resultantes disso poderiam desbloquear uma compreensão muito maior das doenças e abrir caminhos completamente novos para a cura”.

“Devido a este potencial, a criação de uma célula virtual é um dos desafios mais importantes para a próxima era da ciência”, acrescentou Rives. “Isto exigirá esforços coordenados de geração de dados à escala nacional e internacional, razão pela qual estes parceiros estão a unir-se.”

Por que os dados, e não apenas os modelos, são o gargalo

A IA em biologia produziu resultados marcantes – a família AlphaFold da DeepMind demonstrou que as redes neurais podem prever estruturas de proteínas com precisão experimental – mas esses sistemas foram treinados com base em décadas de dados públicos selecionados. Os problemas de fronteira, desde a previsão de como células inteiras respondem às intervenções até a modelagem de interações celulares, exigem dados que em grande parte ainda não existem em formato pronto para IA.

Essa é a lacuna que a iniciativa visa. Em vez de lançar outro modelo, os parceiros estão a financiar a nada glamorosa infra-estrutura da ciência: expandindo os dados de resposta celular para intervenções em muito mais tipos e condições de células do que as que já foram estudadas, construindo e validando tecnologias para estudar células e as suas interacções em maior escala, velocidade e precisão, e montando repositórios partilhados que laboratórios externos podem realmente utilizar.

A expansão também tem uma dimensão defensiva. No Hacker News, onde o anúncio atraiu atenção significativa, os comentadores contrastaram o compromisso com os dados abertos com a remoção, pela actual administração dos EUA, de conjuntos de dados de investigação anteriormente públicos dos servidores do governo - uma tensão entre a ciência aberta na fronteira e a contenção noutros locais.

O que isso significa para a IA na descoberta de medicamentos

Para a indústria farmacêutica e de biotecnologia, a mensagem é que os dados fundamentais estão a tornar-se uma utilidade pública partilhada. A Isommorphic Labs, a empresa de design de medicamentos da Alphabet, e a Meta – que tem a sua própria investigação fundamental em IA e trabalho de estrutura de proteínas – apostam que dados melhor partilhados irão acelerar os modelos de todos, incluindo os seus próprios.

Se a iniciativa for bem sucedida, os resultados a curto prazo serão conjuntos de dados expandidos de resposta celular, abrangendo muito mais tipos e condições de células, além de tecnologia de medição validada que encurta o caminho da hipótese para dados de formação de alta qualidade. O prêmio de longo prazo é uma simulação boa o suficiente para fazer a triagem digital de candidatos a medicamentos antes do primeiro experimento de laboratório úmido.

A comunidade científica está a ser explicitamente convidada a participar: o anúncio da Biohub termina com uma convocatória aberta para que a “comunidade científica mundial” se junte ao projeto.

Para saber mais sobre como o aprendizado de máquina está remodelando as ciências biológicas, consulte a cobertura de pesquisa de IA da AI Buzz Wire.

---

Fique à Frente da IA

As últimas notícias, análises e avanços em inteligência artificial — tudo em um só lugar.

Ler mais notícias de IA →