Una coalizione guidata da Biohub, il Dipartimento dell’Energia degli Stati Uniti e il National Institutes of Health ha annunciato un impegno di 1,8 miliardi di dollari per generare e condividere apertamente i dati necessari per addestrare modelli biologici predittivi di intelligenza artificiale – ciò che i ricercatori chiamano la ricerca di una “cellula virtuale”.
L'annuncio, fatto mercoledì a Redwood City, in California, riunisce agenzie federali, filantropia e tre delle più importanti organizzazioni mondiali di intelligenza artificiale in quello che Biohub descrive come il più grande impegno coordinato fino ad oggi per la generazione di dati biologici pronti per l'intelligenza artificiale. Per maggiori informazioni su questa storia, consulta la nostra ultimi sviluppi nell'IA.
Chi paga per cosa
La cifra di 1,8 miliardi di dollari unisce denaro, dati, calcoli e nuove tecnologie di misurazione di diversi partner:
- Biohub consolida l'impegno con il suo impegno iniziale di 500 milioni di dollari. Di questi, 400 milioni di dollari supportano nuove tecnologie di misurazione che espandono ciò che i biologi possono effettivamente osservare: la tomografia crioelettronica, che risolve i dettagli quasi atomici all’interno della cellula, insieme alla microscopia avanzata progettata per visualizzare le cellule su scale e velocità che gli attuali flussi di lavoro di laboratorio non possono avvicinare.
- Il Dipartimento dell'Energia investirà più di 500 milioni di dollari in cinque anni in misurazioni, modelli e calcoli di laboratorio attraverso il suo Ufficio della scienza.
- L'NIH coordinerà il contributo di set di dati, archivi e basi di conoscenza sviluppati attraverso oltre 500 milioni di dollari di investimenti federali precedenti, con Biohub che lavorerà a fianco dell'agenzia per standardizzare tali set di dati per la formazione dei modelli di intelligenza artificiale.
- Google DeepMind, Isomorphic Labs e Meta stanno investendo collettivamente 300 milioni di dollari nella Virtual Biology Initiative, l'iniziativa internazionale, annunciata per la prima volta nell'aprile 2026, che viene formalizzata con l'espansione odierna.
Il risultato sarà una risorsa aperta per la comunità di ricerca globale, non un set di dati proprietario rinchiuso all’interno di una singola azienda.
Un'espansione, non un inizio
L'annuncio di oggi formalizza e amplia la Virtual Biology Initiative, annunciata per la prima volta nell'aprile 2026 con il mandato di coordinare la generazione di dati tra istituzioni e discipline scientifiche. Il lancio di aprile ha stabilito il quadro; i nuovi impegni lo riempiono di denaro federale, dati federali e investimenti del settore privato.
La divisione del lavoro conta. Il DOE offre capacità di calcolo di livello mondiale e strumentazione di laboratorio nazionale. L’NIH porta set di dati standardizzati accumulati in decenni di ricerca finanziata a livello federale: il tipo di dati biologici longitudinali curati che nessun singolo laboratorio o azienda potrebbe rigenerare. Biohub, l’organizzazione di ricerca sostenuta dalla filantropia tecnologica, funge da hub di integrazione che normalizzerà queste fonti in formati su cui i modelli di intelligenza artificiale possono effettivamente addestrarsi.
La grande sfida della "cellula virtuale".
L'obiettivo dichiarato dell'iniziativa è consentire agli scienziati di eseguire esperimenti in modo digitale: prevedere come una cellula risponde a un farmaco, a una perturbazione genetica o a uno stato patologico prima di toccare una pipetta.
"Un accurato modello predittivo della biologia potrebbe accelerare notevolmente la scoperta scientifica consentendo agli scienziati di eseguire esperimenti in modo digitale", ha affermato Alex Rives, responsabile scientifico di Biohub, nell'annuncio. “Le intuizioni che ne derivano potrebbero sbloccare una comprensione molto più ampia della malattia e aprire percorsi completamente nuovi per le cure”.
"A causa di questo potenziale, la creazione di una cellula virtuale è una delle sfide più importanti per la prossima era della scienza", ha aggiunto Rives. "Richiederà sforzi coordinati per la generazione di dati su scala nazionale e internazionale, motivo per cui questi partner si stanno unendo".
Perché i dati, e non solo i modelli, sono il collo di bottiglia
L’intelligenza artificiale in biologia ha prodotto risultati fondamentali – la famiglia AlphaFold di DeepMind ha dimostrato che le reti neurali possono prevedere le strutture proteiche con accuratezza sperimentale – ma questi sistemi sono stati addestrati su decenni di dati pubblici selezionati. I problemi di frontiera, dalla previsione del modo in cui intere cellule rispondono agli interventi alla modellazione delle interazioni cellulari, richiedono dati che in gran parte non esistono ancora in una forma pronta per l’intelligenza artificiale.
Questo è il divario che l’iniziativa mira a raggiungere. Invece di rilasciare un altro modello, i partner stanno finanziando l’infrastruttura poco affascinante della scienza: espandendo i dati sulla risposta cellulare agli interventi su molti più tipi e condizioni cellulari di quelli finora studiati, costruendo e convalidando tecnologie per studiare le cellule e le loro interazioni su scala, velocità e precisione maggiori e assemblando archivi condivisi che i laboratori esterni possono effettivamente utilizzare.
L’espansione ha anche una dimensione difensiva. Su Hacker News, dove l’annuncio ha attirato molta attenzione, i commentatori hanno contrapposto l’impegno a favore dei dati aperti con la rimozione da parte dell’attuale amministrazione statunitense di set di dati di ricerca precedentemente pubblici dai server governativi: una tensione tra scienza aperta alla frontiera e ridimensionamento altrove.
Cosa significa per l'intelligenza artificiale nella scoperta dei farmaci
Per l’industria farmaceutica e biotecnologica, il messaggio è che i dati fondamentali stanno diventando un’utilità pubblica condivisa. Isomorphic Labs, la società di progettazione farmaceutica di Alphabet, e Meta – che ha la propria ricerca fondamentale sull’intelligenza artificiale e il proprio lavoro sulla struttura delle proteine – scommettono entrambi che una migliore condivisione dei dati accelererà i modelli di tutti, compreso il proprio.
Se l’iniziativa avrà successo, i risultati a breve termine saranno set di dati di risposta cellulare ampliati che copriranno un numero molto maggiore di tipi e condizioni di cellule, oltre a una tecnologia di misurazione convalidata che accorcia il percorso dall’ipotesi ai dati di addestramento di alta qualità. Il premio a lungo termine consiste in una simulazione sufficientemente buona da valutare digitalmente i candidati ai farmaci prima del primo esperimento in laboratorio.
La comunità scientifica è stata esplicitamente invitata a partecipare: il bando di Biohub si chiude con un invito aperto alla “comunità scientifica mondiale” per aderire al progetto.
Per ulteriori informazioni su come l'apprendimento automatico sta rimodellando le scienze della vita, consulta la copertura della ricerca sull'intelligenza artificiale di AI Buzz Wire.
---
Rimani Aggiornato sull'IALe ultime notizie, analisi e scoperte sull'intelligenza artificiale — tutto in un posto.
Leggi altre notizie sull'IA →