Een coalitie onder leiding van Biohub, het Amerikaanse ministerie van Energie en de National Institutes of Health heeft een toezegging van 1,8 miljard dollar aangekondigd om de gegevens te genereren en openlijk te delen die nodig zijn om voorspellende AI-modellen van de biologie te trainen – wat onderzoekers het streven naar een ‘virtuele cel’ noemen.

De aankondiging, woensdag gedaan in Redwood City, Californië, brengt federale instanties, filantropie en drie van 's werelds meest prominente AI-organisaties samen in wat Biohub beschrijft als de grootste gecoördineerde inzet tot nu toe voor het genereren van AI-ready biologische gegevens. Voor meer context over dit verhaal, zie ons AI-nieuws.

Wie betaalt waarvoor

Het bedrag van $1,8 miljard combineert geld, data, berekeningen en nieuwe meettechnologie van verschillende partners:

  • Biohub verankert de inspanning met zijn oprichtingstoezegging van $ 500 miljoen. Daarvan ondersteunt 400 miljoen dollar nieuwe meettechnologieën die uitbreiden wat biologen daadwerkelijk kunnen waarnemen: cryo-elektronentomografie, die bijna-atomaire details in de cel oplost, naast geavanceerde microscopie die is ontworpen om cellen in beeld te brengen op schalen en snelheden die de huidige laboratoriumworkflows niet kunnen benaderen.
  • Het ministerie van Energie zal via zijn Office of Science de komende vijf jaar meer dan $500 miljoen investeren in laboratoriummetingen, modellering en berekeningen.
  • De NIH zal de bijdrage coördineren van datasets, opslagplaatsen en kennisbanken die zijn ontwikkeld via meer dan $ 500 miljoen aan eerdere federale investeringen, waarbij Biohub samen met het agentschap zal samenwerken om deze datasets te standaardiseren voor AI-modeltraining.
  • Google DeepMind, Isomorphic Labs en Meta investeren gezamenlijk $300 miljoen in het Virtual Biology Initiative, de internationale inspanning – voor het eerst aangekondigd in april 2026 – die de huidige expansie formaliseert.

Het resultaat zal een open bron zijn voor de mondiale onderzoeksgemeenschap, en niet een eigen dataset die opgesloten zit in een enkel bedrijf.

Een uitbreiding, geen begin

De aankondiging van vandaag formaliseert en schaalt het Virtual Biology Initiative op, dat voor het eerst werd aangekondigd in april 2026 met een mandaat om de gegevensgeneratie tussen instellingen en wetenschappelijke disciplines te coördineren. De lancering in april vormde het raamwerk; de nieuwe toezeggingen vullen het met federaal geld, federale gegevens en investeringen uit de particuliere sector.

De arbeidsverdeling is van belang. De DOE brengt computercapaciteit van wereldklasse en nationale laboratoriuminstrumentatie met zich mee. De NIH beschikt over gestandaardiseerde datasets die zijn verzameld tijdens tientallen jaren van federaal gefinancierd onderzoek – het soort samengestelde, longitudinale biologische gegevens die geen enkel laboratorium of bedrijf zou kunnen regenereren. Biohub, de onderzoeksorganisatie die wordt gesteund door technologiefilantropie, fungeert als de integrerende hub die deze bronnen zal normaliseren tot formaten waarop AI-modellen daadwerkelijk kunnen trainen.

De grote uitdaging 'Virtuele cel'

Het doel van het initiatief is om het voor wetenschappers mogelijk te maken experimenten digitaal uit te voeren: voorspellen hoe een cel reageert op een medicijn, een genetische verstoring of een ziektetoestand voordat hij een pipet aanraakt.

"Een accuraat voorspellend biologiemodel zou wetenschappelijke ontdekkingen dramatisch kunnen versnellen door wetenschappers in staat te stellen experimenten digitaal uit te voeren", zegt Alex Rives, hoofd wetenschap van Biohub, in de aankondiging. "De inzichten die hieruit voortkomen, kunnen een veel beter begrip van ziekten ontsluiten en volledig nieuwe wegen voor genezing openen."

"Vanwege dit potentieel is de creatie van een virtuele cel een van de belangrijkste uitdagingen voor het volgende tijdperk van de wetenschap", voegde Rives eraan toe. "Het vereist gecoördineerde inspanningen voor het genereren van gegevens op nationale en internationale schaal, en daarom komen deze partners samen."

Waarom data, en niet alleen modellen, het knelpunt zijn

AI in de biologie heeft baanbrekende resultaten opgeleverd – de AlphaFold-familie van DeepMind heeft aangetoond dat neurale netwerken eiwitstructuren met experimentele nauwkeurigheid kunnen voorspellen – maar die systemen zijn getraind op basis van tientallen jaren aan samengestelde openbare gegevens. De grensproblemen, van het voorspellen hoe hele cellen reageren op interventies tot het modelleren van cellulaire interacties, vereisen gegevens die grotendeels nog niet in AI-klare vorm bestaan.

Dat is de kloof die het initiatief beoogt. In plaats van een ander model uit te brengen, financieren de partners de weinig glamoureuze infrastructuur van de wetenschap: het uitbreiden van celresponsgegevens naar interventies in veel meer celtypen en omstandigheden dan tot nu toe zijn onderzocht, het bouwen en valideren van technologieën voor het bestuderen van cellen en hun interacties op grotere schaal, snelheid en nauwkeurigheid, en het samenstellen van gedeelde opslagplaatsen die buiten laboratoria daadwerkelijk kunnen worden gebruikt.

De uitbreiding heeft ook een defensieve dimensie. Op Hacker News, waar de aankondiging veel aandacht trok, stelden commentatoren het engagement op het gebied van open data tegenover de verwijdering door de huidige Amerikaanse regering van eerder openbare onderzoeksdatasets van overheidsservers – een spanning tussen open wetenschap aan de grens en bezuinigingen elders.

Wat het betekent voor AI bij het ontdekken van medicijnen

Voor de farmaceutische en biotechnologische industrie is de boodschap dat fundamentele data een gedeeld openbaar nut aan het worden zijn. Isomorphic Labs, het medicijnontwerpbedrijf van Alphabet, en Meta – dat zijn eigen fundamentele AI-onderzoek en eiwitstructuurwerk heeft – wedden er allebei op dat beter gedeelde gegevens ieders modellen zullen versnellen, inclusief die van henzelf.

Als het initiatief slaagt, zullen de resultaten op de korte termijn bestaan ​​uit uitgebreide datasets over celresponsen die veel meer celtypen en -omstandigheden bestrijken, plus gevalideerde meettechnologie die de weg van hypothese naar trainingsgegevens van hoge kwaliteit verkort. De langetermijnprijs is een simulatie die goed genoeg is om kandidaat-geneesmiddelen digitaal te beoordelen vóór het eerste natte laboratoriumexperiment.

De wetenschappelijke gemeenschap wordt expliciet uitgenodigd om deel te nemen: de aankondiging van Biohub wordt afgesloten met een open oproep aan de "wereldwijde wetenschappelijke gemeenschap" om zich bij het project aan te sluiten.

Voor meer informatie over hoe machinaal leren de levenswetenschappen een nieuwe vorm geeft, zie de AI-onderzoeksverslaggeving van AI Buzz Wire.

---

Blijf Voorop met AI

Het laatste AI-nieuws, analyses en doorbraken — allemaal op één plek.

Lees meer AI-nieuws →