Koalicja pod przewodnictwem Biohuba, Departamentu Energii Stanów Zjednoczonych i Narodowych Instytutów Zdrowia ogłosiła zobowiązanie w wysokości 1,8 miliarda dolarów na generowanie i otwarte udostępnianie danych potrzebnych do szkolenia predykcyjnych modeli biologicznych sztucznej inteligencji – co badacze nazywają dążeniem do „wirtualnej komórki”.

Oświadczenie, ogłoszone w środę w Redwood City w Kalifornii, skupia agencje federalne, organizacje filantropijne i trzy z najważniejszych na świecie organizacji zajmujących się sztuczną inteligencją w ramach, według Biohub, największego jak dotąd skoordynowanego zaangażowania w generowanie danych biologicznych gotowych do wykorzystania sztucznej inteligencji. Więcej kontekstu na ten temat znajdziesz w naszych najnowsze osiągnięcia AI.

Kto za co płaci

Kwota 1,8 miliarda dolarów łączy pieniądze, dane, obliczenia i nową technologię pomiarową od kilku partnerów:

  • Biohub wspiera ten wysiłek swoim założycielskim zaangażowaniem w wysokości 500 milionów dolarów. Z tego 400 milionów dolarów przeznaczone jest na nowe technologie pomiarowe, które poszerzają zakres możliwości faktycznie obserwowanych przez biologów: tomografię krioelektronową, która pozwala na rozpoznanie szczegółów niemal atomowych wewnątrz komórki, oraz zaawansowaną mikroskopię zaprojektowaną do obrazowania komórek w skalach i prędkościach, do których nie są w stanie dotrzeć obecne metody laboratoryjne.
  • Departament Energii w ciągu pięciu lat zainwestuje ponad 500 milionów dolarów w pomiary laboratoryjne, modelowanie i obliczenia za pośrednictwem swojego Biura Naukowego.
  • NIH będzie koordynować wkład zbiorów danych, repozytoriów i baz wiedzy opracowanych dzięki wcześniejszym inwestycjom federalnym o wartości ponad 500 milionów dolarów, przy czym Biohub będzie współpracował z agencją w celu standaryzacji tych zbiorów danych na potrzeby szkolenia w zakresie modeli sztucznej inteligencji.
– Google DeepMind, Isomorphic Labs i Meta wspólnie inwestują 300 milionów dolarów w inicjatywę Virtual Biology Initiative – międzynarodowe przedsięwzięcie – ogłoszone po raz pierwszy w kwietniu 2026 r. – które formalizuje dzisiejsze rozszerzenie.

Rezultatem będą otwarte zasoby dla globalnej społeczności badawczej, a nie zastrzeżony zbiór danych zamknięty w obrębie jednej firmy.

Ekspansja, a nie początek

Dzisiejsze ogłoszenie formalizuje i rozszerza Inicjatywę Biologii Wirtualnej, ogłoszoną po raz pierwszy w kwietniu 2026 r. i mającą na celu koordynację generowania danych między instytucjami i dyscyplinami naukowymi. Kwietniowa premiera ustanowiła ramy; nowe zobowiązania wypełniają go pieniędzmi federalnymi, danymi federalnymi i inwestycjami sektora prywatnego.

Podział pracy ma znaczenie. DOE zapewnia światowej klasy moc obliczeniową i krajowe oprzyrządowanie laboratoryjne. NIH udostępnia ustandaryzowane zbiory danych zgromadzone przez dziesięciolecia badań finansowanych ze środków federalnych – rodzaj wyselekcjonowanych, podłużnych danych biologicznych, których żadne pojedyncze laboratorium ani firma nie jest w stanie odtworzyć. Biohub, organizacja badawcza wspierana przez filantropię technologiczną, działa jako centrum integrujące, które normalizuje te źródła do formatów, na których modele sztucznej inteligencji mogą faktycznie trenować.

Wielkie wyzwanie „Wirtualna komórka”.

Deklarowanym celem inicjatywy jest umożliwienie naukowcom cyfrowego przeprowadzania eksperymentów: przewidywanie reakcji komórki na lek, zaburzenie genetyczne lub stan chorobowy przed dotknięciem pipety.

„Dokładny, predykcyjny model biologii mógłby radykalnie przyspieszyć odkrycia naukowe, umożliwiając naukowcom cyfrowe przeprowadzanie eksperymentów” – powiedział w ogłoszeniu Alex Rives, dyrektor ds. nauki w Biohub. „Wynikające z tego spostrzeżenia mogą umożliwić znacznie lepsze zrozumienie chorób i otworzyć zupełnie nowe ścieżki leczenia”.

„Ze względu na ten potencjał utworzenie wirtualnej komórki jest jednym z najważniejszych wyzwań następnej ery nauki” – dodał Rives. „Będzie to wymagało skoordynowanych wysiłków w zakresie generowania danych na skalę krajową i międzynarodową, dlatego ci partnerzy łączą siły”.

Dlaczego dane, a nie tylko modele, stanowią wąskie gardło

Sztuczna inteligencja w biologii przyniosła przełomowe wyniki — rodzina AlphaFold firmy DeepMind wykazała, że sieci neuronowe potrafią przewidywać struktury białek z eksperymentalną dokładnością — ale systemy te były szkolone na podstawie kilkudziesięciu lat wyselekcjonowanych publicznych danych. Problemy graniczne, począwszy od przewidywania reakcji całych komórek na interwencje, po modelowanie interakcji komórkowych, wymagają danych, które w dużej mierze nie istnieją jeszcze w formie przystosowanej do sztucznej inteligencji.

Właśnie na tę lukę ma być ukierunkowana inicjatywa. Zamiast wypuszczać kolejny model, partnerzy finansują mało efektowną infrastrukturę nauki: rozszerzanie danych dotyczących odpowiedzi komórek na interwencje obejmujące znacznie większą liczbę typów komórek i warunków, niż dotychczas badano, budowanie i walidację technologii do badania komórek i ich interakcji na większą skalę, szybciej i z większą dokładnością oraz gromadzenie wspólnych repozytoriów, z których faktycznie mogą korzystać laboratoria zewnętrzne.

Ekspansja ma także wymiar defensywny. W Hacker News, gdzie ogłoszenie wzbudziło duże zainteresowanie, komentatorzy porównali zobowiązanie do otwartych danych z usunięciem przez obecną administrację USA wcześniej publicznych zbiorów danych badawczych z serwerów rządowych – napięcie między otwartą nauką na pograniczu a ograniczeniami gdzie indziej.

Co to oznacza dla sztucznej inteligencji w odkrywaniu leków

Dla branży farmaceutycznej i biotechnologicznej przesłanie jest takie, że podstawowe dane stają się wspólnym narzędziem publicznym. Isomorphic Labs, firma Alphabet zajmująca się projektowaniem leków, oraz Meta – która prowadzi własne badania podstawowe nad sztuczną inteligencją i prace nad strukturą białek – obstawiają, że lepiej udostępniane dane przyspieszą tworzenie modeli wszystkich, w tym ich własnych.

Jeśli inicjatywa zakończy się sukcesem, krótkoterminowymi rezultatami będą rozszerzone zbiory danych dotyczące odpowiedzi komórkowych, obejmujące znacznie więcej typów i warunków komórek, a także zweryfikowana technologia pomiarowa, która skraca drogę od hipotezy do wysokiej jakości danych szkoleniowych. Nagrodą długoterminową jest symulacja wystarczająco dobra, aby umożliwić cyfrową selekcję kandydatów na leki przed pierwszym eksperymentem w laboratorium mokrym.

Środowisko naukowe zostało wyraźnie zaproszone do udziału: ogłoszenie Biohub kończy się otwartym zaproszeniem skierowanym do „światowej społeczności naukowej” do przyłączenia się do projektu.

Więcej informacji na temat tego, jak uczenie maszynowe zmienia nauki przyrodnicze, można znaleźć w raporcie AI Buzz Wire dotyczącym badań nad sztuczną inteligencją.

---

Bądź na Bieżąco z AI

Najnowsze wiadomości, analizy i przełomy w dziedzinie AI — wszystko w jednym miejscu.

Czytaj więcej wiadomości AI →