바이오허브(Biohub), 미국 에너지부(Department of Energy), 국립보건원(National Institutes of Health)이 이끄는 연합은 생물학의 예측 AI 모델을 훈련하는 데 필요한 데이터를 생성하고 공개적으로 공유하기 위해 18억 달러를 투자하겠다고 발표했습니다. 연구자들은 이를 "가상 세포" 추구라고 부릅니다.

수요일 캘리포니아주 레드우드 시티에서 발표된 이번 발표는 연방 기관, 자선단체, 세계에서 가장 유명한 AI 조직 3곳을 한 데 모아 현재까지 AI 지원 생물학적 데이터를 생성하기 위한 최대 규모의 공동 노력이라고 설명합니다. 이 이야기에 대한 자세한 내용은 인공지능 뉴스를 참조하세요.

누가 무엇을 지불하고 있습니까?

18억 달러 규모의 수치는 여러 파트너의 자금, 데이터, 계산 및 새로운 측정 기술을 결합한 것입니다.

  • 바이오허브는 창립 5억 달러 약속으로 이러한 노력을 뒷받침합니다. 그 중 4억 달러는 생물학자가 실제로 관찰할 수 있는 범위를 확장하는 새로운 측정 기술을 지원합니다. 즉, 세포 내부의 거의 원자에 가까운 세부 사항을 해결하는 저온 전자 단층촬영과 현재 실험실 워크플로가 접근할 수 없는 규모와 속도로 세포를 이미지화하도록 설계된 고급 현미경 기술을 지원합니다.
  • 에너지부는 Office of Science를 통해 실험실 측정, 모델링 및 계산에 5년 동안 5억 달러 이상을 투자할 예정입니다.
  • NIH는 이전 연방 투자에서 5억 달러 이상을 통해 개발된 데이터 세트, 저장소 및 지식 기반의 기여를 조정할 것이며 Biohub는 기관과 협력하여 AI 모델 훈련을 위해 이러한 데이터 세트를 표준화할 것입니다.
  • Google DeepMind, Isomorphic Labs 및 Meta는 2026년 4월에 처음 발표된 국제적 노력인 가상 생물학 이니셔티브에 공동으로 3억 달러를 투자하고 있으며 오늘의 확장이 공식화되었습니다.

그 결과는 단일 회사 내부에 고정된 독점 데이터 세트가 아닌 글로벌 연구 커뮤니티를 위한 공개 리소스가 될 것입니다.

시작이 아닌 확장

오늘의 발표는 기관과 과학 분야 전반에 걸쳐 데이터 생성을 조정하라는 명령으로 2026년 4월에 처음 발표된 가상 생물학 이니셔티브(Virtual Biology Initiative)를 공식화하고 확장합니다. 4월 출시로 프레임워크가 확립되었습니다. 새로운 약속은 연방 자금, 연방 데이터 및 민간 부문 투자로 채워집니다.

노동 분업이 중요합니다. DOE는 세계적 수준의 컴퓨팅 능력과 국립 연구소 장비를 제공합니다. NIH는 수십 년간의 연방 자금 지원 연구를 통해 축적된 표준화된 데이터 세트, 즉 어떤 단일 실험실이나 회사도 재생성할 수 없는 일종의 엄선된 종단적 생물학적 데이터를 제공합니다. 기술 자선 활동의 지원을 받는 연구 조직인 Biohub는 이러한 소스를 AI 모델이 실제로 훈련할 수 있는 형식으로 정규화하는 통합 허브 역할을 합니다.

'가상셀' 그랜드 챌린지

이 계획의 명시된 목표는 과학자들이 피펫을 만지기 전에 세포가 약물, 유전적 교란 또는 질병 상태에 어떻게 반응하는지 예측하는 실험을 디지털 방식으로 실행할 수 있도록 하는 것입니다.

Biohub의 과학 책임자인 Alex Rives는 발표에서 “생물학의 정확한 예측 모델은 과학자들이 디지털 방식으로 실험을 수행할 수 있도록 함으로써 과학적 발견을 극적으로 가속화할 수 있습니다.”라고 말했습니다. "이로부터 얻은 통찰력은 질병에 대한 훨씬 더 큰 이해를 열어주고 치료를 위한 완전히 새로운 길을 열어줄 수 있습니다."

Rives는 "이러한 잠재력 때문에 가상 세포의 생성은 차세대 과학 시대의 가장 중요한 과제 중 하나입니다"라고 덧붙였습니다. "국내 및 국제적 규모의 조정된 데이터 생성 노력이 필요하며 이것이 바로 이러한 파트너가 함께 모이는 이유입니다."

모델뿐만 아니라 데이터도 병목 현상을 일으키는 이유

생물학 분야의 AI는 획기적인 결과를 낳았습니다. DeepMind의 AlphaFold 제품군은 신경망이 실험적 정확성으로 단백질 구조를 예측할 수 있음을 보여주었습니다. 그러나 이러한 시스템은 수십 년 동안 엄선된 공개 데이터를 기반으로 훈련되었습니다. 전체 세포가 개입에 어떻게 반응하는지 예측하는 것부터 세포 상호 작용을 모델링하는 것까지, 프론티어 문제에는 아직 AI 지원 형식으로 존재하지 않는 데이터가 필요합니다.

이것이 이니셔티브가 목표로 하는 격차입니다. 다른 모델을 출시하는 대신, 파트너는 지금까지 연구된 것보다 훨씬 더 많은 세포 유형과 조건에 대한 개입에 대한 세포 반응 데이터를 확장하고, 더 큰 규모, 속도 및 정확성으로 세포와 세포의 상호 작용을 연구하기 위한 기술을 구축 및 검증하고, 외부 실험실에서 실제로 사용할 수 있는 공유 저장소를 조립하는 등 화려하지 않은 과학 인프라에 자금을 지원하고 있습니다.

확장팩에는 방어적인 차원도 있습니다. 이 발표가 큰 관심을 끌었던 Hacker News에서 논평자들은 공개 데이터 약속을 현 미국 행정부가 정부 서버에서 이전에 공개된 연구 데이터 세트를 제거한 것과 대조했습니다. 이는 개척지의 공개 과학과 다른 곳의 축소 사이의 긴장입니다.

신약 발견에서 AI가 갖는 의미

제약 및 생명공학 산업의 경우 기본 데이터가 공유 공공 유틸리티가 되고 있다는 메시지가 있습니다. Alphabet의 약품 디자인 회사인 Isomorphic Labs와 자체적으로 기초적인 AI 연구 및 단백질 구조 작업을 수행하는 Meta는 둘 다 더 나은 공유 데이터가 자신의 모델을 포함한 모든 사람의 모델을 가속화할 것이라고 확신하고 있습니다.

이니셔티브가 성공하면 훨씬 더 많은 세포 유형과 조건을 포괄하는 확장된 세포 반응 데이터 세트와 가설에서 고품질 훈련 데이터로의 경로를 단축하는 검증된 측정 기술이 단기 결과물이 될 것입니다. 장기적인 상은 첫 번째 실험실 실험 전에 디지털 방식으로 약물 후보를 선별하기에 충분한 시뮬레이션입니다.

과학계는 명시적으로 참여하도록 초대받고 있습니다. Biohub의 발표는 "전 세계 과학계"가 프로젝트에 참여하도록 공개적으로 요청하는 것으로 마무리됩니다.

기계 학습이 생명 과학을 어떻게 재편하고 있는지에 대한 자세한 내용은 AI Buzz Wire의 AI 연구 보도를 참조하세요.

---

AI 최신 소식

최신 AI 뉴스, 분석 및 혁신을 한 곳에서 확인하세요.

AI 뉴스 더 보기 →