중국 국가 데이터 관리국(National Data Administration)은 내장된 AI 시스템을 교육하는 데 사용되는 데이터에 대한 표준을 개발하고 현지 당국에 작업을 안내할 것이라고 밝혔습니다. 블룸버그는 9월 13일 이 조치가 빠르게 성장하는 로봇 공학 부문의 가장 큰 병목 현상 중 하나인 고품질의 다양하고 대규모 교육 데이터에 대한 접근을 목표로 한다고 보도했습니다.

이 발표는 에이전시 대표인 Liu Liehong이 의장을 맡은 9월 10일 회의에 이어 이루어졌습니다. 연구 기관, 기술 회사, 휴머노이드 로봇 공학 조직이 참석했으며 규제 당국은 업계가 점점 더 데이터 중심으로 변하고 있다고 말했습니다. 행정부는 또한 기업들이 데이터 자원에 더 많은 돈을 투자하도록 지원할 것이라고 밝혔습니다. 이 이야기에 대한 자세한 내용은 AI 뉴스를 참조하세요.

업계 질문, 베이징 답변

주목할만한 점은 레귤레이터가 얼마나 빨리 움직였는가입니다. MLex에 따르면 열흘 전 같은 기관이 인공지능, 컴퓨팅, 데이터 분야의 7개 기업을 만났습니다. 해당 회의에서 참가자들은 컴퓨팅 리소스의 지역 간 조정과 함께 구현된 AI를 위한 공공 데이터 인프라, 공통 데이터 표준 및 토큰 측정 규칙을 요구했습니다.

공식적인 답변은 2주도 채 지나지 않아 나왔습니다. 이는 중앙 데이터 정책이 중국의 로봇공학 야망에 어떻게 반영되었는지를 강조했습니다. 인공 지능(기계 지능과 휴머노이드 로봇 등의 물리적 기계를 결합한 시스템)은 베이징에서 전략 산업으로 간주되며 데이터는 그 원자재입니다.

휴머노이드 로봇 공학의 데이터 병목 현상

도전의 규모가 상당합니다. 중국정보통신기술원(China Academy of Information and Communications Technology)의 추산에 따르면, 구현된 AI 기반 모델에는 대략 1천만 시간의 실제 훈련 데이터가 필요합니다. The Next Web이 인용한 수치에 따르면 전 세계적으로 10만 시간에서 100만 시간 정도의 고품질 데이터가 존재합니다.

즉, 휴머노이드 로봇공학의 제약은 더 이상 모델이 아닙니다. 이는 몇 시간에 걸쳐 기록된 현실입니다. 데이터는 기계가 지저분한 물리적 환경에서 어떻게 인식하고 추론하고 행동하는지를 캡처합니다.

이미 진행 중인 표준 파이프라인

새로운 추진은 실질적인 기반을 바탕으로 구축됩니다. AP 뉴스 보고서에 따르면 8월 27일에 발표된 국가 표준은 실제 구현 지능 데이터의 품질과 데이터 생성 플랫폼에 대한 기술 요구 사항을 다루고 있으며 몇 가지 추가 사양이 아직 개발 중이라고 합니다.

미국 데이터 관리국(National Data Administration)이 감독하는 프로젝트 중에는 고품질 구현 지능 데이터세트의 소스와 구성 요소, 시뮬레이션된 합성 데이터 생성 및 처리, 훈련 기지에서의 데이터 수집 및 모델 교육 사양을 다루는 표준이 제안되어 있습니다. 이 작업은 국가데이터표준화기술위원회 산하에서 개발 중입니다.

4월에 등록된 한 초안 프로그램은 구체화된 지능 훈련 기지에서의 데이터 수집 및 모델 훈련 표준에 대한 12개월 일정을 설정합니다. 초안 작성 그룹에는 중국 전자 표준화 연구소, 베이징 기술 연구소, 중국 과학원 소프트웨어 연구소 및 로봇 공학 회사가 포함되어 있습니다. 별도의 초안에서는 실제 세계의 로봇 상호 작용을 충분히 수집하는 데 비용이 많이 들고 느리며 재현하기 어려울 수 있기 때문에 점점 더 중요해지고 있는 합성 데이터를 다루고 있습니다.

6월에 발표된 구현 계획에서는 구체화된 지능, 지능형 운전 및 저고도 경제를 포함한 전략 및 신흥 분야의 데이터 세트를 더 빠르게 구축할 것을 요구했습니다. 또한 주요 시나리오에서 물리적 상호 작용, 환경 인식 및 동작 제어를 다루는 데이터를 요구하고 당국에 데이터 정리, 향상, 라벨링, 정렬 및 품질 검사를 개선하도록 지시했습니다.

중국의 훈련장 증설

베이징은 또한 해당 데이터를 수집하기 위한 물리적 인프라를 구축하고 있습니다. TechNode는 70개 이상의 구현된 AI 훈련장이 이미 중국 지방의 절반 이상에서 운영되고 있으며 46개 이상이 계획 또는 건설 중이라고 보도했습니다. 그 중 약 86%가 산업 제조업을 목표로 하고 있습니다.

시설은 양쯔강 삼각주, 베이징-천진-허베이 지역, 주강 삼각주 등 3개 지역에 클러스터되어 있습니다. 그들은 현재 소수의 국가만이 따라올 수 있는 데이터 수집 장치를 형성합니다.

유럽과의 대조

이번 발표는 서구 규제 접근 방식의 비대칭성이 확대되고 있음을 강조합니다. 유럽은 많은 공급을 구축하지 않고도 이러한 종류의 데이터에 대한 광범위한 규칙을 작성했습니다. EU의 데이터법은 2025년 9월 12일부터 적용되었으며 산업 기계를 포함한 연결된 제품에서 생성된 데이터에 액세스할 수 있는 사람을 규정하며, 설계 의무는 2026년 9월 12일 이후 EU 시장에 출시된 연결 제품에 적용됩니다.

유럽연합 집행위원회는 2025년 11월 19일에 AI 데이터에 대한 액세스를 확대하는 것을 최우선 과제로 삼는 데이터 연합 전략을 발표했습니다. The Next Web은 10개월이 지난 후에도 전략이 약속한 데이터 연구소를 포함하여 대부분의 조치가 수행되지 않았다고 보도했습니다. 중국 훈련장과 가장 가까운 유럽 국가는 민간 기업입니다. NEURA Robotics는 10개의 로봇 훈련 체육관을 건설하고 있으며 그 중 5개는 올해 말까지 운영될 예정이며 유럽, 미국, 중국에 분산되어 있습니다.

수요측면 현실 점검

데이터 공급을 표준화한다고 해서 수요가 보장되는 것은 아닙니다. 올해 조사에 참여한 중국 기업 중 23%만이 제공되는 로봇에 만족한다고 답했습니다. 이는 데이터 파이프라인이 아닌 시장이 궁극적으로 채택 속도를 결정할 수 있음을 시사하는 수치입니다.

그럼에도 여행의 방향은 분명하다. 중국은 구체화된 AI 데이터를 체계적으로 생산, 표준화 및 확장하기 위한 전략적 자원으로 취급하고 있으며, 규제 당국은 자신들이 감독하는 업계와 긴밀히 협력하고 있습니다. 전 세계 로봇 제조업체의 경우 훈련 현실을 생성하는 관할권과 그 사용을 주로 규제하는 관할권 간의 격차가 해당 분야의 경쟁 문제를 결정하는 것 중 하나가 되고 있습니다.

---

AI 최신 소식

최신 AI 뉴스, 분석 및 혁신을 한 곳에서 확인하세요.

AI 뉴스 더 보기 →