La Administración Nacional de Datos de China dijo que desarrollará estándares para los datos utilizados para entrenar sistemas de IA incorporados y guiará a las autoridades locales en el trabajo, un paso que Bloomberg informó el 13 de septiembre que apunta a uno de los mayores cuellos de botella en el sector de la robótica de rápido crecimiento: el acceso a datos de capacitación de alta calidad, diversos y a gran escala.

El anuncio se produjo tras una reunión el 10 de septiembre presidida por Liu Liehong, director de la agencia. Asistieron institutos de investigación, empresas de tecnología y organizaciones de robótica humanoide, y el regulador dijo que la industria se basa cada vez más en datos. La administración también señaló que apoyará a las empresas que inviertan más dinero en recursos de datos. Para más contexto sobre esta historia, consulta nuestra noticias de IA.

Pregunta a la industria, respuesta de Beijing

Es notable la rapidez con la que se movió el regulador. Diez días antes, la misma agencia se había reunido con siete empresas de los sectores de inteligencia artificial, informática y datos, según MLex. En esa reunión, los participantes pidieron una infraestructura de datos públicos para la IA incorporada, estándares de datos comunes y reglas de medición de tokens, junto con una coordinación interregional de los recursos informáticos.

La respuesta formal llegó menos de dos semanas después, subrayando cuán central se ha vuelto la política de datos para las ambiciones robóticas de China. La IA incorporada (sistemas que combinan inteligencia artificial con máquinas físicas como robots humanoides) se considera en Beijing una industria estratégica, y los datos son su materia prima.

El cuello de botella de datos en la robótica humanoide

La escala del desafío es considerable. Según estimaciones de la Academia de Tecnología de la Información y las Comunicaciones de China, los modelos básicos de IA incorporados necesitan aproximadamente 10 millones de horas de datos de entrenamiento del mundo real. En todo el mundo existen entre 100.000 y 1 millón de horas de datos de alta calidad, según cifras citadas por The Next Web.

En otras palabras, la limitación en la robótica humanoide ya no es el modelo. Son horas de realidad grabada: datos que capturan cómo las máquinas perciben, razonan y actúan en entornos físicos desordenados.

Un proceso de normalización ya en marcha

El nuevo impulso se basa en un trabajo preliminar sustancial. Los estándares nacionales publicados el 27 de agosto cubren la calidad de los datos de inteligencia incorporada del mundo real y los requisitos técnicos para las plataformas de generación de datos, con varias especificaciones adicionales aún en desarrollo, según un informe de AP News.

Entre los proyectos supervisados ​​por la Administración Nacional de Datos se encuentran estándares propuestos que cubren las fuentes y elementos constitutivos de conjuntos de datos de inteligencia incorporada de alta calidad, generación y procesamiento de datos sintéticos simulados y especificaciones para la recopilación de datos y la capacitación de modelos en bases de capacitación. El trabajo se desarrolla en el marco del Comité Técnico Nacional de Normalización de Datos.

Un borrador de programa, registrado en abril, establece un cronograma de 12 meses para un estándar sobre recopilación de datos y entrenamiento de modelos en bases de entrenamiento de inteligencia incorporada. Su grupo de redacción incluye el Instituto de Normalización Electrónica de China, el Instituto de Tecnología de Beijing, el Instituto de Software de la Academia de Ciencias de China y empresas de robótica. Un borrador separado aborda los datos sintéticos, que se están volviendo cada vez más importantes porque recopilar suficientes interacciones entre robots y el mundo físico puede ser costoso, lento y difícil de reproducir.

Un plan de implementación emitido en junio pedía una construcción más rápida de conjuntos de datos en campos estratégicos y emergentes, incluida la inteligencia incorporada, la conducción inteligente y la economía de baja altitud. También pidió datos que cubran la interacción física, la percepción ambiental y el control de movimiento en escenarios clave, y ordenó a las autoridades mejorar la limpieza, mejora, etiquetado, alineación e inspección de calidad de los datos.

Construcción del campo de entrenamiento de China

Beijing también está construyendo la infraestructura física para recopilar esos datos. Más de 70 campos de entrenamiento de IA incorporados ya están operando en más de la mitad de las regiones provinciales de China, y 46 más están planificados o en construcción, informó TechNode. Alrededor del 86 por ciento de ellos están destinados a la fabricación industrial.

Las instalaciones se agrupan en tres regiones: el delta del río Yangtze, la región Beijing-Tianjin-Hebei y el delta del río Perla. Juntos forman un aparato de recopilación de datos que pocos países pueden igualar actualmente.

El contraste con Europa

El anuncio destaca una asimetría cada vez mayor con los enfoques regulatorios occidentales. Europa ha redactado normas extensas para este tipo de datos sin generar gran parte del suministro. La Ley de Datos de la UE se aplica desde el 12 de septiembre de 2025 y regula quién puede acceder a los datos generados por productos conectados, incluida la maquinaria industrial, mientras que las obligaciones de diseño afectan a los productos conectados comercializados en el mercado de la UE después del 12 de septiembre de 2026.

La Comisión Europea publicó una Estrategia de Unión de Datos el 19 de noviembre de 2025 cuya primera prioridad es ampliar el acceso a los datos para la IA. Diez meses después, la mayoría de esas acciones no se han llevado a cabo, incluidos los laboratorios de datos que prometía la estrategia, informó The Next Web. El equivalente europeo más cercano a un campo de entrenamiento chino es una empresa privada: NEURA Robotics está construyendo diez gimnasios de entrenamiento de robótica, cinco de ellos previstos para finales de este año, repartidos entre Europa, Estados Unidos y China.

Verificación de la realidad del lado de la demanda

Estandarizar el suministro de datos no garantiza la demanda. Sólo el 23 por ciento de las empresas chinas encuestadas este año dijeron que estaban satisfechas con los robots que se ofrecían, una cifra que sugiere que el mercado -no el flujo de datos- puede determinar en última instancia el ritmo de adopción.

Aún así, la dirección del viaje es clara. China está tratando los datos de IA incorporados como un recurso estratégico que debe producirse, estandarizarse y ampliarse sistemáticamente, mientras sus reguladores coordinan estrechamente con la industria que supervisan. Para los fabricantes de robots de todo el mundo, la brecha entre las jurisdicciones que generan la realidad de la capacitación y aquellas que regulan principalmente su uso se está convirtiendo en una de las cuestiones competitivas que definen el campo.

---

Mantente al Día con la IA

Las últimas noticias, análisis y avances de inteligencia artificial, en un solo lugar.

Leer más noticias de IA →