Національне управління даних Китаю заявило, що розробить стандарти для даних, які використовуються для навчання втілених систем штучного інтелекту, і скеровуватиме місцеву владу в роботі. Bloomberg повідомив про цей крок 13 вересня, який спрямований на одне з найбільших вузьких місць у швидкозростаючому секторі робототехніки: доступ до високоякісних, різноманітних і великомасштабних навчальних даних.
Оголошення відбулося після зустрічі 10 вересня під головуванням Лю Ліхонга, який очолює агентство. Дослідницькі інститути, технологічні компанії та організації гуманоїдної робототехніки взяли участь, і регулятор сказав, що галузь стає все більше керованою даними. Адміністрація також повідомила, що підтримуватиме компанії, які вкладають більше грошей у ресурси даних. For more context on this story, see our ongoing breaking AI news.
Промисловість запитує, Пекін відповідає
Примітно те, як швидко рухався регулятор. Десятьма днями раніше це ж агентство зустрілося з сімома компаніями зі секторів штучного інтелекту, обчислювальної техніки та даних, повідомляє MLex. На цій зустрічі учасники закликали до інфраструктури загальнодоступних даних для втіленого ШІ, загальних стандартів даних і правил вимірювання токенів, а також міжрегіональної координації обчислювальних ресурсів.
Офіційна відповідь надійшла менше ніж через два тижні, підкреслюючи, наскільки політика даних стала центральною для робототехнічних амбіцій Китаю. Втілений штучний інтелект — системи, які поєднують машинний інтелект із фізичними машинами, такими як людиноподібні роботи — розглядається в Пекіні як стратегічна галузь, а дані є її сировиною.
Вузьке місце даних у гуманоїдній робототехніці
Масштаби виклику значні. За оцінками Китайської академії інформаційно-комунікаційних технологій, втілені базові моделі ШІ потребують приблизно 10 мільйонів годин реальних даних для навчання. Відповідно до цифр, наведених The Next Web, у світі існує від 100 000 до 1 мільйона годин високоякісних даних.
Іншими словами, обмеження в гуманоїдній робототехніці більше не є моделлю. Це години записаної реальності — дані, що фіксують те, як машини сприймають, розмірковують і діють у безладному фізичному середовищі.
Стандарти вже запущені
Новий поштовх базується на суттєвій основі. Відповідно до звіту AP News, опубліковані 27 серпня національні стандарти стосуються якості даних реального втіленого інтелекту та технічних вимог до платформ генерації даних, а кілька додаткових специфікацій все ще знаходяться в стадії розробки.
Серед проектів, які контролює Національне управління даних, запропоновані стандарти, що охоплюють джерела та складові елементи високоякісних наборів даних втіленого інтелекту, генерацію та обробку змодельованих синтетичних даних, а також специфікації для збору даних і навчання моделі на навчальних базах. Робота розробляється під керівництвом Національного технічного комітету зі стандартизації даних.
Один проект програми, зареєстрований у квітні, встановлює 12-місячний графік для стандарту збору даних і моделювання навчання на тренувальних базах втіленого інтелекту. До його редакційної групи входять Китайський інститут стандартизації електроніки, Пекінський технологічний інститут, Інститут програмного забезпечення Академії наук Китаю та робототехнічні компанії. Окремий проект стосується синтетичних даних, які стають дедалі важливішими, оскільки збір достатньої кількості взаємодій роботів із фізичним світом може бути дорогим, повільним і важким для відтворення.
План впровадження, опублікований у червні, закликав до швидшого створення наборів даних у стратегічних і нових сферах, включаючи втілений інтелект, розумне водіння та економіку на низькій висоті. Він також закликав до даних, що охоплюють фізичну взаємодію, сприйняття навколишнього середовища та контроль руху в ключових сценаріях, і наказав органам влади покращити очищення даних, покращення, маркування, вирівнювання та перевірку якості.
Китайський тренувальний полігон
Пекін також будує фізичну інфраструктуру для збору цих даних. Понад 70 втілених полігонів штучного інтелекту вже працюють у більш ніж половині провінційних регіонів Китаю, ще 46 планується або будується, повідомляє TechNode. Близько 86 відсотків з них спрямовані на промислове виробництво.
Об’єкти згруповані в трьох регіонах: дельта річки Янцзи, регіон Пекін-Тяньцзінь-Хебей і дельта річки Чжуцзян. Разом вони утворюють апарат збору даних, з яким наразі можуть зрівнятися небагато країн.
Контраст з Європою
Оголошення підкреслює розширення асиметрії із західними підходами до регулювання. Європа написала широкі правила для такого роду даних, не створюючи значної частини пропозиції. Закон ЄС про дані застосовується з 12 вересня 2025 року та регулює, хто може отримати доступ до даних, створених підключеними продуктами, включно з промисловим обладнанням, тоді як зобов’язання щодо дизайну поширюються на підключені продукти, розміщені на ринку ЄС після 12 вересня 2026 року.
19 листопада 2025 року Європейська комісія опублікувала стратегію об’єднання даних, першочерговим завданням якої є розширення доступу до даних для ШІ. Десять місяців потому більшість цих дій не було виконано, включаючи лабораторії даних, які обіцяла стратегія, повідомляє The Next Web. Найближчим європейським еквівалентом китайського тренувального майданчика є приватна компанія: NEURA Robotics будує десять робототехнічних тренувальних залів, п’ять із яких мають бути запущені до кінця цього року, розділених між Європою, Сполученими Штатами та Китаєм.
Перевірка реальності з боку попиту
Стандартизація пропозиції даних не гарантує попиту. Лише 23 відсотки китайських підприємств, опитаних цього року, сказали, що вони задоволені пропонованими роботами, цифра, яка свідчить про те, що ринок, а не канал передачі даних, може остаточно визначати темпи впровадження.
Та все ж напрямок руху зрозумілий. Китай розглядає втілені дані штучного інтелекту як стратегічний ресурс, який необхідно систематично виробляти, стандартизувати та масштабувати, тоді як його регулятори тісно координують роботу з галуззю, яку вони контролюють. Для виробників роботів у всьому світі розрив між юрисдикціями, які створюють навчальну реальність, і тими, які здебільшого регулюють його використання, стає одним із визначальних конкурентних питань у галузі.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →