Google DeepMind представив SL2T, модель штучного інтелекту, призначену для перекладу мови жестів у текст, яка вперше з’явиться на новій лінійці смартфонів компанії Pixel 11. Модель, представлена під банером «Надання штучного інтелекту мовою жестів у руки користувачів», знаменує собою одну з найгучніших спроб надати розуміння мови жестів у режимі реального часу на звичайних споживчих пристроях.
Оголошення надійшло разом із презентацією Google Pixel 11, де компанія продемонструвала набір нових функцій на базі Gemini. Серед них жестовий переклад виділявся як чітка віха в доступності, перетворюючи передню камеру телефону на міст між глухими користувачами та людьми, які не знають мови жестів.
Мова жестів для тексту на пристрої
Згідно з DeepMind і звітами Engadget і Android Authority, SL2T може транскрибувати мову жестів у текст безпосередньо на пристроях Pixel 11. Ця функція дебютує на Pixel 11 Pro Fold, флагманському складному телефоні Google, який компанія позиціонувала як демонстрацію нової можливості.
Digital Trends описав випуск як «новий спосіб для глухих користувачів спілкуватися з людьми, які не знають мови жестів», розглядаючи SL2T як практичний інструмент для повсякденної розмови, а не як суто експериментальну демонстрацію. Ідея проста, але потужна: глухий користувач підписує свій телефон, модель інтерпретує жести, а отриманий текст відображається для читання чуючим співрозмовником.
Запуск моделі на пристрої, а не відправка відео в хмару, має значні наслідки як для конфіденційності, так і для надійності. Розмови мовою жестів є інтимними та часто містять конфіденційну інформацію, а якщо уникнути зворотного зв’язку з хмарою, ці дані зберігаються в телефоні. Це також дозволяє функції працювати в ситуаціях, коли зв’язок поганий.
Чому мова жестів є важкою проблемою ШІ
Мова жестів набагато складніша, ніж просто розпізнавання форми рук. Повні мови жестів, такі як американська мова жестів (ASL), використовують жести рук, міміку, позу тіла та рух у просторі для передачі значення, і вони мають власну граматику, яка відрізняється від розмовних мов. Модель, яка відстежує лише руки, пропустить багато з того, що говорить підписант.
Ось чому жестовий переклад відстає від розпізнавання мовлення. Створення системи, яка може інтерпретувати повне багатство підписаного зв’язку в режимі реального часу, по телефону, в межах жорсткого бюджету електроенергії та пам’яті, є справжньою інженерною проблемою. DeepMind ще не опублікував повних технічних деталей щодо архітектури SL2T або тестової продуктивності, і компанія підкреслила у своєму оголошенні переваги користувача, а не сирі показники.
Варто відзначити обмежені публічні деталі. Незалежна перевірка показників точності, підтримуваних мов жестів і затримки визначить, чи є SL2T надійним щоденним інструментом чи функцією на ранній стадії, яка все ще потребує зрілості. На даний момент підтвердження у власному оголошенні DeepMind і численних публікаціях про технології підтверджує, що модель існує та постачається на споживчому обладнанні.
Доступність як поле битви ШІ
SL2T з’являється, оскільки функції доступності стають дедалі помітнішою ареною конкуренції між лабораторіями ШІ та виробниками пристроїв. Субтитри в реальному часі, описи зображень для незрячих користувачів, а тепер і жестовий переклад позиціонуються не як спеціальні додатки, а як заголовні можливості, які демонструють практичну цінність ШІ на пристрої.
Для Google прив’язка SL2T до випуску Pixel 11 має дві мети. Це надає новому апаратному забезпеченню відмітну особливість, якої не вистачає телефонам конкурентів, і підсилює повідомлення про те, що Gemini, помічник Google зі штучним інтелектом, вплетений в операційну систему на фундаментальному рівні. Pixel 11 Pro Fold зі збільшеним внутрішнім екраном є природним першим домом для функції, призначеної для показу співрозмовнику за столом.
Штучний інтелект жестової мови попереду
Більше питання для спільноти глухих і людей з вадами слуху полягає в тому, чи SL2T виходить за межі одного пристрою та обмеженого набору мов жестів. Американська мова жестів, імовірно, буде зосереджена на запуску, але в усьому світі існують сотні мов жестів, кожна зі своєю структурою та регіональними варіаціями. Модель, яка чудово працює для тих, хто підписує ASL у Сполучених Штатах, може бути малокорисною для користувача британської жестової мови, Auslan або LSF.
DeepMind має послужний список того, що починав звужувати та розширювати, як це було з такими системами, як AlphaFold та його моделями погоди. Якщо SL2T дотримується цієї моделі, дебют Pixel 11 є першим кроком, а не готовим продуктом. Відгуки спільноти від глухих користувачів, які найкраще оцінюють, чи є переклади точними та природними, визначатимуть те, що буде далі.
Наразі поява сурдоперекладу на телефонах масового ринку є помітним кроком. Це свідчить про те, що давній розрив між здатністю штучного інтелекту розуміти розмовну мову та його здатністю розуміти жестову мову може нарешті почати закриватися, один пристрій за раз.
Будьте в курсі останніх випусків моделей і розробок штучного інтелекту на висвітленні останніх новин AI Buzz Wire.
