Google DeepMind a dezvăluit SL2T, un model de inteligență artificială conceput pentru a traduce limbajul semnelor în text, lansând mai întâi pe noua linie de smartphone-uri Pixel 11 a companiei. Modelul, introdus sub bannerul „pune AI limbajului semnelor în mâinile utilizatorilor”, marchează una dintre cele mai importante încercări de până acum de a aduce înțelegerea limbajului semnelor în timp real la un dispozitiv de consum obișnuit.
Anunțul a venit alături de evenimentul de lansare a lui Pixel 11 de la Google, în care compania a prezentat o suită de noi funcții alimentate de Gemini. Printre acestea, traducerea în limbajul semnelor s-a remarcat ca o etapă clară de accesibilitate, transformând camera frontală a unui telefon într-o punte între utilizatorii surzi și persoanele care nu cunosc limbajul semnelor.
Limba semnelor pentru text, pe dispozitiv
Potrivit DeepMind și rapoarte de la Engadget și Android Authority, SL2T poate transcrie limbajul semnelor în text direct pe dispozitivele Pixel 11. Caracteristica debutează pe Pixel 11 Pro Fold, telefonul pliant emblematic al Google, pe care compania l-a poziționat ca o vitrină pentru noua capabilitate.
Digital Trends a descris lansarea ca fiind „o nouă modalitate pentru utilizatorii surzi de a comunica cu oameni care nu cunosc limbajul semnelor”, încadrând SL2T ca un instrument practic pentru conversația de zi cu zi, mai degrabă decât o demonstrație pur experimentală. Ideea este simplă, dar puternică: un utilizator surd semnează la telefonul său, modelul interpretează gesturile, iar textul rezultat este afișat pentru ca un partener de conversație care auz să îl citească.
Rularea modelului pe dispozitiv, mai degrabă decât livrarea video în cloud, are implicații semnificative atât pentru confidențialitate, cât și pentru fiabilitate. Conversațiile în limbajul semnelor sunt intime și conțin adesea informații sensibile, iar evitarea unui drum dus-întors în cloud păstrează acele date pe telefon. De asemenea, permite ca funcția să funcționeze în situații în care conectivitatea este slabă.
De ce limbajul semnelor este o problemă grea de AI
Limbajul semnelor este mult mai complex decât simpla recunoaștere a formelor mâinilor. Limbile semnelor complete, cum ar fi limbajul semnelor americane (ASL), folosesc gesturile mâinii, expresiile faciale, postura corpului și mișcarea în spațiu pentru a transmite sens și au propria lor gramatică, care este diferită de limbile vorbite. Un model care urmărește doar mâinile va pierde mult din ceea ce spune un semnatar.
Acesta este motivul pentru care traducerea în limbajul semnelor a rămas în urma recunoașterii vorbirii. Construirea unui sistem care poate interpreta întreaga bogăție a comunicării semnate în timp real, pe un telefon, în limitele bugetelor reduse de putere și memorie, reprezintă o adevărată provocare de inginerie. DeepMind nu a publicat încă detalii tehnice complete despre arhitectura SL2T sau performanța de referință, iar compania a subliniat experiența cu care se confruntă utilizatorii în defavoarea valorilor brute în anunțul său.
Detaliile publice limitate merită remarcate. Verificarea independentă a ratelor de acuratețe, a limbajelor semnelor acceptate și a latenței va determina dacă SL2T este un instrument zilnic de încredere sau o caracteristică în stadiu incipient care încă are nevoie de maturizare. Deocamdată, coroborarea anunțului DeepMind și a multiplelor publicații tehnologice confirmă existența modelului și se livrează pe hardware de consum.
Accesibilitatea ca câmp de luptă AI
SL2T apare pe măsură ce funcțiile de accesibilitate au devenit o arena de competiție din ce în ce mai vizibilă între laboratoarele AI și producătorii de dispozitive. Subtitrările în timp real, descrierile de imagini pentru utilizatorii nevăzători și acum traducerea în limbajul semnelor sunt poziționate nu ca suplimente de nișă, ci ca capabilități de titlu care demonstrează valoarea practică a AI pe dispozitiv.
Pentru Google, legarea SL2T de lansarea Pixel 11 are două scopuri. Oferă noului hardware o caracteristică distinctivă de care le lipsește telefoanele concurenților și întărește mesajul că Gemini, asistentul AI al Google, este țesut în sistemul de operare la un nivel fundamental. Pixel 11 Pro Fold, cu ecranul său interior mai mare, este prima casă naturală pentru o funcție menită să fie prezentată unui partener de conversație pe o masă.
Drumul de urmat pentru IA în limbajul semnelor
Întrebarea mai mare pentru comunitatea surzilor și cu probleme de auz este dacă SL2T se extinde dincolo de un singur dispozitiv și un set limitat de limbaje semnelor. Limba semnelor americane este probabil punctul central al lansării, dar există sute de limbi semnetice în întreaga lume, fiecare cu propria sa structură și variație regională. Un model care funcționează minunat pentru semnatarii ASL din Statele Unite poate fi de puțin folos pentru un utilizator de limbajul semnelor britanic, Auslan sau LSF.
DeepMind are un palmares în ceea ce privește începutul îngust și extins, așa cum a făcut cu sisteme precum AlphaFold și modelele sale meteorologice. Dacă SL2T urmează acest model, debutul Pixel 11 este mai degrabă o mișcare de deschidere decât un produs finit. Feedback-ul comunității de la utilizatorii surzi, care sunt cel mai bine poziționați pentru a aprecia dacă traducerile sunt corecte și naturale, va modela ceea ce urmează.
Deocamdată, sosirea traducerii în limbajul semnelor pe un telefon de masă este un pas notabil. Acesta sugerează că decalajul de lungă durată dintre capacitatea AI de a înțelege limba vorbită și capacitatea sa de a înțelege limbajul semnelor poate începe în sfârșit să se închidă, câte un dispozitiv.
Fiți la curent cu cele mai recente lansări de modele și dezvoltări AI la Acoperirea știrilor de ultimă oră a AI Buzz Wire.
