OpenAI a lansat GPT-Live, o nouă serie de modele de voce pentru ChatGPT care poate asculta și vorbi în același timp, marcând cea mai semnificativă revizuire a companiei a experienței vocale conversaționale de până acum. Lansarea folosește ceea ce OpenAI descrie ca o arhitectură full-duplex, permițând utilizatorilor să întrerupă, să vorbească și să converseze cu asistentul într-un mod despre care compania spune că se simte ca un apel telefonic real.

Lansarea vine alături de lansarea mai largă de către OpenAI a familiei de modele GPT-5.6 în această săptămână și reprezintă un impuls pentru a face ca știrile de ultimă oră AI despre interfețele vocale să se simtă mai puțin ca a comanda o mașină și mai mult ca a discuta cu o persoană.

Ce face GPT-Live diferit

Asistenții vocali tradiționali funcționează într-un mod semi-duplex: vorbiți, apoi opriți, apoi sistemul vă procesează cererea și răspunde. Turnul este rigid. GPT-Live rupe acest model cu procesarea audio full-duplex, ceea ce înseamnă că modelul te poate auzi în timp ce încă vorbește. Acest lucru permite întreruperi naturale, corecții la mijlocul propoziției și conversații care se suprapun - genul de oameni dus-întors îl consideră de la sine înțeles, dar cu care AI-urile vocale s-au luptat istoric.

Potrivit Reuters, modelele GPT-Live ascultă și vorbesc simultan - o capacitate care a fost mult timp o țintă pentru domeniul AI vocal. Abordarea elimină pauzele incomode și turnarea forțată care au definit versiunile anterioare ale modului vocal al ChatGPT.

Un detaliu tehnic notabil: atunci când GPT-Live întâmpină întrebări complexe, le transmite pe GPT-5.5 în fundal. Modelul vocal gestionează fluxul conversațional în timp real, în timp ce un model de raționament mai amplu lucrează la sarcini mai grele din culise – apoi transmite răspunsul. Această diviziune a muncii, conform OpenAI, îmbunătățește drastic calitatea răspunsului, fără a sacrifica receptivitatea care face ca conversația în timp real să pară naturală.

Disponibilitate și prețuri

OpenAI lansează noile modele de voce în două niveluri:

  • GPT-Live-1 — modelul complet, disponibil acum pentru abonații plătitori ChatGPT (planuri Plus, Pro și Team).
  • GPT-Live-1 mini — o versiune mai mică și mai ușoară disponibilă pentru conturile ChatGPT gratuite.
Accesul API va veni în curând, a spus OpenAI, ceea ce va permite dezvoltatorilor să integreze vocea full-duplex în propriile aplicații. Compania nu a publicat încă prețurile detaliate pentru API.

Lansarea aduce și căutarea pe web direct în conversația vocală. După cum a raportat Search Engine Journal, GPT-Live integrează căutarea live în vocea ChatGPT, astfel încât utilizatorii să poată întreba despre evenimente curente sau informații care se schimbă rapid și să obțină răspunsuri bazate pe rezultate web proaspete, fără a schimba modurile.

O piață competitivă pentru IA vocală

GPT-Live aterizează într-un peisaj AI vocal din ce în ce mai aglomerat. Google și-a extins funcțiile de voce bazate pe Gemini pe Android și pe produsul său Gemini Live, în timp ce Apple continuă să reprogrameze Siri în jurul modelelor de limbi mari. Anthropic, principalul rival al OpenAI, și-a concentrat eforturile recente pe modele de codare și raționament agentic, mai degrabă decât pe voce.

Abordarea full-duplex este locul în care industria mai largă pare să se îndrepte. Permițând ascultarea și vorbirea simultană, GPT-Live reduce latența și elimină cea mai mare plângere pe care utilizatorii au avut-o cu asistenții vocali: așteptarea. Transmiterea la GPT-5.5 pentru interogări complexe este, de asemenea, un semnal că OpenAI vede vocea nu ca pe o interfață redusă, ci ca pe o ușă de intrare către modelele sale cele mai capabile.

De ce contează

Vocea a fost tratată de ani de zile ca o interfață secundară, bazată pe comandă - bună pentru setarea cronometrelor și verificarea vremii, mai puțin utilă pentru conversații nuanțate. Pariul GPT-Live este că blocajul nu a fost niciodată inteligența modelului, ci interfața: forțând oamenii să vorbească în rafale izolate.

Dacă conversația full-duplex funcționează în mod fiabil la scară, schimbă modul în care oamenii interacționează cu inteligența artificială pe telefoane, în mașini, pe difuzoare inteligente și, eventual, pe dispozitive portabile. De asemenea, ridică preocupări familiare - cu privire la consimțământul în dispozitivele care ascultă mereu, cu privire la realismul vocilor sintetice și despre dacă o conversație mai naturală îi determină pe utilizatori să aibă încredere excesivă în răspunsurile unei AI.

OpenAI nu a detaliat măsuri de siguranță specifice pentru GPT-Live dincolo de politicile sale de conținut existente, deși integrarea căutării înseamnă că modelul poate acum trage informații live într-o voce care poate fi mai greu de evaluat critic pentru utilizatori decât textul prin care pot derula înapoi.

Ce urmează

Deocamdată, GPT-Live este în primul rând o funcție ChatGPT și în al doilea rând un produs pentru dezvoltatori. Testul real va ajunge cu acces API, atunci când aplicațiile terțe, platformele de servicii pentru clienți și producătorii de hardware vor putea conecta conversația full-duplex în propriile produse. Tot atunci OpenAI se va confrunta cu presiunea prețurilor din partea modelelor de voce open-source mai ieftine și a concurenților dornici să se potrivească cu această funcție.

Lansarea simultană cu lansarea publică a GPT-5.6 sugerează că OpenAI vede vocea și raționamentul ca două jumătăți ale aceleiași strategii: un model puternic care gândește, asociat cu o interfață care vă permite să vorbiți cu el ca un coleg.

Rămâi înaintea AI

Pentru o acoperire continuă a lansărilor de modele, a IA vocală și a tot ceea ce modelează industria, urmăriți cele mai recente evoluții AI la AI Buzz Wire.

Citiți mai multe știri AI →