OpenAI heeft GPT-Live gelanceerd, een nieuwe reeks stemmodellen voor ChatGPT die tegelijkertijd kunnen luisteren en spreken. Dit markeert de belangrijkste herziening van de spraakervaring van het bedrijf tot nu toe. De release maakt gebruik van wat OpenAI beschrijft als een full-duplex architectuur, waardoor gebruikers de assistent kunnen onderbreken, erover kunnen praten en met hem kunnen praten op een manier die volgens het bedrijf aanvoelt als een echt telefoongesprek.

De lancering komt naast OpenAI's bredere uitrol van de GPT-5.6-modelfamilie deze week, en vertegenwoordigt een poging om breaking AI news over spraakinterfaces minder te laten voelen als het besturen van een machine en meer als het chatten met een persoon.

Wat GPT-Live anders maakt

Traditionele stemassistenten werken in een half-duplexmodus: u spreekt, dan stopt u, waarna het systeem uw verzoek verwerkt en reageert. Het nemen van beurten is rigide. GPT-Live doorbreekt dat patroon met full-duplex audioverwerking, wat betekent dat het model u kan horen terwijl het nog aan het praten is. Dat maakt natuurlijke onderbrekingen, correcties in het midden van een zin en overlappende gesprekken mogelijk – het soort heen-en-weer-gesprekken dat mensen als vanzelfsprekend beschouwen, maar waarmee stem-AI’s in het verleden moeite hebben gehad.

Volgens Reuters luisteren en spreken de GPT-Live-modellen tegelijkertijd – een mogelijkheid die lange tijd een doelwit is geweest op het gebied van stem-AI. De aanpak elimineert de lastige pauzes en het gedwongen beurten nemen die eerdere versies van de spraakmodus van ChatGPT hebben gedefinieerd.

Een opmerkelijk technisch detail: wanneer GPT-Live complexe vragen tegenkomt, geeft het deze op de achtergrond door aan GPT-5.5. Het stemmodel verwerkt de gespreksstroom in realtime, terwijl een groter redeneermodel achter de schermen aan moeilijkere taken werkt en vervolgens het antwoord terugkoppelt. Die taakverdeling verbetert volgens OpenAI de responskwaliteit drastisch, zonder dat dit ten koste gaat van de responsiviteit waardoor real-time gesprekken natuurlijk aanvoelen.

Beschikbaarheid en prijzen

OpenAI rolt de nieuwe stemmodellen in twee lagen uit:

  • GPT-Live-1 — het volledige model, nu beschikbaar voor betalende ChatGPT-abonnees (Plus-, Pro- en Team-abonnementen).
  • GPT-Live-1 mini — een kleinere, lichtere versie beschikbaar voor gratis ChatGPT-accounts.
API-toegang komt binnenkort beschikbaar, aldus OpenAI, waardoor ontwikkelaars full-duplex spraak in hun eigen applicaties kunnen inbouwen. Het bedrijf heeft nog geen gedetailleerde prijzen voor de API gepubliceerd.

Door de lancering wordt webzoeken ook rechtstreeks in het spraakgesprek opgenomen. Zoals Search Engine Journal meldde, integreert GPT-Live live zoeken in ChatGPT-stem, zodat gebruikers kunnen vragen naar actuele gebeurtenissen of snel veranderende informatie en antwoorden kunnen krijgen op basis van nieuwe webresultaten zonder van modus te hoeven wisselen.

Een competitieve Voice AI-markt

GPT-Live belandt in een steeds drukker wordend stem-AI-landschap. Google heeft zijn door Gemini aangedreven stemfuncties op Android en zijn Gemini Live-product gepromoot, terwijl Apple Siri blijft herwerken rond grote taalmodellen. Anthropic, de belangrijkste rivaal van OpenAI, heeft zijn recente inspanningen gericht op agentische coderings- en redeneermodellen in plaats van op stem.

De full-duplexbenadering is waar de bredere industrie naartoe lijkt te gaan. Door gelijktijdig luisteren en spreken mogelijk te maken, vermindert GPT-Live de latentie en neemt het de grootste klacht weg die gebruikers hebben gehad met stemassistenten: het wachten. De overdracht naar GPT-5.5 voor complexe zoekopdrachten is ook een signaal dat OpenAI voice niet als een uitgeklede interface beschouwt, maar als een voordeur naar de meest capabele modellen.

Waarom het ertoe doet

Spraak wordt al jaren behandeld als een secundaire, commandogestuurde interface – goed voor het instellen van timers en het controleren van het weer, minder handig voor genuanceerde gesprekken. De gok van GPT-Live is dat het knelpunt nooit de intelligentie van het model was, maar de interface: mensen dwingen om in geïsoleerde uitbarstingen te spreken.

Als full-duplex-gesprekken op grote schaal betrouwbaar werken, verandert dit de manier waarop mensen omgaan met AI op telefoons, in auto's, op slimme luidsprekers en uiteindelijk op draagbare apparaten. Het roept ook bekende zorgen op: over toestemming in apparaten die altijd luisteren, over het realisme van synthetische stemmen, en over de vraag of een natuurlijker gesprek ertoe leidt dat gebruikers de antwoorden van een AI te veel vertrouwen.

OpenAI heeft geen specifieke veiligheidsmaatregelen voor GPT-Live gedetailleerd die verder gaan dan het bestaande inhoudsbeleid, hoewel de zoekintegratie betekent dat het model nu live-informatie kan omzetten in een stem die voor gebruikers wellicht moeilijker te beoordelen is dan tekst waar ze doorheen kunnen scrollen.

Wat komt erna

Voorlopig is GPT-Live eerst een ChatGPT-functie en vervolgens een ontwikkelaarsproduct. De echte test komt met API-toegang, wanneer apps van derden, klantenserviceplatforms en hardwarefabrikanten full-duplex gesprekken in hun eigen producten kunnen pluggen. Dat is ook het moment waarop OpenAI te maken krijgt met prijsdruk van goedkopere open-source spraakmodellen en van concurrenten die deze functie graag willen evenaren.

De gelijktijdige lancering met de publieke release van GPT-5.6 suggereert dat OpenAI stem en redenering ziet als twee helften van dezelfde strategie: een krachtig model dat nadenkt, gecombineerd met een interface waarmee je er als een collega mee kunt praten.

Blijf AI een stap voor

Voor voortdurende berichtgeving over modelreleases, stem-AI en alles wat de industrie vormgeeft, volgt u de nieuwste AI-ontwikkelingen op AI Buzz Wire.

Lees meer AI-nieuws →