OpenAI har lanserat GPT-Live, en ny serie röstmodeller för ChatGPT som kan lyssna och tala samtidigt, vilket markerar företagets hittills mest betydande översyn av sin konversationsröstupplevelse. Utgåvan använder vad OpenAI beskriver som en full-duplex-arkitektur, vilket tillåter användare att avbryta, prata om och samtala med assistenten på ett sätt som företaget säger känns som ett riktigt telefonsamtal.

Lanseringen kommer tillsammans med OpenAI:s bredare lansering av modellfamiljen GPT-5.6 den här veckan, och representerar en push för att få brytande AI-nyheter om röstgränssnitt att kännas mindre som att styra en maskin och mer som att chatta med en person.

Vad gör GPT-Live annorlunda

Traditionella röstassistenter arbetar i halvduplexläge: du talar, sedan slutar du, sedan behandlar systemet din förfrågan och svarar. Svängtagning är stel. GPT-Live bryter det mönstret med full-duplex ljudbehandling, vilket innebär att modellen kan höra dig medan den fortfarande pratar. Det möjliggör naturliga avbrott, korrigeringar i mitten av meningar och överlappande konversationer - den typ av fram och tillbaka människor tar för givna men röst-AI:er har historiskt kämpat med.

Enligt Reuters lyssnar och talar GPT-Live-modellerna samtidigt - en förmåga som länge har varit ett mål för röst-AI-området. Tillvägagångssättet tar bort de besvärliga pauserna och påtvingade turtagningarna som har definierat tidigare versioner av ChatGPT:s röstläge.

En anmärkningsvärd teknisk detalj: när GPT-Live stöter på komplexa frågor lämnar den dem till GPT-5.5 i bakgrunden. Röstmodellen hanterar samtalsflödet i realtid, medan en större resonemangsmodell arbetar med svårare uppgifter bakom kulisserna — sedan återkopplar svaret. Den arbetsfördelningen, enligt OpenAI, förbättrar svarskvaliteten drastiskt utan att offra lyhördheten som gör att samtal i realtid känns naturligt.

Tillgänglighet och prissättning

OpenAI rullar ut de nya röstmodellerna i två nivåer:

  • GPT-Live-1 — hela modellen, tillgänglig nu för betalande ChatGPT-prenumeranter (Plus-, Pro- och Team-planer).
  • GPT-Live-1 mini — en mindre, lättare version tillgänglig för gratis ChatGPT-konton.
API-åtkomst kommer snart, sa OpenAI, vilket gör det möjligt för utvecklare att bygga in full-duplex röst i sina egna applikationer. Företaget har ännu inte publicerat detaljerade priser för API:et.

Lanseringen tar också med webbsökning direkt in i röstkonversationen. Som Search Engine Journal rapporterade, integrerar GPT-Live livesökning i ChatGPT-röst, så att användare kan fråga om aktuella händelser eller snabbt föränderlig information och få svar grundade i nya webbresultat utan att byta läge.

En konkurrenskraftig Voice AI-marknad

GPT-Live landar i ett alltmer trångt landskap för röst-AI. Google har pressat sina Gemini-drivna röstfunktioner över Android och sin Gemini Live-produkt, medan Apple fortsätter att omarbeta Siri kring stora språkmodeller. Anthropic, OpenAIs främsta rival, har fokuserat sina senaste ansträngningar på agentkodning och resonemangsmodeller snarare än röst.

Full-duplex-metoden är dit den bredare branschen verkar vara på väg. Genom att tillåta att lyssna och tala samtidigt, minskar GPT-Live latensen och tar bort de enskilt största klagomålen som användare har haft med röstassistenter: väntan. Överlämningen till GPT-5.5 för komplexa frågor är också en signal om att OpenAI inte ser rösten som ett avskalat gränssnitt, utan som en ytterdörr till dess mest kapabla modeller.

Varför det är viktigt

Voice har i flera år behandlats som ett sekundärt, kommandostyrt gränssnitt - bra för att ställa in timers och kontrollera väder, mindre användbart för nyanserade konversationer. GPT-Lives satsning är att flaskhalsen aldrig var modellens intelligens, utan gränssnittet: som tvingade människor att tala i isolerade skurar.

Om full-duplex konversation fungerar tillförlitligt i skala, förändrar det hur människor interagerar med AI på telefoner, i bilar, på smarta högtalare och så småningom på bärbara enheter. Det väcker också välbekanta farhågor – om samtycke i enheter som alltid lyssnar, om realismen hos syntetiska röster, och om huruvida mer naturliga samtal leder till att användare överlitar en AI:s svar.

OpenAI har inte detaljerat specifika säkerhetsåtgärder för GPT-Live utöver sina befintliga innehållspolicyer, även om sökintegreringen innebär att modellen nu kan dra liveinformation till en röst som kan vara svårare för användare att kritiskt utvärdera än text de kan rulla tillbaka genom.

Vad kommer härnäst

För närvarande är GPT-Live en ChatGPT-funktion först och en utvecklarprodukt sedan. Det verkliga testet kommer med API-åtkomst, när appar från tredje part, kundtjänstplattformar och maskinvarutillverkare kan koppla in full-duplex-konversation i sina egna produkter. Det är också då OpenAI kommer att möta prispress från billigare röstmodeller med öppen källkod och från konkurrenter som är ivriga att matcha funktionen.

Den samtidiga lanseringen med GPT-5.6:s offentliga utgåva antyder att OpenAI ser röst och resonemang som två halvor av samma strategi: en kraftfull modell som tänker, tillsammans med ett gränssnitt som låter dig prata med den som en kollega.

Ligg före AI

För kontinuerlig bevakning av modellsläpp, röst-AI och allt som formar branschen, följ den senaste AI-utvecklingen på AI Buzz Wire.

Läs mer AI-nyheter →