OpenAI tar med röstbaserade agentfunktioner till ChatGPT-mobilappen, vilket låter användarna utlösa verkligt arbete - att utarbeta dokument, sammanfatta e-postmeddelanden, bygga presentationer - helt enkelt genom att prata, meddelade företaget på onsdagen, som rapporterats av TechCrunch.
Utrullningen sträcker sig till smartphonefunktioner som OpenAI tidigare erbjöd på stationära datorer, och den landar när rösten blir ett av de snabbast växande sätten som användare interagerar med AI-assistenter för komplexa uppgifter.
Vad prenumeranter kan göra med rösten
Plus- och Pro-prenumeranter kommer att kunna använda fliken Arbete i ChatGPT-mobilappen för att skapa dokument, skriva utkast till e-postmeddelanden eller sammanfatta Slack-meddelanden med rösten. Samma röstarbetsflöde täcker tyngre jobb som fliken Arbete redan stöder, som att bygga webbplatser, skapa presentationer, använda molnwebbläsaren och gräva i ekonomiområdet för ChatGPT.
Free and Go-användare får en smalare del av uppdateringen och får möjligheten att arbeta med plugins och anslutna appar.
OpenAI sa att röstkonversationer nu kommer att ge rikare textutdata, och användare kan flytta sig smidigt mellan röst- och textlägen. Kanske det mest praktiska tillägget för människor som jonglerar med pendlar och stationära datorer: en konversation som startas när du är på språng kan återupptas senare på skrivbordsappen.
Vägen från GPT-Live till mobila agenter
Uppdateringen är det mobila kapitlet i en berättelse som OpenAI började i juli, när den lanserade GPT-Live, dess nya konversationsmodell, och senare kopplade den till skrivbordsappen så att användare kunde slutföra uppgifter på fliken Arbete och bygga appar på fliken Codex med rösten. Onsdagens tillkännagivande stänger slingan genom att föra samma röststyrda uppgiftsexekvering till telefoner.
Varför röstagenter på mobil är viktiga
Skiftet speglar hur användningsmönster förändras. Fler användare vänder sig till röst för att ge kommandon till AI-assistenter för komplexa uppgifter, och telefonen är där dessa kommandon mest naturligt sker - mellan möten, i bilen eller borta från ett tangentbord.
Fram till nu har de mest kraftfulla agentfunktionerna i ChatGPT funnits på skrivbordet. Användare som ville att ChatGPT skulle bygga en presentation eller köra en forskningsuppgift i flera steg måste vara vid sin dator och skriva instruktioner på fliken Arbete. Mobilappen, trots all sin popularitet, var till stor del en konversationsyta. Onsdagens uppdatering kollapsar den distinktionen: telefonen blir en legitim plats att kicka igång väsentligt arbete, med röstkanalen som gränssnitt.
Prenumerationsdelningen
Utbyggnaden skärper också gränserna mellan ChatGPT:s prenumerationsnivåer. Plus- och Pro-prenumeranter – planerna som redan har de högsta användningsgränserna och tillgång till OpenAIs mest kapabla modeller – får den fullständiga röststyrda Work-fliken-upplevelsen, inklusive skapande av dokument, e-postutkast och Slack-sammanfattningar. De kan också bygga sajter, skapa presentationer, använda molnwebbläsaren och komma åt ekonomiområdet för ChatGPT, allt med rösten.
Free and Go-användare får en mer begränsad uppsättning funktioner centrerade på plugins och anslutna appar. Den nivåindelningen följer ett välbekant mönster för OpenAI: bevisa en kapacitet på skrivbordet, ta sedan med en mobilversion vars mest värdefulla funktioner driver användare mot betalplaner. För OpenAI fördjupar flytten vallgraven runt dess betalda nivåer i ett ögonblick när rivaler aggressivt uppvaktar samma användare.
Hur det kan jämföras med Anthropics tillvägagångssätt
Den konkurrenskraftiga bakgrunden är viktig här. TechCrunch noterar att Anthropic nyligen gjorde handoffs mellan mobil och stationär enklare för sina egna användare och slog ihop sina Cowork- och Chat-gränssnitt till en upplevelse. OpenAI, däremot, håller fortfarande chatt och arbetsytor åtskilda - en avsiktlig produktuppdelning som håller tillfälliga konversationer åtskilda från arbetsytan där filer, projekt och verktyg lever.
De två företagen kör effektivt motsatta experiment i AI-assistent arbetsflödesdesign. Anthropics sammanslagna gränssnitt satsar på att användare vill ha en enda enhetlig yta som följer dem över enheter. OpenAI:s satsning är att chatt och strukturerade arbetsytor tjänar olika behov och bör förbli distinkta, med rösten som fungerar som bindväv — börja en uppgift genom att prata på mobilen, förfina den med ett tangentbord på skrivbordet.
Vad du ska titta på härnäst
Den uppenbara nästa frågan är hur långt röstagenter reser från fliken Arbete. OpenAI:s skrivbordsintegration når redan in i Codex, dess appbyggande verktyg, och mobil paritet där skulle förvandla telefoner till fulla utvecklingsytor. OpenAI har inte meddelat tidpunkten för det.
Olöst är också tillförlitlighet. Agentiska röstuppgifter – utarbeta, sammanfatta, bläddra – involverar körning i flera steg där fel förvärras och mobila miljöer lägger till avbrott och kontextväxling. Tidig användarupplevelse kommer att avgöra om röststyrt arbete blir en daglig vana eller förblir en demovänlig funktion.
Hur som helst är färdriktningen tydlig: assistenten som svarade på frågor med rösten för två år sedan förväntas nu slutföra uppgiften innan du når ditt skrivbord. Med onsdagens uppdatering kan OpenAI:s mobilanvändare börja den uppgiften med en mening – och plocka upp den på en större skärm när de anländer.
---
Stay ahead of AIFå de senaste AI-nyheterna, analyserna och genombrotten – allt på ett ställe.
Läs mer AI-nyheter →