Jak donosi TechCrunch, firma ogłosiła w środę, że OpenAI wprowadza do aplikacji mobilnej ChatGPT funkcje agenta oparte na głosie, umożliwiając użytkownikom wykonywanie prawdziwej pracy – redagowania dokumentów, podsumowań e-maili, tworzenia prezentacji – po prostu poprzez rozmowę.

Wdrożenie obejmuje także funkcje smartfonów, które OpenAI wcześniej oferowało na komputerach stacjonarnych, i zakończy się, gdy głos stanie się jednym z najszybciej rozwijających się sposobów interakcji użytkowników z asystentami AI w przypadku złożonych zadań.

Co subskrybenci mogą robić głosowo

Abonenci Plus i Pro będą mogli używać karty Praca w aplikacji mobilnej ChatGPT do tworzenia dokumentów, szkiców e-maili lub podsumowywania wiadomości Slack za pomocą głosu. Ten sam przepływ pracy głosowej obejmuje cięższe zadania, które obsługuje już karta Praca, takie jak budowy, tworzenie prezentacji, korzystanie z przeglądarki w chmurze i przeglądanie obszaru finansów ChatGPT.

Użytkownicy wersji Free and Go otrzymują węższy wycinek aktualizacji, zyskując możliwość pracy z wtyczkami i połączonymi aplikacjami.

OpenAI twierdzi, że rozmowy głosowe będą teraz generować bogatszy tekst, a użytkownicy będą mogli płynnie przełączać się między trybami głosowymi i tekstowymi. Być może najbardziej praktyczny dodatek dla osób łączących dojazdy do pracy i pracę na komputerze: rozmowę rozpoczętą w drodze można później wznowić w aplikacji komputerowej.

Droga od GPT-Live do agentów mobilnych

Aktualizacja jest mobilnym rozdziałem historii OpenAI rozpoczętej w lipcu, kiedy uruchomiono GPT-Live, nowy model konwersacyjny, a później podłączono go do aplikacji komputerowej, aby użytkownicy mogli wykonywać zadania na karcie Praca i tworzyć aplikacje na karcie Kodeks za pomocą głosu. Środowe ogłoszenie zamyka pętlę, wprowadzając tę ​​samą realizację zadań sterowaną głosem na telefony.

Dlaczego agenci głosowi na urządzeniach mobilnych mają znaczenie

Ta zmiana odzwierciedla sposób, w jaki zmieniają się wzorce użytkowania. Coraz więcej użytkowników korzysta z głosu, aby wydawać polecenia asystentom AI w przypadku złożonych zadań, a telefon to miejsce, w którym te polecenia wydawane są w najbardziej naturalny sposób – między spotkaniami, w samochodzie lub z dala od klawiatury.

Do tej pory najpotężniejsze funkcje agenta w ChatGPT były dostępne na komputerach stacjonarnych. Użytkownicy, którzy chcieli, aby ChatGPT zbudował prezentację lub przeprowadził wieloetapowe zadanie badawcze, musieli siedzieć przy komputerze i wpisywać instrukcje w zakładce Praca. Aplikacja mobilna, mimo całej swojej popularności, w dużej mierze służyła do konwersacji. Środowa aktualizacja obala to rozróżnienie: telefon staje się legalnym miejscem do rozpoczęcia merytorycznej pracy, z kanałem głosowym jako interfejsem.

Podział subskrypcji

Wdrożenie zaostrza także granice pomiędzy poziomami subskrypcji ChatGPT. Abonenci Plus i Pro — plany, które już oferują najwyższe limity wykorzystania i dostęp do najbardziej wydajnych modeli OpenAI — uzyskują pełną obsługę głosową karty Work, w tym tworzenie dokumentów, redagowanie wiadomości e-mail i podsumowania w Slacku. Mogą także tworzyć witryny, tworzyć prezentacje, korzystać z przeglądarki w chmurze i uzyskiwać dostęp do obszaru finansów ChatGPT, a wszystko to za pomocą głosu.

Użytkownicy wersji Free and Go otrzymują bardziej ograniczony zestaw możliwości skupionych na wtyczkach i połączonych aplikacjach. Ten podział jest zgodny ze schematem znanym z OpenAI: udowodnij możliwości na komputerach stacjonarnych, a następnie udostępnij wersję mobilną, której najcenniejsze funkcje skłaniają użytkowników do korzystania z płatnych planów. W przypadku OpenAI posunięcie to pogłębia fosę wokół płatnych poziomów w momencie, gdy rywale agresywnie zabiegają o tych samych użytkowników.

Porównanie z podejściem Anthropic

Konkurencja ma tutaj znaczenie. TechCrunch zauważa, że ​​firma Anthropic niedawno ułatwiła swoim użytkownikom przełączanie między urządzeniami mobilnymi a komputerami stacjonarnymi i połączyła interfejsy Cowork i Chat w jedno. Z kolei OpenAI nadal oddziela czat od przestrzeni roboczej — celowy podział produktu, który oddziela zwykłe rozmowy od przestrzeni roboczej, w której znajdują się pliki, projekty i narzędzia.

Obie firmy faktycznie prowadzą przeciwstawne eksperymenty w zakresie projektowania przepływu pracy z wykorzystaniem asystentów AI. Połączony interfejs Anthropic zakłada, że ​​użytkownicy chcą jednej, ujednoliconej powierzchni, która będzie podążać za nimi na różnych urządzeniach. OpenAI stawia na to, że czat i zorganizowane przestrzenie robocze służą różnym potrzebom i powinny pozostać odrębne, a głos pełni rolę tkanki łącznej — rozpocznij zadanie, rozmawiając na telefonie komórkowym, udoskonalaj je za pomocą klawiatury na komputerze.

Co obejrzeć dalej

Oczywistym następnym pytaniem jest to, jak daleko agenci głosowi przemieszczają się od karty Praca. Integracja komputerów stacjonarnych OpenAI sięga już do Codexu, jego narzędzia do tworzenia aplikacji, a parytet mobilny zamieniłby tam telefony w pełnoprawne powierzchnie programistyczne. OpenAI nie ogłosiło, kiedy to nastąpi.

Nierozwiązana pozostaje również niezawodność. Agentyczne zadania głosowe — szkicowanie, podsumowywanie, przeglądanie — obejmują wieloetapowe wykonywanie, w którym błędy się nawarstwiają, a środowiska mobilne powodują dodatkowe zakłócenia i przełączanie kontekstu. Wczesne doświadczenie użytkownika zadecyduje, czy praca sterowana głosem stanie się codziennym nawykiem, czy pozostanie funkcją przyjazną dla wersji demonstracyjnych.

Tak czy inaczej, kierunek rozwoju jest jasny: oczekuje się, że asystent, który dwa lata temu odpowiadał głosowo na pytania, zakończy zadanie, zanim dotrzesz do swojego biurka. Dzięki środowej aktualizacji użytkownicy mobilni OpenAI mogą rozpocząć to zadanie od zdania i po przybyciu kontynuować je na większym ekranie.

---

Wyprzedź sztuczną inteligencję

Otrzymuj najnowsze wiadomości, analizy i przełomowe informacje dotyczące sztucznej inteligencji — wszystko w jednym miejscu.

Przeczytaj więcej aktualności o sztucznej inteligencji →