OpenAI는 음성 기반 에이전트 기능을 ChatGPT 모바일 앱에 도입하여 사용자가 대화만으로 문서 초안 작성, 이메일 요약, 프레젠테이션 작성 등 실제 작업을 시작할 수 있다고 수요일 발표했습니다. TechCrunch의 보도에 따르면 OpenAI는 수요일 발표했습니다.
이번 출시는 이전에 데스크톱에서 OpenAI가 제공했던 스마트폰 기능으로 확장되었으며 음성은 사용자가 복잡한 작업을 위해 AI 보조자와 상호 작용하는 가장 빠르게 성장하는 방법 중 하나가 되었습니다.
가입자가 음성으로 할 수 있는 작업
Plus 및 Pro 구독자는 ChatGPT 모바일 앱의 작업 탭을 사용하여 문서를 작성하고 이메일 초안을 작성하거나 음성으로 Slack 메시지를 요약할 수 있습니다. 동일한 음성 워크플로는 사이트 구축, 프레젠테이션 생성, 클라우드 브라우저 사용, ChatGPT의 재정 영역 조사와 같이 작업 탭에서 이미 지원하는 더 무거운 작업을 다룹니다.
Free 및 Go 사용자는 업데이트 범위가 더 좁아져 플러그인 및 연결된 앱으로 작업할 수 있는 기능을 얻게 됩니다.
OpenAI는 이제 음성 대화가 더 풍부한 텍스트 출력을 생성하고 사용자는 음성과 텍스트 모드 사이를 유연하게 이동할 수 있다고 말했습니다. 출퇴근길과 데스크탑을 동시에 이용하는 사람들을 위한 가장 실용적인 추가 기능은 이동 중에 시작한 대화를 나중에 데스크탑 앱에서 다시 시작할 수 있다는 것입니다.
GPT-Live에서 모바일 에이전트로 가는 길
이 업데이트는 OpenAI가 7월에 새로운 대화 모델인 GPT-Live를 출시하고 나중에 이를 데스크톱 앱에 연결하여 사용자가 음성으로 작업 탭 작업을 완료하고 Codex 탭에서 앱을 구축할 수 있었던 이야기의 모바일 장입니다. 수요일의 발표는 동일한 음성 기반 작업 실행을 전화기에 적용하여 루프를 종료합니다.
모바일 음성 에이전트가 중요한 이유
이러한 변화는 사용 패턴이 어떻게 변화하고 있는지를 반영합니다. 더 많은 사용자가 복잡한 작업을 위해 AI 보조자에게 명령을 내리기 위해 음성을 사용하고 있으며 회의 중, 차 안 또는 키보드가 없는 곳에서 이러한 명령이 가장 자연스럽게 발생하는 곳은 전화입니다.
지금까지 ChatGPT의 가장 강력한 에이전트 기능은 데스크톱에 있었습니다. ChatGPT가 프레젠테이션을 작성하거나 다단계 조사 작업을 실행하기를 원하는 사용자는 컴퓨터에서 작업 탭에 지침을 입력해야 했습니다. 모바일 앱은 그 인기에도 불구하고 대부분 대화의 표면이었습니다. 수요일의 업데이트에서는 이러한 차이가 무너졌습니다. 음성 채널을 인터페이스로 사용하여 전화가 실질적인 작업을 시작하는 합법적인 장소가 되었습니다.
구독 분할
또한 이번 출시로 ChatGPT의 구독 계층 간의 경계가 더욱 명확해졌습니다. Plus 및 Pro 구독자(이미 가장 높은 사용 제한과 OpenAI의 가장 유능한 모델에 대한 액세스 권한을 제공하는 플랜)는 문서 작성, 이메일 초안 작성 및 Slack 요약을 포함하여 완전한 음성 기반 작업 탭 경험을 얻을 수 있습니다. 또한 음성으로 사이트를 구축하고, 프레젠테이션을 만들고, 클라우드 브라우저를 사용하고, ChatGPT의 재정 영역에 액세스할 수 있습니다.
Free 및 Go 사용자는 플러그인 및 연결된 앱을 중심으로 보다 제한된 기능 세트를 받습니다. 이러한 계층화는 OpenAI의 친숙한 패턴을 따릅니다. 즉, 데스크톱에서 기능을 입증한 다음 사용자를 유료 요금제로 유도하는 가장 중요한 기능을 갖춘 모바일 버전을 가져오는 것입니다. OpenAI의 경우, 경쟁사가 동일한 사용자에게 공격적으로 구애하고 있는 시점에 이번 조치로 유료 계층 주변의 해자가 깊어졌습니다.
Anthropic의 접근 방식과 비교하는 방법
여기서는 경쟁적 배경이 중요합니다. TechCrunch는 Anthropic이 최근 자체 사용자를 위해 모바일과 데스크톱 간의 핸드오프를 더 쉽게 만들고 Cowork와 Chat 인터페이스를 하나의 경험으로 통합했다고 지적합니다. 반면 OpenAI는 여전히 채팅과 작업 공간을 분리하여 유지하고 있습니다. 이는 파일, 프로젝트 및 도구가 있는 작업 공간과 일상적인 대화를 구분하는 의도적인 제품 분할입니다.
두 회사는 AI 지원 워크플로 설계에 있어 상반된 실험을 효과적으로 진행하고 있습니다. Anthropic의 병합 인터페이스는 사용자가 여러 장치에서 사용자를 따르는 단일 통합 표면을 원한다고 확신합니다. OpenAI는 채팅과 구조화된 작업 공간이 서로 다른 요구 사항을 충족하고 음성을 연결 조직으로 사용하여 고유하게 유지되어야 한다고 확신합니다. 모바일에서 대화하여 작업을 시작하고 데스크톱의 키보드로 작업을 다듬습니다.
다음에 볼만한 것
다음 질문은 음성 에이전트가 작업 탭에서 얼마나 멀리 이동하는지입니다. OpenAI의 데스크톱 통합은 이미 앱 구축 도구인 Codex에 도달했으며 모바일 패리티는 휴대폰을 완전한 개발 표면으로 전환할 것입니다. OpenAI는 이에 대한 시기를 발표하지 않았습니다.
또한 신뢰성도 해결되지 않았습니다. 초안 작성, 요약, 찾아보기 등의 에이전트 음성 작업에는 오류가 복합적으로 발생하는 다단계 실행이 포함되며 모바일 환경에서는 중단 및 컨텍스트 전환이 추가됩니다. 초기 사용자 경험에 따라 음성 기반 작업이 일상적인 습관이 될지 아니면 데모 친화적인 기능으로 남을지 결정됩니다.
어느 쪽이든 이동 방향은 분명합니다. 2년 전 음성으로 질문에 답했던 비서가 이제 귀하가 책상에 도착하기 전에 작업을 완료해야 합니다. 수요일 업데이트를 통해 OpenAI의 모바일 사용자는 문장으로 해당 작업을 시작할 수 있으며, 도착하면 더 큰 화면에서 해당 작업을 선택할 수 있습니다.
---
AI보다 앞서 나가세요최신 AI 뉴스, 분석, 획기적인 소식을 모두 한 곳에서 받아보세요.
AI 뉴스 자세히 보기 →