OpenAI đang đưa các tính năng tác nhân dựa trên giọng nói vào ứng dụng di động ChatGPT, cho phép người dùng kích hoạt công việc thực tế – soạn thảo tài liệu, tóm tắt email, xây dựng bản trình bày – chỉ bằng cách nói chuyện, công ty đã công bố hôm thứ Tư, theo báo cáo của TechCrunch.
Việc triển khai mở rộng sang các khả năng của điện thoại thông minh mà OpenAI đã cung cấp trước đây trên máy tính để bàn và nó sẽ diễn ra khi giọng nói trở thành một trong những cách phát triển nhanh nhất mà người dùng tương tác với trợ lý AI cho các tác vụ phức tạp.
Người đăng ký có thể làm gì bằng giọng nói
Người đăng ký Plus và Pro sẽ có thể sử dụng tab Công việc trong ứng dụng di động ChatGPT để tạo tài liệu, email soạn thảo hoặc tóm tắt tin nhắn Slack bằng giọng nói. Quy trình làm việc bằng giọng nói tương tự bao gồm các công việc nặng hơn mà tab Công việc đã hỗ trợ, chẳng hạn như xây dựng trang web, tạo bản trình bày, sử dụng trình duyệt đám mây và đào sâu vào lĩnh vực tài chính của ChatGPT.
Người dùng Free và Go nhận được phần cập nhật hẹp hơn, có khả năng hoạt động với các plugin và ứng dụng được kết nối.
OpenAI cho biết các cuộc trò chuyện bằng giọng nói giờ đây sẽ tạo ra đầu ra văn bản phong phú hơn và người dùng có thể di chuyển linh hoạt giữa chế độ giọng nói và văn bản. Có lẽ sự bổ sung thiết thực nhất dành cho những người đang cân nhắc giữa đường đi làm và máy tính để bàn: cuộc trò chuyện bắt đầu khi đang di chuyển có thể được tiếp tục lại sau trên ứng dụng máy tính để bàn.
Con đường từ GPT-Live đến đại lý di động
Bản cập nhật là chương di động của câu chuyện OpenAI bắt đầu vào tháng 7, khi nó ra mắt GPT-Live, mô hình đàm thoại mới và sau đó đưa nó vào ứng dụng máy tính để bàn để người dùng có thể hoàn thành các tác vụ trên tab Công việc và xây dựng ứng dụng trong tab Codex bằng giọng nói. Thông báo hôm thứ Tư khép lại vòng lặp bằng cách đưa tính năng thực thi tác vụ điều khiển bằng giọng nói tương tự vào điện thoại.
Tại sao tác nhân thoại lại quan trọng trên thiết bị di động
Sự thay đổi phản ánh cách thức sử dụng đang thay đổi. Ngày càng có nhiều người dùng chuyển sang sử dụng giọng nói để ra lệnh cho trợ lý AI thực hiện các tác vụ phức tạp và điện thoại là nơi những lệnh đó diễn ra một cách tự nhiên nhất — giữa các cuộc họp, trong ô tô hoặc khi không dùng bàn phím.
Cho đến thời điểm hiện tại, các tính năng tác nhân mạnh mẽ nhất trong ChatGPT vẫn tồn tại trên máy tính để bàn. Người dùng muốn ChatGPT xây dựng bản trình bày hoặc chạy tác vụ nghiên cứu gồm nhiều bước cần phải có mặt trên máy tính của họ, nhập hướng dẫn vào tab Công việc. Ứng dụng dành cho thiết bị di động, với tất cả sự phổ biến của nó, phần lớn là một bề mặt đàm thoại. Bản cập nhật hôm thứ Tư đã xóa bỏ sự khác biệt đó: điện thoại trở thành một nơi hợp pháp để bắt đầu công việc quan trọng, với giao diện là kênh thoại.
Việc chia đăng ký
Việc triển khai cũng làm rõ hơn ranh giới giữa các cấp độ đăng ký của ChatGPT. Người đăng ký Plus và Pro — các gói đã có giới hạn sử dụng cao nhất và quyền truy cập vào các mô hình có khả năng nhất của OpenAI — sẽ có được trải nghiệm tab Công việc được điều khiển bằng giọng nói đầy đủ, bao gồm tạo tài liệu, soạn thảo email và tóm tắt Slack. Họ cũng có thể xây dựng trang web, tạo bản trình bày, sử dụng trình duyệt đám mây và truy cập khu vực tài chính của ChatGPT, tất cả đều bằng giọng nói.
Người dùng Free và Go nhận được một bộ khả năng hạn chế hơn, tập trung vào các plugin và ứng dụng được kết nối. Việc phân cấp đó tuân theo mô hình quen thuộc của OpenAI: chứng minh khả năng trên máy tính để bàn, sau đó đưa ra phiên bản di động có các tính năng có giá trị nhất thúc đẩy người dùng chuyển sang các gói trả phí. Đối với OpenAI, động thái này sẽ đào sâu thêm khoảng cách xung quanh các cấp độ trả phí của nó vào thời điểm các đối thủ đang ráo riết thu hút cùng một người dùng.
So sánh với cách tiếp cận của Anthropic
Bối cảnh cạnh tranh quan trọng ở đây. TechCrunch lưu ý rằng Anthropic gần đây đã giúp người dùng của mình chuyển giao giữa thiết bị di động và máy tính để bàn dễ dàng hơn và hợp nhất giao diện Cowork và Chat thành một trải nghiệm. Ngược lại, OpenAI vẫn tách biệt cuộc trò chuyện và không gian làm việc - sự phân chia sản phẩm có chủ ý giúp tách biệt các cuộc trò chuyện thông thường với không gian làm việc nơi chứa các tệp, dự án và công cụ.
Hai công ty đang thực hiện các thử nghiệm trái ngược nhau một cách hiệu quả trong thiết kế quy trình làm việc có trợ lý AI. Giao diện hợp nhất của Anthropic đặt cược rằng người dùng muốn có một bề mặt thống nhất duy nhất theo dõi họ trên các thiết bị. OpenAI đặt cược rằng không gian làm việc có cấu trúc và trò chuyện phục vụ các nhu cầu khác nhau và phải khác biệt, với vai trò giọng nói là mô liên kết - bắt đầu một nhiệm vụ bằng cách nói chuyện trên thiết bị di động, tinh chỉnh nó bằng bàn phím trên máy tính để bàn.
Xem gì tiếp theo
Câu hỏi tiếp theo rõ ràng là các tác nhân thoại di chuyển bao xa từ tab Công việc. Sự tích hợp máy tính để bàn của OpenAI đã vươn tới Codex, công cụ xây dựng ứng dụng của nó và tính tương đương trên thiết bị di động sẽ biến điện thoại thành các bề mặt phát triển đầy đủ. OpenAI chưa công bố thời gian cho việc đó.
Cũng chưa được giải quyết là độ tin cậy. Các tác vụ thoại tổng thể — soạn thảo, tóm tắt, duyệt — liên quan đến việc thực thi nhiều bước, trong đó các lỗi phức tạp và môi trường di động gây thêm gián đoạn và chuyển đổi ngữ cảnh. Trải nghiệm ban đầu của người dùng sẽ quyết định liệu công việc điều khiển bằng giọng nói có trở thành thói quen hàng ngày hay vẫn là một tính năng thân thiện với bản demo.
Dù thế nào đi nữa, hướng đi vẫn rõ ràng: trợ lý đã trả lời các câu hỏi bằng giọng nói hai năm trước hiện phải hoàn thành nhiệm vụ trước khi bạn đến bàn làm việc. Với bản cập nhật hôm thứ Tư, người dùng di động của OpenAI có thể bắt đầu nhiệm vụ đó bằng một câu — và tiếp tục nhiệm vụ đó trên màn hình lớn hơn khi họ đến nơi.
---
Đi trước AINhận tin tức, phân tích và đột phá mới nhất về AI — tất cả ở cùng một nơi.
Đọc thêm tin tức về AI →