OpenAI đã ra mắt GPT-Live, một loạt mẫu giọng nói mới dành cho ChatGPT có thể nghe và nói cùng lúc, đánh dấu bước cải tiến quan trọng nhất của công ty về trải nghiệm giọng nói đàm thoại cho đến nay. Bản phát hành sử dụng những gì OpenAI mô tả là kiến ​​trúc song công hoàn toàn, cho phép người dùng ngắt lời, nói chuyện và trò chuyện với trợ lý theo cách mà công ty cho biết giống như một cuộc gọi điện thoại thực sự.

Sự ra mắt này diễn ra cùng với việc OpenAI triển khai rộng rãi dòng mẫu GPT-5.6 trong tuần này và thể hiện nỗ lực khiến tin nóng về AI về giao diện giọng nói không giống như ra lệnh cho một cỗ máy mà giống trò chuyện với một người hơn.

Điều gì khiến GPT-Live trở nên khác biệt

Trợ lý giọng nói truyền thống hoạt động ở chế độ bán song công: bạn nói, sau đó dừng lại, sau đó hệ thống xử lý yêu cầu của bạn và phản hồi. Việc luân phiên là cứng nhắc. GPT-Live phá vỡ khuôn mẫu đó bằng cách xử lý âm thanh song công hoàn toàn, nghĩa là mô hình có thể nghe thấy bạn trong khi vẫn đang nói. Điều đó cho phép ngắt quãng một cách tự nhiên, sửa giữa câu và trò chuyện chồng chéo – kiểu mà con người qua lại được coi là điều hiển nhiên nhưng AI giọng nói trong lịch sử đã phải vật lộn với điều đó.

Theo Reuters, các mẫu GPT-Live nghe và nói đồng thời - một khả năng từ lâu đã trở thành mục tiêu của lĩnh vực AI bằng giọng nói. Cách tiếp cận này loại bỏ các khoảng dừng khó xử và bắt buộc phải thay phiên nhau đã xác định các phiên bản trước đó của chế độ giọng nói của ChatGPT.

Một chi tiết kỹ thuật đáng chú ý: khi GPT-Live gặp phải các câu hỏi phức tạp, nó sẽ chuyển những câu hỏi đó cho GPT-5.5 ở chế độ nền. Mẫu giọng nói xử lý luồng hội thoại trong thời gian thực, trong khi một mô hình lý luận lớn hơn sẽ xử lý các nhiệm vụ khó hơn ở hậu trường — sau đó cung cấp câu trả lời. Theo OpenAI, sự phân công lao động đó cải thiện đáng kể chất lượng phản hồi mà không làm mất đi khả năng phản hồi khiến cuộc trò chuyện trong thời gian thực trở nên tự nhiên.

Tình trạng sẵn có và giá cả

OpenAI đang triển khai các mẫu giọng nói mới theo hai cấp độ:

  • GPT-Live-1 — mô hình đầy đủ, hiện có sẵn cho những người đăng ký ChatGPT trả phí (các gói Plus, Pro và Team).
  • GPT-Live-1 mini — phiên bản nhỏ hơn, nhẹ hơn dành cho tài khoản ChatGPT miễn phí.
Quyền truy cập API sắp ra mắt, OpenAI cho biết, điều này sẽ cho phép các nhà phát triển xây dựng giọng nói song công hoàn toàn vào ứng dụng của riêng họ. Công ty vẫn chưa công bố giá chi tiết cho API.

Việc ra mắt cũng đưa tìm kiếm trên web trực tiếp vào cuộc trò chuyện bằng giọng nói. Như Search Engine Journal đã báo cáo, GPT-Live tích hợp tìm kiếm trực tiếp vào giọng nói ChatGPT, do đó người dùng có thể hỏi về các sự kiện hiện tại hoặc thông tin thay đổi nhanh chóng và nhận câu trả lời dựa trên kết quả web mới mà không cần chuyển đổi chế độ.

Thị trường AI có giọng nói cạnh tranh

GPT-Live đáp xuống bối cảnh AI bằng giọng nói ngày càng đông đúc. Google đã và đang đẩy mạnh các tính năng giọng nói do Gemini cung cấp trên Android và sản phẩm Gemini Live, trong khi Apple tiếp tục làm lại Siri xung quanh các mô hình ngôn ngữ lớn. Anthropic, đối thủ chính của OpenAI, đã tập trung nỗ lực gần đây vào các mô hình lý luận và mã hóa tác nhân hơn là giọng nói.

Cách tiếp cận song công hoàn toàn là nơi mà ngành công nghiệp rộng lớn hơn dường như đang hướng tới. Bằng cách cho phép nghe và nói đồng thời, GPT-Live giảm độ trễ và loại bỏ khiếu nại lớn nhất mà người dùng từng gặp phải với trợ lý giọng nói: sự chờ đợi. Việc chuyển sang GPT-5.5 cho các truy vấn phức tạp cũng là tín hiệu cho thấy OpenAI xem giọng nói không phải là một giao diện rút gọn mà là cánh cửa dẫn đến các mô hình có khả năng nhất của nó.

Tại sao nó lại quan trọng

Giọng nói trong nhiều năm đã được coi là giao diện phụ, điều khiển bằng lệnh — phù hợp để đặt bộ hẹn giờ và kiểm tra thời tiết, ít hữu ích hơn cho cuộc trò chuyện có nhiều sắc thái. GPT-Live đặt cược rằng nút thắt cổ chai không bao giờ nằm ​​ở trí thông minh của mô hình mà là giao diện: buộc con người phải nói theo từng đợt riêng biệt.

Nếu cuộc trò chuyện song công hoàn toàn hoạt động đáng tin cậy trên quy mô lớn, nó sẽ thay đổi cách mọi người tương tác với AI trên điện thoại, ô tô, loa thông minh và cuối cùng là trên các thiết bị đeo được. Nó cũng đặt ra những lo ngại quen thuộc – về sự đồng ý trong các thiết bị luôn lắng nghe, về tính chân thực của giọng nói tổng hợp và về việc liệu cuộc trò chuyện tự nhiên hơn có khiến người dùng tin tưởng quá mức vào câu trả lời của AI hay không.

OpenAI chưa trình bày chi tiết các biện pháp an toàn cụ thể cho GPT-Live ngoài các chính sách nội dung hiện có của nó, mặc dù việc tích hợp tìm kiếm có nghĩa là mô hình hiện có thể chuyển thông tin trực tiếp thành giọng nói mà người dùng có thể khó đánh giá nghiêm túc hơn văn bản mà họ có thể cuộn lại.

Điều gì xảy ra tiếp theo

Hiện tại, GPT-Live trước hết là tính năng ChatGPT và thứ hai là sản phẩm dành cho nhà phát triển. Thử nghiệm thực sự sẽ đến với quyền truy cập API, khi các ứng dụng của bên thứ ba, nền tảng dịch vụ khách hàng và nhà sản xuất phần cứng có thể kết nối cuộc trò chuyện song công hoàn toàn vào sản phẩm của riêng họ. Đó cũng là lúc OpenAI sẽ phải đối mặt với áp lực về giá từ các mẫu giọng nói nguồn mở rẻ hơn và từ các đối thủ cạnh tranh đang mong muốn có được tính năng này.

Việc ra mắt đồng thời với bản phát hành công khai của GPT-5.6 cho thấy OpenAI coi giọng nói và lý luận là hai nửa của cùng một chiến lược: một mô hình mạnh mẽ có khả năng tư duy, kết hợp với giao diện cho phép bạn nói chuyện với nó như một đồng nghiệp.

Đi trước AI

Để liên tục đưa tin về các phiên bản mô hình, AI giọng nói và mọi thứ định hình ngành, hãy theo dõi những phát triển AI mới nhất tại AI Buzz Wire.

Đọc thêm tin tức về AI →