Google đã ra mắt Gemini 3.8 Live và Gemini 3.8 Live Extended Thought, một cặp mô hình đối thoại trực tiếp mà công ty mô tả là tiên tiến nhất dành cho cuộc trò chuyện bằng giọng nói tự nhiên. Các mô hình này bắt đầu được triển khai vào ngày 15 tháng 9 trên API Gemini, Google AI Studio, Search Live, Gemini Live và Google Workspace, với quyền truy cập dành cho doanh nghiệp ở chế độ xem trước riêng tư thông qua Gemini Enterprise.

Thông báo đến từ Tom Ouyang, kỹ sư chính và Malini Jaganathan, thành viên đội ngũ kỹ thuật, thay mặt Nhóm Âm thanh Gemini viết thư. Nó mở rộng dòng Gemini 3.8 đã ra mắt vào đầu tháng này với các mẫu Flash và Flash Cyber, đồng thời đánh dấu bước tiến mạnh mẽ nhất của Google vào hỗ trợ giọng nói đa phương thức, thời gian thực - một thị trường nơi chế độ giọng nói của OpenAI và một làn sóng các công ty khởi nghiệp về giọng nói đang cạnh tranh cho cùng một trường hợp sử dụng hàng ngày.

Buổi ra mắt phù hợp với một khoảng thời gian đặc biệt đông đúc dành cho dòng sản phẩm của Google; đưa tin về những phát triển AI mới nhất cho thấy công ty hiện đã xuất xưởng liên tục trong khoảng thời gian vài tuần khi cạnh tranh với các đối thủ về giá cả, mã hóa và bây giờ là giọng nói.

Được xây dựng để trò chuyện theo thời gian thực

Điều khác biệt giữa mô hình Trực tiếp với mô hình trò chuyện tiêu chuẩn có gắn micrô là độ trễ và trạng thái. Tài liệu Live API của Google mô tả giao diện có độ trễ thấp xử lý các luồng âm thanh, hình ảnh và văn bản liên tục qua kết nối WebSocket có trạng thái, chấp nhận âm thanh PCM 16kHz thô, hình ảnh JPEG với tốc độ tối đa một khung hình mỗi giây và văn bản cũng như trả về âm thanh giọng nói trong thời gian thực.

Các mô hình xử lý dữ liệu đầu vào trực quan gần như trong thời gian thực, cho phép trợ lý nhìn thấy những gì người dùng nhìn thấy — Các video minh họa của Google hiển thị Gemini 3.8 Live hướng dẫn phiên làm quen của nhân viên bằng cách sử dụng ngữ cảnh trực quan, chơi cờ gần như thời gian thực và xây dựng các kế hoạch kinh doanh hoàn chỉnh cũng như bộ công cụ tiếp thị tùy chỉnh thông qua giọng nói tự nhiên. Các mô hình này cũng có thể tự động phát hiện và chuyển đổi giữa 97 ngôn ngữ được hỗ trợ, giữa cuộc trò chuyện mà không cần người dùng chuyển đổi cài đặt.

Có lẽ điều quan trọng nhất khi sử dụng thực tế: các mô hình thực thi các công cụ và lệnh gọi API ở chế độ nền trong khi cuộc trò chuyện vẫn tiếp tục, xác nhận các yêu cầu và duy trì cuộc đối thoại trong khi nhiệm vụ kết thúc. Điều đó biến trợ lý từ một người trả lời hoàn toàn theo lượt thành một thứ gì đó gần gũi hơn với một nhân viên tình cờ nói chuyện.

Những con số Google đang chào mời

Google báo cáo rằng Tư duy mở rộng trực tiếp của Gemini 3.8 đã chiếm vị trí tổng thể hàng đầu về Chỉ số chất lượng chuyển giọng nói thành giọng nói của Phân tích nhân tạo với số điểm 82,6. Khi hoàn thành nhiệm vụ đại lý, công ty trích dẫn 68,6% trên điểm chuẩn τ-Voice và 35,1% trong đánh giá τ-Voice-banking của Sierra, cùng với điểm 97,7% trên Big Bench Audio.

Đó là những số liệu do chính Google báo cáo và việc xác minh độc lập sẽ mất thời gian - nhưng tuyên bố đứng đầu biểu đồ Phân tích nhân tạo, nếu đúng, sẽ đưa Google vượt lên trên các dịch vụ tối ưu hóa giọng nói từ OpenAI và các công ty AI giọng nói chuyên dụng về chất lượng hội thoại tổng thể. Google cũng cho biết Extended Thought duy trì mức giá có tính cạnh tranh cao, ngầm chấp nhận áp lực về giá đã định hình thế hệ 3.8.

Tất cả âm thanh do mô hình tạo ra đều được đánh dấu bằng SynthID, hình mờ không thể nhận ra của Google, do đó, giọng nói do AI tạo ra vẫn có thể được phát hiện — một biện pháp bảo vệ tuân thủ và thông tin sai lệch đang trở thành tiêu chuẩn trên các sản phẩm tổng hợp của Google.

Bạn có thể sử dụng nó ở đâu

Sự sẵn có khác nhau giữa hai mô hình. Gemini 3.8 Live khả dụng cho tất cả mọi người trong Search Live, chế độ tìm kiếm trực quan theo thời gian thực của Google. Tư duy mở rộng có sẵn trong Gemini Live, trong Docs dành cho người đăng ký Google AI Pro và Ultra thông qua Workspace cũng như trong Gmail và Keep dành cho tất cả người dùng Google.

Các nhà phát triển lấy mô hình thông qua API Gemini và Google AI Studio và Google cho biết Live API đã được sử dụng trên các nền tảng bao gồm Agora, Fishjam, LiveKit, Pipecat, Vercel và Vision Agents để xây dựng giao diện điều khiển bằng giọng nói trên cơ sở hạ tầng thời gian thực của Google. Salesforce, Genspark và Lumeris được chỉ định là đối tác ra mắt các mẫu xe mới.

Thị trường AI giọng nói đông đúc

Giọng nói đang trở thành chiến trường giao diện của năm 2026 vì đó là nơi AI cuối cùng thoát khỏi bàn phím. Một mô hình có thể nhìn, nghe, chuyển đổi ngôn ngữ và chạy các công cụ trong khi nói chuyện đang cạnh tranh không phải với các chatbot khác mà với cuộc gọi điện thoại, đường dây hỗ trợ khách hàng và trợ lý cá nhân.

Lợi thế của Google là khả năng phân phối: Tìm kiếm, Android, Workspace và Chrome mang lại cho các mô hình Live một cơ sở cài đặt mà không đối thủ nào có thể sánh được. Công ty đang đặt cược rằng việc hiện diện ở mọi ngóc ngách trong ngày của người dùng — giờ đây với những mẫu giọng nói tốt nhất — sẽ quan trọng hơn bất kỳ chiến thắng điểm chuẩn nào. Các đối thủ sẽ có cơ hội phản hồi, nhưng Google đã nói rõ rằng giọng nói đó, từng là tính năng demo, giờ là dòng sản phẩm hạng nhất.

Đối với các nhà phát triển, thông điệp cũng trực tiếp tương tự. Bằng cách xuất bản các định dạng đầu vào chính xác, ghi lại quá trình thực thi công cụ nền và tạo dựng hệ sinh thái bằng các nền tảng Live API, Google đang cố gắng biến ngăn xếp của mình thành nền tảng mặc định cho bất kỳ ai xây dựng giao diện giọng nói - từ bot hỗ trợ khách hàng đến trợ lý thiết bị đeo. Liệu các tuyên bố về chất lượng của Gemini 3.8 Live có được giữ vững trong quá trình thử nghiệm độc lập hay không, quá trình phát triển tính khả dụng đã bắt đầu diễn ra.

---

Đi trước AI

Nhận tin tức, phân tích và đột phá mới nhất về AI — tất cả ở cùng một nơi.

Đọc thêm tin tức về AI →