Google đã ra mắt Gemini 3.5 Transcribe, một mô hình chuyển giọng nói thành văn bản mới được xây dựng để chép lời theo thời gian thực, tự động nhận dạng hơn 85 ngôn ngữ — và cải tiến đầu ra trong quá trình thực hiện, loại bỏ các từ đệm và sửa lỗi phát âm mà không cần yêu cầu.

Sự ra mắt này đã định vị hệ thống giọng nói của Google như một thách thức trực tiếp trong thị trường phiên âm đang phát triển nhanh chóng, nơi độ chính xác và độ trễ ngày càng quyết định việc nhà phát triển dịch vụ nào áp dụng cho cuộc gọi, cuộc họp, phụ đề và giao diện giọng nói. For more context on this story, see our ongoing AI news.

Người mẫu có thể làm gì

Theo thông báo của Google, phạm vi đưa tin được xuất bản bởi The Decoding, Gemini 3.5 Transcribe vượt xa việc chuyển đổi lời nói thành văn bản:

  • Tự động phát hiện ngôn ngữ trên hơn 85 ngôn ngữ, không cần cấu hình
  • Loại bỏ từ đệm, làm sạch "ừm", "uh" và những từ không trôi chảy tương tự
  • Sửa lỗi lỡ lời, tạo ra văn xuôi dễ đọc thay vì tiếng ồn nguyên văn
  • Định dạng văn bản tự động, bao gồm dấu câu và cấu trúc

Công ty báo cáo tỷ lệ lỗi từ là 4,0% đối với âm thanh phát trực tuyến và 2,6% đối với âm thanh được ghi, cùng với giảm độ trễ khoảng 70% so với phiên bản tiền nhiệm, Chirp 3 — một tỷ lệ đáng kể trong các tình huống phụ đề trực tiếp trong đó độ trễ làm gián đoạn cuộc trò chuyện.

Hai giao diện cho hai công việc

Các nhà phát triển có quyền truy cập thông qua hai giao diện lập trình ứng dụng riêng biệt:

API trực tiếp — `gemini-3.5-transcribe-live`

Xử lý tính năng phát trực tuyến theo thời gian thực với độ trễ rất thấp, nhắm mục tiêu phụ đề trực tiếp, tác nhân thoại và trợ lý tương tác trong đó thời gian phản hồi quan trọng nhất.

API tương tác — `gemini-3.5-transcribe`

Xử lý âm thanh đã ghi và trả về bản ghi có thuộc tính của người nói và dấu thời gian — quy trình làm việc điển hình cho các cuộc họp, phỏng vấn, podcast và hậu kỳ truyền thông.

Ngoài phiên âm, mô hình này còn hỗ trợ gọi hàm, nghĩa là nó có thể ủy quyền các nhiệm vụ tiếp theo cho các mô hình khác trong dòng Gemini — ví dụ: kích hoạt yêu cầu tạo hình ảnh hoặc tìm kiếm trên web dựa trên điều gì đó được nói trong một phiên. Điều đó biến công cụ phiên âm thành lớp giao diện có thể điều khiển được cho các ứng dụng điều khiển bằng giọng nói.

Đã được vận chuyển trên các sản phẩm của Google

Mô hình này hiện có sẵn trong Google AI Studio và trên Nền tảng đại lý doanh nghiệp Gemini dành cho các nhà phát triển hiện nay. Google cũng đã kết nối nó với các bề mặt của người tiêu dùng: Gboard trên Android sử dụng nó thông qua một thành phần nội bộ có tên Rambler để đọc chính tả, ứng dụng Gemini trên macOS áp dụng nó cho tính năng nhập bằng giọng nói và tích hợp Chrome dự kiến ​​sẽ diễn ra sau đó.

Sự phân phối đó rất quan trọng. Tính năng nhận dạng giọng nói giúp duy trì quy mô và việc nhúng mô hình vào bàn phím, ứng dụng dành cho máy tính để bàn và trình duyệt giúp mô hình này tiếp cận hàng tỷ lượt tương tác đầu vào hàng ngày — đồng thời cung cấp các vòng đánh giá cần thiết để giữ tỷ lệ lỗi giảm trong các giọng, phương ngữ và môi trường ồn ào.

Cổ phần cạnh tranh trong AI lời nói

Phiên âm đã âm thầm trở thành một chiến trường cạnh tranh giữa các phòng thí nghiệm hàng đầu cũng như các nhà cung cấp chuyên nghiệp. Khả năng hiểu giọng nói chính xác, có độ trễ thấp là tấm vé vào cửa cho các sản phẩm tổng đài hoạt động theo lệnh nói, thông tin về cuộc họp doanh nghiệp, tính năng trợ năng và tự động hóa dịch vụ khách hàng đa ngôn ngữ.

Bằng cách kết hợp các cải tiến tích cực về độ trễ với đầu ra tự sửa lỗi, Google đang đánh cược rằng các nhà phát triển thích bản ghi đọc giống như văn bản đã chỉnh sửa hơn là ghi lại ngữ âm thô - đánh đổi độ trung thực nguyên văn nghiêm ngặt để có được khả năng sử dụng. Các nhóm cần hồ sơ chính xác, chẳng hạn như người ghi chép pháp lý hoặc y tế, vẫn có thể muốn có chế độ nguyên văn; đối với những người khác, sự khác biệt thực tế giữa việc nghe ai đó và hiểu họ tiếp tục thu hẹp.

Với Gemini 3.5 Transcribe hiện đã có sẵn rộng rãi trong AI Studio và công cụ dành cho doanh nghiệp, thử nghiệm có ý nghĩa đầu tiên sẽ là các số liệu áp dụng từ các nhà phát triển tác nhân thoại — một phân khúc thị trường đang phát triển đủ nhanh để thậm chí mức độ chính xác tăng dần cũng chuyển thành các quyết định chuyển đổi đáng kể.

Tại sao độ trễ là chiến trường thực sự

Tỷ lệ lỗi được đưa lên hàng đầu nhưng độ trễ lặng lẽ xác định sản phẩm nào khả thi. Công cụ phiên âm cung cấp lớp phủ phụ đề trực tiếp cần phải theo kịp cuộc trò chuyện, nếu không người xem sẽ không tương tác. Tác nhân thoại đang đàm phán cuộc gọi hỗ trợ khách hàng không thể tạm dừng một cách lúng túng trong khi lớp lời nói của nó bắt kịp. Theo báo cáo của Google, độ trễ giảm 70% so với Chirp 3 nhắm chính xác vào khoảng cách đó - rút ngắn khoảng cách giữa người nói hoàn thành câu và các hệ thống tiếp theo tác động lên nó.

Đối với các ứng dụng tác nhân, điều này kết hợp: mỗi lượt của một cuộc đối thoại bằng giọng nói đều bao gồm sự nhận biết, lý luận và phản hồi. Việc loại bỏ mili giây khỏi giai đoạn nhận dạng giúp các nhà xây dựng có khoảng trống để chi tiêu cho các mô hình lý luận có khả năng hơn — và chậm hơn — mà không vi phạm ngân sách về thời gian đàm thoại.

Sự đánh đổi nguyên văn

Một sự lựa chọn thiết kế xứng đáng được xem xét kỹ lưỡng. Theo mặc định, Gemini 3.5 Transcribe quản lý đầu ra: các từ điền sẽ biến mất, các lỗi vấp được sửa và định dạng được áp dụng tự động. Đối với hầu hết các mục đích sử dụng kinh doanh — phút, chú thích, kho lưu trữ có thể tìm kiếm — đó chính xác là những gì người dùng muốn.

Nhưng một số quy trình công việc nhất định phụ thuộc vào bản ghi nguyên văn. Lời khai pháp lý, đánh giá tuân thủ và xác minh sự thật của báo chí đôi khi đòi hỏi phải biết chính xác những gì đã nói, bao gồm cả sự do dự. Các tổ chức trong các ngành được quản lý sẽ muốn biết rõ mức độ làm mịn là tùy chọn và có thể định cấu hình trước khi chuyển các quy trình nhạy cảm sang mô hình mới. Các thông số API và tài liệu của Google sẽ thiết lập một cách hiệu quả vị trí của dòng nguyên văn so với dòng trau chuốt cho ngành.

Dấu chân đa ngôn ngữ như hào nước

Phạm vi phủ sóng của hơn 85 ngôn ngữ với tính năng phát hiện tự động không chỉ là một mục trong danh sách kiểm tra tính năng. Phạm vi tiếp cận đa ngôn ngữ tập trung giá trị vào các thị trường mà các đối thủ cạnh tranh tụt hậu về mặt lịch sử: giọng khu vực, chuyển đổi mã giữa các ngôn ngữ ở giữa câu và các ngôn ngữ có nguồn tài nguyên thấp đều trừng phạt các mô hình được đào tạo hạn chế về ngữ liệu nặng tiếng Anh.

Đối với các doanh nghiệp toàn cầu đang vận hành các trung tâm hỗ trợ ở hàng chục quốc gia, một mô hình duy nhất xử lý việc phát hiện ngôn ngữ sẽ giúp giảm độ phức tạp của quá trình tích hợp một cách minh bạch — một quy trình thay vì nhiều cấu hình cho mỗi thị trường. Kết hợp với việc phân phối thông qua hàng tỷ lượt cài đặt Android của Gboard, Google đang định vị tính đa ngôn ngữ có chất lượng phiên âm là cơ sở hạ tầng chứ không phải là một khả năng cao cấp.

Xem gì

Ba tín hiệu sẽ cho biết liệu Gemini 3.5 Transcribe có thay đổi thị phần hay chỉ đơn thuần làm tăng kỳ vọng: sự di chuyển của nhà phát triển theo điểm chuẩn của bên thứ ba trong những tháng tới; các đối thủ cạnh tranh nhanh chóng khớp các con số về độ trễ thay vì các tuyên bố về độ chính xác như thế nào; và liệu các hook gọi hàm có tạo ra làn sóng tác nhân ưu tiên giọng nói được xây dựng nguyên bản trên Gemini hay không. Quá trình ra mắt hiện đã diễn ra và các mức giá thông qua AI Studio sẽ giúp việc thử nghiệm đủ rẻ để chi phí chuyển đổi giảm xuống gần như không có.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →