Google lặng lẽ tung ra hai bản cập nhật mô hình Gemini quan trọng trong vòng 48 giờ trong tuần này và cả hai đều nhắm thẳng vào các nhà phát triển xây dựng ứng dụng sản xuất. Theo blog chính thức của Google, Gemini 3.5 Transcribe, được giới thiệu vào ngày 26 tháng 8, là mô hình chuyển lời nói thành văn bản chính xác nhất của công ty cho đến nay. Gemini Omni 1.1 Flash, được công bố vào ngày 27 tháng 8, mang đến khả năng điều khiển cấp độ chuyên nghiệp cho video tổng hợp, bao gồm kéo dài cảnh lên tới 40 giây và nâng cấp 4K. Cả hai mô hình đều có sẵn thông qua API Gemini trong Google AI Studio và Nền tảng đại lý doanh nghiệp Gemini.

Gemini 3.5 Phiên âm: chuyển lời nói thành văn bản tự dọn dẹp For more context on this story, see our ongoing latest AI developments.

Google cho biết, điều khiến Gemini 3.5 Transcribe khác biệt với tính năng nhận dạng giọng nói thông thường là nó chuyển đổi âm thanh thô trực tiếp thành văn bản được định dạng, trau chuốt thay vì bản ghi thô. Mô hình này xử lý tiếng ồn xung quanh, biệt ngữ phức tạp và dọn dẹp độ trôi chảy một cách tự nhiên — mô hình này loại bỏ các từ đệm như "ừm" và "ahs", giải quyết các lỗi tự sửa, chẳng hạn như "chúng ta gặp nhau vào Thứ Ba—không, Thứ Tư" và tự động định dạng đầu ra.

Những con số chuẩn mà Google trích dẫn rất đáng chú ý. Theo đo lường bằng Phân tích nhân tạo, mô hình này đạt được tỷ lệ lỗi từ trung bình (WER) là 4,0% đối với các trường hợp sử dụng phát trực tuyến và 2,6% đối với âm thanh không phát trực tuyến. Trên điểm chuẩn đa ngôn ngữ FLEURS trên các ngôn ngữ hàng đầu, nó đạt WER 5,50% ở chế độ phát trực tuyến và 5,04% không phát trực tuyến, cải thiện so với mô hình phiên âm trước đây của Google, Chirp 3. Thời gian đến phiên âm cuối cùng cải thiện 70% so với Chirp 3, một lần nữa được đo bằng Phân tích nhân tạo.

Mô hình này có hai biến thể cho hai quy trình làm việc. Đối với các ứng dụng trực tiếp, `gemini-3.5-transcribe-live` cung cấp tính năng phát trực tiếp hai chiều liên tục với độ trễ dưới giây thông qua Live API, nhắm mục tiêu đến tác nhân thoại và phụ đề theo thời gian thực. Đối với âm thanh được ghi lại — cuộc họp, nhật ký cuộc gọi, kho lưu trữ — `gemini-3.5-transcribe` cung cấp tính năng phân bổ người nói cho tối đa ba người nói (có hỗ trợ nhiều hơn ở chế độ thử nghiệm) và dấu thời gian cấp từ thông qua API Tương tác.

Các khả năng khác bao gồm tự động phát hiện và phiên âm trên hơn 85 ngôn ngữ với khả năng xử lý giọng và phương ngữ cũng như hỗ trợ từ vựng tùy chỉnh để mô hình thích ứng với biệt ngữ chuyên ngành và cách viết riêng. Google cũng cung cấp cho mô hình một loại con mắt: thông qua chức năng gọi, nó có thể ủy thác các nhiệm vụ như tạo hình ảnh hoặc phân tích tệp cho các mô hình Gemini khác - một tính năng hiện có trong ứng dụng Gemini trên macOS.

Gemini Omni 1.1 Flash: quá trình tạo video phát triển theo dòng thời gian

Lần ra mắt thứ hai giải quyết khiếu nại phổ biến nhất về video AI: khả năng kiểm soát. Gemini Omni 1.1 Flash là bản cập nhật tập trung vào sản xuất giúp cho video tổng hợp có thể được quản lý theo cách mà các phiên bản tiền nhiệm của nó không làm được. Giám đốc sản phẩm Google DeepMind là Anish Nangia và Alisa Fortin mô tả bản phát hành này khiến Omni 1.1 "sẵn sàng sản xuất để sử dụng chuyên nghiệp".

Mở rộng cảnh là tính năng tiêu đề. Giờ đây, các nhà phát triển có thể tiếp tục tạo cảnh quay liền mạch từ clip hiện có, với mô hình phân tích tối đa 10 giây bối cảnh trước đó — một bước nhảy vọt so với các mô hình trước đó chỉ tham chiếu đến giây cuối cùng. Video có thể được kéo dài theo từng khoảng 10 giây lên đến độ dài tích lũy là 40 giây, cải thiện tính nhất quán về mặt hình ảnh và tính bám sát của câu chuyện cho những câu chuyện dài hơn.

Bản cập nhật cũng bổ sung thêm tính năng nội suy khung hình đầu tiên và khung hình cuối cùng, cho phép các nhà phát triển chỉ định khung hình bắt đầu và kết thúc để tạo ra các chuyển động và chuyển tiếp mượt mà, có chủ ý của máy ảnh giữa các cảnh quay. Để phân phối, các dự án đã hoàn thành có thể được nâng cấp lên độ phân giải 4K, trong khi chế độ xem trước 360p cho phép người tạo lặp lại các lời nhắc một cách nhanh chóng và ít tốn kém trước khi thực hiện kết xuất cuối cùng.

Từ API đến các bề mặt hàng ngày

Google cũng đang đưa cả hai mô hình vào các sản phẩm tiêu dùng của mình, đây là nơi lợi thế phân phối của nó thể hiện. Trên Android, tính năng "Rambler" mới trong Gboard sử dụng Phiên âm 3.5 để biến suy nghĩ được nói thành văn bản có định dạng phù hợp đồng thời lọc các từ đệm — người dùng thậm chí có thể chỉnh sửa bằng giọng nói. Mô hình này cũng hỗ trợ tính năng đọc chính tả trong ứng dụng Gemini trên macOS, hoạt động cùng với ngữ cảnh màn hình trong Google AntiGravity và đang được tích hợp vào Chrome.

Đối với các nhà phát triển, hai lần ra mắt này được coi là một chiến lược: Google đang đẩy Gemini từ một chatbot mà bạn nói chuyện vào cơ sở hạ tầng có thể nhìn, nghe và tạo ra phương tiện truyền thông. Với OpenAI, ElevenLabs và một nhóm các công ty khởi nghiệp video cạnh tranh trong cùng một lãnh thổ, tỷ lệ lỗi từ 2,6% và các cảnh mạch lạc dài 40 giây là giá thầu mở đầu của Google cho khối lượng công việc sản xuất thực sự tạo ra doanh thu — tác nhân thoại, quy trình phụ đề và công cụ sáng tạo. Các nhà phát triển có thể bắt đầu xây dựng bằng cả hai mô hình trong Google AI Studio ngay hôm nay.

Tại sao tỷ lệ lỗi từ vẫn quan trọng

Tỷ lệ lỗi từ nghe giống như một thống kê học thuật, nhưng trong quá trình sản xuất, đó là sự khác biệt giữa một sản phẩm giọng nói hoạt động hiệu quả và một sản phẩm gây thất vọng. Mọi phát ngôn bị hiểu sai trong tác nhân thoại đều phá vỡ một nhiệm vụ: ID đơn hàng bị nghe nhầm dẫn đến tra cứu không thành công, địa chỉ bị cắt xén gửi gói hàng đến sai thành phố. Đó là lý do tại sao khoảng cách giữa WER 2,6% đối với âm thanh không phát trực tuyến và tốc độ một chữ số cao thường thấy ở một thế hệ mô hình trước đây đã tạo nên sự khác biệt về mức độ về khả năng sử dụng.

Sự khác biệt giữa hai chế độ mà Google báo cáo cũng có ý nghĩa quan trọng đối với các kiến ​​trúc sư. Phiên âm trực tuyến - con số WER 4,0 phần trăm - đánh đổi một số độ chính xác để có độ trễ dưới giây, điều mà các trường hợp sử dụng tương tác như tác nhân thoại trực tiếp yêu cầu. Phiên âm hàng loạt âm thanh đã ghi chạy chậm hơn nhưng đạt 2,6 phần trăm, đó là lý do tại sao việc phân tích sau cuộc gọi và xử lý lưu trữ có thể đòi hỏi khắt khe hơn. Quyết định của Google hiển thị cả hai dưới dạng điểm cuối mô hình riêng biệt thay vì một cài đặt có thể điều chỉnh thừa nhận rằng các nhà phát triển xây dựng các sản phẩm khác nhau ở cả hai phía của sự cân bằng đó.

Quy trình làm việc theo từng cấp độ để sản xuất video

Bản cập nhật Omni 1.1 Flash cũng thực tế không kém về cách thức hoạt động sáng tạo thực sự diễn ra. Việc lặp lại video tạo ra rất tốn kém: mọi thử nghiệm nhanh chóng đều có nghĩa là một kết xuất đầy đủ. Chế độ xem trước 360p mới tách biệt việc khám phá và phân phối, cho phép người sáng tạo duyệt qua các biến thể nhanh chóng với chi phí thấp và chỉ trả tiền cho việc nâng cấp 4K cho những cảnh quay được xem xét.

Cơ chế mở rộng cảnh giải quyết vấn đề mạch lạc đã giữ video AI ở trong khu ổ chuột có kích thước bằng clip. Bằng cách phân tích 10 giây của bối cảnh trước đó thay vì chỉ khung hình cuối cùng, mô hình có thể kéo dài cảnh với khoảng tăng 10 giây lên đến 40 giây trong khi vẫn giữ nguyên các ký tự, ánh sáng và phong cách hình ảnh nhất quán. Kết hợp với phép nội suy khung hình đầu tiên và khung hình cuối cùng — mang đến cho người chỉnh sửa các điểm kiểm soát xác định, cách đánh dấu vào và ra hoạt động trong chỉnh sửa thông thường — cảnh quay do AI tạo bắt đầu phù hợp với quy trình hậu sản xuất thực tế thay vì thay thế chúng toàn bộ.

##Bức tranh cạnh tranh

Cả hai lần ra mắt đều định vị Google là cơ sở hạ tầng chứ không phải là điểm đến. Về mặt phát biểu, Google đang cạnh tranh với các nhà cung cấp phiên âm chuyên dụng và hệ thống giọng nói của các đối thủ trên nền tảng đám mây bằng cách đưa tính chính xác tiên tiến nhất vào API Gemini mà các nhà phát triển của họ đã sử dụng. Về video, nó đang cạnh tranh trong một thị trường đông đúc với các công ty khởi nghiệp được tài trợ tốt bằng cách nhấn mạnh vào khả năng kiểm soát và tích hợp quy trình làm việc thay vì cảnh tượng thô sơ.

Lợi thế phân phối có thể là yếu tố quyết định. Mô hình phiên âm tương tự mà các nhà phát triển có thể gọi từ API Gemini đã hỗ trợ tính năng đọc chính tả Rambler của Gboard trên Android, ứng dụng Gemini trên macOS, Google AntiGravity và Chrome — nghĩa là Google có thể phân bổ việc phát triển mô hình qua hàng tỷ tương tác của người dùng trong khi thu thập âm thanh đa dạng trong thế giới thực giúp liên tục cải thiện mô hình đó. Đối với các nhà phát triển chọn nhóm bài phát biểu hoặc video vào năm 2026, bánh đà đó hiện là một phần của quảng cáo chiêu hàng.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →