Theo Engadget, Meta đã tiết lộ một mô hình AI âm thanh mới có thể phân biệt giữa nhiều người nói và phiên âm nhiều ngôn ngữ trong thời gian thực, trong một động thái đẩy công ty tiến sâu hơn vào thị trường AI lời nói ngày càng đông đúc. The Information lần đầu tiên đưa tin về thông báo về mẫu âm thanh, trong khi một sản phẩm đồng hành - Muse Voice Transcribe, đưa tính năng đọc chính tả bằng giọng nói theo thời gian thực cho Mac - đã được 9to5Mac trình bày chi tiết.

Bộ đôi phát hành tín hiệu rằng Meta đang coi giọng nói là đầu vào hạng nhất cho ngăn xếp AI của mình chứ không phải là một suy nghĩ lại. Phiên âm theo thời gian thực có thể xử lý những người nói chồng chéo, chuyển đổi ngôn ngữ giữa cuộc trò chuyện và đọc chính tả trên toàn hệ thống là những khả năng biến giọng nói từ một tính năng mới lạ thành giao diện sử dụng hàng ngày. For more context on this story, see our ongoing latest AI developments.

Một mô hình, nhiều tiếng nói, nhiều ngôn ngữ

Khả năng tiêu đề, như Engadget đã báo cáo, là khả năng của mô hình để phân biệt giữa nhiều người nói và nhiều ngôn ngữ trong thời gian thực. Sự kết hợp đó giải quyết đồng thời hai vấn đề khó khăn nhất trong phiên âm thực tế: ghi nhật ký người nói - tìm ra ai đã nói gì - và nhận dạng đa ngôn ngữ, trong đó cuộc trò chuyện diễn ra giữa các ngôn ngữ mà không bị tạm dừng.

Hầu hết các quy trình phiên âm hiện có đều coi đây là các giai đoạn riêng biệt: đầu tiên, mô hình nhật ký sẽ chia tách các loa, sau đó mô hình nhận dạng sẽ phiên âm từng phân đoạn. Việc kết hợp chúng thành một mô hình thời gian thực duy nhất là điều giúp công nghệ trở nên khả thi cho các trường hợp sử dụng trực tiếp — cuộc họp, phỏng vấn, cuộc gọi của khách hàng, lớp phủ dịch trực tiếp — trong đó việc chờ xử lý hậu kỳ sẽ không đạt được mục đích.

Muse Voice Transcribe mang tính năng đọc chính tả đến mọi ứng dụng Mac

Bên cạnh mô hình này, Meta còn ra mắt Muse Voice Transcribe cho macOS. Như 9to5Mac đã báo cáo, công cụ này cung cấp khả năng đọc chính tả bằng giọng nói theo thời gian thực hoạt động trên các ứng dụng Mac - thực sự là một lớp đọc chính tả trên toàn hệ thống thay vì một ứng dụng độc lập. Phạm vi phủ sóng của Gadget Review mô tả nó mang lại khả năng đọc chính tả theo thời gian thực cho mọi ứng dụng Mac.

Thiết kế đó quan trọng để áp dụng. Các công cụ viết chính tả tồn tại hoặc chết do ma sát: nếu người dùng phải sao chép văn bản ra khỏi một cửa sổ riêng biệt, họ sẽ ngừng sử dụng văn bản đó. Hoạt động ở cấp hệ thống có nghĩa là tính năng nhập bằng giọng nói sẽ khả dụng ở bất cứ nơi nào con trỏ nhấp nháy — email, trình chỉnh sửa mã, ứng dụng nhắn tin, tài liệu — đó chính xác là cách các công cụ đọc chính tả thành công nhất đã thu hút được khán giả của họ.

Bản phát hành Mac cũng đánh dấu lãnh thổ đáng chú ý của Meta. Những nỗ lực AI của công ty tập trung vào các ứng dụng di động, trợ lý Meta AI và các mô hình gia đình Llama và gia đình Muse. Việc cung cấp một công cụ năng suất dành cho máy tính để bàn bóng bẩy cho nền tảng của Apple giúp Meta tiếp xúc trực tiếp với cơ sở người dùng chuyên nghiệp mà trước đây họ đã phải vật lộn để tiếp cận — và khiến Meta phải cạnh tranh với các tiện ích chép chính tả và phiên âm đã có trên nền tảng.

Cánh đồng đông đúc ngày càng nhanh hơn

Meta đang bước vào một thị trường đã được định giá lại và thiết kế lại trong hai năm qua. Các mô hình nguồn mở Whisper của OpenAI đặt cơ sở cho việc phiên âm đa ngôn ngữ có thể truy cập được và API Phiên âm GPT trả phí của công ty đã hạ giá phần lớn thị trường thương mại về mặt giá cả. Trong khi đó, Google cũng đã nỗ lực theo hướng tương tự: các mô hình phiên âm do Gemini cung cấp bao gồm hàng chục ngôn ngữ trong thời gian thực đã được triển khai cho các nhà phát triển, như chúng tôi đã đề cập khi Google vận chuyển các mô hình phiên âm giọng nói theo thời gian thực 85 ngôn ngữ của mình.

Trong bối cảnh đó, sự khác biệt đã chuyển từ độ chính xác thô — trong đó các phần tử dẫn đầu được tập hợp trong phạm vi nhiễu của nhau theo điểm chuẩn tiêu chuẩn — sang các chi tiết thực tế: độ trễ, khả năng xử lý loa, chuyển đổi mã giữa các ngôn ngữ, giá cả và nơi chạy mô hình. Sự nhấn mạnh của Meta vào khả năng nhận dạng đa người nói và đa ngôn ngữ đồng thời trong thời gian thực nhắm chính xác vào những chi tiết thiết thực đó.

Tại sao giọng nói đột nhiên mang tính chiến lược

Thời điểm không phải là ngẫu nhiên. Giọng nói đang trở thành giao diện mặc định cho các tác nhân AI và các công ty sở hữu lớp âm thanh — thu thập, phiên âm, hiểu, phản hồi — kiểm soát điểm truy cập tự nhiên nhất đến trải nghiệm trợ lý. Meta đã công khai tham vọng của mình đối với kính AI và thiết bị đeo được, trong đó giọng nói về cơ bản là đầu vào thực tế duy nhất. Mô hình âm thanh nhanh, chính xác và có thể di chuyển là cơ sở hạ tầng cho lộ trình đó.

Ngoài ra còn có góc độ doanh nghiệp. Các cuộc họp, cuộc gọi hỗ trợ và công việc thực địa tạo ra khối lượng lớn âm thanh đa loa mà các tổ chức muốn có thể tìm kiếm và thực hiện được. Một mô hình phiên âm đáng tin cậy khi cuộc trò chuyện diễn ra — với người nói được gắn nhãn và ngôn ngữ được xử lý mà không cần cấu hình thủ công — là sự khác biệt giữa bản demo và sản phẩm.

Phiên âm thời gian thực còn mang lại lợi ích ngoài sự tiện lợi. Phụ đề trực tiếp giúp người dùng khiếm thính và khiếm thính có thể tiếp cận các cuộc họp, lớp học và chương trình phát sóng, đồng thời phụ đề tức thì đa ngôn ngữ giúp giảm bớt rào cản ngôn ngữ cho các nhóm quốc tế. Khi phiên âm đủ nhanh để theo kịp giọng nói tự nhiên và đủ mạnh để theo dõi nhiều người nói cùng một lúc, các tính năng trợ năng đó sẽ không còn là những điều chỉnh đặc biệt nữa mà trở thành mặc định được tích hợp trong các công cụ hàng ngày.

Meta chưa công bố giá cả hoặc chi tiết đầy đủ về tính khả dụng trong phạm vi bảo hiểm ban đầu. Nhưng hướng đi thì không thể nhầm lẫn: lớp âm thanh của ngăn xếp AI, từ lâu được coi là một mặt hàng, giờ đây trở thành mặt trận trong cuộc chiến nền tảng — và Meta đã quyết định chiến đấu vì nó.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →