Inception Labs đã phát hành Mercury 2.5 vào thứ Ba, một phiên bản mới của mô hình ngôn ngữ khuếch tán thương mại mà công ty mô tả là LLM khuếch tán có khả năng nhất trên thị trường và theo hiểu biết của họ, đây là mô hình ngôn ngữ khuếch tán lớn nhất từng được đào tạo. Theo thông báo của công ty, mô hình này mang lại trí thông minh tăng 40% so với người tiền nhiệm của nó, Mercury 2, trong khi vẫn giữ nguyên cấu hình phục vụ có độ trễ thấp, chi phí thấp đã khiến kiến trúc khuếch tán trở nên hấp dẫn đối với khối lượng công việc khối lượng lớn.
Công ty, do Giám đốc điều hành Stefano Ermon đứng đầu, tuyên bố Mercury 2.5 có thể so sánh với các mô hình tiên tiến được tối ưu hóa về chi phí bao gồm GPT-5.6 Luna (Thấp), Gemini 3.5 Flash-Lite và Claude Haiku 4.5. Những so sánh đó được báo cáo bởi nhà cung cấp và chưa được xác minh bằng các tiêu chuẩn độc lập, nhưng họ định vị một mô hình phổ biến - một sự tò mò nghiên cứu từ lâu - như một giải pháp thay thế sản xuất cho các mô hình đương nhiệm tự phát. Để biết tin tức mới nhất về mô hình AI, hãy theo dõi tin tức về mô hình đang diễn ra của AI Buzz Wire. tin tức mới nhất về mô hình AI
Tốc độ, bối cảnh và giá cả
Những con số tiêu đề rất tích cực. Inception Labs cho biết Mercury 2.5 tạo ra 1.107 mã thông báo mỗi giây trên các GPU NVIDIA có sẵn rộng rãi, với cửa sổ ngữ cảnh là 260.000 mã thông báo. Giá được đặt ở mức 0,20 đô la cho mỗi triệu mã thông báo đầu vào và 0,75 đô la cho mỗi triệu mã thông báo đầu ra, với chương trình khuyến mãi ra mắt giảm giá mô hình 80% xuống còn 0,04 đô la cho mỗi triệu đầu vào và 0,15 đô la cho mỗi triệu đầu ra.
Về mặt khả năng, mô hình này cung cấp khả năng lý luận có thể điều chỉnh được — cho phép các nhà phát triển đánh đổi độ trễ để lấy độ sâu trên cơ sở từng yêu cầu — cùng với các lệnh gọi công cụ song song và đầu ra JSON được căn chỉnh theo lược đồ để tạo có cấu trúc. Công ty coi việc phát hành là kết quả đầu tiên của vòng đào tạo được thúc đẩy bởi phép đo từ xa trong sản xuất: kể từ khi Mercury 2 ra mắt, hàng nghìn nhà phát triển đã xây dựng nó, hàng chục doanh nghiệp đã triển khai nó và mức độ sử dụng đã tăng hơn một bậc.
Tại sao Mô hình Khuếch tán Tạo Văn bản Nhanh hơn
LLM chính thống từ OpenAI, Google và Anthropic có tính tự hồi phục: chúng tạo văn bản mỗi lần một mã thông báo, với mỗi mã thông báo được điều chỉnh dựa trên mọi thứ được tạo trước nó. Sự phụ thuộc tuần tự đó đặt nền tảng vững chắc cho tốc độ tạo ra. Thay vào đó, các mô hình ngôn ngữ khuếch tán bắt đầu bằng một khối nhiễu và tinh chỉnh lặp lại tất cả các mã thông báo song song, cho phép thông lượng cao hơn nhiều trên phần cứng GPU thông thường sau khi mô hình được đào tạo để hội tụ rõ ràng.
Sự đánh đổi trong lịch sử là chất lượng: các mô hình phổ biến đã theo sau các mô hình tự hồi quy về các tiêu chuẩn lý luận và tuân theo chỉ dẫn. Đặt cược cốt lõi của Inception Labs - và tuyên bố cơ bản về Mercury 2.5 - là khoảng cách này đã thu hẹp đến mức mà sự khuếch tán chiếm ưu thế trên trục mà hầu hết khách hàng thực sự cảm thấy: độ trễ và chi phí ở khối lượng sản xuất.
Tuyên bố sản xuất từ những khách hàng đầu tiên
Thông báo này chủ yếu dựa vào việc triển khai của khách hàng hơn là các bảng điểm chuẩn. OpenCall, công ty xây dựng các đại lý điện thoại AI cho các cuộc gọi trực tiếp của khách hàng, đã báo cáo rằng việc chuyển sang Mercury đã đưa độ trễ phản hồi mô hình trung bình của nó lên khoảng 170 mili giây. Oliver Silverstein, đồng sáng lập và Giám đốc điều hành của OpenCall, cho biết thời gian phản hồi P99 của công ty đã giảm từ vài phút xuống còn một giây và trung bình từ 0,4 giây xuống dưới 0,2 - những con số mà ông mô tả là nhanh hơn đáng kể so với bất kỳ nhà cung cấp nào khác mà công ty đã thử nghiệm, bao gồm cả tính năng lý luận được kích hoạt.
Augment Code, một nhà sản xuất trợ lý mã hóa AI, sử dụng Mercury để nén ngữ cảnh, định tuyến mô hình và tìm kiếm công cụ MCP. Theo Inception Labs, việc chuyển khối lượng công việc nén sang Mercury đã giảm 82% độ trễ của bước đó, từ khoảng 150 giây xuống còn 27 giây và giảm 90% chi phí trong khi vẫn duy trì chất lượng. Trường hợp sử dụng minh họa điểm ảnh hưởng của kinh tế: các tác nhân mã hóa thực hiện nhiều lệnh gọi mô hình hỗ trợ nhỏ xung quanh mỗi thế hệ chính, đồng thời độ trễ và chi phí gộp trên các lệnh gọi đó.
NVIDIA, công ty có phần cứng chạy mô hình, cũng cân nhắc. Shruti Koparkar, giám đốc sản phẩm cấp cao trong Nhóm Máy tính Tăng tốc của NVIDIA, cho biết Inception có các mô hình ngôn ngữ dựa trên sự khuếch tán tiên tiến trên cơ sở hạ tầng NVIDIA AI và việc nâng cao chất lượng của Mercury 2.5 với tốc độ bền vững cho thấy các kiến trúc mới có thể phát triển thành các hệ thống sẵn sàng sản xuất nhanh như thế nào.
Bản xem trước của Mercury Voice và Bộ định tuyến Mercury
Cùng với mô hình này, Inception Labs đã công bố bản xem trước của hai sản phẩm mới. Mercury Voice là một LLM phổ biến được tối ưu hóa cho các tác nhân thoại có ngân sách độ trễ eo hẹp nhất, thời gian quảng cáo đến mã thông báo đầu tiên dưới 170 mili giây. Mercury Router sử dụng mô hình khuếch tán để hiểu các lời nhắc đến và định tuyến chúng đến bất kỳ mô hình nào - mở hoặc đóng - mang lại sự kết hợp tốt nhất giữa chất lượng, tốc độ và chi phí, định vị Inception ở vị trí cao hơn các đối thủ cạnh tranh cũng như một trong số họ.
Mercury 2.5 có sẵn thông qua API riêng của Inception cũng như thông qua Baseten và OpenRouter. Việc triển khai dành cho doanh nghiệp bổ sung năng lực chuyên dụng, tự động thay đổi quy mô, kiểm soát tuân thủ và lưu giữ dữ liệu có thể định cấu hình. Công ty đang cung cấp 100 triệu mã thông báo miễn phí cho các nhà phát triển đang dùng thử API.
Công ty cũng cho biết họ đã bắt đầu đào tạo mô hình tiếp theo của mình – mô hình lớn nhất từ trước đến nay, dự kiến phát hành trong những tháng tới – được mô tả là một bước nhảy vọt về khả năng mà không ảnh hưởng đến tốc độ phổ biến hoặc hiệu quả của mã thông báo. Nếu tuyên bố đó được giữ nguyên, áp lực lên những công ty đương nhiệm có xu hướng tự thoái lui sẽ được cảm nhận đầu tiên ở các tầng hàng hóa trên thị trường, nơi giá cả và độ trễ quyết định hầu hết các hợp đồng.
Đi trước AI
Theo dõi những phát triển AI mới nhất và tin tức nóng hổi về trí tuệ nhân tạo khi các kiến trúc mô hình mới chạy đua vào sản xuất.
Đọc thêm tin tức về AI →