Sakana AI có trụ sở tại Tokyo đã ra mắt Fugu, một hệ thống mang lại hiệu suất của mô hình AI tiên phong bằng cách phối hợp linh hoạt nhiều mô hình cùng một lúc. Thay vì xây dựng một mạng lưới thần kinh khổng lồ, bản thân Fugu là một mô hình ngôn ngữ được đào tạo để gọi các LLM khác từ một "nhóm tác nhân" có thể hoán đổi, tập hợp một nhóm các mô hình chuyên biệt cho từng nhiệm vụ và tổng hợp đầu ra của chúng thông qua một API tương thích với OpenAI.
Sự ra mắt, được đưa tin bởi THE DECODER, MarkTechPost và MIT Sloan Management Review, thể hiện sự đặt cược rằng bước nhảy vọt tiếp theo về hiệu suất AI có thể đến ít hơn từ quy mô thô mà nhiều hơn từ sự phối hợp thông minh hơn của các mô hình đã tồn tại. For more context on this story, see our ongoing AI industry coverage.
Một Mô Hình Để Chỉ Huy Tất Cả
Đối với người dùng, Fugu hoạt động giống như một mô hình duy nhất. Dưới mui xe, nó có thể tự xử lý một yêu cầu hoặc tập hợp một nhóm gồm các mô hình chuyên biệt, quản lý việc lựa chọn, ủy quyền, kiểm tra và tổng hợp trong nội bộ. Sakana AI cho biết cách tiếp cận này được xây dựng dựa trên công việc trước đó như ALE-Agent, đã xếp thứ 21 trong số 1.000 chuyên gia về con người trong một cuộc thi viết mã bằng cách sử dụng các kỹ thuật điều phối.
Công ty đang phát hành hai biến thể. Mô hình Fugu cơ sở nhắm đến độ trễ thấp và hiệu suất ổn định hàng ngày trong các trường hợp sử dụng mã hóa, đánh giá mã và chatbot, đồng thời cho phép các nhóm loại trừ các tác nhân cụ thể khỏi nhóm để đảm bảo quyền riêng tư hoặc tuân thủ. Fugu Ultra được xây dựng để mang lại chất lượng câu trả lời tối đa cho các vấn đề phức tạp, gồm nhiều bước như sao chép các bài báo khoa học, phân tích an ninh mạng cũng như tìm kiếm bằng sáng chế và tài liệu.
Tuyên bố về điểm chuẩn gây chú ý
Theo kết quả điểm chuẩn mà Sakana AI công bố, Fugu Ultra hoạt động ngang bằng với Fable 5 và Mythos Preview của Anthropic trên một loạt điểm chuẩn về mã hóa, lý luận và khoa học. Đáng chú ý, cả mô hình Anthropic đều không thực sự nằm trong nhóm đại lý của Fugu vì chúng không được công khai, có nghĩa là Fugu đạt được số điểm tương đương khi sử dụng các mô hình khác.
Những con số được công bố thật ấn tượng. Trên SWE-Bench Pro, Fugu Ultra đạt 73,7 điểm, trước Opus 4,8 với 69,2, Gemini 3.1 Pro ở 54,2 và GPT 5,5 ở 58,6. Trên TerminalBench 2.1, nó đạt điểm 80,2 so với 82,1 của Opus 4.8. Trên LiveCodeBench, nó đạt 93,2 so với 85,3 của GPT 5.5 và trong Bài kiểm tra cuối cùng của Nhân loại, nó đạt 50,0, đứng đầu là 49,8 của Opus 4.8 và 41,4 của GPT 5.5.
Thử nghiệm trong thế giới thực Vẽ nên một bức tranh hỗn hợp
Những đánh giá thực tế ban đầu kém nhiệt tình hơn so với điểm chuẩn. Nhà nghiên cứu AI Ethan Mollick đã viết trên X rằng Fugu Ultra "cực kỳ chậm", với các bài kiểm tra mã hóa thông thường của anh ấy mất 30 phút và kết quả là "ổn" nhưng không bằng Fable trong thực tế. Một người dùng khác cho biết đã vượt quá toàn bộ hạn ngạch 5 giờ đối với gói 20 đô la chỉ bằng một lời nhắc, trong khi các nhà phát triển trên Hacker News phàn nàn rằng gói 200 đô la mỗi tháng mang lại thời gian sử dụng ít hơn ba giờ một tuần.
Đánh giá mã nổi lên như một điểm sáng, gần giống với Opus 4.8 hoặc GPT 5.5 về chất lượng. Một thử nghiệm đối đầu cho thấy Fugu Ultra hoàn thành nhiệm vụ mã hóa trong 22 phút với giá 7,32 USD, nhanh hơn và rẻ hơn nhiều so với 79 phút và 37,85 USD của Opus 4.8, mặc dù người đánh giá thích kết quả đầu ra của Opus hơn.
Sakana AI, được thành lập tại Tokyo vào năm 2023 và được hỗ trợ bởi Nvidia, đã xây dựng danh tính của mình dựa trên nghiên cứu AI lấy cảm hứng từ thiên nhiên, sử dụng các thuật toán tiến hóa và ý tưởng trí tuệ tập thể để đạt được hiệu suất cao hơn từ các mô hình hiện có. Fugu mở rộng triết lý đó sang thị trường thương mại, biến việc hòa âm thành một sản phẩm. Công ty cũng đang định vị hệ thống này cho khán giả Nhật Bản lo lắng về việc phụ thuộc quá nhiều vào các nhà cung cấp Hoa Kỳ, với trang web song ngữ và mức giá nhắm đến cả các nhà phát triển cá nhân và nhóm doanh nghiệp.
Một hàng rào chống lại sự khóa chặt của nhà cung cấp
Ngoài hiệu suất thô, Sakana AI còn coi Fugu như một biện pháp bảo vệ chống lại sự phụ thuộc vào bất kỳ nhà cung cấp AI nào. Công ty chỉ ra các biện pháp kiểm soát xuất khẩu gần đây của Hoa Kỳ đã rút các mẫu Fable và Mythos của Anthropic khỏi thị trường nước ngoài như một bằng chứng cho thấy quyền truy cập vào các hệ thống hàng đầu có thể biến mất chỉ sau một đêm.
Sakana AI viết trong thông báo của mình: “Đối với một tổ chức hoặc một quốc gia, việc dựa vào API của một công ty duy nhất cho cơ sở hạ tầng, tài chính hoặc quản trị quan trọng là một lỗ hổng nghiêm trọng”. Vì nhóm mô hình của Fugu hoàn toàn có thể hoán đổi nên hệ thống có thể định tuyến lại sang các mô hình khác nếu một nhà cung cấp ngừng hoạt động.
Các nhà phân tích cảnh báo rằng điều này không giống như chủ quyền thực sự. Hiệu suất của Fugu phụ thuộc vào mô hình nào nằm trong nhóm của nó và một số nhà cung cấp hàng đầu hạn chế quyền truy cập cùng lúc sẽ vẫn thu hẹp các tùy chọn của nó. Công ty cũng chưa tiết lộ mức độ chi phí và mức sử dụng token của lớp điều phối. Tuy nhiên, khi các mô hình biên giới trở thành tài sản địa chính trị và việc gắn bó với một nhà cung cấp duy nhất ngày càng rủi ro hơn, Fugu đưa ra bản xem trước về một ngành AI nơi sự phối hợp có thể quan trọng ngang bằng với năng lực.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →



