Tuần này, một công ty khởi nghiệp có tên TypeSafe AI đã nổi lên sau hai năm hoạt động lén lút với một tuyên bố táo bạo: ngành công nghiệp này đã xây dựng sai loại mô hình cho tự động hóa. Sản phẩm đầu tiên của họ, một hệ thống tên là Jev, được công ty gọi là "Mô hình hệ thống một" và nó nhanh chóng trở thành câu chuyện được thảo luận nhiều nhất trên Hacker News, thu hút hơn 1.800 điểm.

"Các người mẫu đã trở thành siêu nhân trong trò chuyện trong nhiều năm, vậy tự động hóa ở đâu?" công ty hỏi trong bài đăng ra mắt của mình. Người sáng lập, một cựu nhà nghiên cứu OpenAI, cho biết các phương pháp mà ông giúp xây dựng ở đó đã trở thành nghiên cứu đằng sau ChatGPT và ông từng tin rằng các mô hình trò chuyện sẽ dẫn đến trí thông minh nhân tạo chung trước khi kết luận rằng còn thiếu một điều gì đó lớn lao. For more context on this story, see our ongoing latest AI developments.

Mô hình Hệ thống Một là gì?

Cái tên này mượn từ sự phân biệt của tâm lý học giữa tư duy Hệ thống Một nhanh, trực quan và lý luận chậm rãi, có chủ ý của Hệ thống Hai. Khi các mô hình ngôn ngữ lớn ngày nay tạo ra mã thông báo văn bản theo mã thông báo, Jev được xây dựng để đưa ra các quyết định nhanh chóng, có cấu trúc mà phần mềm có thể sử dụng trực tiếp.

Công ty mô tả mô hình này là "một cuộc gọi chức năng trí tuệ biên giới: trạng thái không có cấu trúc trong, đưa ra các quyết định xác suất." Thay vì tạo ra văn xuôi phải được phân tích cú pháp và xác thực, Jev đưa ra các giá trị có cấu trúc được xác định trước, mỗi giá trị kèm theo xác suất đã hiệu chỉnh và điểm tin cậy. Công ty tuyên bố mô hình này không bao giờ mắc lỗi loại và không thể gây ảo giác theo cách mà các mô hình văn bản có thể làm, mặc dù nhà cung cấp đó tuyên bố đảm bảo sự giám sát kỹ lưỡng cho đến khi được đánh giá độc lập.

Sự khác biệt về kiến ​​trúc là cơ chế phân phối. Theo bài đăng, Jev tạo ra tất cả các đầu ra của nó theo một lần truyền song song duy nhất thay vì tự động hồi quy, mỗi lần một mã thông báo. Công ty cho biết việc từ bỏ việc tạo chuỗi dạng tự do chính là điều giúp tăng tốc độ: đầu ra được tính toán đồng thời thay vì tuần tự.

Công thức luyện tập mới

Dưới vỏ bọc, TypeSafe cho biết họ đã xây dựng một ngăn xếp mới: kiến trúc mô hình tùy chỉnh, bộ lấy mẫu song song và phương pháp đào tạo mà nó gọi là Học tăng cường cho các quyết định đã hiệu chỉnh hoặc RLCD. Công ty đặt RLCD chống lại hai công thức thống trị của ngành. Học tập tăng cường từ phản hồi của con người sẽ tối ưu hóa các phản hồi mà người đánh giá ưa thích; học tập tăng cường với phần thưởng có thể kiểm chứng sẽ tối ưu hóa cho kết quả đầu ra có thể được kiểm tra theo chương trình. Thay vào đó, RLCD huấn luyện mô hình để gắn các xác suất trung thực về mặt nhận thức vào các câu trả lời của nó đối với các nhiệm vụ phán đoán nhanh.

Kết quả cuối cùng, theo công ty: độ tin cậy cao hơn sẽ tương quan với độ chính xác cao hơn và các đầu vào tương tự sẽ tạo ra đầu ra nhất quán, các thuộc tính quan trọng khi các quyết định của mô hình được đưa trực tiếp vào phần mềm sản xuất.

Tuyên bố về Hiệu suất và Giá cả

Các tuyên bố rất tích cực ngay cả theo tiêu chuẩn khởi nghiệp. TypeSafe cho biết Jev đạt được trí thông minh tương tự như các LLM hiện có về cái mà nó gọi là nhiệm vụ Hệ thống Một trong khi chạy nhanh hơn 40 lần đến 200 lần đối với các hình dạng truy vấn đó. Trang chủ của công ty trích dẫn số liệu nhanh hơn 193,6 lần và rẻ hơn 444,6 lần, mặc dù bài đăng trên blog thừa nhận đây là "mức tăng cao hơn trong thế giới thực". Công ty cũng cho biết mô hình này đạt tốc độ khoảng 100 mili giây, đủ nhanh để đưa phán đoán AI vào quy trình làm việc của người dùng trong đó độ trễ là rất quan trọng.

Giá cả tuân theo thiết kế độc đáo. TypeSafe liệt kê các mã thông báo đầu vào ở mức 0,042 USD trên một triệu mã thông báo, khoảng 42 USD trên một tỷ USD và lưu ý rằng cấu trúc chi phí LLM thông thường bị đảo ngược: vì Jev tạo ra các đầu ra có cấu trúc song song thay vì tạo ra các chuỗi dài, nên phần mã thông báo đầu ra đắt tiền của sổ cái phần lớn biến mất. Công ty so sánh điều này với các mô hình thông thường, trong đó mã thông báo đầu ra thường có giá cao hơn nhiều lần so với mã thông báo đầu vào.

Biên lai và giới hạn của chúng

Theo ghi nhận của mình, bài đăng ra mắt cố gắng chứng minh sự cường điệu bằng các minh chứng song song. Để so sánh tiêu đề của mình, công ty đã sử dụng GPT-5.6 Terra với lý do mặc định, được mô tả là mô hình có thể so sánh nhất với Jev về trí thông minh trung bình. Các câu trả lời tham khảo trong các đánh giá của nó được tính bằng mức trung bình của GPT-6 Astra và Anthropic's Fable 5.1 của OpenAI, một lựa chọn mà công ty thừa nhận là thiên vị so với các phòng thí nghiệm hiện tại. Các con số về chi phí và độ trễ cho phía LLM đến từ OpenRouter, công ty lưu ý rằng nó đưa ra các xu hướng định tuyến của riêng mình.

Phần phương pháp luận đó thẳng thắn một cách bất thường đối với một thông báo ra mắt và đó cũng là nơi những người hoài nghi sẽ tập trung. Tất cả các con số tiêu đề đều đến từ các nhiệm vụ mà chính công ty đã chọn, được mô tả là các quyết định có thể được phân loại, định tuyến, cho điểm, trích xuất hoặc phân nhánh, chính xác theo hình dạng mà kiến ​​trúc của công ty ưa thích. Chưa có điểm chuẩn độc lập nào và cơ cấu riêng của công ty thừa nhận việc so sánh phụ thuộc vào việc lựa chọn truy vấn.

Tại sao buổi ra mắt lại gây được tiếng vang

Sự đón nhận nhiệt tình của Hacker News, trong đó bài đăng đạt 1.800 điểm trong vòng một ngày, cho thấy lời rao hàng đã chạm đến sự lo lắng thực sự. Các nhà phát triển xây dựng các sản phẩm AI đã dành hai năm vật lộn với khoảng cách giữa các bản demo ấn tượng và khả năng tự động hóa đáng tin cậy: các lệnh gọi công cụ ảo giác, các phán đoán không nhất quán, chuỗi các bước lý luận chậm chạp đắt tiền được ghim lại với nhau bằng mã keo dễ vỡ.

Đánh cuộc của TypeSafe là một phần có ý nghĩa của khối lượng công việc AI trong thế giới thực hoàn toàn không cần một mô hình trò chuyện. Kiểm tra gian lận, phân loại vé hỗ trợ, chấm điểm khách hàng tiềm năng, kiểm duyệt nội dung, phân tích nhật ký và vô số quyết định định tuyến về cơ bản là các vấn đề phân loại với không gian đầu ra được xác định rõ ràng. Đối với những người đó, một mô hình chuyên dụng trả về xác suất đã hiệu chỉnh tính bằng mili giây có thể cắt giảm LLM có mục đích chung cả về tốc độ và chi phí.

Lập luận phản biện cũng quen thuộc: các mô hình chung ngày càng tốt hơn và rẻ hơn, đồng thời giao diện chuỗi linh hoạt khiến LLM không thể đoán trước cũng chính là điều khiến chúng có thể thích ứng với các nhiệm vụ mới mà không cần đào tạo lại. Một công cụ quyết định hẹp phải tìm đủ khối lượng công việc đồng nhất để biện minh cho sự tồn tại của nó.

Jev có sẵn trong quyền truy cập sớm bắt đầu từ tuần này. Cho dù nó trở thành một danh mục mới hay một chú thích gây tò mò, buổi ra mắt này sẽ bổ sung thêm tiếng nói riêng biệt cho một cuộc tranh luận ngày càng lớn hơn trong ngành: con đường nhanh nhất dẫn đến tự động hóa AI có thể không phải thông qua các chatbot lớn hơn mà thông qua các mô hình được thiết kế từ những nguyên tắc đầu tiên để thực hiện chính xác một điều, một cách nhanh chóng và để cho bạn biết mức độ chắc chắn của chúng.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →