Một công ty khởi nghiệp AI mới do một cựu nhà nghiên cứu OpenAI thành lập đã đưa ra cái mà họ gọi là một loại mô hình hoàn toàn mới - một loại mô hình không thể viết cho bạn một bài luận và nói rằng đó chính xác là vấn đề.
TypeSafe AI đã công bố vào thứ Ba về việc phát hành "System One Model" đầu tiên, có tên là Jev, có sẵn ngay trong giai đoạn truy cập sớm. Công ty được thành lập bởi Diogo Almeida, người cho biết nghiên cứu đằng sau việc làm theo hướng dẫn của ChatGPT phát triển từ công việc mà ông đã đóng góp tại OpenAI. Sau hai năm lén lút, ông lập luận rằng sự tập trung vào trò chuyện của ngành đã che khuất những điểm mà quá trình tự động hóa thực sự thất bại. For more context on this story, see our ongoing AI industry coverage.
"Các người mẫu đã trở thành siêu nhân trong trò chuyện trong nhiều năm, vậy tự động hóa ở đâu?" Almeida đã viết trong bài đăng ra mắt. "Đó là câu hỏi thúc đẩy tôi trong bốn năm qua."
Mô hình 'Hệ thống Một' thực sự là như thế nào
Cái tên này mượn từ sự phân biệt của tâm lý học giữa tư duy nhanh, bản năng và lý luận chậm, có chủ ý. Trong đó các mô hình ngôn ngữ lớn tạo mã thông báo văn bản theo mã thông báo - linh hoạt, chung chung và đôi khi có xu hướng vô nghĩa tự tin - Jev của TypeSafe được xây dựng để thực hiện điều gì đó hẹp hơn: lấy trạng thái phi cấu trúc làm đầu vào và trả về các quyết định đã nhập, có cấu trúc kèm theo xác suất đã hiệu chỉnh.
Công ty mô tả Jev là "một chức năng trí tuệ biên giới được gọi: trạng thái không có cấu trúc trong, đưa ra các quyết định xác suất." Bởi vì các đầu ra có thể được xác định trước và mô hình không bao giờ tạo ra các chuỗi dạng tự do, TypeSafe tuyên bố rằng nó không thể tạo ra lỗi loại - một thuộc tính mà công ty cho biết được đảm bảo về mặt toán học thay vì có khả năng thống kê - và không thể gây ảo giác theo cách mà các mô hình tạo văn bản có thể làm.
Theo bài đăng giới thiệu, kiến trúc này khác với thực tiễn chính thống theo ba cách: kiến trúc mô hình mới, bộ lấy mẫu song song tạo ra tất cả kết quả đầu ra trong một truy vấn thay vì tuần tự và một phương pháp đào tạo mà công ty gọi là Học tăng cường cho các quyết định đã hiệu chỉnh (RLCD), tối ưu hóa các xác suất trung thực về mặt nhận thức thay vì sở thích của con người hoặc các kết quả đầu ra có thể kiểm chứng bằng lập trình.
Tuyên bố: Nhanh hơn 100 lần, một phần chi phí
Những con số mà TypeSafe công bố rất tích cực. Công ty cho biết Jev cung cấp thông tin tình báo có thể so sánh với các LLM biên giới hiện tại về cái mà họ gọi là nhiệm vụ "Định hình Hệ thống Một" — quyết định phân loại, định tuyến, tính điểm, trích xuất và phân nhánh — trong khi phản hồi trong 70 đến 500 mili giây, so với thời gian phản hồi từ đầu đến cuối là 3 đến 329 giây đối với các mô hình biên giới. Công ty cho biết điều đó nhanh hơn gấp 40 lần đến 200 lần.
Giá cả cũng độc đáo tương tự: 0,042 USD trên một triệu mã thông báo đầu vào, miễn phí mã thông báo đầu ra vì đầu ra được tính toán song song thay vì mã thông báo được tạo theo mã thông báo. Công ty thừa nhận trong bài đăng của mình rằng họ chưa thể chứng minh được mức giá bền vững trên quy mô lớn.
“Những tuyên bố đặc biệt đòi hỏi bằng chứng đặc biệt,” bài đăng viết, trước khi đưa ra bằng chứng mà nó có.
Biên lai - và những gì những người hoài nghi nói
TypeSafe đã xuất bản một bản demo song song so sánh Jev với GPT-5.6 Terra, được mô tả là mô hình biên giới có thể so sánh nhất ở mức độ thông minh tương tự và cho biết sự bất đồng duy nhất trong quá trình chạy được ghi lại liên quan đến một quyết định thực sự mơ hồ. Nó cũng giới thiệu một phương pháp "đánh giá quy trình làm việc" mới để đo lường các mô hình chống lại sự đồng thuận của các mô hình bên ngoài lớn nhất - Astra của OpenAI và Anthropic's Fable - bên trong một biểu đồ điện toán cố định và tuyên bố Jev "sở hữu biên giới Pareto với gần 2 bậc độ lớn."
Đáng chú ý, công ty đã xuất bản một bài đăng kèm theo có tiêu đề "antibenchmaxxing" giải thích lý do tại sao nó tránh các điểm chuẩn truyền thống, lập luận rằng một mô hình được thiết kế cho các quyết định có cấu trúc bên trong quy trình làm việc phần mềm chống lại sự so sánh toàn cầu có ý nghĩa.
Phản ứng trên Hacker News, nơi buổi ra mắt đã thu hút hàng trăm điểm trong vòng vài giờ, từ sự phấn khích thực sự đến sự hoài nghi rõ ràng. Một số nhà bình luận lưu ý rằng bằng chứng công khai phần lớn bao gồm các video demo - bao gồm một video hiển thị mô hình cung cấp năng lượng cho vòng lặp trò chơi Doom - thay vì các đánh giá có thể lặp lại của bên thứ ba. Những người khác cho rằng cách tiếp cận này được hiểu tốt nhất là một công cụ phân loại cực kỳ nhanh, chất lượng vượt trội, hữu ích cho một phần khối lượng công việc thay vì thay thế cho LLM.
Ngay cả những nhà quan sát có thiện cảm cũng đã định hình gánh nặng chứng minh một cách rõ ràng. Một người bình luận viết: “Đúng, họ nói như những người hoài nghi nhưng không đưa ra nhiều bằng chứng, ngoài một vài video demo”. "Một bản demo trực tiếp sẽ thuyết phục hơn nhiều."
Tại sao nó lại có thể quan trọng
Cú ném tiếp đất vào một điểm thực sự đau đớn. Một phần lớn các cuộc gọi LLM sản xuất trong phần mềm thương mại hoàn toàn không mang tính khái quát - chúng là các phán đoán nhị phân, phân công danh mục và quyết định định tuyến được gói gọn trong văn xuôi. Nếu một mô hình có thể thực hiện các cuộc gọi đó với độ tin cậy đã hiệu chỉnh ở mức 70 mili giây và chi phí đầu ra bằng 0, thì tính kinh tế của phần mềm được hỗ trợ bởi AI sẽ thay đổi đáng kể: giao diện người dùng theo thời gian thực trở nên thiết thực và các bước quy trình quá đắt để tự động hóa bằng LLM trở nên đủ rẻ để chạy ở mọi nơi.
Các trường hợp sử dụng được đề xuất của TypeSafe bao gồm phân loại và định tuyến dữ liệu, xác minh và bảo vệ đầu ra LLM, phát hiện các bản bẻ khóa và phân tích giảm bản đồ trên các tập dữ liệu lớn - khối lượng công việc trong đó mã xung quanh có thể hạn chế quyền tự do của mô hình và phát hiện lỗi.
Công ty thẳng thắn trả lời các câu hỏi mở: các đánh giá được công bố của họ được thực hiện từ máy tính xách tay ở Bờ Tây Hoa Kỳ và tính bền vững về giá cả trong dài hạn vẫn chưa được chứng minh. Liệu những tuyên bố về trí thông minh của Jev có tồn tại được khi tiếp xúc với thử nghiệm độc lập hay không sẽ quyết định liệu "Mô hình Hệ thống Một" trở thành một danh mục hay một sự tò mò.
Quyền truy cập sớm hiện được mở thông qua trang web của công ty.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →