Nhóm Ornith đã phát hành Ornith-1.5, một nhóm mô hình ngôn ngữ trọng lượng mở được xây dựng dựa trên một ý tưởng khác thường: mô hình này tạo ra các nhiệm vụ đào tạo của riêng mình, thiết kế khung riêng và học hỏi từ các nỗ lực giải pháp của riêng mình trong một vòng lặp chạy liên tục. Theo đánh giá riêng của nhóm, Ornith-1.5-397B hàng đầu đạt điểm 86,1 trên Terminal-Bench 2.1 (Terminus-2), ngang bằng với Claude Opus 4.8 của Anthropic ở mức 85,0 và vượt lên trên mọi mẫu nguồn mở khác có kích thước tương đương.
Bản phát hành, được xuất bản trong tuần này trên blog Ornith và trên Hugging Face theo giấy phép MIT, là loạt đạn mới nhất trong cuộc đua AI nguồn mở thường xuyên tạo ra các kết quả từng được cho là không thể nếu không có ngân sách của phòng thí nghiệm biên giới. Đối với các nhà phát triển và doanh nghiệp theo dõi tin tức mới nhất về mô hình AI, tầm quan trọng gấp đôi: điểm chuẩn ngang bằng với một mô hình đóng hàng đầu và một công thức đào tạo chỉ ra nơi tiếp theo là quá trình phát triển mô hình mở.
Ba kích cỡ, một công thức
Ornith-1.5 xuất xưởng với ba cấu hình: một chiếc hàng đầu dành cho hỗn hợp các chuyên gia tham số 397B, một MoE 35B chỉ kích hoạt các tham số 3B trên mỗi mã thông báo và một mô hình dày đặc 9B nhỏ gọn với biến thể "Di động" được lượng tử hóa được thiết kế để chạy trực tiếp trên các thiết bị iPhone và Android. Cả ba đều có sẵn trên Hugging Face cùng với các bản dựng GGUF, MLX và NVFP4 và thẻ mô hình cho biết dòng sản phẩm này được xây dựng trên kiến trúc Qwen3.5 MoE.
Dòng dõi rất quan trọng ở đây. Ornith-1.0, được phát hành đầu năm nay, đã phổ biến cách tiếp cận "tự giàn giáo" đối với mã hóa tác nhân và trở thành một thành công thầm lặng — bản dựng 9B GGUF của nó đã ghi được hơn năm triệu lượt tải xuống trên Ôm Mặt. Ornith-1.5 mở rộng khuôn khổ đó từ việc tối ưu hóa giàn giáo và triển khai thành một quy trình tự cải tiến hoàn chỉnh.
Vòng lặp hoàn thiện bản thân, được giải thích
Trong quy trình sau đào tạo thông thường, học tăng cường chạy dựa trên một nhóm nhiệm vụ cố định do con người quản lý. Thay vào đó, Ornith-1.5 có mô hình đề xuất các nhiệm vụ mới, tạo ra một giàn giáo dành riêng cho nhiệm vụ — các hướng dẫn, công cụ và chiến lược phân rã được sử dụng để giải quyết vấn đề — và sau đó tạo ra các bản triển khai giải pháp được chấm điểm bởi giàn giáo mà nó vừa xây dựng. Phần thưởng được truyền ngược lại qua cả ba giai đoạn bằng cách sử dụng GRPO, do đó, hệ thống đồng thời học cách viết các nhiệm vụ tốt hơn, khung tốt hơn và giải pháp tốt hơn.
Phần thưởng tạo nhiệm vụ là trọng tâm của thiết kế. Mỗi nhiệm vụ đề xuất được tính điểm dựa trên ba tín hiệu nhân: tính hợp lệ (giàn giáo có thực hiện và đánh giá chính xác không?), độ khó biên (tỷ lệ thành công thực nghiệm của mô hình có gần mục tiêu khoảng 20% không, khiến các nhiệm vụ mang tính thách thức nhưng có thể học được?) và tính mới (nó có đủ khác biệt so với mọi thứ trong bộ đệm các nhiệm vụ được tạo trước đó không?). Bởi vì độ khó được đo lường dựa trên tỷ lệ thành công hiện tại của mô hình nên chương trình giảng dạy sẽ tự động nâng cao khi mô hình được cải thiện.
Nhóm cũng báo cáo các biện pháp chống hack rõ ràng trong quá trình đánh giá: lịch sử git bị xóa khỏi hình ảnh kho lưu trữ nên các mô hình không thể khôi phục các giải pháp trước đó và quyền truy cập mạng bị vô hiệu hóa để ngăn các mô hình tìm nạp câu trả lời bên ngoài. Tất cả các kết quả được tính trung bình trên năm lần chạy độc lập.
Những con số
Về mã hóa tác nhân, cụm kết quả tự báo cáo của hạm ở đầu trường nguồn mở. Trên Terminal-Bench 2.1 chạy qua bộ khai thác Terminus-2, 86.1 của Ornith-1.5-397B vượt trội so với Claude Opus 4.8 (85.0), DeepSeek-V4-Flash-0731 (82.7) và GLM-5.2 (81). Trên cùng một điểm chuẩn chạy qua bộ khai thác Mã Claude, Ornith-1.5 đạt 85,2 so với 78,9 của Opus 4.8. Trên SWE-bench Verify, cả hai đang bằng nhau ở mức 86,0 và 85,8, với Kimi K3 dẫn trước một chút ở 86,2.
Khoảng cách ngày càng mở rộng trên các bộ tác nhân khó hơn. Trên DeepSWE, Ornith-1.5-397B đạt điểm 56,0 - cao hơn 46,2 của GLM-5.2, mặc dù xếp sau Opus 4,8 (59,0) và Kimi K3 (67,5). Bước nhảy vọt đáng chú ý nhất là về mặt thế hệ: Ornith-1.0 chỉ đạt 8,0 điểm trên DeepSWE, nghĩa là phiên bản mới mang lại cải tiến gấp bảy lần trên cùng một nhóm điểm chuẩn.
Các mô hình nhỏ hơn kể câu chuyện của riêng họ. Ornith-1.5-35B-A3B, chỉ kích hoạt các tham số 3B trên mỗi mã thông báo, đạt 68,5 điểm trên Terminal-Bench 2.1 (Mã Claude) so với 43,4 đối với Gemma 4-31B của Google và 51,7 đối với Muse Glimmer-30B của Meta và đăng 79,0 trên SWE-bench Đã xác minh. Mẫu 9B đạt 47,0 trên Terminal-Bench 2.1, 70,6 trên SWE-bench Verify và 86,4 trên GPQA Diamond — những con số đưa mẫu điện thoại vào khoảng cách vượt trội so với các đối thủ thuộc loại máy tính để bàn.
Hãy cẩn thận và bối cảnh
Đây là các điểm chuẩn do nhà phát triển thực hiện, không phải kết quả được kiểm tra độc lập và các mô hình so sánh đã được nhóm Ornith đánh giá theo cài đặt khai thác riêng của nhóm. Các phòng thí nghiệm của đối thủ cũng điều chỉnh các sự đánh đổi khác nhau; Sự dẫn đầu của Kimi K3 trên DeepSWE cho thấy biên giới của công việc phần mềm tác nhân vẫn còn nhiều tranh cãi. Nhưng tính minh bạch trong toàn bộ bảng của bản phát hành — mức trung bình trong 5 lần chạy, cấu hình khai thác được công bố, các biện pháp bảo vệ được công bố — khiến cho việc sao chép độc lập trở nên đơn giản một cách bất thường.
Phản ứng của cộng đồng là rất đáng kể. Thông báo phát hành đã thu hút hơn một trăm điểm trên Hacker News trong vòng vài giờ, với cuộc thảo luận tập trung ít hơn vào các tuyên bố điểm chuẩn mà tập trung vào phương pháp tự cải thiện, mà một số nhà bình luận mô tả là một trong những triển khai mở đáng tin cậy hơn của việc tạo tác vụ kiểu đệ quy.
Đối với hệ sinh thái nguồn mở, Ornith-1.5 hạ cánh vào thời điểm các mô hình mở từ các phòng thí nghiệm của Trung Quốc và các nhóm độc lập phương Tây đang thu hẹp khoảng cách với các biên giới khép kín về các nhiệm vụ mã hóa và tác nhân. Dòng sản phẩm được MIT cấp phép phù hợp với mô hình khép kín hàng đầu trên Terminal-Bench — và gửi biến thể 9B sẵn sàng cho điện thoại — thu hẹp khoảng cách đó hơn nữa và thực hiện điều đó bằng một phương pháp đào tạo mà bất kỳ ai cũng có thể kiểm tra, tái tạo và mở rộng.
---
Đi trước AINhận tin tức, phân tích và đột phá mới nhất về AI — tất cả ở cùng một nơi.
Đọc thêm tin tức về AI →