Fireworks Research, nhóm mô hình bên trong công ty khởi nghiệp suy luận Fireworks AI, đã giới thiệu Ember-1, một mô hình chuyên biệt mà công ty cho biết sẽ tạo ra các câu trả lời tương tự như Kimi K3 của Moonshot AI trong khi phát ra ít mã thông báo hơn khoảng 40%. Mô hình này đã xuất hiện trực tuyến trên nền tảng của Fireworks vào ngày 23 tháng 9 và trong vài ngày qua, nó đã trở thành một trong những bản phát hành được thảo luận nhiều nhất trong cộng đồng nhà phát triển, thu hút hàng trăm lượt tán thành trên Hacker News khi các lập trình viên tranh luận liệu mã thông báo lý luận có phải là biên giới chi phí tiếp theo hay không.
Màn chào hàng diễn ra vào thời điểm khi các suy luận chứ không phải khả năng của mô hình ngày càng quyết định những đội nào có đủ khả năng vận chuyển. Đối với các nhóm đang xem khối lượng công việc tổng đài tiêu tốn ngân sách, sự phát triển AI mới nhất đã làm rõ một điều: thói quen tốn kém nhất của ngành hiện nay không phải là đào tạo các mô hình tiên phong mà là vận hành chúng. Ember-1 là nỗ lực của Fireworks nhằm tấn công trực tiếp vào vấn đề đó và công ty đã hỗ trợ nó bằng một bộ tiêu chuẩn và số lượng sản xuất chi tiết bất thường.
Người mẫu tư duy Nghĩ quá nhiều
Quan sát cốt lõi đằng sau Ember-1 là các mô hình lý luận như Kimi K3 dành phần lớn số token được tạo ra của họ — đôi khi hơn 90%, theo Fireworks — cho lý luận nội bộ thay vì cho chính câu trả lời. Đối với một yêu cầu duy nhất, điều đó là tốn kém. Trong khối lượng công việc tổng đài, nó kết hợp: mỗi lượt của cuộc trò chuyện của tổng đài viên sẽ phát lại tất cả lý do trước đó trở lại mô hình, do đó, bối cảnh tăng lên gần như bậc hai với số lượt và các dấu vết lý luận dài từ các lượt đầu sẽ được đọc lại và tính phí lại cho mỗi cuộc gọi tiếp theo.
Fireworks cho biết khách hàng đã nói với họ rằng họ muốn khả năng mã hóa của Kimi K3 với chi phí thấp hơn, nhưng việc đơn giản từ chối nỗ lực suy luận của mô hình sẽ không hiệu quả - cài đặt tốn ít công sức sẽ mang lại quá nhiều chất lượng. Giải pháp thay thế là đào tạo một mô hình suy luận hiệu quả hơn trong khi vẫn giữ được lý do quan trọng.
Đào tạo về sự lãng phí
Theo bài đăng trên blog của công ty, việc xây dựng Ember-1 đã thực hiện hơn 50 thử nghiệm đào tạo và hơn 200 đánh giá, chạy hoàn toàn trên nền tảng Serverless Training của riêng Fireworks. Nhóm nghiên cứu cho biết họ đã phát triển các thuật toán huấn luyện mới để rút ngắn khả năng suy luận mà không làm mất đi độ chính xác.
Điều đáng chú ý là công ty đã không cố gắng loại bỏ lý luận bán buôn. Một số tính chất chi tiết rõ ràng của Kimi K3 là sự tự phản ánh hiệu quả - xem lại một giả định, phản hồi phản hồi hoặc truy tìm kết quả từ quyết định trước đó giúp mô hình phục hồi sau sai lầm. Chế độ luyện tập được thiết kế để duy trì khả năng đó đồng thời cắt giảm các vòng lặp không hiệu quả.
Dữ liệu đào tạo bao gồm toán học, mã hóa, tuân theo hướng dẫn, hội thoại, tìm kiếm, sử dụng công cụ và công nghệ phần mềm, bao gồm cả các vấn đề độc lập và tương tác nhiều lượt mở rộng. Fireworks cho biết họ chỉ sử dụng dữ liệu của chính mình và không sử dụng dữ liệu khách hàng.
Điểm chuẩn: Trên hoặc gần Biên giới Pareto
Để ước tính chi phí, Fireworks đã tính toán chi phí trên mỗi điểm chuẩn bằng cách sử dụng giá API công khai của Kimi K3 — 3 USD trên một triệu mã thông báo đầu vào không được lưu trong bộ nhớ đệm, 0,30 USD trên một triệu mã thông báo đầu vào được lưu vào bộ nhớ đệm và 15 USD trên một triệu mã thông báo đầu ra — và so sánh Ember-1 với K3 ở mức nỗ lực lý luận thấp, cao và tối đa. Trên mọi điểm chuẩn với hơn 50 mẫu thử nghiệm, công ty báo cáo rằng Ember-1 nằm trên hoặc gần biên giới Pareto, phù hợp với K3 với nỗ lực tối đa với một phần chi phí và thống trị hoàn toàn K3 với nỗ lực thấp.
Các so sánh tiêu đề với K3 ở nỗ lực tối đa, theo báo cáo của Fireworks:
| Điểm chuẩn | Mẫu | K3 (nỗ lực tối đa) | Ember-1 |
|---|---|---|---|
| Băng ghế đầu cuối 2.1 | 89 | 80,9% | 82,0% |
| Băng ghế dự bị SWE đã được xác minh | 500 | 93,2% | 92,2% |
| SWE-Tương tác | 75 | 21,3% | 20,0% |
| DeepSWE 1.1 | 113 | 66,4% | 75,2% |
| τ²-Hãng hàng không Bench | 50 | 64% | 66% |
Về chi phí cho mỗi nhiệm vụ, Fireworks báo cáo Ember-1 cắt giảm chi tiêu 51,9% cho Terminal Bench 2.1, 32,5% cho SWE-Interact, 23,7% cho DeepSWE 1.1 và 15,5% cho SWE-bench Trusted so với K3 ở mức nỗ lực tối đa — trong trường hợp DeepSWE, chênh lệch hơn 126 USD cho mỗi đơn vị công việc theo mức tính toán của công ty.
Công ty cũng đã đánh giá Ember-1 trên Ghế cạnh giường bệnh của Doximity, một điểm chuẩn đã được bác sĩ xác nhận đối với 500 trường hợp lâm sàng trên 10 chuyên khoa mà Fireworks thực hiện thông qua Chỉ số Thông minh Chuyên ngành mới ra mắt của họ. Ở đó, Fireworks cho biết Ember-1 đã đặt ra giới hạn Pareto mới về chi phí cho mỗi nhiệm vụ trên cả mô hình mở và đóng, bao gồm GPT-5.6 Sol, GPT-6 Astra và Claude Opus 5. Tuyên bố đó xuất phát từ chỉ mục riêng của Fireworks và chưa được xác minh độc lập.
Lưu lượng truy cập trực tiếp: Ít token hơn, cùng số điểm
Điểm chuẩn là một chuyện; sản xuất là chuyện khác. Fireworks đã chạy thử nghiệm A/B trực tiếp với hai khách hàng về khối lượng công việc mã hóa sản xuất của họ và báo cáo rằng Ember-1 sử dụng ít mã thông báo hơn khoảng 35% cho mỗi tác vụ với chất lượng tương đương. Trong một so sánh được đo lường, Kimi K3 đạt 0,751 điểm trong khi tạo ra 49.300 mã thông báo đầu ra cho mỗi nhiệm vụ, so với 0,753 của Ember-1 trên 29.900 mã thông báo — giảm 71,3% số mã thông báo lý luận và tổng số mã thông báo ít hơn 39%. Sau các cuộc thử nghiệm, một khách hàng đã chuyển Ember-1 sang sản xuất trực tiếp với kế hoạch mở rộng quy mô để thay thế hoàn toàn mẫu cơ sở.
Bên trong Fireworks, mô hình này đã được lặng lẽ chuyển sang quy trình mã hóa của chính công ty trước khi ra mắt. Kết quả mà nhóm cho biết là đáng tự hào nhất: không ai để ý đến. Các nhà phát triển tiếp tục công việc của họ mà không phát hiện ra sự chuyển đổi trong khi tiêu thụ ít token hơn đáng kể.
Trí tuệ chuyên biệt như một chiến lược
Ember-1 là mô hình đầu tiên trong chuỗi dự kiến của Fireworks Research và nó xuất hiện cùng với Chỉ số Thông minh Chuyên biệt của công ty, một nỗ lực đo điểm chuẩn được giới thiệu vào đầu tháng này để so sánh các mô hình mở, đóng và chuyên biệt trong các nhiệm vụ trong thế giới thực do chuyên gia tạo ra.
Lối chơi chiến lược rất dễ đọc. Thay vì đào tạo một mô hình biên giới từ đầu, Fireworks đã sử dụng một mô hình trọng lượng mở mạnh mẽ, đào tạo hiệu quả của mã thông báo vào đó và hiện đang bán khả năng tương tự với chi phí cho mỗi nhiệm vụ thấp hơn. Khi các bản phát hành trọng lượng mở từ các phòng thí nghiệm như Moonshot tiếp tục thu hẹp khoảng cách về năng lực, các nhà cung cấp suy luận đang phát hiện ra rằng sự khác biệt lâu dài có thể nằm ở chi phí cho mỗi nhiệm vụ đã hoàn thành thay vì vị trí trên bảng xếp hạng — một sự thay đổi có lợi cho các công ty có cơ sở hạ tầng phục vụ và đào tạo mạnh mẽ.
Cần phải nêu rõ những lưu ý này: những con số trên đến từ blog riêng của Fireworks, những đánh giá của chính nó và những khách hàng trả tiền của chính nó. Việc sao chép độc lập việc tiết kiệm mã thông báo trên khối lượng công việc bên ngoài sẽ là thử nghiệm thực sự. Nhưng nếu kết quả đúng, cách hiệu quả nhất về mặt chi phí để vận hành một mô hình mở cấp biên giới có thể không còn là làm cho nó ít suy nghĩ hơn nữa - mà có thể là chạy một mô hình đã học cách suy nghĩ hiệu quả.
---
Nhận tin tức, phân tích và đột phá mới nhất về AI — tất cả ở cùng một nơi.
Đọc thêm tin tức về AI →