DeepSeek đã phát hành DSpark, một khung giải mã suy đoán nguồn mở mà công ty cho biết sẽ tăng tốc suy luận mô hình ngôn ngữ lớn (LLM) lên tới 85% trong lưu lượng truy cập trực tiếp mà không làm giảm chất lượng đầu ra. Được mô tả trong một bài báo mới của DeepSeek-AI và Đại học Bắc Kinh, hệ thống này đã chạy bên trong cơ sở hạ tầng phục vụ DeepSeek-V4 để xử lý các yêu cầu thực của người dùng.
Công việc này đã giải quyết một trong những vấn đề khó khăn nhất trong AI sản xuất: suy luận chậm do các mô hình tạo văn bản mỗi lần một mã thông báo, mỗi mã yêu cầu phải truyền toàn bộ qua mạng. Giải mã đầu cơ là một biện pháp khắc phục phổ biến trong đó một mô hình "bản nháp" nhỏ, nhanh đề xuất một khối mã thông báo mà mô hình kích thước đầy đủ sau đó sẽ xác minh trong một lần chuyển, chấp nhận tiền tố chính xác dài nhất. Bởi vì việc xác minh diễn ra song song và chính xác về mặt toán học nên nó tăng tốc mọi thứ trong khi vẫn duy trì sự phân bổ của mô hình ban đầu. DSpark, được phát hành cùng với kho đào tạo DeepSpec trên GitHub, nhanh chóng trở thành một trong những câu chuyện về kỹ thuật AI được thảo luận nhiều nhất trên Hacker News. For more context on this story, see our ongoing more AI stories.
Tại sao giải mã đầu cơ hiện tại lại gặp trở ngại
Nghiên cứu giải mã suy đoán gần đây đã chuyển sang "trình soạn thảo song song" tạo ra toàn bộ khối mã thông báo ứng cử viên trong một lần chuyển tiếp duy nhất, làm cho độ trễ của bản nháp gần như không phụ thuộc vào kích thước khối. Bài báo DSpark xác định hai điểm nghẽn đã ngăn cản các phương pháp này thực hiện đúng lời hứa trên quy mô lớn.
Đầu tiên là vấn đề chất lượng. Bởi vì những người soạn thảo song song dự đoán từng vị trí một cách độc lập nên họ không thể mô hình hóa cách các mã thông báo trong một khối phụ thuộc lẫn nhau. Các nhà nghiên cứu cho thấy điều này dẫn đến "va chạm đa phương thức" và sự phân rã chấp nhận nhanh chóng ở các vị trí sau trong khối dự thảo, một hiện tượng mà họ gọi là phân rã hậu tố. Khối song song càng dài thì đuôi của nó càng có nhiều khả năng bị sai.
Thứ hai là vấn đề ở cấp độ hệ thống. Mặc dù việc tạo các khối dự thảo dài rất rẻ nhưng việc xác minh một cách mù quáng mọi mã thông báo được đề xuất sẽ gây lãng phí dung lượng lô khan hiếm đối với các mã thông báo có khả năng bị từ chối. Dưới tính đồng thời cao của hệ thống phân phát thực tế, thời lượng xác minh lý tưởng thay đổi theo hai trục: các yêu cầu có cấu trúc như mã duy trì tỷ lệ chấp nhận cao hơn so với trò chuyện mở và việc xác minh các mã thông báo bổ sung gần như miễn phí khi tải nhẹ nhưng đắt tiền khi hệ thống bão hòa.
Mô hình dự thảo bán tự hồi quy
Để khắc phục sự phân rã hậu tố, DSpark áp dụng cái mà các tác giả gọi là kiến trúc bán tự hồi quy. Nó kết hợp một đường trục song song nặng về mặt tính toán, có thể đề xuất nhiều mã thông báo cùng một lúc, với một mô-đun tuần tự nhẹ giới thiệu mô hình phụ thuộc nội khối. Thiết kế này nhằm kết hợp công suất cao của các mô hình song song ở các vị trí ban đầu với sự gắn kết hậu tố của các trình soạn thảo tự hồi quy truyền thống, tạo ra các mã thông báo lần lượt và tôn trọng sự phụ thuộc một cách tự nhiên.
Trên các điểm chuẩn ngoại tuyến được kiểm soát bao gồm lý luận toán học, tạo mã và trò chuyện hàng ngày, nhóm báo cáo rằng DSpark cải thiện đáng kể độ dài được chấp nhận cho mỗi chu kỳ xác minh so với các đường cơ sở mạnh mẽ. Cụ thể, bài báo nêu rõ DSpark cải thiện độ dài được chấp nhận so với trình soạn thảo Eagle3 tự hồi quy lần lượt là 30,9%, 26,7% và 30,0% trên ba cài đặt và so với trình soạn thảo DFlash song song lần lượt là 16,3%, 18,4% và 18,3%.
Xác minh độ tin cậy theo lịch trình, nhận biết tải
Một nửa mới lạ hơn của DSpark là cách tiếp cận xác minh. Thay vì xác minh số lượng mã thông báo dự thảo cố định cho mỗi yêu cầu, DSpark hình thành việc lựa chọn độ dài xác minh như một vấn đề tối đa hóa thông lượng toàn cầu. Nó kết hợp các ước tính đã hiệu chỉnh về thời gian tồn tại của tiền tố của bản nháp, cái mà bài báo gọi là xác suất sống sót, với một bộ lập lịch nhận biết phần cứng để đọc tải động cơ theo thời gian thực.
Kết quả là xác minh theo lịch trình tin cậy: hệ thống tự động điều chỉnh số lượng mã thông báo mà nó xác minh cho mỗi yêu cầu dựa trên cả nội dung của yêu cầu và trạng thái hiện tại của công cụ phân phát. Trong điều kiện tải nhẹ, nó có thể đủ khả năng để xác minh một cách rộng rãi, trong khi ở mức độ đồng thời cao, nó chỉ chuyển ngân sách xác minh của mô hình mục tiêu tới các mã thông báo có lợi nhuận kỳ vọng cao nhất, tránh sự sụt giảm thông lượng do chi tiêu công suất hàng loạt cho các mã thông báo có xác suất thấp.
Kết quả theo lưu lượng truy cập người dùng trực tiếp
Những con số có hậu quả nhất đến từ sản xuất. Nhóm đã triển khai DSpark bên trong hệ thống phân phối DeepSeek-V4 phục vụ lưu lượng truy cập trực tiếp của người dùng và so sánh nó với đường cơ sở sản xuất trước đó của công ty, một phương pháp dự đoán nhiều mã thông báo được gọi là MTP-1.
Theo bài báo, DSpark liên tục tăng tốc độ tạo của mỗi người dùng từ 60% đến 85% đối với DeepSeek-V4-Flash và từ 57% đến 78% đối với DeepSeek-V4-Pro với tổng thông lượng phù hợp. Theo các thỏa thuận cấp độ dịch vụ nghiêm ngặt trong đó công suất cơ sở bị suy giảm nghiêm trọng, tương đương 120 mã thông báo mỗi giây đối với Flash và 50 mã thông báo mỗi giây đối với Pro, DSpark giảm thiểu chi phí xác minh để duy trì thông lượng mạnh mẽ. Bằng cách vượt qua vách đá hiệu suất đó, các tác giả cho rằng nó sẽ mở ra các cấp độ tương tác nghiêm ngặt mà trước đây không thể đạt được, chuyển dịch hiệu quả biên giới Pareto của LLM ra bên ngoài.
Sự khác biệt đó rất quan trọng đối với các nhà khai thác. Tốc độ cho mỗi người dùng nhanh hơn với cùng một tổng thông lượng có nghĩa là các trợ lý và quy trình làm việc tổng thể phản ứng nhanh hơn mà không cần mua thêm phần cứng, trong khi SLA có độ trễ nghiêm ngặt khi tải là điểm khác biệt giữa bản demo nghiên cứu với hệ thống có thể xử lý khi lưu lượng truy cập tăng đột biến.
Nguồn mở cho cộng đồng
DeepSeek đang phát hành các điểm kiểm tra DSpark đã được đào tạo cho cả hai mẫu xem trước DeepSeek-V4-Flash và DeepSeek-V4-Pro. Kho lưu trữ DeepSpec đi kèm, được xuất bản theo giấy phép MIT cho phép, được mô tả là một cơ sở mã đánh giá và đào tạo dựa trên thuật toán đầy đủ, dựa trên thuật toán để giải mã suy đoán. Nó bao gồm các tiện ích chuẩn bị dữ liệu, triển khai mô hình dự thảo, tập lệnh đào tạo và khai thác đánh giá, đồng thời cung cấp ba thuật toán mô hình dự thảo: DSpark, DFlash và Eagle3.
Bản phát hành này hạ thấp rào cản đối với các phòng thí nghiệm và nhóm cơ sở hạ tầng khác trong việc đào tạo và đánh giá các mô hình dự thảo của riêng họ dựa trên quy trình tiêu chuẩn hóa. Bộ đánh giá của DeepSpec bao gồm các tiêu chuẩn đã được thiết lập bao gồm GSM8K, MATH500, AIME 2025, HumanEval, MBPP, LiveCodeBench, MT-Bench, AlpacaEval và Arena-Hard-v2.
Tại sao nó lại quan trọng
Chi phí suy luận và độ trễ hiện nằm trong số những hạn chế xác định của ngành AI, định hình mọi thứ từ cách các công ty triển khai các tác nhân AI mạnh mẽ đến việc liệu các nhà cung cấp nhỏ hơn có thể cạnh tranh với các nhà cung cấp siêu quy mô về kinh tế đơn vị hay không. Đóng góp của DSpark không phải là một thuật toán mới mà là một minh chứng cho thấy việc đồng thiết kế cẩn thận mô hình dự thảo và bộ lập lịch xác minh, đồng thời coi thời lượng xác minh như một chức năng của trạng thái hệ thống trực tiếp, có thể thúc đẩy kim chỉ nam một cách có ý nghĩa trong quá trình triển khai thực tế.
Đối với DeepSeek, công ty đã tạo dựng được danh tiếng của mình trên các hệ thống được phát hành mở, hiệu quả, DSpark là một điểm dữ liệu khác trong lập luận mà phòng thí nghiệm đã đưa ra trong hơn một năm: rằng hiệu suất phân phát cấp cao nhất có thể đạt được thông qua kỹ thuật thông minh hơn thay vì chỉ thông qua tính toán thô. Thực tế là lợi nhuận được đo lường theo lưu lượng truy cập trực tiếp, thay vì theo điểm chuẩn tổng hợp, giúp các nhà khai thác khác dễ dàng xem xét kết quả một cách nghiêm túc hơn khi cộng đồng nguồn mở tiếp thu bài báo và bắt đầu tái tạo các con số.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →

