Phòng thí nghiệm AI Trung Quốc DeepSeek đã phát hành V4.1-Flash, một mô hình trọng lượng mở đa phương thức kết hợp nền tảng 552 tỷ tham số với một số tính năng nén bộ nhớ mạnh mẽ nhất từng được cung cấp trong hệ thống cấp cao nhất. Mô hình này đã đi vào hoạt động vào thứ Tư với giấy phép của MIT về Ôm mặt và một báo cáo kỹ thuật đi kèm, Reuters đưa tin, đưa tin về phòng thí nghiệm có trụ sở tại Hàng Châu.
Việc phát hành không chỉ là một phiên bản thông thường. DeepSeek đã đồng thời ngừng cấp V4 Pro hàng đầu của mình và TechNode đã báo cáo rằng các yêu cầu tới V4 Pro hiện đang được chuyển đến V4.1-Flash - một tuyên bố nổi bật về sự tin tưởng vào một mẫu máy mang tên "Flash" nhưng vẫn đăng số điểm chuẩn bằng hoặc cao hơn mẫu máy mà nó thay thế. For more context on this story, see our ongoing latest AI developments.
Một "Flash" lớn hơn với hóa đơn bộ nhớ nhỏ hơn
Theo thẻ mô hình chính thức, DeepSeek-V4.1-Flash là mô hình Hỗn hợp chuyên gia (MoE) với 552 tỷ thông số cơ bản cộng với thành phần bộ nhớ có điều kiện "Engram" gồm 196 tỷ tham số được truy cập thưa thớt thông qua tra cứu dựa trên mã thông báo. Bất chấp kích thước khổng lồ, mô hình này chỉ kích hoạt 8 tỷ tham số cho mỗi mã thông báo trong quá trình điền trước và 16 tỷ trong khi giải mã — ít tham số hoạt động hơn so với mô hình tiền thân có tham số 284B, chạy không đổi ở mức 13 tỷ.
Trọng tâm kiến trúc là thứ mà DeepSeek gọi là thiết kế Bộ giải mã-Bộ mã hóa Nhân quả (CED): Máy biến áp 40 lớp được chia thành bộ mã hóa nhân quả 20 lớp, sau đó là bộ giải mã 20 lớp. Vì bộ đệm KV toàn cầu của bộ giải mã được chiếu từ trạng thái ẩn của bộ mã hóa cuối cùng thay vì tích lũy từng lớp nên bộ nhớ cần thiết để duy trì các cuộc hội thoại dài sẽ giảm đáng kể.
Các số nén là tiêu đề. Với bộ nhớ đệm KV chính của FP4 ở định dạng E2M1, dung lượng bộ nhớ đệm KV toàn cầu giảm xuống 890 byte mỗi mã thông báo — gần bằng một phần tư DeepSeek-V4-Flash. Một kỹ thuật có tên là SWA Bounded Replay tái tạo lại các trạng thái chú ý bị thiếu bằng cách chỉ phát lại cửa sổ mã thông báo gần đây nhất, cắt bộ đệm KV liên tục xuống còn khoảng 1/8 so với mô hình Flash trước đó. Theo thẻ mẫu, mức giảm gần gấp bốn lần so với V4-Flash và 437 lần so với DeepSeek-V1. Các thành phần bổ sung bao gồm Chú ý thưa thớt nén 2 (CSA2), chỉ định cho mỗi lớp chú ý một trong ba chế độ tĩnh và giải mã suy đoán DSpark để tạo nhanh hơn.
Dưới lớp vỏ bọc, mỗi lớp MoE kết hợp một chuyên gia được chia sẻ với 384 chuyên gia được định tuyến, kích hoạt sáu chuyên gia được định tuyến trên mỗi mã thông báo.
Điểm chuẩn: Đi trước Flagship đã nghỉ hưu
Dựa trên các đánh giá mô hình cơ sở trong báo cáo kỹ thuật, V4.1-Flash vượt qua V4 Pro lớn hơn nhiều trong một số thử nghiệm chính: 74,1 trên MMLU-Pro so với 73,5, 79,4 trên HumanEval so với 76,8, 60,6 trên BigCodeBench và 93,0 trên GSM8K. Tờ South China Morning Post đưa tin rằng DeepSeek cho biết mô hình mới đánh bại Kimi K3 về các tiêu chuẩn mạng và mã hóa, một tuyên bố đáng chú ý trong lĩnh vực mô hình mở của Trung Quốc cũng bao gồm dòng GLM-5.3 của Z.ai và dòng Qwen của Alibaba.
Với nỗ lực lý luận tối đa, mô hình hướng dẫn đạt điểm 90,9 trên GPQA Diamond — ấn tượng, mặc dù vẫn đứng sau các hệ thống tiên phong hàng đầu được tham chiếu trong bảng so sánh của DeepSeek, GPT-5.6 Sol ở 94,1 và Claude Opus 5.0 ở 93,4. Kimi K3 ngồi ở vị trí 92,9. Thành thật mà nói: đây là một mô hình liền kề với mức giá mở, không phải là một cuộc quét sạch các phòng thí nghiệm đã đóng cửa.
V4.1-Flash cũng thực sự đa phương thức. Bộ mã hóa thị giác DeepSeek-ViT, được đào tạo từ đầu, cung cấp hình ảnh thông qua máy chiếu hai lớp và mô hình đã được đào tạo chung về văn bản và hình ảnh ngay từ khi bắt đầu đào tạo trước. Nó đạt 56,5 điểm trên MMMU-Pro và 95,6 trên DocVQA.
Được xây dựng cho đại lý, định giá theo số lượng
Các lựa chọn thiết kế giúp đối tượng mục tiêu hiểu rõ: khối lượng công việc tác nhân, trong đó các mô hình đọc được các bối cảnh rộng lớn và hành động trong tầm nhìn dài hạn. Mô hình này hỗ trợ các cửa sổ ngữ cảnh lên tới một triệu mã thông báo, được đào tạo trên kho ngữ liệu đa phương thức có 45 nghìn tỷ mã thông báo và cung cấp khả năng quay số nỗ lực lý luận có thể kiểm soát liên tục từ 1 đến 100 để đánh đổi chi phí suy luận theo độ chính xác. Phạm vi bảo hiểm của Bộ giải mã nhấn mạnh rằng việc tiết kiệm bộ nhớ đặc biệt làm giảm chi phí để chạy các tác nhân AI - khối lượng công việc dành nhiều thời gian để đọc đầu vào hơn là tạo ra đầu ra.
Phản ứng của cộng đồng đã được nhấn mạnh. Chủ đề ra mắt trên Hacker News đã thu hút hơn 650 điểm và một chủ đề trước đó có tiêu đề "DeepSeek ra mắt flash v4.1 rẻ hơn và mạnh mẽ hơn v4 pro" đã thu thập được gần 400 điểm nữa. Những người bình luận chạy mô hình cục bộ lưu ý rằng các tham số Engram thậm chí có thể được chuyển sang ổ SSD nhanh, mở ra con đường dẫn đến suy luận gần biên giới trên phần cứng của người tiêu dùng.
Seeking Alpha đã thẳng thắn đóng khung các cổ phần thương mại, gọi đây là mô hình chi phí cực thấp đặt ra thách thức cho các phòng thí nghiệm biên giới của Hoa Kỳ - một lời nhắc nhở rằng cuộc chiến về giá trong suy luận AI không có dấu hiệu hạ nhiệt.
Giây phút cân nhắc cho thông báo
Thời gian đang nói lên điều đó. Một ngày trước khi ra mắt, Reuters đưa tin rằng DeepSeek đã khai thác CITIC Securities để sắp xếp IPO trên Thị trường STAR của Thượng Hải, sau báo cáo trước đó rằng doanh thu của phòng thí nghiệm đã tăng gấp 10 lần so với khả năng niêm yết. Việc vận chuyển một mô hình mở thu hút sự chú ý vài ngày sau đó sẽ tiếp tục duy trì đà đó.
Việc phát hành cũng diễn ra trong bối cảnh các công ty AI Trung Quốc đang bị giám sát chặt chẽ. Đầu tuần này, các cơ quan của Hoa Kỳ bao gồm NSA, CISA và FBI đã nêu tên sáu công ty AI của Trung Quốc trong một lời khuyên về việc chắt lọc mô hình quy mô công nghiệp – một lời nhắc nhở rằng những thắng lợi về mặt kỹ thuật của DeepSeek giờ đây đã đến cùng với hành trang địa chính trị.
Không điều nào trong số đó làm lu mờ câu chuyện kỹ thuật. Với việc V4 Pro ngừng hoạt động và lưu lượng truy cập của nó được chuyển sang một mô hình rẻ hơn, mạnh hơn, DeepSeek đã đưa ra lập luận rõ ràng nhất có thể rằng vào năm 2026, ranh giới thú vị của AI có thể không chỉ là ai xây dựng mô hình lớn nhất — mà còn là ai phục vụ nhiều khả năng nhất trên mỗi gigabyte bộ nhớ.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →