Một dự án nguồn mở ít được biết đến có tên Strata sắp ra mắt. Công cụ được MIT cấp phép, chạy Qwen3.8-Flash-Next của Alibaba — một mô hình gồm 125 tỷ thông số gồm các chuyên gia — trên các PC chơi game thông thường, đã xuất hiện trên trang nhất của Hacker News vào ngày 4 tháng 10 với hơn 640 điểm và kho lưu trữ GitHub của nó đã thu thập được hơn 11.000 sao kể từ khi nó được tạo ra vào ngày 24 tháng 9.
Ý tưởng rất đơn giản: một mô hình gồm 125 tỷ tham số thường tồn tại trên máy chủ có thể trò chuyện, viết mã, đọc hình ảnh và điều khiển các tác nhân mã hóa hoàn toàn trên card đồ họa tiêu dùng mà không cần rời khỏi máy.
Strata thực sự làm gì
Strata vừa là công cụ suy luận vừa là trình cài đặt chỉ bằng một cú nhấp chuột cho Windows và Linux. Theo tài liệu của nó, các yêu cầu rất khiêm tốn so với tiêu chuẩn của mô hình biên giới: GPU có ít nhất 12GB VRAM từ dòng RTX 20, 30, 40 hoặc 50 của NVIDIA hoặc dòng Radeon RX 6000, 7000 hoặc 9000 của AMD, ít nhất 32GB RAM hệ thống và khoảng 80GB dung lượng SSD trống.
Công cụ này cung cấp các phiên bản lượng tử hóa của Qwen3.8-Flash-Next ở một số mức nén, từ Q2_0 đến IQ3_S, cùng với một biến thể mã chuyên dụng. Nó hiển thị các API tương thích với OpenAI và Anthropic trên localhost, nghĩa là các công cụ được xây dựng cho ChatGPT hoặc Claude – bao gồm các tác nhân mã hóa như Claude Code, Cursor và Codex – có thể được trỏ đến máy chủ cục bộ với những thay đổi tối thiểu. Đầu vào hình ảnh tùy chọn và hỗ trợ đa GPU được bao gồm và trình cài đặt thậm chí còn cung cấp chế độ thiết lập được hỗ trợ bởi AI cho phép trợ lý mã hóa định cấu hình máy từ một lời nhắc được dán.
Những con số về tốc độ
Điểm chuẩn được công bố của dự án, được đo trên hai máy tính để bàn của người tiêu dùng, là lý do khiến bản phát hành lan rộng. Trên NVIDIA RTX 5070 với 12GB VRAM được ghép nối với Ryze 5 7600 và 64GB RAM, Strata báo cáo:
- Lượng tử hóa Q2_0: 94 mã thông báo mỗi giây để tạo và 2.650 mã thông báo mỗi giây để xử lý kịp thời trên tài liệu mã thông báo 32K
- IQ3_S: 53 token mỗi thế hệ thứ hai, 1.620 token mỗi giây xử lý nhanh chóng
- Biến thể bộ mã hóa: 55 mã thông báo mỗi thế hệ thứ hai
Về phía AMD, RX 9070 XT với 16GB VRAM quản lý 60 mã thông báo mỗi giây ở Q2_0. Tài liệu ước tính rằng RTX 3090 với 24GB VRAM sẽ đạt 100 đến 140 mã thông báo mỗi giây — nhanh hơn mức hầu hết mọi người có thể đọc.
Để so sánh, sáu tháng trước, việc chạy ngay cả một mô hình dày đặc 70 tỷ tham số cục bộ ở tốc độ có thể sử dụng được cũng cần một máy trạm có hàng trăm gigabyte bộ nhớ hợp nhất hoặc các thủ thuật giải mã suy đoán tích cực.
Tại sao Model 125B lại phù hợp với thẻ chơi game
Hai phần công nghệ có thể làm được điều này. Đầu tiên là bản thân mô hình. Như AI Buzz Wire đã đề cập khi phát hành, Qwen3.8-Flash-Next là kiến trúc kết hợp giữa các chuyên gia với tổng số khoảng 125 tỷ tham số nhưng chỉ có khoảng 6 tỷ hoạt động trên mỗi mã thông báo — vì vậy, mỗi từ được tạo sẽ chạm vào một phần nhỏ của mạng, cắt giảm đáng kể khả năng tính toán trên mỗi mã thông báo.
Thứ hai là lượng tử hóa. Các cài đặt trước nhanh nhất của Strata nén trọng số của mô hình xuống còn hai hoặc ba bit cho mỗi tham số, đánh đổi một số độ chính xác để lấy dấu chân phù hợp với GPU 12GB và RAM hệ thống. Sự cân bằng đó là sự cảnh báo chính: lượng tử cấp Q2 và cấp IQ2 làm suy giảm chất lượng một cách có thể đo lường được đối với các tác vụ nặng về lý luận và người mua nên coi các con số tốc độ tiêu đề là điểm khởi đầu thay vì đảm bảo cho mọi khối lượng công việc. Các trang điểm chuẩn cộng đồng trong kho lưu trữ theo dõi kết quả chất lượng ở mọi kích cỡ.
Một phần của làn sóng AI địa phương lớn hơn
Strata xuất hiện trong bối cảnh động lực suy luận cục bộ đang tăng tốc. Dòng sản phẩm Qwen của Alibaba đã trở thành dòng mô hình mở được tải xuống nhiều nhất, Meta và Google có các mô hình cạnh tranh nguồn mở của riêng họ và một làn sóng công cụ hiện cho phép người tiêu dùng chạy các trợ lý có khả năng mà không cần đăng ký hoặc dữ liệu rời khỏi thiết bị của họ.
Dự án cũng phản ánh định nghĩa về "phần cứng tiêu dùng" đang thay đổi như thế nào. Một card đồ họa tầm trung 2026 với 12GB VRAM, được sản xuất chủ yếu để chơi game, hiện là một công cụ tăng tốc suy luận khả thi cho một mô hình thuộc lớp kích thước đã xác định các hệ thống biên giới chỉ hai năm trước.
Strata vẫn là phần mềm ban đầu — công cụ theo dõi vấn đề của kho lưu trữ ghi lại những điểm chưa hoàn thiện trên các GPU cũ hơn và bộ xử lý không phải AVX2 — nhưng dự án được MIT cấp phép, miễn phí và được phát triển dưới dạng mở, với sự hỗ trợ thử nghiệm cho Intel Arc, thẻ Tesla và Radeon cũ hơn cũng như các thiết bị đa GPU được các thành viên cộng đồng ghi lại.
Đối với các nhà phát triển, điều rút ra thực tế nhất có thể là khả năng tương thích API localhost: bất kỳ tập lệnh hoặc tác nhân nào được viết dựa trên OpenAI hoặc SDK Anthropic đều có thể được chuyển hướng đến triển khai Qwen cục bộ bằng cách thay đổi URL cơ sở, biến Strata thành một tùy chọn ít ma sát cho nguyên mẫu nhạy cảm với quyền riêng tư, sử dụng ngoại tuyến hoặc đơn giản là giới hạn chi tiêu API.
Cách dùng thử
Bắt đầu không yêu cầu phiên cuối cùng với sách hướng dẫn. Trình cài đặt cung cấp trình điều khiển, trọng lượng mô hình và máy chủ cục bộ trong một lượt và kho lưu trữ bao gồm tệp thiết lập được thiết kế để dán trực tiếp vào trợ lý mã hóa AI, sau đó trợ lý này sẽ tự động định cấu hình máy. Lần khởi chạy đầu tiên chậm hơn trong khi trọng lượng tải từ đĩa; tài liệu đề xuất sử dụng ổ SSD và cảnh báo rằng các cuộc hội thoại dài sẽ chuyển nhiều công việc hơn vào RAM hệ thống.
Đi trước AITheo dõi AI Buzz Wire để biết thông tin mới nhất về các mô hình nguồn mở, công cụ AI cục bộ và phần cứng suy luận.
Đọc thêm tin tức về AI →