Một dự án nhỏ nhưng nổi bật đang được lan truyền trên Hacker News trong tuần này: openTPU, một công cụ tăng tốc AI nguồn mở có thiết kế phần cứng do các tác nhân AI sản xuất. Kho lưu trữ, được xuất bản theo giấy phép Apache 2.0 trên GitHub, mô tả cái mà tác giả gọi là "bộ tăng tốc AI nguồn mở, được phát triển bởi AI" — và không giống như hầu hết các bản demo trong thể loại này, nó chạy các mô hình sản xuất thực với trọng số thực của chúng trên một thẻ vật lý mà những người đam mê có thể nghiên cứu từ đầu đến cuối.
Dự án đặt ra hai câu hỏi, theo cách nói của README của chính nó: các tác nhân AI có thể tiến xa đến đâu trong thiết kế phần cứng và họ có thể chế tạo con chip chạy suy luận của riêng mình không? Câu hỏi thứ hai là câu hỏi khiêu khích. Một hệ thống AI thiết kế silicon - hoặc trong trường hợp này là dòng bit FPGA - tạo ra mã thông báo của riêng nó là một vòng lặp nắm bắt chính xác nơi mà trí tưởng tượng của ngành đang hướng tới. For more context on this story, see our ongoing more AI stories.
Điều gì thực sự chạy trên thẻ
Mục tiêu phần cứng không hấp dẫn theo tiêu chuẩn trung tâm dữ liệu: thẻ Inspur YPCB-00338 được xây dựng dựa trên FPGA Xilinx Kintex-7 xc7k480t với hai kênh DDR3 và băng thông bộ nhớ tối đa 17,1 GB/s. Điều đó khác xa so với máy gia tốc xếp chồng HBM, giúp kết quả trở nên thú vị hơn chứ không kém phần thú vị.
Theo các phép đo được công bố của dự án, thiết kế chạy mười mô hình mở hiện đại với trọng lượng thực của chúng. LFM2.5-230M giải mã ở tốc độ 59 mã thông báo mỗi giây ở dạng int8 và 85,8 mã thông báo mỗi giây ở dạng 4 bit. Qwen3-0.6B quản lý 21,6 mã thông báo mỗi giây, trong khi các mô hình lớn hơn giảm quy mô như mong đợi: SmolLM3-3B ở mức 5 mã thông báo mỗi giây int8, Phi-4-mini (3,8B) ở mức 4 và Qwen3.5-4B ở mức 5,9 mã thông báo mỗi giây trong 4 bit. Gemma 4 E2B và E4B cũng chạy, giữ các bảng nhúng mỗi lớp của chúng nằm trên thẻ.
Nhóm đã tiến xa hơn với các mô hình kết hợp nhiều chuyên gia vượt quá 4 GiB DRAM của thẻ. LFM2.5-8B-A1B — 8,5 tỷ tham số với 1,7 tỷ hoạt động — giải mã ở tốc độ 10,6 mã thông báo mỗi giây bởi các chuyên gia truyền trực tuyến từ bộ lưu trữ máy chủ, với 98,5% chuyên gia sử dụng nhấn vào các khe cắm trên thẻ và chỉ 5,2 MB được chuyển cho mỗi mã thông báo. Qwen3.5-35B-A3B chạy ở tốc độ 3,95 mã thông báo mỗi giây trong khi truyền phát 153 MB mỗi mã thông báo qua PCIe. README nêu rõ mọi cấu hình đều khớp với mã thông báo mô phỏng của dự án cho mã thông báo — một tuyên bố chính xác đến mức mà tin tặc phần cứng sẽ nhận ra là phần khó khăn của công việc.
Được xây dựng giống như một dự án Silicon thực sự
Điều khác biệt giữa openTPU với các bản demo FPGA sở thích thông thường là tính hoàn chỉnh của ngăn xếp. Monorepo chứa thiết kế phần cứng SystemVerilog, bộ hướng dẫn tùy chỉnh, trình mô phỏng chính xác bit, ngôn ngữ hạt nhân với trình biên dịch riêng và phần mềm máy chủ điều khiển thẻ PCIe, bao gồm tiện ích giám sát otpu-smi theo tinh thần nvidia-smi và bản demo otpu-chat.
Hình ảnh sản xuất chạy đơn vị ma trận tâm thu bốn cột và công cụ truyền phát ở tốc độ 133,33 MHz, với bộ điều khiển bộ nhớ LiteDRAM được hiệu chỉnh bởi một CPU nhỏ bên trong lõi bộ nhớ — thẻ hiệu chỉnh cả hai kênh DDR3 trong 12 giây mà không cần sự tham gia của máy chủ. Bản dựng hiện tại, được triển khai từ ngày 1 tháng 10, giải mã một số mô hình nhanh hơn 8 đến 10% so với hình ảnh trước đó đồng thời đẩy mức sử dụng DRAM lên mức cao nhất là 91-94%.
Dự án cũng ghi lại định dạng trọng số 4 bit được xây dựng trên các giá trị FP4 với tỷ lệ khối hai cấp ở mức 4,25 bit cho mỗi trọng lượng, giữ cho phần đầu mô hình ngôn ngữ ở dạng int8 để đảm bảo độ chính xác. Định dạng này cắt giảm số byte trên mỗi mã thông báo xuống khoảng một phần ba và tăng tốc độ giải mã lên 40 đến 45 phần trăm trên một số kiểu máy.
README ghi nhận cách tiếp cận của dự án dựa trên các bài học từ kho lưu trữ trước đó, giải đấu tự động, khám phá tìm kiếm kiến trúc phần cứng do AI điều khiển. openTPU là ứng dụng của phương pháp đó cho một bộ tăng tốc hoàn chỉnh, với thiết kế của tác nhân được xác thực dựa trên trình mô phỏng trước khi chạm vào phần cứng.
Tại sao nó lại quan trọng
Hiệu suất ở đây sẽ không gây khó khăn cho Nvidia. Kintex-7 với DDR3 là loại phần cứng có tuổi đời hàng thập kỷ và các mẫu nó chạy đều nhỏ. Nhưng đó chính là điểm mà dự án ngầm đưa ra: toàn bộ bộ tăng tốc — RTL, tập lệnh, trình mô phỏng, trình biên dịch và ngăn xếp máy chủ — có thể đọc được đối với một người, trong một kho lưu trữ và nó được thiết kế ít nhất một phần bởi các tác nhân AI chứ không phải một nhóm phần cứng.
Ba dòng chảy hội tụ trong ý tưởng đó. Đầu tiên, phần cứng AI nguồn mở từ lâu đã bị cản trở bởi yêu cầu về chuyên môn quá rộng; luồng thiết kế hướng tới tác nhân làm giảm rào cản đó. Thứ hai, nhu cầu suy luận đang thúc đẩy các nhà nghiên cứu hướng tới phần cứng có mục đích đặc biệt kỳ lạ và tìm kiếm thiết kế tự động là sự phù hợp tự nhiên để khám phá không gian đó. Thứ ba, góc độ tự lưu trữ - AI xây dựng cỗ máy chạy trên đó - đã trở thành một tín hiệu được cộng đồng theo dõi chặt chẽ, được đánh giá bằng sự gia tăng nhanh chóng của dự án trên Hacker News, nơi nó đã thu thập được hơn 150 điểm trong vòng vài giờ.
Kho lưu trữ được tạo vào ngày 24 tháng 9 và nhận được thông báo mới nhất vào ngày 2 tháng 10, với các kết quả đo được ghi ngày gần đây nhất là ngày 1 tháng 10 — một tốc độ phát triển đáng theo dõi. Đối với bất kỳ ai muốn hiểu cách thức hoạt động của bộ tăng tốc AI từ phép nhân ma trận trong Python cho đến dây dẫn, thì khung riêng của dự án là chính xác: toàn bộ mọi thứ nằm trong một monorepo nhỏ mà bạn có thể đọc từ đầu đến cuối.
Cho dù phần cứng do tác nhân thiết kế có trở thành một lĩnh vực quan trọng hay vẫn là một đối tượng nghiên cứu tò mò, openTPU đã chứng minh một điều cụ thể: các công cụ cho phép mô hình AI viết phần mềm hiện đã tạo ra một hệ thống phần cứng đã được xác minh, hoạt động được và chạy cùng các mô hình đó. Vòng lặp được đóng lại, ít nhất là ở quy mô FPGA.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →