โครงการเล็กๆ แต่โดดเด่นกำลังเผยแพร่ใน Hacker News ในสัปดาห์นี้: openTPU ซึ่งเป็นตัวเร่ง AI แบบโอเพ่นซอร์สซึ่งมีการออกแบบฮาร์ดแวร์ที่ผลิตโดยตัวแทน AI พื้นที่เก็บข้อมูลซึ่งเผยแพร่ภายใต้ลิขสิทธิ์ Apache 2.0 บน GitHub อธิบายถึงสิ่งที่ผู้เขียนเรียกว่า "ตัวเร่ง AI แบบโอเพ่นซอร์สที่พัฒนาโดย AI" และแตกต่างจากการสาธิตส่วนใหญ่ในประเภทนี้ตรงที่มันรันโมเดลการผลิตจริงที่มีน้ำหนักจริงบนการ์ดจริงที่ผู้ที่ชื่นชอบสามารถศึกษาได้ตั้งแต่ต้นจนจบ

โครงการถามคำถามสองข้อตามคำพูดของ README: เจ้าหน้าที่ AI สามารถออกแบบฮาร์ดแวร์ได้ไกลแค่ไหน และพวกเขาสามารถสร้างชิปที่รันการอนุมานของตนเองได้หรือไม่ คำถามที่สองคือคำถามที่เร้าใจ ระบบ AI ที่ออกแบบซิลิคอน หรือในกรณีนี้คือบิตสตรีม FPGA ที่สร้างโทเค็นของตัวเอง นั้นเป็นวงจรที่รวบรวมทิศทางที่จินตนาการของอุตสาหกรรมกำลังมุ่งหน้าไป For more context on this story, see our ongoing artificial intelligence updates.

สิ่งที่ทำงานจริงบนการ์ด

เป้าหมายฮาร์ดแวร์ไม่สวยงามตามมาตรฐานศูนย์ข้อมูล: การ์ด Inspur YPCB-00338 ที่สร้างขึ้นโดยใช้ Xilinx Kintex-7 xc7k480t FPGA พร้อมช่อง DDR3 สองช่องและแบนด์วิดท์หน่วยความจำสูงสุด 17.1 GB/s นั่นยังห่างไกลจากตัวเร่งความเร็วแบบซ้อน HBM ซึ่งทำให้ผลลัพธ์น่าสนใจยิ่งขึ้นไม่น้อย

ตามการวัดที่เผยแพร่ของโครงการ การออกแบบใช้โมเดลเปิดที่ทันสมัยจำนวน 10 แบบพร้อมน้ำหนักจริง LFM2.5-230M ถอดรหัสที่ 59 โทเค็นต่อวินาทีใน int8 และ 85.8 โทเค็นต่อวินาทีใน 4 บิต Qwen3-0.6B จัดการโทเค็น 21.6 ต่อวินาที ในขณะที่โมเดลขนาดใหญ่ลดขนาดลงตามที่คาดไว้: SmolLM3-3B ที่ 5 โทเค็นต่อวินาที int8, Phi-4-mini (3.8B) ที่ 4 และ Qwen3.5-4B ที่ 5.9 โทเค็นต่อวินาทีใน 4 บิต Gemma 4 E2B และ E4B ยังทำงานอยู่ โดยคงตารางการฝังต่อชั้นไว้บนการ์ด

ทีมงานก้าวไปอีกขั้นด้วยโมเดลที่ผู้เชี่ยวชาญผสมผสานกันซึ่งเกิน 4 GiB ของ DRAM ของการ์ด LFM2.5-8B-A1B — พารามิเตอร์ 8.5 พันล้านพารามิเตอร์พร้อมการใช้งาน 1.7 พันล้านรายการ — ถอดรหัสที่ 10.6 โทเค็นต่อวินาทีโดยการสตรีมผู้เชี่ยวชาญจากที่เก็บข้อมูลโฮสต์ โดยผู้เชี่ยวชาญ 98.5 เปอร์เซ็นต์ใช้งานช่องบนการ์ดและมีการถ่ายโอนเพียง 5.2 MB ต่อโทเค็น Qwen3.5-35B-A3B ทำงานที่ 3.95 โทเค็นต่อวินาที ในขณะที่สตรีม 153 MB ต่อโทเค็นผ่าน PCIe การกำหนดค่าทุกรายการ README ระบุว่าตรงกับโทเค็นจำลองของโครงการสำหรับโทเค็น ซึ่งเป็นข้ออ้างที่แน่นอนเล็กน้อยว่าแฮกเกอร์ฮาร์ดแวร์จะรับรู้ว่าเป็นส่วนที่ยากของงานนี้

สร้างขึ้นเหมือนโครงการซิลิคอนจริง

สิ่งที่แยก openTPU จากการสาธิต FPGA สำหรับงานอดิเรกทั่วไปคือความสมบูรณ์ของสแต็ก monorepo ประกอบด้วยการออกแบบฮาร์ดแวร์ SystemVerilog, ชุดคำสั่งแบบกำหนดเอง, ตัวจำลองบิตที่แน่นอน, ภาษาเคอร์เนลพร้อมคอมไพเลอร์ของตัวเอง และซอฟต์แวร์โฮสต์ที่ขับเคลื่อนการ์ด PCIe รวมถึงยูทิลิตี้ตรวจสอบ otpu-smi ตามจิตวิญญาณของ nvidia-smi และการสาธิต otpu-chat

อิมเมจการผลิตรันยูนิตเมทริกซ์ซิสโตลิกสี่คอลัมน์และสตรีมเอ็นจิ้นที่ 133.33 MHz โดยมีตัวควบคุมหน่วยความจำ LiteDRAM ที่ได้รับการปรับเทียบโดย CPU ขนาดเล็กภายในแกนหน่วยความจำ — การ์ดจะปรับเทียบช่องสัญญาณ DDR3 ทั้งสองช่องใน 12 วินาทีโดยไม่ต้องเกี่ยวข้องกับโฮสต์ โครงสร้างปัจจุบันซึ่งปรับใช้ตั้งแต่วันที่ 1 ตุลาคม ถอดรหัสหลายรุ่นได้เร็วกว่าอิมเมจก่อนหน้า 8 ถึง 10 เปอร์เซ็นต์ ในขณะที่ผลักดันการใช้งาน DRAM ไปที่ 91-94 เปอร์เซ็นต์ของจุดสูงสุด

โปรเจ็กต์ยังบันทึกรูปแบบน้ำหนัก 4 บิตที่สร้างจากค่า FP4 พร้อมด้วยบล็อกสองระดับที่ 4.25 บิตต่อน้ำหนัก ทำให้ส่วนหัวของโมเดลภาษาอยู่ใน int8 เพื่อความแม่นยำ รูปแบบจะลดจำนวนไบต์ต่อโทเค็นประมาณหนึ่งในสามและเพิ่มความเร็วในการถอดรหัสขึ้น 40 ถึง 45 เปอร์เซ็นต์ในบางรุ่น

README ให้เครดิตแนวทางของโครงการกับบทเรียนจากพื้นที่เก็บข้อมูลก่อนหน้านี้ auto-arch-tournament ซึ่งสำรวจการค้นหาสถาปัตยกรรมฮาร์ดแวร์ที่ขับเคลื่อนด้วย AI openTPU คือการประยุกต์วิธีการดังกล่าวกับตัวเร่งความเร็วที่สมบูรณ์ โดยการออกแบบของเอเจนต์ได้รับการตรวจสอบเทียบกับเครื่องจำลองก่อนที่จะสัมผัสกับฮาร์ดแวร์

ทำไมมันถึงสำคัญ

ประสิทธิภาพที่นี่จะไม่สร้างปัญหาให้กับ Nvidia Kintex-7 พร้อม DDR3 เป็นฮาร์ดแวร์ระดับหนึ่งที่มีอายุหลายสิบปี และรุ่นที่รันนั้นมีขนาดเล็ก แต่นั่นคือจุดที่โปรเจ็กต์สร้างขึ้นโดยปริยาย: ตัวเร่งความเร็วทั้งหมด — RTL, ชุดคำสั่ง, ตัวจำลอง, คอมไพเลอร์ และสแต็กโฮสต์ — สามารถอ่านได้สำหรับหนึ่งคนในที่เก็บข้อมูลเดียว และได้รับการออกแบบอย่างน้อยบางส่วนโดยเอเจนต์ AI แทนที่จะเป็นทีมฮาร์ดแวร์

กระแสสามกระแสมาบรรจบกันในความคิดนั้น ประการแรก ฮาร์ดแวร์ AI แบบโอเพ่นซอร์สถูกขัดขวางมานานแล้วจากความเชี่ยวชาญที่จำเป็น ขั้นตอนการออกแบบที่ขับเคลื่อนโดยตัวแทนช่วยลดอุปสรรคดังกล่าว ประการที่สอง ความต้องการในการอนุมานกำลังผลักดันนักวิจัยไปสู่ฮาร์ดแวร์วัตถุประสงค์พิเศษที่แปลกใหม่ และการค้นหาการออกแบบอัตโนมัติก็เหมาะอย่างยิ่งสำหรับการสำรวจพื้นที่นั้น ประการที่สาม มุมมองการโฮสต์ด้วยตนเอง – AI สร้างเครื่องที่มันทำงาน – กลายเป็นสัญญาณที่ชุมชนจับตามองอย่างใกล้ชิด โดยตัดสินจากการเพิ่มขึ้นอย่างรวดเร็วของโครงการใน Hacker News ซึ่งรวบรวมมากกว่า 150 คะแนนภายในไม่กี่ชั่วโมง

พื้นที่เก็บข้อมูลถูกสร้างขึ้นเมื่อวันที่ 24 กันยายน และได้รับการผลักดันล่าสุดในวันที่ 2 ตุลาคม โดยมีผลการวัดวันที่ล่าสุดคือวันที่ 1 ตุลาคม ซึ่งเป็นก้าวการพัฒนาที่น่าจับตามองในตัวมันเอง สำหรับใครก็ตามที่ต้องการเข้าใจว่า AI Accelerator ทำงานอย่างไรตั้งแต่เมทริกซ์คูณใน Python ไปจนถึงสายไฟ การจัดเฟรมของโปรเจ็กต์นั้นแม่นยำ: สิ่งทั้งหมดอยู่ใน monorepo ขนาดเล็กตัวเดียวที่คุณสามารถอ่านได้ตั้งแต่ต้นจนจบ

ไม่ว่าฮาร์ดแวร์ที่ออกแบบโดยเอเจนต์จะกลายเป็นกลุ่มเฉพาะที่จริงจังหรือยังคงเป็นที่สนใจในการวิจัย openTPU ได้แสดงให้เห็นบางสิ่งที่เป็นรูปธรรม: เครื่องมือที่ช่วยให้โมเดล AI เขียนซอฟต์แวร์ได้ผลิตระบบฮาร์ดแวร์ที่ใช้งานได้และได้รับการตรวจสอบแล้วซึ่งใช้งานโมเดลเดียวกันเหล่านั้น ลูปปิด อย่างน้อยก็ในระดับ FPGA

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →