သေးငယ်သော်လည်း ထင်ရှားသော ပရောဂျက်တစ်ခုသည် ယခုသီတင်းပတ်တွင် Hacker News တွင် ပျံ့နှံ့နေသည်- AI အေးဂျင့်များမှ ဟာ့ဒ်ဝဲဒီဇိုင်းကို ကိုယ်တိုင်ထုတ်လုပ်ထားသည့် open-source AI အရှိန်မြှင့်စက် openTPU။ GitHub ပေါ်ရှိ Apache 2.0 လိုင်စင်အောက်တွင် ထုတ်ဝေထားသော သိုလှောင်မှုတွင် ၎င်း၏စာရေးဆရာများက "AI မှတီထွင်ထားသော open-source AI accelerator" ဟုခေါ်သည့်အရာကို ဖော်ပြသည် — ဤအမျိုးအစားရှိ သရုပ်ပြအများစုနှင့်မတူဘဲ ၎င်းသည် ဝါသနာရှင်များအဆုံးထိလေ့လာနိုင်သော ရုပ်ပိုင်းဆိုင်ရာကတ်တစ်ခုပေါ်တွင် ၎င်းတို့၏အစစ်အမှန်အလေးချိန်များဖြင့် ထုတ်လုပ်မှုမော်ဒယ်များကို လုပ်ဆောင်ထားသည်။

ပရောဂျက်သည် ၎င်း၏ကိုယ်ပိုင် README ၏ စကားလုံးများဖြင့် မေးခွန်းနှစ်ခုမေးသည်- AI အေးဂျင့်များသည် ဟာ့ဒ်ဝဲဒီဇိုင်းကို မည်မျှအထိ သွားနိုင်သနည်း၊ ၎င်းတို့သည် ၎င်းတို့၏ကိုယ်ပိုင် ကောက်ချက်ချသည့် ချစ်ပ်ကို တည်ဆောက်နိုင်ပါသလား။ ဒုတိယမေးခွန်းမှာ ဒေါသကြီးသည်။ ဆီလီကွန်ကို ဒီဇိုင်းထုတ်သည့် AI စနစ် — သို့မဟုတ် ဤအခြေအနေတွင်၊ ၎င်း၏ကိုယ်ပိုင်တိုကင်များကိုထုတ်ပေးသည့် FPGA bitstream — သည် စက်မှုလုပ်ငန်း၏စိတ်ကူးစိတ်သန်းရှိရာကို အတိအကျဖမ်းယူနိုင်သည့် ကွင်းဆက်တစ်ခုဖြစ်သည်။ For more context on this story, see our ongoing AI trends.

ကတ်ပေါ်တွင် အမှန်တကယ် အလုပ်လုပ်သည်

ဟာ့ဒ်ဝဲပစ်မှတ်သည် ဒေတာစင်တာ စံနှုန်းများဖြင့် ညစ်ညမ်းနေသည်- DDR3 ချန်နယ်နှစ်ခုနှင့် 17.1 GB/s အမြင့်ဆုံးမှတ်ဉာဏ် bandwidth ရှိသော Xilinx Kintex-7 xc7k480t FPGA ဝန်းကျင်တွင် တည်ဆောက်ထားသော Inspur YPCB-00338 ကတ်။ ၎င်းသည် HBM-stacked accelerator နှင့် ဝေးကွာနေသောကြောင့် ရလဒ်များကို ပို၍စိတ်ဝင်စားစရာကောင်းသည်၊ မနည်းလှပါ။

ပရောဂျက်၏ ထုတ်ပြန်ထားသော တိုင်းတာချက်များအရ ဒီဇိုင်းသည် ၎င်းတို့၏အစစ်အမှန်အလေးချိန်များဖြင့် ခေတ်မီအဖွင့်မော်ဒယ် ၁၀ ခုကို လုပ်ဆောင်သည်။ LFM2.5-230M သည် int8 တွင် တစ်စက္ကန့်လျှင် တိုကင် 59 ခုနှင့် 4-bit တွင် တစ်စက္ကန့်လျှင် တိုကင် 85.8 ကို ကုဒ်လုပ်သည်။ Qwen3-0.6B သည် တစ်စက္ကန့်လျှင် 21.6 တိုကင်များကို စီမံခန့်ခွဲနိုင်ပြီး အရွယ်အစားကြီးသော မော်ဒယ်များသည် မျှော်လင့်ထားသည့်အတိုင်း ကျဆင်းသွားသည်- SmolLM3-3B သည် တစ်စက္ကန့်လျှင် 5 တိုကင် int8 တွင် 5 တိုကင်၊ Phi-4-mini (3.8B) တွင် 4 နှင့် Qwen3.5-4B တို့သည် တစ်စက္ကန့်လျှင် 5.9 တိုကင်များ 4-bit တွင်ရှိသည်။ Gemma 4 E2B နှင့် E4B တို့သည် ၎င်းတို့၏ တစ်လွှာချင်းမြှုပ်ထားသော စားပွဲများကို ကတ်ပေါ်တွင် ထားရှိပေးသည်။

အဖွဲ့သည် ကတ်၏ 4 GiB DRAM ထက်ကျော်လွန်သော အရောအနှော-ကျွမ်းကျင်ပညာရှင်များ မော်ဒယ်များဖြင့် ဆက်လက်လုပ်ဆောင်ခဲ့သည်။ LFM2.5-8B-A1B — 1.7 ဘီလီယံ active ပါရှိသော 8.5 ဘီလီယံ ဘောင်များ — ကျွမ်းကျင်သူများ၏ 98.5% သည် on-card slots များကို ထိထိရောက်ရောက်အသုံးပြုပြီး 5.2 MB သာ တိုကင်တစ်ခုလျှင် 5.2 MB သာ လွှဲပြောင်းပေးပါသည်။ Qwen3.5-35B-A3B သည် PCIe တွင် တိုကင်တစ်ခုလျှင် 153 MB ထုတ်လွှင့်နေစဉ် တစ်စက္ကန့်လျှင် 3.95 တိုကင်များဖြင့် လုပ်ဆောင်သည်။ ဖွဲ့စည်းမှုတိုင်း၊ README သည် တိုကင်အတွက် ပရောဂျက်၏ simulator တိုကင်နှင့် ကိုက်ညီသည် — ဟာ့ဒ်ဝဲဟက်ကာများသည် အလုပ်၏ခက်ခဲသောအစိတ်အပိုင်းအဖြစ် အသိအမှတ်မပြုကြောင်း အနည်းငယ်တိကျမှုရှိသည်ဟု ဆိုထားသည်။

စစ်မှန်သော ဆီလီကွန်ပရောဂျက်ကဲ့သို့ တည်ဆောက်ထားသည်။

OpenTPU ကို ပုံမှန်ဝါသနာ FPGA သရုပ်ပြများနှင့် ပိုင်းခြားထားသည်မှာ stack ၏ ပြီးပြည့်စုံမှုဖြစ်သည်။ monorepo တွင် SystemVerilog ဟာ့ဒ်ဝဲဒီဇိုင်း၊ စိတ်ကြိုက်ညွှန်ကြားချက်အစုံ၊ အနည်းငယ်တိကျသော simulator၊ ၎င်း၏ကိုယ်ပိုင် compiler ပါသည့် kernel ဘာသာစကားနှင့် otpu-smi စောင့်ကြည့်ခြင်း utility တစ်ခုအပါအဝင် nvidia-smi နှင့် otpu-chat သရုပ်ပြသရုပ်ပြစနစ်အပါအဝင် PCIe ကတ်ကို မောင်းနှင်သည့် host software ပါရှိသည်။

ထုတ်လုပ်မှုပုံတွင် ကော်လံလေးခုပါ systolic matrix ယူနစ်နှင့် 133.33 MHz ရှိ stream engine တစ်ခုကို လုပ်ဆောင်ထားပြီး LiteDRAM memory controllers များကို memory core အတွင်းရှိ CPU ငယ်ဖြင့် ချိန်ညှိထားသည် — ကတ်သည် host ပါဝင်မှုမရှိဘဲ DDR3 လိုင်းနှစ်ခုလုံးကို 12 စက္ကန့်အတွင်း ချိန်ညှိပေးသည်။ အောက်တိုဘာလ 1 ရက်နေ့ကတည်းက စတင်အသုံးပြုခဲ့သော လက်ရှိတည်ဆောက်မှုသည် DRAM အသုံးပြုမှုကို အထွတ်အထိပ်သို့ 91-94 ရာခိုင်နှုန်းအထိ တွန်းအားပေးပြီး ယခင်ပုံထက် 8 မှ 10 ရာခိုင်နှုန်းအထိ မော်ဒယ်အများအပြားကို ကုဒ်နံပါတ်ကို ကုဒ်လုပ်ပါသည်။

ပရောဂျက်သည် အလေးချိန်တစ်ခုလျှင် 4.25 bits ဖြင့် အဆင့်နှစ်ဆင့်ပိတ်ဆို့စကေးများဖြင့် တည်ဆောက်ထားသော 4-bit အလေးချိန်ဖော်မတ်ကို မှတ်တမ်းတင်ထားပြီး ဘာသာစကား-မော်ဒယ်ခေါင်းကို တိကျမှုအတွက် int8 တွင် ထားရှိထားသည်။ ဖော်မတ်သည် တိုကင်တစ်ခုလျှင် bytes ကို အကြမ်းဖျင်းအားဖြင့် သုံးပုံတစ်ပုံခန့်ဖြတ်ပြီး အချို့မော်ဒယ်များတွင် ကုဒ်အမြန်နှုန်းကို 40 မှ 45 ရာခိုင်နှုန်းအထိ မြှင့်တင်ပေးသည်။

README သည် AI-မောင်းနှင်သော ဟာ့ဒ်ဝဲဗိသုကာရှာဖွေမှုအား စူးစမ်းလေ့လာသည့် အစောပိုင်းသိုလှောင်မှုဖြစ်သော အလိုအလျောက် Arch-tournament မှ သင်ခန်းစာများဆီသို့ ပရောဂျက်၏ချဉ်းကပ်ပုံကို ဂုဏ်ပြုပါသည်။ openTPU သည် ဟာ့ဒ်ဝဲကို မထိမီက အေးဂျင့်များ၏ ဒီဇိုင်းကို ဟာ့ဒ်ဝဲကို မထိမီက Simulator နှင့် သက်သေပြပြီး ပြီးပြည့်စုံသော အရှိန်မြှင့်စက်အတွက် ထိုနည်းလမ်း၏ အသုံးချမှုဖြစ်သည်။

##ဘာကြောင့်အရေးကြီးတာလဲ။

ဤနေရာတွင်စွမ်းဆောင်ရည်သည် Nvidia ကိုဒုက္ခပေးမည်မဟုတ်ပါ။ DDR3 ပါသော Kintex-7 သည် ဆယ်စုနှစ်တစ်ခုစာ သက်တမ်းရှိ ဟာ့ဒ်ဝဲအမျိုးအစားဖြစ်ပြီး ၎င်းအသုံးပြုသည့် မော်ဒယ်များသည် သေးငယ်သည်။ သို့သော် ၎င်းသည် ပရောဂျက်မှ သွယ်ဝိုက်ပြောဆိုသည့်အချက်ဖြစ်သည်- RTL၊ ညွှန်ကြားချက်အစုံ၊ Simulator၊ compiler နှင့် host stack တစ်ခုလုံးသည် လူတစ်ဦး၊ သိုလှောင်ခန်းတစ်ခုတွင် နားလည်နိုင်သည်၊ ၎င်းကို ဟာ့ဒ်ဝဲအဖွဲ့ထက် အနည်းဆုံး AI အေးဂျင့်များက ဒီဇိုင်းထုတ်ထားသည်။

ရေစီးကြောင်း သုံးခုသည် ထိုအတွေးတွင် ပေါင်းစပ်သွားလေသည်။ ပထမဦးစွာ၊ ကျွမ်းကျင်မှုလိုအပ်သော ကျယ်ကျယ်ပြန့်ပြန့်ရှိခြင်းကြောင့် open-source AI ဟာ့ဒ်ဝဲကို အချိန်အတော်ကြာအောင် မှေးမှိန်စေခဲ့သည်။ အေးဂျင့်မောင်းနှင်သော ဒီဇိုင်းစီးဆင်းမှုသည် ထိုအတားအဆီးကို လျော့နည်းစေသည်။ ဒုတိယအချက်၊ ကောက်ချက်ချမှုတောင်းဆိုမှုသည် သုတေသီများကို ထူးခြားဆန်းပြားသော အထူးရည်ရွယ်သည့် ဟာ့ဒ်ဝဲဆီသို့ တွန်းအားပေးနေပြီး အလိုအလျောက် ဒီဇိုင်းရှာဖွေမှုသည် ထိုနေရာကို စူးစမ်းရှာဖွေရန်အတွက် သဘာဝအတိုင်း သင့်လျော်မှုတစ်ခုဖြစ်သည်။ တတိယအချက်မှာ၊ ၎င်းတွင်လည်ပတ်နေသောစက်ကို AI တည်ဆောက်ခြင်း self-hosting ထောင့်သည် နာရီပိုင်းအတွင်း အချက်ပေါင်း 150 ကျော်ကို စုဆောင်းထားသည့် Hacker News တွင် ပရောဂျက်၏ အရှိန်အဟုန်ဖြင့် အရှိန်အဟုန်ဖြင့် အကဲဖြတ်သည့် အသိုင်းအဝိုင်းမှ အနီးကပ်စောင့်ကြည့်နေသည့် အချက်ပြမှုဖြစ်လာသည်။

သိုလှောင်မှုအား စက်တင်ဘာ 24 ရက်နေ့တွင် ဖန်တီးခဲ့ပြီး ၎င်း၏နောက်ဆုံးတွန်းအားကို အောက်တိုဘာလ 2 ရက်နေ့တွင် လက်ခံရရှိခဲ့ပြီး မကြာသေးမီက အောက်တိုဘာလ 1 ရက်စွဲဖြင့် တိုင်းတာသည့်ရလဒ်များ — ၎င်း၏ကိုယ်ပိုင်အခွင့်အရေးဖြင့် ကြည့်ရှုရကျိုးနပ်သည့် ဖွံ့ဖြိုးတိုးတက်မှုအရှိန်အဟုန်တစ်ခုဖြစ်သည်။ AI အရှိန်မြှင့်စက်သည် Python တွင် matrix များပြားခြင်းမှ ဝါယာကြိုးများအထိ AI အရှိန်မြှင့်လုပ်ဆောင်ပုံကို နားလည်လိုသူတိုင်းအတွက်၊ ပရောဂျက်၏ ကိုယ်ပိုင်ဘောင်သွင်းမှုသည် တိကျသည်- အရာအားလုံးသည် သင်အဆုံးထိဖတ်နိုင်သော monorepo အသေးတစ်ခုတွင် နေထိုင်ပါသည်။

အေးဂျင့်-ဒီဇိုင်းထုတ်ထားသော ဟာ့ဒ်ဝဲသည် လေးနက်သော နယ်ပယ်တစ်ခုဖြစ်လာသည်ဖြစ်စေ သို့မဟုတ် စူးစမ်းလေ့လာလိုစိတ်ရှိနေသည်ဖြစ်စေ openTPU သည် ခိုင်မာသည့်အရာတစ်ခုကို သရုပ်ပြခဲ့သည်- AI မော်ဒယ်များကို ဆော့ဖ်ဝဲလ်ရေးသားခွင့်ပေးသည့် ကိရိယာများသည် ယခု တူညီသော မော်ဒယ်များကို လုပ်ဆောင်သည့် အလုပ်ဖြစ်၊ အတည်ပြုထားသော ဟာ့ဒ်ဝဲစနစ်တစ်ခုကို ထုတ်လုပ်လိုက်ပြီဖြစ်သည်။ ကွင်းပတ်သည် အနည်းဆုံး FPGA အတိုင်းအတာဖြင့် ပိတ်ထားသည်။

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →