இந்த வாரம் ஹேக்கர் செய்திகளில் ஒரு சிறிய ஆனால் குறிப்பிடத்தக்க திட்டம் பரவுகிறது: openTPU, ஒரு திறந்த மூல AI முடுக்கி அதன் வன்பொருள் வடிவமைப்பு AI முகவர்களால் தயாரிக்கப்பட்டது. GitHub இல் Apache 2.0 உரிமத்தின் கீழ் வெளியிடப்பட்ட களஞ்சியம், அதன் ஆசிரியர்கள் "AI ஆல் உருவாக்கப்பட்ட ஒரு திறந்த மூல AI முடுக்கி" என்று விவரிக்கிறது - மேலும் இந்த வகையின் பெரும்பாலான டெமோக்களைப் போலல்லாமல், ஆர்வலர்கள் இறுதிவரை படிக்கக்கூடிய உடல் அட்டையில் உண்மையான தயாரிப்பு மாதிரிகளை இயக்குகிறது.
திட்டமானது அதன் சொந்த README இன் வார்த்தைகளில் இரண்டு கேள்விகளைக் கேட்கிறது: AI முகவர்கள் வன்பொருள் வடிவமைப்பில் எவ்வளவு தூரம் செல்ல முடியும், மேலும் அவர்கள் தங்கள் சொந்த அனுமானத்தை இயக்கும் சிப்பை உருவாக்க முடியுமா? இரண்டாவது கேள்வி ஆத்திரமூட்டும் கேள்வி. சிலிக்கானை வடிவமைக்கும் ஒரு AI அமைப்பு - அல்லது இந்த விஷயத்தில், FPGA பிட்ஸ்ட்ரீம் - அதன் சொந்த டோக்கன்களை உருவாக்குவது என்பது தொழில்துறையின் கற்பனை எங்கு செல்கிறது என்பதை சரியாகப் படம்பிடிக்கும் ஒரு வளையமாகும். For more context on this story, see our ongoing artificial intelligence updates.
கார்டில் உண்மையில் என்ன இயங்குகிறது
ஹார்டுவேர் இலக்கு தரவு மையத் தரநிலைகளின்படி அழகற்றது: இரண்டு DDR3 சேனல்கள் மற்றும் 17.1 GB/s பீக் மெமரி பேண்ட்வித் கொண்ட Xilinx Kintex-7 xc7k480t FPGA ஐச் சுற்றி உருவாக்கப்பட்ட Inspur YPCB-00338 அட்டை. இது HBM-அடுக்கப்பட்ட முடுக்கியிலிருந்து வெகு தொலைவில் உள்ளது, இது முடிவுகளை மிகவும் சுவாரஸ்யமாக்குகிறது, குறைவாக இல்லை.
திட்டத்தின் வெளியிடப்பட்ட அளவீடுகளின்படி, வடிவமைப்பு பத்து நவீன திறந்த மாதிரிகளை அவற்றின் உண்மையான எடையுடன் இயக்குகிறது. LFM2.5-230M int8 இல் வினாடிக்கு 59 டோக்கன்கள் மற்றும் 4-பிட்டில் வினாடிக்கு 85.8 டோக்கன்கள் என டிகோட் செய்கிறது. Qwen3-0.6B வினாடிக்கு 21.6 டோக்கன்களை நிர்வகிக்கிறது, அதே நேரத்தில் பெரிய மாடல்கள் எதிர்பார்த்தபடி குறைகின்றன: SmolLM3-3B வினாடிக்கு 5 டோக்கன்கள் int8, Phi-4-mini (3.8B) 4, மற்றும் Qwen3.5-4B 4-பிட்டில் வினாடிக்கு 5.9 டோக்கன்கள். Gemma 4 E2B மற்றும் E4B ஆகியவையும் இயங்குகின்றன, அவற்றின் ஒவ்வொரு அடுக்கு உட்பொதிப்பு அட்டவணைகளையும் அட்டையில் தங்கியிருக்கும்.
கார்டின் 4 GiB DRAM ஐத் தாண்டிய நிபுணர்களின் கலவை மாடல்களுடன் குழு மேலும் சென்றது. LFM2.5-8B-A1B — 1.7 பில்லியன் செயலில் உள்ள 8.5 பில்லியன் அளவுருக்கள் — ஹோஸ்ட் ஸ்டோரேஜில் இருந்து ஸ்ட்ரீமிங் நிபுணர்கள் மூலம் வினாடிக்கு 10.6 டோக்கன்களில் டிகோட் செய்யப்படுகிறது, 98.5 சதவீத வல்லுநர்கள் ஆன்-கார்டு ஸ்லாட்டுகளைத் தாக்கி ஒரு டோக்கனுக்கு 5.2 எம்பி மட்டுமே மாற்றுகிறார்கள். Qwen3.5-35B-A3B வினாடிக்கு 3.95 டோக்கன்களில் இயங்குகிறது, அதே நேரத்தில் PCIe மீது டோக்கனுக்கு 153 MB ஸ்ட்ரீமிங் செய்கிறது. ஒவ்வொரு உள்ளமைவும், README கூறுகிறது, டோக்கனுக்கான திட்டத்தின் சிமுலேட்டர் டோக்கனுடன் பொருந்துகிறது - வன்பொருள் ஹேக்கர்கள் வேலையின் கடினமான பகுதியாக அங்கீகரிப்பார்கள் என்பது ஒரு பிட்-சரியான கூற்று.
ஒரு உண்மையான சிலிக்கான் திட்டம் போல் கட்டப்பட்டது
வழக்கமான பொழுதுபோக்கு FPGA டெமோக்களிலிருந்து openTPU ஐ பிரிப்பது அடுக்கின் முழுமையாகும். மோனோரெப்போவில் SystemVerilog வன்பொருள் வடிவமைப்பு, தனிப்பயன் அறிவுறுத்தல் தொகுப்பு, ஒரு பிட்-எக்ஸாக்ட் சிமுலேட்டர், அதன் சொந்த கம்பைலருடன் கூடிய கர்னல் மொழி மற்றும் nvidia-smi மற்றும் otpu-chat டெமோவின் ஆவியில் உள்ள otpu-smi கண்காணிப்பு பயன்பாடு உட்பட PCIe கார்டை இயக்கும் ஹோஸ்ட் மென்பொருள் ஆகியவை உள்ளன.
உற்பத்திப் படம் நான்கு நெடுவரிசை சிஸ்டாலிக் மேட்ரிக்ஸ் யூனிட் மற்றும் 133.33 மெகா ஹெர்ட்ஸ் ஸ்ட்ரீம் எஞ்சினுடன் இயங்குகிறது, லைட் டிராம் மெமரி கன்ட்ரோலர்கள் மெமரி கோர் உள்ளே ஒரு சிறிய சிபியு மூலம் அளவீடு செய்யப்படுகிறது - கார்டு டிடிஆர்3 சேனல்கள் இரண்டையும் ஹோஸ்ட் ஈடுபாடு இல்லாமல் 12 வினாடிகளில் அளவீடு செய்கிறது. அக்டோபர் 1 முதல் பயன்படுத்தப்பட்ட தற்போதைய உருவாக்கம், முந்தைய படத்தை விட 8 முதல் 10 சதவீதம் வேகமாக பல மாடல்களை டிகோட் செய்கிறது, அதே நேரத்தில் DRAM பயன்பாட்டை 91-94 சதவீத உச்சத்திற்கு தள்ளுகிறது.
இந்தத் திட்டமானது FP4 மதிப்புகளில் கட்டமைக்கப்பட்ட 4-பிட் எடை வடிவமைப்பை ஆவணப்படுத்துகிறது, ஒரு எடைக்கு 4.25 பிட்கள் என்ற இரண்டு-நிலை பிளாக் ஸ்கேல்களுடன், மொழி-மாடல் தலையை துல்லியத்திற்காக int8 இல் வைத்திருக்கிறது. இந்த வடிவம் ஒரு டோக்கனுக்கு பைட்டுகளை மூன்றில் ஒரு பங்கு குறைக்கிறது மற்றும் சில மாடல்களில் டிகோட் வேகத்தை 40 முதல் 45 சதவீதம் வரை உயர்த்துகிறது.
AI- இயக்கப்படும் வன்பொருள் கட்டமைப்பு தேடலை ஆராய்ந்த முந்தைய களஞ்சியமான ஆட்டோ-ஆர்ச்-டோர்னமென்ட்டின் பாடங்களுக்கான திட்டத்தின் அணுகுமுறையை README வரவு வைக்கிறது. openTPU என்பது ஒரு முழுமையான முடுக்கிக்கு அந்த முறையின் பயன்பாடாகும், வன்பொருளைத் தொடுவதற்கு முன்பு முகவர்களின் வடிவமைப்பு சிமுலேட்டருக்கு எதிராக சரிபார்க்கப்பட்டது.
ஏன் இது முக்கியமானது
இங்கே செயல்திறன் என்விடியாவை தொந்தரவு செய்யாது. DDR3 உடன் Kintex-7 என்பது ஒரு தசாப்த கால பழமையான ஹார்டுவேர் வகுப்பாகும், மேலும் அது இயக்கும் மாதிரிகள் சிறியதாக இருக்கும். ஆனால் திட்டமானது மறைமுகமாகச் சொல்லும் புள்ளி இதுதான்: முழு முடுக்கி - RTL, அறிவுறுத்தல் தொகுப்பு, சிமுலேட்டர், கம்பைலர் மற்றும் ஹோஸ்ட் ஸ்டாக் - ஒருவருக்கு, ஒரு களஞ்சியத்தில் தெளிவாகத் தெரியும், மேலும் இது வன்பொருள் குழுவைக் காட்டிலும் AI முகவர்களால் ஒரு பகுதியாவது வடிவமைக்கப்பட்டுள்ளது.
அந்த யோசனையில் மூன்று நீரோட்டங்கள் ஒன்றிணைகின்றன. முதலாவதாக, திறந்த மூல AI வன்பொருள் நீண்ட காலமாக தேவைப்படும் நிபுணத்துவத்தின் பரந்த அகலத்தால் தடைபட்டுள்ளது; முகவர்-உந்துதல் வடிவமைப்பு ஓட்டம் அந்த தடையை குறைக்கிறது. இரண்டாவதாக, அனுமான தேவை ஆராய்ச்சியாளர்களை கவர்ச்சியான சிறப்பு நோக்கத்திற்கான வன்பொருளை நோக்கித் தள்ளுகிறது, மேலும் தானியங்கி வடிவமைப்பு தேடல் என்பது அந்த இடத்தை ஆராய்வதற்கான இயல்பான பொருத்தமாகும். மூன்றாவதாக, சுய-ஹோஸ்டிங் கோணம் - AI அது இயங்கும் இயந்திரத்தை உருவாக்குவது - சமூகம் உன்னிப்பாகக் கவனிக்கும் ஒரு சமிக்ஞையாக மாறியுள்ளது, இது ஹேக்கர் நியூஸில் திட்டத்தின் விரைவான உயர்வால் மதிப்பிடப்படுகிறது, இது மணிநேரங்களுக்குள் 150 புள்ளிகளுக்கு மேல் சேகரிக்கப்பட்டது.
இந்த களஞ்சியம் செப்டம்பர் 24 அன்று உருவாக்கப்பட்டது மற்றும் அக்டோபர் 2 அன்று அதன் சமீபத்திய உந்துதலைப் பெற்றது, அளவிடப்பட்ட முடிவுகள் அக்டோபர் 1 ஆம் தேதி வரை இருந்தன - இது அதன் சொந்த உரிமையில் பார்க்க வேண்டிய வளர்ச்சி வேகம். AI முடுக்கி எவ்வாறு செயல்படுகிறது என்பதைப் புரிந்து கொள்ள விரும்பும் எவருக்கும், பைத்தானில் உள்ள மேட்ரிக்ஸ் பெருக்கத்திலிருந்து கம்பிகள் வரை, திட்டத்தின் சொந்த ஃப்ரேமிங் துல்லியமானது: முழு விஷயமும் ஒரு சிறிய மோனோரெபோவில் வாழ்கிறது, நீங்கள் முடிவில் இருந்து இறுதிவரை படிக்கலாம்.
முகவர் வடிவமைத்த வன்பொருள் ஒரு தீவிரமான முக்கிய அம்சமாக மாறினாலும் அல்லது ஆராய்ச்சி ஆர்வமாக இருந்தாலும், openTPU உறுதியான ஒன்றை நிரூபித்துள்ளது: AI மாதிரிகள் மென்பொருளை எழுத அனுமதிக்கும் கருவிகள் இப்போது அதே மாதிரிகளை இயக்கும் வேலை செய்யும், சரிபார்க்கப்பட்ட வன்பொருள் அமைப்பை உருவாக்கியுள்ளன. லூப் மூடப்பட்டுள்ளது, குறைந்தபட்சம் FPGA அளவில்.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →