একটি ছোট কিন্তু আকর্ষণীয় প্রকল্প এই সপ্তাহে হ্যাকার নিউজে প্রচারিত হচ্ছে: openTPU, একটি ওপেন-সোর্স এআই অ্যাক্সিলারেটর যার হার্ডওয়্যার ডিজাইন নিজেই এআই এজেন্টরা তৈরি করেছে। GitHub-এ Apache 2.0 লাইসেন্সের অধীনে প্রকাশিত রিপোজিটরিটি বর্ণনা করে যে এর লেখকরা "এআই দ্বারা তৈরি একটি ওপেন-সোর্স AI অ্যাক্সিলারেটর" বলে অভিহিত করেছেন — এবং এই ধারার বেশিরভাগ ডেমোর বিপরীতে, এটি একটি শারীরিক কার্ডে তাদের আসল ওজন সহ বাস্তব উত্পাদন মডেলগুলি চালায় যা উত্সাহীরা শেষ পর্যন্ত অধ্যয়ন করতে পারে৷
প্রকল্পটি তার নিজস্ব README এর ভাষায় দুটি প্রশ্ন জিজ্ঞাসা করে: AI এজেন্টরা হার্ডওয়্যার ডিজাইনে কতদূর যেতে পারে এবং তারা কি তাদের নিজস্ব অনুমান চালাতে পারে এমন চিপ তৈরি করতে পারে? দ্বিতীয় প্রশ্নটি উত্তেজক। একটি AI সিস্টেম যা সিলিকন ডিজাইন করে — অথবা এই ক্ষেত্রে, FPGA বিটস্ট্রিম — যা নিজস্ব টোকেন তৈরি করে তা হল একটি লুপ যা শিল্পের কল্পনা ঠিক কোন দিকে যাচ্ছে তা ক্যাপচার করে৷ For more context on this story, see our ongoing more AI stories.
আসলে কার্ডে কি চলে
হার্ডওয়্যার টার্গেট ডাটা-সেন্টার স্ট্যান্ডার্ডের দ্বারা অপরূপ: একটি Inspur YPCB-00338 কার্ড একটি Xilinx Kintex-7 xc7k480t FPGA এর চারপাশে তৈরি করা হয়েছে দুটি DDR3 চ্যানেল এবং একটি 17.1 GB/s পিক মেমরি ব্যান্ডউইথ। এটি একটি এইচবিএম-স্ট্যাকড অ্যাক্সিলারেটর থেকে অনেক দূরে, যা ফলাফলগুলিকে আরও আকর্ষণীয় করে তোলে, কম নয়।
প্রকল্পের প্রকাশিত পরিমাপ অনুসারে, নকশাটি তাদের আসল ওজন সহ দশটি আধুনিক খোলা মডেল চালায়। LFM2.5-230M int8 এ প্রতি সেকেন্ডে 59 টোকেন এবং 4-বিটে প্রতি সেকেন্ডে 85.8 টোকেন ডিকোড করে। Qwen3-0.6B প্রতি সেকেন্ডে 21.6 টোকেন পরিচালনা করে, যখন বড় মডেলগুলি প্রত্যাশিত হিসাবে স্কেল করে: SmolLM3-3B প্রতি সেকেন্ডে 5 টোকেন int8, Phi-4-mini (3.8B) 4 এ এবং Qwen3.5-4B 4-বিটে প্রতি সেকেন্ডে 5.9 টোকেন। Gemma 4 E2B এবং E4Bও চলে, কার্ডে তাদের প্রতি-স্তর এম্বেডিং টেবিলের বাসিন্দা রেখে।
দলটি বিশেষজ্ঞদের মিশ্রণের মডেলগুলির সাথে আরও এগিয়ে গেছে যা কার্ডের 4 GiB DRAM-কে ছাড়িয়ে গেছে। LFM2.5-8B-A1B — 1.7 বিলিয়ন সক্রিয় সহ 8.5 বিলিয়ন প্যারামিটার — হোস্ট স্টোরেজ থেকে স্ট্রিমিং বিশেষজ্ঞদের দ্বারা প্রতি সেকেন্ডে 10.6 টোকেন ডিকোড করে, 98.5 শতাংশ বিশেষজ্ঞ অন-কার্ড স্লট ব্যবহার করে এবং প্রতি টোকেন প্রতি 5.2 MB স্থানান্তরিত হয়। Qwen3.5-35B-A3B প্রতি সেকেন্ডে 3.95 টোকেন এ চলে যখন PCIe এর উপর টোকেন প্রতি 153 MB স্ট্রিমিং করে। প্রতিটি কনফিগারেশন, README জানিয়েছে, টোকেনের জন্য প্রকল্পের সিমুলেটর টোকেনের সাথে মেলে — একটি বিট-সঠিকতা দাবি করে যে হার্ডওয়্যার হ্যাকাররা কাজের কঠিন অংশ হিসাবে স্বীকৃতি দেবে।
একটি বাস্তব সিলিকন প্রকল্পের মত নির্মিত
সাধারণ শখ FPGA ডেমো থেকে openTPU কে আলাদা করে তা হল স্ট্যাকের সম্পূর্ণতা। মনোরেপোতে রয়েছে SystemVerilog হার্ডওয়্যার ডিজাইন, একটি কাস্টম নির্দেশনা সেট, একটি বিট-সঠিক সিমুলেটর, একটি নিজস্ব কম্পাইলার সহ একটি কার্নেল ভাষা এবং হোস্ট সফ্টওয়্যার যা PCIe কার্ড চালায়, যার মধ্যে রয়েছে একটি otpu-smi মনিটরিং ইউটিলিটি nvidia-smi এবং একটি otpu-চ্যাট ডেমো।
প্রোডাকশন ইমেজটি একটি চার-কলামের সিস্টোলিক ম্যাট্রিক্স ইউনিট এবং 133.33 মেগাহার্টজ এ একটি স্ট্রিম ইঞ্জিন চালায়, মেমরি কোরের ভিতরে একটি ছোট CPU দ্বারা ক্যালিব্রেট করা LiteDRAM মেমরি কন্ট্রোলার সহ - কার্ডটি কোন হোস্ট জড়িত ছাড়াই 12 সেকেন্ডে উভয় DDR3 চ্যানেলকে ক্যালিব্রেট করে। বর্তমান বিল্ড, 1 অক্টোবর থেকে স্থাপন করা হয়েছে, বেশ কয়েকটি মডেলকে পূর্ববর্তী চিত্রের তুলনায় 8 থেকে 10 শতাংশ দ্রুত ডিকোড করে যখন DRAM ব্যবহারকে 91-94 শতাংশে ঠেলে দেয়।
প্রকল্পটি FP4 মানগুলির উপর নির্মিত একটি 4-বিট ওজন বিন্যাসকেও নথিভুক্ত করে যার প্রতি ওজন 4.25 বিট দুই-স্তরের ব্লক স্কেল রয়েছে, যা সঠিকতার জন্য ভাষা-মডেল প্রধানকে int8-এ রেখে। ফরম্যাটটি টোকেন প্রতি বাইট মোটামুটি এক তৃতীয়াংশ কম করে এবং কিছু মডেলে ডিকোড গতি 40 থেকে 45 শতাংশ বাড়িয়ে দেয়।
README পূর্ববর্তী সংগ্রহস্থল, অটো-আর্ক-টুর্নামেন্ট থেকে পাঠের জন্য প্রকল্পের পদ্ধতির কৃতিত্ব দেয়, যা এআই-চালিত হার্ডওয়্যার আর্কিটেকচার অনুসন্ধান অন্বেষণ করে। openTPU হল একটি সম্পূর্ণ এক্সিলারেটরে সেই পদ্ধতির প্রয়োগ, হার্ডওয়্যার স্পর্শ করার আগে এজেন্টদের নকশা একটি সিমুলেটরের বিরুদ্ধে বৈধ করা হয়।
কেন এটা গুরুত্বপূর্ণ
এখানে পারফরম্যান্স এনভিডিয়াকে কষ্ট দেবে না। DDR3 সহ একটি Kintex-7 হার্ডওয়্যারের একটি দশক-পুরাতন শ্রেণি, এবং এটি যে মডেলগুলি চালায় তা ছোট। কিন্তু প্রকল্পটি স্পষ্টভাবে এই পয়েন্টটি তৈরি করে: সম্পূর্ণ এক্সিলারেটর — RTL, নির্দেশ সেট, সিমুলেটর, কম্পাইলার এবং হোস্ট স্ট্যাক — একজন ব্যক্তির কাছে, একটি সংগ্রহস্থলে সুস্পষ্ট, এবং এটি হার্ডওয়্যার টিমের পরিবর্তে অন্তত আংশিকভাবে এআই এজেন্টদের দ্বারা ডিজাইন করা হয়েছিল।
সেই ধারণায় তিনটি স্রোত মিলিত হয়। প্রথমত, ওপেন-সোর্স এআই হার্ডওয়্যার দীর্ঘকাল ধরে প্রয়োজনীয় দক্ষতার প্রশস্ততা দ্বারা বাধাগ্রস্ত হয়েছে; একটি এজেন্ট-চালিত নকশা প্রবাহ সেই বাধাকে কমিয়ে দেয়। দ্বিতীয়ত, অনুমানের চাহিদা গবেষকদের বহিরাগত বিশেষ-উদ্দেশ্যের হার্ডওয়্যারের দিকে ঠেলে দিচ্ছে, এবং স্বয়ংক্রিয় নকশা অনুসন্ধান সেই স্থানটি অন্বেষণের জন্য একটি স্বাভাবিক উপযুক্ত। তৃতীয়ত, সেলফ-হোস্টিং অ্যাঙ্গেল — এআই যে মেশিনে এটি চালায় সেটি তৈরি করা — একটি সংকেত হয়ে উঠেছে সম্প্রদায় ঘনিষ্ঠভাবে দেখে, হ্যাকার নিউজে প্রকল্পের দ্রুত বৃদ্ধির দ্বারা বিচার করে, যেখানে এটি কয়েক ঘণ্টার মধ্যে 150 এর বেশি পয়েন্ট সংগ্রহ করেছে।
রিপোজিটরিটি 24 সেপ্টেম্বর তৈরি করা হয়েছিল এবং 2 অক্টোবরে এটির সর্বশেষ ধাক্কা পেয়েছে, যার পরিমাপ করা ফলাফলগুলি সম্প্রতি 1 অক্টোবর তারিখে করা হয়েছিল - এটি নিজের অধিকারে দেখার মতো একটি বিকাশের গতি। যে কেউ বুঝতে চায় কিভাবে একটি AI এক্সিলারেটর কিভাবে কাজ করে একটি ম্যাট্রিক্স থেকে পাইথনে তারের মধ্যে গুন করে, প্রকল্পের নিজস্ব ফ্রেমিং সঠিক: পুরো জিনিসটি একটি ছোট মনোরেপোতে থাকে আপনি শেষ থেকে শেষ পড়তে পারেন।
এজেন্ট-ডিজাইন করা হার্ডওয়্যার একটি গুরুতর কুলুঙ্গি হয়ে উঠুক বা একটি গবেষণার কৌতূহল রয়েই থাকুক, openTPU কিছু কিছু নির্দিষ্ট করে দেখিয়েছে: AI মডেলগুলিকে সফ্টওয়্যার লিখতে দেয় এমন সরঞ্জামগুলি এখন একটি কার্যকরী, যাচাইকৃত হার্ডওয়্যার সিস্টেম তৈরি করেছে যা একই মডেলগুলি চালায়৷ লুপ বন্ধ, অন্তত FPGA স্কেলে.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →