যখন OpenAI এই সপ্তাহে GPT-6 Astra উন্মোচন করেছে, তখন একটি ডেমো এমন দর্শকদের কাছ থেকে বিশেষ মনোযোগ আকর্ষণ করেছে যেটি খুব কমই ফ্রন্টিয়ার মডেল লঞ্চে চিৎকার করে: বৈদ্যুতিক প্রকৌশলী। লঞ্চ পোস্টে ওপেন-সোর্স ইলেকট্রনিক্স ডিজাইন টুল KiCad-এ একটি সার্কিট বোর্ড ডিজাইন করা মডেলটিকে দেখানো হয়েছে। তবে ইঞ্জিনিয়ারদের একটি ছোট দল একটি কঠিন প্রশ্ন জিজ্ঞাসা করছে - এআই মডেলগুলি ইলেকট্রনিক্স সফ্টওয়্যার পরিচালনা করতে পারে কিনা তা নয়, তবে তারা যে সার্কিটগুলি তৈরি করে তা আসলে কাজ করে কিনা।

তাদের উত্তরটি 4 সেপ্টেম্বর EEBench আকারে এসেছে, একটি নতুন পাবলিক বেঞ্চমার্ক যা মানুষের বিচারের পরিবর্তে নির্ধারক SPICE সিমুলেশন ব্যবহার করে AI- ডিজাইন করা সার্কিটকে গ্রেড করে। প্রাথমিক ফলাফলগুলি প্রস্তাব করে যে বর্তমান মডেলগুলি ইলেকট্রনিক্স সম্পর্কে তাদের আউটপুট যা সাধারণত দেখায় তার চেয়ে অনেক বেশি জানে, তবুও বাস্তব-বিশ্বের অংশের আচরণে ব্যর্থ হয় যা মানব প্রকৌশলীদেরও ট্রিপ দেয়। For more context on this story, see our ongoing AI news.

কেন সার্কিট ডিজাইনের নিজস্ব বেঞ্চমার্ক প্রয়োজন

EEBench টিম, যা eebench.org-এ বেঞ্চমার্ক প্রকাশ করে, বলে যে তার অভিজ্ঞতা দেখায় বর্তমান মডেলগুলি পাঠ্যপুস্তক, ডেটাশিট, অ্যাপ্লিকেশন নোট এবং বিপুল পরিমাণ কোড শোষণ করেছে। বটলনেক হল ইন্টারফেস। যখন একজন এজেন্ট KiCad-এর মতো একটি গ্রাফিকাল CAD টুল পরিচালনা করে, তখন এটি মেনুতে ক্লিক করতে এবং স্ক্রীনে যা আছে তা ট্র্যাক করতে তার অনেক প্রচেষ্টা ব্যয় করে, বৈদ্যুতিক যুক্তির পরিবর্তে স্থানাঙ্ক এবং অ্যাপ্লিকেশন অবস্থার সাথে এর প্রসঙ্গ উইন্ডো ব্যবহার করে।

EEBench একটি ভিন্ন পদ্ধতি গ্রহণ করে। বেঞ্চমার্কের সার্কিটগুলি অ্যাটোপিলে লেখা হয়, এমন একটি ভাষা যা ইলেকট্রনিক্সকে ঘোষণামূলক কোড হিসাবে বর্ণনা করে, তাই এজেন্ট সরাসরি উপাদান, সংযোগ এবং সীমাবদ্ধতার উপর কাজ করে। মডেলটি একটি নকশা পরিবর্তন করতে পারে, এটি তৈরি করতে পারে, একটি সিমুলেশন চালাতে পারে এবং প্রকল্পটি না রেখে ব্যর্থতাগুলি পরিদর্শন করতে পারে। দলের মতে, এটি একটি মডেলকে একটি GUI-তে লাইন আঁকতে বলার চেয়ে অনেক ভাল কাজ করে - এবং এটি কম্পিউটার-ব্যবহারের দক্ষতার পরিবর্তে বেঞ্চমার্ক পরীক্ষা ইলেকট্রনিক্স জ্ঞানের অনুমতি দেয়।

বাস্তব অংশ, বাস্তব ব্যর্থতা

একটি পাবলিক টাস্ক একটি আবাসিক শক্তি মিটার থেকে টানা হয়। যখন এর 5-ভোল্ট সরবরাহ অদৃশ্য হয়ে যায়, সার্কিটটিকে অবশ্যই প্রসেসরটিকে আরও 20 মিলিসেকেন্ডের জন্য জীবিত রাখতে হবে যাতে এটি জমা পড়া রিডিংগুলি সংরক্ষণ করতে পারে, সুরক্ষিত রেলটি পুরো সময় প্রসেসরের 3.0-ভোল্ট ব্রাউনআউট থ্রেশহোল্ডের উপরে থাকে।

বেশিরভাগ মডেল, টিম রিপোর্ট, অবিলম্বে সঠিক ভিত্তি উপসংহারে পৌঁছান: একটি ক্যাপাসিটর যোগ করুন। বেঞ্চমার্ক এটি শোনার চেয়ে কঠিন করে তোলে। একটি সত্যিকারের সিরামিক ক্যাপাসিটর তার বিজ্ঞাপিত ক্যাপাসিট্যান্সের চেয়ে অনেক কম সরবরাহ করতে পারে একবার এটি জুড়ে ভোল্টেজ প্রয়োগ করা হলে, অংশগুলি সহনশীলতা বহন করে, এবং অতিরিক্ত ক্যাপাসিট্যান্স খরচ যোগ করে, স্থান নেয় এবং বিদ্যুৎ ফেরার সময় রেলের রিচার্জকে ধীর করে দেয়।

গ্রেডাররা একটি জমা পড়ে যা পাঠ্যপুস্তকের উত্তর এবং কাজের হার্ডওয়্যারের মধ্যে ব্যবধানকে চিত্রিত করে। একটি নকশা নামমাত্র 22 মাইক্রোফ্যারাড নির্দিষ্ট করে - একটি মান যা কাগজে যথেষ্ট দেখায়। কিন্তু 4.7 ভোল্টের পক্ষপাতিত্বে, গ্রেডারটি কার্যকর ক্যাপাসিট্যান্সের মাত্র 11.4 মাইক্রোফ্যারাড পরিমাপ করেছে, যা টাস্কের 545-মাইক্রোফ্যারাড প্রয়োজনীয়তার চেয়ে অনেক কম। উত্স কোড সফলভাবে নির্মিত হয়েছে. সার্কিটটি এখনও ব্যর্থ হয়েছে: সিমুলেশন দেখায় যে সুরক্ষিত রেলটি 3-ভোল্টের প্রয়োজনের নিচে পড়ে মাত্র 0.85 মিলিসেকেন্ড পরে, প্রয়োজনীয় 20 এর কাছাকাছি কোথাও নেই।

কঠিন কাজগুলো আরও ঠেলে দেয়। একটি এনালগ অ্যাসাইনমেন্টের জন্য একটি অপ-অ্যাম্পের চারপাশে একটি মাল্টিপল-ফিডব্যাক লো-পাস ফিল্টার সংশ্লেষিত করা প্রয়োজন, প্রয়োজনীয় খুঁটির জন্য প্রতিরোধক এবং ক্যাপাসিটর অনুপাত সমাধান করা এবং প্রতিটি উপাদানকে সবচেয়ে খারাপ-কেস সহনশীলতার কোণে ঠেলে দেওয়া হলেও লাভ, কাটঅফ ফ্রিকোয়েন্সি এবং Q সীমার মধ্যে রাখা প্রয়োজন।

কিভাবে গ্রেডিং কাজ করে

EEBench চেক সম্পূর্ণরূপে নির্ধারক. জোতা জমা দেওয়া নকশা তৈরি করে, সার্কিট গ্রাফ এবং উপকরণের বিল তৈরি করে এবং SPICE সিমুলেশন এবং ডিজাইন চেকগুলির একটি সেট চালায়, প্রতিটি প্রয়োজনীয়তা একটি সাংখ্যিক সীমার বিপরীতে একটি পরিমাপ তৈরি করে। কার্যগুলি উপাদান-সহনশীলতার কোণে লাভ, থ্রেশহোল্ড, লহর, ক্ষণস্থায়ী প্রতিক্রিয়া এবং আচরণ পরিমাপ করে। প্রযুক্তিগত স্কোরটি উপকরণের একটি রেফারেন্স বিলের বিপরীতে একটি খরচ-দক্ষতা পরিমাপের সাথে একত্রিত হয় - যদিও সার্কিট কাজ করার পরে খরচ শুধুমাত্র সাহায্য করে।

দলটি একটি কোডিং এজেন্টকে একটি কম্পাইলার এবং একটি পরীক্ষা স্যুট দেওয়ার সাথে সেটআপের তুলনা করে, পরীক্ষাগুলি ভোল্টেজ এবং উপাদানের আচরণ পরিমাপ করে। সংস্করণ 1-এর সমস্ত কাজ বাস্তব প্রস্তুতকারকের অংশগুলি ব্যবহার করে, ডেটাশিট থেকে বের করা স্পেসিফিকেশন সহ এবং সিমুলেশন মডেলগুলিতে নিয়ে যাওয়া হয়, এজেন্টকে এমন সমন্বয়গুলি খুঁজে পেতে বাধ্য করে যা বিদ্যমান, অর্ডার করা যেতে পারে এবং যুক্তিসঙ্গত মূল্য দেওয়া হয়।

প্রথম লিডারবোর্ড

1 সেপ্টেম্বরের ফলাফল 13টি টাস্কে 61.6% সহ EEBench V1-এর শীর্ষে Claude Opus 5-কে রাখে। Grok 4.6 57.1% এ দ্বিতীয় হয়েছে, 56.4% এ Claude Fable 5.1 থেকে ঠিক এগিয়ে। Claude Fable 5 54.3% এবং Claude Opus 4.8 Max 51.4% স্কোর করেছে। দলটি নোট করেছে যে কয়েক মাস আগে এটি আশা করেনি যে মডেলগুলি এই ভাল পারফর্ম করবে।

একটি ফলাফল দলটিকে বিশেষভাবে খুশি করেছে: xAI গ্রোক 4.6 মডেল কার্ডে EEBench অন্তর্ভুক্ত করেছে, 3D মডেলিং এবং প্যারামেট্রিক CAD মূল্যায়নের পাশাপাশি ইঞ্জিনিয়ারিং ত্বরণের একটি বিভাগে। xAI-এর নিজস্ব প্রকাশিত রান উচ্চ যুক্তির প্রচেষ্টায় 60.0% এ Grok 4.6 স্কোর করেছে। xAI-এর লঞ্চ সামগ্রী অনুসারে, মডেলটি কম্পিউটার-সহায়ক ডিজাইন সহ ডোমেন-নির্দিষ্ট পরিবেশে উচ্চ-মানের ইঞ্জিনিয়ারিং ডেটা এবং শক্তিবৃদ্ধি শেখার প্রশিক্ষণ পেয়েছে।

এখন পর্যন্ত ওপেনএআই-এর পরীক্ষিত মডেলগুলি সারণীতে আরও নিচে বসেছে: GPT-5.5 স্কোর করেছে 42.3% এবং GPT-5.6 Sol 39.4%। এখনও পর্যন্ত কোন GPT-6 Astra ফলাফল নেই — একটি উল্লেখযোগ্য ফাঁক প্রদত্ত যে মডেলের KiCad ডেমো নতুন করে মনোযোগ আকর্ষণ করেছে৷ বেঞ্চমার্কের লিডারবোর্ড, পদ্ধতি এবং নমুনা ফলাফল এক্সপ্লোরার সবই সর্বজনীন, এবং ল্যাবগুলি তাদের নিজস্ব মডেল চালাতে পারে।

এটা কি পরিমাপ করে না — এখনো

EEBench V1 শুধুমাত্র সিমুলেশনের মাধ্যমে এনালগ এবং ডিজিটাল ডিজাইন কভার করে। এটি এখনও পরীক্ষা করে না যে একটি মডেল একটি ফিজিক্যাল বোর্ড স্থাপন করতে পারে, এটি তৈরি করতে পারে বা একটি সমাপ্ত পণ্য আনতে পারে - পর্যায় যেখানে সম্পূর্ণ নতুন ব্যর্থতার মোডগুলি উপস্থিত হয়। দলটি বলেছে যে তারা সেই পর্যায়গুলি পরে যুক্ত করতে চায়, তবে প্রয়োজনীয়-ডিজাইন-যাচাইকরণ লুপের উপর দৃষ্টি নিবদ্ধ করা সংস্করণ 1 কারণ সেখানেই দরকারী ইঞ্জিনিয়ারিং কাজ ইতিমধ্যেই উদ্দেশ্যমূলকভাবে গ্রেড করা যেতে পারে।

তবুও, বেঞ্চমার্ক একটি বলার মুহুর্তে অবতরণ করে। একটি ফ্রন্টিয়ার ল্যাব এখন এটিকে একটি মডেল কার্ডে উদ্ধৃত করে, ডেমো লঞ্চ করে ইলেকট্রনিক্সকে সামনের পৃষ্ঠায় রাখে, এবং শীর্ষ স্কোর - 61.6% - দেখায় যে মডেলগুলি নির্ভরযোগ্য থেকে দূরে থাকাকালীন অর্থপূর্ণভাবে সক্ষম হচ্ছে৷ বৈদ্যুতিক প্রকৌশলীদের জন্য, প্রথম EEBench ফলাফলের বার্তাটি পরিমাপ করা হয়: AI ক্রমবর্ধমানভাবে কাগজে সার্কিট ডিজাইন করতে পারে। তারা প্রকৃত অংশের সাথে যোগাযোগ রক্ষা করে কিনা তা খুঁজে বের করার জন্য এই বেঞ্চমার্কটি বিদ্যমান।

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →