রিয়েল-এসডব্লিউই নামে একটি নতুন বেঞ্চমার্ক চ্যালেঞ্জ করছে যে কীভাবে এআই শিল্প কোডিং ক্ষমতা পরিমাপ করে এবং প্রথম ফলাফলগুলি সীমান্ত ল্যাবগুলির জন্য নম্র। Anthropic's Fable 5.1, Claude Code harness এর ভিতরে চলমান, ব্যক্তিগত, বাস্তব-ওয়ার্ল্ড এন্টারপ্রাইজ কোডবেস থেকে টানা টাস্কগুলিতে 38.8% রেজোলিউশন রেট সহ বোর্ডের নেতৃত্ব দেয়। পরীক্ষা করা কোনো মডেল 40 শতাংশ ক্লিয়ার করে না।

নির্দিষ্ট ল্যাবস দ্বারা এই মাসে প্রকাশিত বেঞ্চমার্ক, প্রাইভেট প্রোডাকশন কোডবেসগুলিতে ফ্রন্টিয়ার এআই মডেলগুলি মূল্যায়ন করে যে দলটি আসল সংস্থাগুলি থেকে লাইসেন্স করেছে৷ এর নির্মাতারা যুক্তি দেন যে বিশেষজ্ঞ-উত্পাদিত বা সিন্থেটিক কাজগুলি, যদিও ভালভাবে ডিজাইন করা হয়েছে, প্রকৃত কোম্পানির প্রকৌশলীরা বাস্তবে যে কাজটি করে থাকেন তা মৌখিক কাজ নয়। For more context on this story, see our ongoing latest AI developments.

কেন ব্যক্তিগত কোডবেস ছবি পরিবর্তন করে

রিয়েল-এসডব্লিউই দুটি অক্ষের উপর SWE-বেঞ্চের মতো প্রতিষ্ঠিত বেঞ্চমার্ক থেকে আলাদা, এর লেখকদের মতে: অন্তর্নিহিত কোডিং আর্টিফ্যাক্ট এবং নির্দেশের নির্দিষ্টতা। প্রতিটি কাজ একটি মালিকানাধীন সিস্টেম থেকে আসে যার কোড এবং সমাধানগুলি পাবলিক ইন্টারনেটে পাওয়া যায় না, যার মানে এজেন্টরা পাবলিক রিপোজিটরি থেকে টানা মুখস্থ উত্তরগুলির উপর নির্ভর করতে পারে না।

কাজগুলি ব্যবসায়িক ফলাফলও বহন করে। বেঞ্চমার্কের উদাহরণের কাজগুলির মধ্যে রয়েছে বিলিং সঠিকভাবে নেওয়া, ট্যাক্স গণনা করা এবং গ্রাহকদের স্থানান্তর করা — এমন পরিবর্তনগুলি যা একটি ব্যবসা কীভাবে চলে তা প্রভাবিত করে, প্রায়শই একাধিক পরিষেবা জুড়ে। প্রতিটি কোম্পানির নিজস্ব নিয়মাবলী এবং কোড লেখার উপায় রয়েছে এবং এজেন্টদের অবশ্যই সেই নিয়মগুলি বুঝতে হবে এবং ইতিমধ্যে যা আছে তার সাথে কাজ করে এমন পরিবর্তন করতে হবে।

"কোডিং এজেন্ট কি আসলেই বাস্তব জগতে একজন সফটওয়্যার ইঞ্জিনিয়ারের কাজ করতে পারে?" বেঞ্চমার্ক এর ভূমিকা জিজ্ঞাসা. লিডারবোর্ড উত্তরটি প্রস্তাব করে, আপাতত: সর্বোত্তম সময়ের প্রায় এক তৃতীয়াংশ।

সম্পূর্ণ লিডারবোর্ড

নির্দিষ্ট ল্যাবগুলি আটটি ফ্রন্টিয়ার মডেল-এবং-হারনেস সমন্বয় মূল্যায়ন করেছে, 95 শতাংশ আত্মবিশ্বাসের ব্যবধান সহ, প্রতি টাস্ক প্রতি আটটি স্বাধীন রানের গড় হিসাবে পাস@1 হিসাবে রেজোলিউশনের হার পরিমাপ করেছে:

1. কথা 5.1 (ক্লড কোড) — 38.8%
2. GPT-6 Astra (Codex CLI) — 33.8%
3. মিথুন 3.8 ফ্ল্যাশ (মিথুন CLI) — 31.2%
4. GLM 5.3 (ক্লদ কোড) — 28.8%
5. (টাই) Grok 4.6 (Grok বিল্ড) — 23.8%
5. (টাই) মিউজ স্পার্ক 1.3 (মিউজ কোড) — 23.8%
7. কিমি K3 (কিমি কোড) — 18.8%
8. GPT-5.6 Sol (Codex CLI) — 16.2%

সপ্তাহান্তে হ্যাকার নিউজে ফলাফলগুলি ব্যাপকভাবে আলোচনা করা হয়েছিল, যেখানে বেঞ্চমার্ক কয়েকশত আপভোট এবং প্রাইভেট-কোডবেস মূল্যায়ন এজেন্টের অগ্রগতির জন্য সঠিক মাপকাঠি কিনা তা নিয়ে একটি প্রাণবন্ত বিতর্ক তৈরি করেছিল।

শীর্ষে একটি সংকীর্ণ কিন্তু অর্থপূর্ণ বিস্তার

বর্তমান প্রতিযোগিতামূলক ল্যান্ডস্কেপ সম্পর্কে এটি যা বলে তার জন্য শীর্ষ চারটি সিস্টেমের মধ্যে ব্যবধান উল্লেখযোগ্য। OpenAI-এর GPT-6 Astra-এর উপরে Fable 5.1-এর পাঁচ-পয়েন্ট লিড এমন একটি মাপকাঠিতে অর্থবহ যেখানে প্রতিটি কাজই প্রকৃত উৎপাদন সমস্যা। জেমিনি 3.8 ফ্ল্যাশ নেওয়া তৃতীয়টি আকর্ষণীয়, যেহেতু মডেলটি একটি দ্রুত, কম খরচের ওয়ার্কহরস হিসেবে ফ্ল্যাগশিপ রিজনিং সিস্টেমের পরিবর্তে অবস্থান করছে। Z.ai-এর GLM 5.3, ক্লাউড কোডের মাধ্যমে মূল্যায়ন করা, নেতার পাঁচটি পয়েন্টের মধ্যে অবতরণ করে বোঝায় যে কীভাবে প্রতিযোগিতামূলক ওপেন-ওয়েট মডেলগুলি ব্যবহারিক ইঞ্জিনিয়ারিং কাজে পরিণত হয়েছে।

সমানভাবে বলছে নীচের স্প্রেড. GPT-5.6 Sol, একটি আগের ওপেনএআই রিলিজ, Fable 5.1-এর তুলনায় অর্ধেকেরও কম কাজ সমাধান করে — সীমান্তটি কত দ্রুত সরে গেছে, এবং ড্রপ-অফ কতটা খাড়া হতে পারে তার একটি অনুস্মারক মাত্র একটি মডেল প্রজন্মের পিছনে।

হারনেসগুলি মডেলের মতোই গুরুত্বপূর্ণ

বেঞ্চমার্কের পদ্ধতিগত পছন্দগুলির মধ্যে একটি হল মনোযোগ আকর্ষণ করা: মডেলগুলিকে বিচ্ছিন্নভাবে মূল্যায়ন করার পরিবর্তে, বাস্তব-এসডব্লিউই নেটিভ হার্নেস ব্যবহার করে — ক্লড কোড, কোডেক্স সিএলআই, জেমিনি সিএলআই, গ্রোক বিল্ড — এন্টারপ্রাইজ ইঞ্জিনিয়াররা বাস্তবে কীভাবে কাজ করে তা প্রতিফলিত করতে। লিডারবোর্ড সুস্পষ্টভাবে মডেল-এবং-হার্নেস সংমিশ্রণগুলিকে র‌্যাঙ্ক করে, স্বীকার করে যে ভারা, টুল অ্যাক্সেস এবং পুনরাবৃত্তি লুপগুলি এখন বাস্তব স্থাপনার মডেল ক্ষমতা থেকে অবিচ্ছেদ্য।

এন্টারপ্রাইজ নির্বাচন করার সিস্টেমের জন্য যে ফ্রেমিং ব্যাপার। একই মডেল তার চারপাশে মোড়ানো এজেন্ট জোতাগুলির উপর নির্ভর করে খুব ভিন্নভাবে পারফর্ম করতে পারে এবং পাবলিক বেঞ্চমার্ক নম্বরগুলিতে কোডিং সহকারীর মূল্যায়নকারী ক্রেতারা তাদের নিজস্ব কোডবেসে কীভাবে সেই সিস্টেমগুলি আচরণ করবে তার একটি বিকৃত চিত্র পেতে পারে।

এটি শিল্পের জন্য কী বোঝায়

বেঞ্চমার্কগুলিকে বারবার স্যাচুরেশনের জন্য অভিযুক্ত করা হয়েছে, ফ্রন্টিয়ার মডেলগুলি পাবলিক পরীক্ষাগুলিতে প্রায় নিখুঁত স্কোর পোস্ট করে যা প্রশিক্ষণের ডেটাতে ফাঁস করে। রিয়েল-এসডব্লিউই-এর নকশা একই সাথে উভয় সমস্যা মোকাবেলা করার চেষ্টা করে: কোডটি ব্যক্তিগত এবং লাইসেন্সপ্রাপ্ত, কাজগুলি কর্মরত ইঞ্জিনিয়ারিং টিমের প্রকৃত কাজের পণ্য, এবং নির্দেশাবলী পালিশ সমস্যা বিবৃতির পরিবর্তে বাস্তব টিকিটের অগোছালো নির্দিষ্টতা প্রতিফলিত করে।

নিরঙ্কুশ টেকঅ্যাওয়ে হল পরম স্তর। এমনকি সর্বোত্তম সিস্টেম প্রথম প্রচেষ্টায় দশটি বাস্তব এন্টারপ্রাইজ টাস্কের মধ্যে চারটিরও কম সমাধান করে, গড়ে আট রানের বেশি। এজেন্টিক কোডিংয়ের সমস্ত অগ্রগতির জন্য, বেঞ্চমার্ক পরামর্শ দেয় যে বাস্তব উত্পাদন সিস্টেমে স্বায়ত্তশাসিত সফ্টওয়্যার ইঞ্জিনিয়ারিং একটি তত্ত্বাবধানে রয়ে গেছে - এমন একটি যেখানে মানব প্রকৌশলীরা বিক্রেতাদের ডেমোগুলির চেয়ে অনেক বেশি বার পর্যালোচনা, পুনর্নির্দেশ এবং মেরামত করে।

কোডিং সহকারীর মধ্যে থেকে বেছে নেওয়া উদ্যোগগুলির জন্য, বেঞ্চমার্ক একটি ব্যবহারিক চেকলিস্ট অফার করে: ব্যক্তিগত কোডে মূল্যায়ন করা সিস্টেমগুলিকে অগ্রাধিকার দেয়, একক-চালিত শিরোনাম সংখ্যার পরিবর্তে আত্মবিশ্বাসের ব্যবধানের উপর জোর দেয় এবং কাঁচা মডেলের ক্ষমতার মতো ওজন হারনেস গুণমান। Real-SWE-এর প্রথম লিডারবোর্ডটি শেষ শব্দ হবে না — তবে এটি এখনও পর্যন্ত প্রতিটি ইঞ্জিনিয়ারিং নেতা এজেন্টিক কোডিং সম্পর্কে জিজ্ঞাসা করছে এমন প্রশ্নের সবচেয়ে সরাসরি উত্তর।

কোডিং এজেন্ট, মডেল রিলিজ এবং তাদের গঠন করা গবেষণা সম্পর্কে আরও জানতে, বেঞ্চমার্ক ফলাফলের পরবর্তী রাউন্ডের হিসাবে সর্বশেষ AI সংবাদ অনুসরণ করুন।

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →