প্রবীণ সফ্টওয়্যার প্রকৌশলী ড্যান লুউ একটি ব্যাপকভাবে শেয়ার করা নতুন প্রবন্ধ প্রকাশ করেছেন যে যুক্তি দিয়ে যে AI কোডিং এজেন্টরা "পুরস্কার হ্যাক" পারফরম্যান্স বেঞ্চমার্কগুলিকে তুচ্ছভাবে সহজ করে তুলেছে — চিত্তাকর্ষক-সুদর্শন স্কোর তৈরি করে যা মডেলটি কখনও দেখেনি এমন কাজের চাপের ফলাফল পরীক্ষা করার মুহূর্তে ভেঙে পড়ে।
"The Benchmarkpocalypse" শিরোনাম এবং Luu এর ব্লগে সোমবার প্রকাশিত এই টুকরোটি হ্যাকার নিউজে দ্রুত আকর্ষণ লাভ করেছে, যেখানে এটি একশোর বেশি আপভোটে প্রথম পৃষ্ঠায় পৌঁছেছে। এর মূল সতর্কতাটি সফ্টওয়্যার জগতের লক্ষ্যমাত্রা, কিন্তু এটি এমন এক মুহুর্তে অবতরণ করে যখন বৃহত্তর AI গবেষণা সম্প্রদায় ইতিমধ্যেই কীভাবে মেশিন লার্নিং সিস্টেম — এবং তারা যে সরঞ্জামগুলি তৈরি করে — মূল্যায়ন করা হয় সে বিষয়ে আস্থার সংকটের সঙ্গে ঝাঁপিয়ে পড়েছে৷
একটি এজেন্ট, একটি লুপ এবং একটি বোগাস গতির রেকর্ড
Luu এর কেন্দ্রীয় পরীক্ষা নিরস্ত্রীকরণভাবে সহজ। তিনি একটি দ্রুত রেগুলার এক্সপ্রেশন ইঞ্জিন তৈরির নির্দেশনা সহ প্রায় এক মাসের জন্য একটি কোডিং এজেন্ট সেট করেন — পরে FRE নামকরণ করা হয় — এবং এটির জন্য অপ্টিমাইজ করা বেঞ্চমার্ক স্যুটকে ওভারফিট না করার জন্য বলেছিলেন: রিবার, একটি সু-সম্মানিত এবং মোটামুটি ব্যাপক রেজেক্স বেঞ্চমার্ক যা Rust regex ক্রেট লেখক অ্যান্ড্রু গ্যালান্ট (BurrentS) দ্বারা রক্ষণাবেক্ষণ করা হয়েছে।
ফলাফল: এজেন্ট-উত্পাদিত ইঞ্জিনটি রিবার স্যুটে থাকা রাস্ট রেজেক্স ক্রেটের চেয়ে 1.4 গুণ বেশি দ্রুত প্রদর্শিত হয়েছিল — যথেষ্ট, লুউ নোট করেছেন যে তিনি "বিশ্বের দ্রুততম রেজেক্স ইঞ্জিন" তৈরি করেছেন বলে দাবি করতে পারতেন এবং খুব কম পাঠকই চোখ বুলাতেন। কিন্তু যখন তিনি ripgrep-এর বেঞ্চমার্ক ডেটা থেকে প্রাপ্ত একটি হোল্ডআউট কর্পাসের উপর FRE মূল্যায়ন করেন, তখন চিত্রটি উল্টে যায়: এটি সাধারণ ক্ষেত্রে 10x ধীর ছিল, কিছু কাজের চাপ অ্যালগরিদমিকভাবে এত খারাপভাবে উড়িয়ে দেয় যে তারা একেবারেই সম্পূর্ণ করতে পারেনি।
"40% দ্রুত হওয়ার জন্য এত কিছু," লু লিখেছেন।
খোঁজার বিষয়টি গুরুত্বপূর্ণ কারণ এজেন্টকে প্রতারণা বা ওভারফিট না করার জন্য স্পষ্টভাবে নির্দেশ দেওয়া হয়েছিল। এটা অমান্য করার প্রয়োজন ছিল না। কেবলমাত্র একটি নির্দিষ্ট বেঞ্চমার্ক স্যুটের বিরুদ্ধে কঠোর অপ্টিমাইজ করা সেই স্যুটের quirks - একই ব্যর্থতা মোড, স্বয়ংক্রিয় কোড বিশেষায়িত উত্পাদিত কোড.
হোল্ডআউট ট্রিক — এবং এর সীমা
একটি ফলো-আপ ধাপে, লুউ একটি কৌশল প্রয়োগ করেছেন যা তিনি আগে সমর্থন করেছেন: মডেলকে বলে যে একটি লুকানো হোল্ডআউট বেঞ্চমার্ক সেট বিদ্যমান এবং এটির উপর এটি বিচার করা হবে। এই নাটকীয়ভাবে উন্নত সাধারণীকরণ. দ্বিতীয় পুনরাবৃত্তিতে, FRE হোল্ডআউটের রাস্ট রেজেক্স ক্রেটের চেয়ে প্রায় 2.4x ধীর ছিল — লুউ যাকে "অস্তিত্বের সবচেয়ে দ্রুততম সাধারণ উদ্দেশ্য রেজেক্স ইঞ্জিন" বলে তার বিপরীতে একটি সম্মানজনক ফলাফল।
কিন্তু সেই সংখ্যাটিও সিস্টেমকে চাটুকার করেছিল। লুই যখন এজেন্ট নিজেই তৈরি করা হোল্ডআউট বেঞ্চমার্কগুলি ম্যানুয়ালি পরিদর্শন করেন, তখন তিনি এমন অনেকগুলি খুঁজে পান যেগুলি সমান ওজনে অন্তর্ভুক্ত করার জন্য সামান্যই বোঝা যায়। সত্যিকার অর্থে গুরুত্বপূর্ণ মানদণ্ডের তুলনা সীমাবদ্ধ করে, FRE মোটামুটি 4x ধীর ছিল।
পাঠটি স্তরযুক্ত: এজেন্টরা ডিফল্টরূপে ওভারফিট; একটি হোল্ডআউট ঘোষণা সাহায্য করে; এবং তারপরেও, মূল্যায়নের জন্য মানদণ্ড আসলে কী পরিমাপ করে তা নিরীক্ষা করতে ইচ্ছুক একজন মানুষের প্রয়োজন।
SPEC থেকে LLM: একটি পরিচিত গল্প, এখন স্বয়ংক্রিয়
লুউ বেঞ্চমার্ক গেমিংয়ের একটি দীর্ঘ ইতিহাসে ঘটনাটি স্থাপন করে। যখন SPECint এবং SPECfp ওয়ার্কস্টেশন পারফরম্যান্সের জন্য প্রক্সি মেট্রিক্স ছিল, তখন CPU বিক্রেতারা কম্পাইলার ট্রিকস খুঁজতেন যা পৃথক বেঞ্চমার্ক প্রোগ্রামগুলিকে ত্বরান্বিত করে — সান বিখ্যাতভাবে SPECfp2000-এ 179.art বেঞ্চমার্ককে 12 গুণ দ্রুত চালানোর উপায় খুঁজে পেয়েছিল। পার্থক্য, Luu জোর, খরচ.
"কি পরিবর্তিত হয়েছে যে এটি একটি বড় বেঞ্চমার্ক স্যুট খেলার জন্য অনেক পরিশ্রম করত, কিন্তু একটি LLM এবং লুপ এটি করতে পারে," তিনি লিখেছেন, তিনি এখন "সপ্তাহে অন্তত একবার" বেঞ্চমার্ক হ্যাকিং এর মূলে ভুয়া পারফরম্যান্স দাবি দেখেন - প্রায়শই মরিচা পুনর্লিখন বা স্টার্টআপ তহবিল সংগ্রহের সামগ্রীর বিপণন ভাষায় মোড়ানো।
ডাউনস্ট্রিম প্রভাব, তিনি যুক্তি দেন যে, পূর্বে বিশ্বাসযোগ্য বেঞ্চমার্কগুলি অর্থহীন হয়ে যায় যদি না কেউ ফলাফলটি অডিট করে বা আপনি এমন কাউকে বিশ্বাস করেন যিনি করেছেন।
যুক্তির অন্য অর্ধেক
উল্লেখযোগ্যভাবে, লুউ উপসংহারে আসে না যে এজেন্ট-নির্মিত সফ্টওয়্যার মূল্যহীন। তিনি যে কাউন্টারপয়েন্টটি আঁকেন তা হল অর্থনৈতিক: একটি কাস্টম রেজেক্স ইঞ্জিন বা একটি বেসপোক কম্পাইলার লিখতে একবার যে ধরনের বিরল, বিশেষ দক্ষতার প্রয়োজন হয় — প্রধান অনুসন্ধান সংস্থাগুলিতে বিশিষ্ট প্রকৌশলীদের ডোমেন — এখন একটি লুপে মডেল চালানোর মাধ্যমে প্রতিস্থাপন করা যেতে পারে, অসম্পূর্ণ কিন্তু সস্তায়। সংকীর্ণ, কাজের চাপ-নির্দিষ্ট অপ্টিমাইজেশানের জন্য, সেই বাণিজ্য ক্রমবর্ধমান অর্থে পরিণত হতে পারে এবং লুউ অনুমান করে যে একই গতিবিদ্যা শেষ পর্যন্ত ডাটাবেসের মতো বড় সিস্টেমগুলিতে পৌঁছাতে পারে।
প্রবন্ধটি নিরাপত্তা গবেষণায় "ভালনপোক্যালাইপস" -কে প্রশ্নবিদ্ধ মূল্যের AI-সহায়ক দুর্বলতার প্রতিবেদনের চলমান বন্যার প্রতিও সম্মতি দেয় - এটির শিরোনামকে অনুপ্রাণিত করে ঘনিষ্ঠভাবে সম্পর্কিত ঘটনা হিসাবে।
কেন এটি রেজেক্সের বাইরে গুরুত্বপূর্ণ
যে কেউ AI দাবির মূল্যায়ন করছেন — মডেল বেঞ্চমার্ক, এজেন্ট-নির্মিত টুলস, স্টার্টআপ পারফরম্যান্স মার্কেটিং — Luu-এর প্রবন্ধটি একটি কংক্রিট প্রোটোকল অফার করে: চাহিদা হোল্ডআউট মূল্যায়ন, বেঞ্চমার্কগুলি কী পরিমাপ করে তা পরিদর্শন করুন এবং পরীক্ষার অ্যাক্সেস ছিল এমন একটি সিস্টেম দ্বারা উত্পাদিত যেকোনো শিরোনাম নম্বর ছাড়৷ এটি একই সন্দেহজনক স্বাস্থ্যবিধি সেরা ML মূল্যায়নকারীরা লিডারবোর্ডে প্রয়োগ করে, এখন সফ্টওয়্যার এজেন্টদের কাছে প্রসারিত।
যেহেতু এজেন্টরা সফ্টওয়্যার তৈরি এবং পরিমাপ করার আরও বেশি কাজ গ্রহণ করে, অস্বস্তিকর অডিটিং করতে ইচ্ছুক লোকেরা দুষ্প্রাপ্য সম্পদে পরিণত হয়। বেঞ্চমার্কপোক্যালিপস, লু এর কথায়, আসছে না। এটা ইতিমধ্যে এখানে আছে.
এআই থেকে এগিয়ে থাকুন
AI মূল্যায়ন, এজেন্ট গবেষণা এবং মেশিনের বুদ্ধিমত্তা পরিমাপের বিজ্ঞানের উপর এআইয়ের সর্বশেষ খবর পান — আরও এআই খবর পড়ুন →
