সাকানা এআই ট্রানজ্যাকশন অন মেশিন লার্নিং রিসার্চ (টিএমএলআর) জার্নালে একটি গবেষণা পত্র "বিয়ন্ড ইমিটেশন" প্রকাশ করেছে, যেখানে মানুষের পর্যালোচনার অনুকরণের পরিবর্তে ত্রুটি শনাক্তকরণের চারপাশে নির্মিত একটি এলএলএম-সহায়ক পিয়ার রিভিউ সিস্টেমের বর্ণনা রয়েছে, মার্কটেকপোস্ট 10 অক্টোবর রিপোর্ট করেছে। কেন্দ্রীয় প্রশ্ন টোকিও-ভিত্তিক এআই ক্লোজিং রিভিউয়ের উপর ভিত্তি করে কীভাবে উত্তর দেয়: এর আউটপুট মানুষের পর্যালোচনার সাথে মেলে, এটি কি একটি রোপিত ভুল খুঁজে পেতে পারে?
দল দুটি নিদর্শন প্রেরণ করেছে: ত্রুটি সনাক্তকরণ পরিমাপের জন্য একটি দ্বন্দ্ব বেঞ্চমার্ক, এবং একটি বহু-স্তরযুক্ত পর্যালোচনা (এমএলআর) সিস্টেম যা প্রতিটি বেসলাইন পরীক্ষা করে। পিয়ার রিভিউ বাড়ানোর জন্য AI ব্যবহারে ক্রমবর্ধমান আগ্রহের মধ্যে ফলাফলগুলি আসে - জমা দেওয়ার পরিমাণ বৃদ্ধির কারণে চাপের মধ্যে একটি প্রক্রিয়া। AI কীভাবে গবেষণাকে নিজেই নতুন আকার দিচ্ছে সে সম্পর্কে আরও জানতে, আমাদের नवीनतम AI উন্নয়ন অনুসরণ করুন।
রোপিত ভুলের একটি মানদণ্ড
কন্ট্রাডিকশন বেঞ্চমার্ক প্রকৃত কাগজপত্রে ত্রুটি স্থাপন করে এবং পর্যালোচনাকারীরা সেগুলি ধরছে কিনা তা পরীক্ষা করে। গবেষকরা ACL, AISTATS, CVPR, এবং ICML 2025, প্লাস NeurIPS 2024 থেকে 257টি CC-লাইসেন্সযুক্ত কাগজপত্র সংগ্রহ করেছেন, তারপর প্রতিটি কাগজের দাবি, প্রমাণ এবং পদ্ধতির জ্ঞানের গ্রাফ তৈরি করতে Gemini 2.5 Pro ব্যবহার করেছেন।
তীব্রতা কাঠামোগতভাবে সংজ্ঞায়িত করা হয়: কাগজের "প্রধান দাবি" থেকে একটি নোডের দূরত্ব নির্ধারণ করে যে ত্রুটিটি কতটা কেন্দ্রীয়। দূরত্ব শূন্য একটি মূল দাবিকে আঘাত করে; বৃহত্তর দূরত্ব সমর্থন বিবরণ আঘাত. GPT-4.1 তারপর প্রতি দূরত্বে একটি নোডকে একটি দ্বন্দ্বে পুনর্লিখন করে, মোট 1,164 ডেটা পয়েন্ট তৈরি করে। একজন o3 বিচারক প্রতিটি পর্যালোচনা দশবার করে। পরিষ্কার কাগজপত্রে বিচারক 99.9% নির্ভুলতায় পৌঁছেছেন, এবং এটি ম্যানুয়ালি নিশ্চিত হওয়া ক্যাচগুলিতে 86.8% সংবেদনশীলতা দেখিয়েছে - যার অর্থ রিপোর্ট সনাক্তকরণ স্কোরগুলি আসলে রক্ষণশীল হতে পারে।
কিভাবে বহু-স্তরযুক্ত পর্যালোচনা কাজ করে
MLR হল একটি এজেন্টিক সিস্টেম যা একটি কাগজের সমালোচনা করার আগে বুঝতে পারে, অফ-দ্য-শেল্ফ ক্লাউড মডেলগুলিতে চলমান তিনটি বিশেষ এজেন্ট থেকে একত্রিত হয় — কোনও GPU ক্লাস্টার এবং কোনও ফাইন-টিউনিংয়ের প্রয়োজন নেই:
- পরিশিষ্ট এজেন্ট (ক্লদ হাইকু 3.5): পরিশিষ্ট থেকে পরীক্ষা এবং বাস্তবায়নের বিবরণ সংক্ষিপ্ত করে।
- সাহিত্য পর্যালোচনা এজেন্ট (ক্লড সনেট 4, ঐচ্ছিক): পূর্বের কাজের প্রসঙ্গে কাগজটি স্থাপন করতে ওয়েব অনুসন্ধান ব্যবহার করে।
- রিভিউ এজেন্ট (ক্লড সনেট 4): কম্পিউটার বিজ্ঞানী এস কেশবের সুপরিচিত "থ্রি-পাস অ্যাপ্রোচ" দ্বারা অনুপ্রাণিত একটি থ্রি-পাস প্রম্পট চেইন চালায় — প্রথমে একটি উচ্চ-স্তরের রূপরেখা, তারপর একটি বিশদ পঠিত দুর্বলতা, অনুমান, এবং ফাঁকগুলি, এবং সবশেষে একটি দুর্বলতা, একটি দুর্বলতা, সব প্রশ্নের উত্তর দেয়। সুপারিশ, একটি স্কোর, এবং একটি করণীয় তালিকা।
পিডিএফ সরাসরি মডেলগুলিতে প্রেরণ করা হয়, তাই পরিসংখ্যান এবং সমীকরণগুলি প্রক্রিয়াকরণে বেঁচে থাকে। সিস্টেমটি মূল পাঠ্যের 10 পৃষ্ঠা পর্যন্ত পাঠ করে এবং সাকানা প্রতি পর্যালোচনার মূল্য প্রায় $0.47 অনুমান করে।
ফলাফল: ডিজাইন এবং মডেল চয়েস উভয়ই গুরুত্বপূর্ণ
MLR বেঞ্চমার্কে পরীক্ষিত চারটি সিস্টেমের নেতৃত্ব দিয়েছে। চারটি স্বাধীন পর্যালোচনার সাথে, এটি মূল-দাবি (দূরত্ব-শূন্য) দ্বন্দ্বের 73.43% এবং সামগ্রিকভাবে 40.95% ধরেছে। সেরা বেসলাইন, AgentReview নামক একটি সিস্টেম, মূল দাবিতে শুধুমাত্র 14.81% পরিচালনা করেছে। এমনকি একটি একক MLR পর্যালোচনা 60.79% মূল-দাবি ত্রুটি ধরা পড়েছে।
একটি অ্যাবলেশন স্টাডি মডেলের পছন্দ থেকে ডিজাইনের অবদানকে আলাদা করে। একটি বিদ্যমান পর্যালোচনা পাইপলাইনের ভিতরে Claude Sonnet 4-এর জন্য GPT-4.1 অদলবদল করা কোর-ক্লেম সনাক্তকরণ 14.56% থেকে 35.40% এ উন্নীত করেছে, যখন MLR-এর মাল্টি-এজেন্ট ডিজাইন একটি একক পর্যালোচনার জন্য শীর্ষে প্রায় 25 শতাংশ পয়েন্ট যোগ করেছে। ত্রুটিগুলি মূল দাবি থেকে দূরে সরে যাওয়ার সাথে সাথে সনাক্তকরণের নির্ভুলতা পড়ে যায়, যা লেখক বলেছেন যে তীব্রতা স্কোরিংকে সমর্থন করে।
চিত্রটি অগোছালো, বাস্তব-বিশ্বের ডেটাতে অন্ধকার করে। WithdrarXiv-Check-এ, 211টি প্রকৃতপক্ষে arXiv কাগজপত্রের একটি সেট প্রত্যাহার করে, MLR "অনুরূপ" ম্যাচগুলিতে 26.07% এবং সঠিক ম্যাচগুলিতে 16.11% স্কোর করেছিল — এবং সিস্টেমটি পাণ্ডুলিপি পাঠে লাগানো লুকানো প্রম্পট ইনজেকশনের জন্য দুর্বল থেকে যায়৷ বাস্তব প্রত্যাহার করা কাগজপত্র পড়া, অন্য কথায়, সিন্থেটিক দ্বন্দ্ব ধরার চেয়ে অনেক কঠিন।
পিয়ার রিভিউ এর জন্য এর মানে কি
অধ্যয়নের সবচেয়ে ব্যবহারিক টেকঅ্যাওয়ে এটির সবচেয়ে কম চটকদার হতে পারে: সিস্টেম ডিজাইন এবং মডেল পছন্দ উভয়ই বস্তুগতভাবে ত্রুটি সনাক্তকরণকে সরিয়ে দেয় এবং পর্যালোচনাকারীরা যারা বিচার করার আগে পড়েন তাদের তুলনায় অনেক বেশি গুরুতর ত্রুটি খুঁজে পান যা মানুষের পর্যালোচনা পাঠ্যে প্যাটার্ন-মেলে। এই পার্থক্যটি গুরুত্বপূর্ণ কারণ এআই-সহায়ক পর্যালোচনার বেশিরভাগ পূর্বের কাজগুলি মানুষের বিচারের সাথে চুক্তির জন্য অপ্টিমাইজ করা হয়েছে - একটি মেট্রিক যা প্রকৃত যাচাইয়ের পরিবর্তে আত্মবিশ্বাসী-সাউন্ডিং সামঞ্জস্যকে পুরস্কৃত করে।
সাকানার ফলাফলগুলি পরামর্শ দেয় না যে AI মানব রেফারিদের প্রতিস্থাপন করতে প্রস্তুত — এমন একটি সিস্টেম যা প্রকৃত প্রত্যাহার করা কাগজপত্রে বেশিরভাগ ত্রুটি মিস করে এবং এমবেডেড প্রম্পট দ্বারা ম্যানিপুলেট করা যেতে পারে এটি একটি সহায়ক স্তর হিসাবে বিবেচিত হয়, কর্তৃপক্ষ নয়। বেঞ্চমার্কের সিন্থেটিক ত্রুটিগুলি পরিসংখ্যানগত অস্পষ্টতা এবং প্রতিদ্বন্দ্বিতাপূর্ণ ব্যাখ্যার চেয়েও পরিষ্কার যা সমকক্ষ পর্যালোচনায় বাস্তব মতানৈক্যকে প্রাধান্য দেয়, তাই রোপিত দ্বন্দ্বের উপর পারফরম্যান্সকে প্রতিশ্রুতি নয়, সিলিং হিসাবে পড়া উচিত।
কিন্তু প্রতি পর্যালোচনায় মোটামুটিভাবে $0.47, যে কোনো সিস্টেমের পরীক্ষিত সর্বোচ্চ ত্রুটি-সনাক্তকরণের হার সহ, MLR একটি নিকটবর্তী সময়ের দিকে নির্দেশ করে যেখানে AI পর্যালোচকরা দ্বন্দ্বের জন্য একটি ফার্স্ট-পাস স্ক্রীন পরিচালনা করেন যখন মানব পর্যালোচকরা বিচারের উপর ফোকাস করেন যা মেশিন এখনও করতে পারে না। জার্নাল এবং কনফারেন্স আয়োজকরা LLM-সহায়ক পর্যালোচনা নিয়ে পরীক্ষা-নিরীক্ষা করছেন তাদের কাছে এখন তাদের নিজস্ব সিস্টেমগুলি পরিমাপ করার জন্য একটি পাবলিক বেঞ্চমার্ক এবং একটি শক্তিশালী বেসলাইন উভয়ই রয়েছে — এবং, যদি 73.43% এবং 14.81% এর মধ্যে ব্যবধান বজায় থাকে, তাহলে একটি স্পষ্ট সংকেত যে স্থাপত্য পড়া কাঁচা মডেলের আকারের চেয়ে বেশি গুরুত্বপূর্ণ।
---
এআই থেকে এগিয়ে থাকুনসর্বশেষ AI খবর, বিশ্লেষণ এবং সাফল্য পান — সব এক জায়গায়।
আরও এআই খবর পড়ুন →