Ornith টিম Ornith-1.5 প্রকাশ করেছে, একটি অস্বাভাবিক ধারণার চারপাশে নির্মিত ওপেন-ওয়েট ল্যাঙ্গুয়েজ মডেলের একটি পরিবার: মডেলটি তার নিজস্ব প্রশিক্ষণের কাজ তৈরি করে, নিজস্ব স্ক্যাফোল্ড ডিজাইন করে এবং ক্রমাগত চলমান লুপে নিজস্ব সমাধানের প্রচেষ্টা থেকে শেখে। দলের নিজস্ব মূল্যায়ন অনুসারে, ফ্ল্যাগশিপ Ornith-1.5-397B টার্মিনাল-বেঞ্চ 2.1 (টার্মিনাস-2) তে 86.1 স্কোর করেছে, এটিকে 85.0-এ Anthropic's Claude Opus 4.8-এর সমকক্ষ এবং তুলনীয় আকারের অন্যান্য ওপেন-সোর্স মডেলের চেয়ে এগিয়ে রেখেছে।

এই সপ্তাহে অর্নিথ ব্লগে এবং এমআইটি লাইসেন্সের অধীনে হাগিং ফেস-এ প্রকাশিত রিলিজটি ওপেন-সোর্স এআই রেসের সর্বশেষ সালভো যা নিয়মিতভাবে ফলাফল তৈরি করেছে যা একবার ফ্রন্টিয়ার ল্যাবের বাজেট ছাড়া অসম্ভব বলে মনে করা হয়েছিল। সর্বশেষ AI মডেলের খবর ট্র্যাক করা ডেভেলপার এবং এন্টারপ্রাইজগুলির জন্য তাত্পর্য দ্বিগুণ: একটি অগ্রণী ক্লোজড মডেলের সাথে বেঞ্চমার্ক সমতা, এবং একটি প্রশিক্ষণ রেসিপি যা নির্দেশ করে যে ওপেন মডেল ডেভেলপমেন্ট পরবর্তী দিকে যাচ্ছে।

তিন সাইজ, এক রেসিপি

Ornith-1.5 তিনটি কনফিগারেশনে পাঠানো হয়: একটি 397B-প্যারামিটার মিশ্রণ-অফ-বিশেষজ্ঞদের ফ্ল্যাগশিপ, একটি 35B MoE যা প্রতি টোকেন শুধুমাত্র 3B প্যারামিটার সক্রিয় করে, এবং একটি কমপ্যাক্ট 9B ঘন মডেল যার একটি কোয়ান্টাইজড "মোবাইল" ভেরিয়েন্ট যা সরাসরি iPhone এবং Android ডিভাইসে চালানোর জন্য ডিজাইন করা হয়েছে৷ তিনটিই GGUF, MLX, এবং NVFP4 বিল্ডের পাশাপাশি Hugging Face-এ উপলব্ধ, এবং মডেল কার্ডগুলি নির্দেশ করে যে পরিবারটি Qwen3.5 MoE আর্কিটেকচারে নির্মিত।

বংশ এখানে গুরুত্বপূর্ণ। Ornith-1.0, এই বছরের শুরুতে মুক্তি পেয়েছে, এজেন্টিক কোডিং-এর জন্য "সেলফ-স্ক্যাফোল্ডিং" পদ্ধতিকে জনপ্রিয় করেছে এবং এটি একটি শান্ত হিট হয়ে উঠেছে — এর 9B GGUF বিল্ড হ্যাগিং ফেস-এ পাঁচ মিলিয়নেরও বেশি ডাউনলোড লগ করেছে৷ Ornith-1.5 একটি সম্পূর্ণ স্ব-উন্নতি পাইপলাইনে স্ক্যাফোল্ড এবং রোলআউটগুলি অপ্টিমাইজ করা থেকে সেই কাঠামোকে প্রসারিত করে।

স্ব-উন্নতি লুপ, ব্যাখ্যা করা হয়েছে

একটি প্রচলিত পোস্ট-ট্রেনিং পাইপলাইনে, শক্তিবৃদ্ধি শিক্ষা মানব-নিয়োজিত কাজের একটি নির্দিষ্ট সেটের বিরুদ্ধে চলে। Ornith-1.5 এর পরিবর্তে মডেলটি নিজেই নতুন টাস্ক প্রস্তাব করে, একটি টাস্ক-নির্দিষ্ট স্ক্যাফোল্ড তৈরি করে — নির্দেশাবলী, টুলস, এবং সমস্যাটি আক্রমণ করার জন্য ব্যবহৃত পচন কৌশল — এবং তারপরে সমাধান রোলআউট তৈরি করে যা এটি তৈরি করা স্ক্যাফোল্ড দ্বারা স্কোর করা হয়। GRPO ব্যবহার করে তিনটি ধাপের মাধ্যমেই পুরষ্কার প্রচার করা হয়, তাই সিস্টেম একই সাথে আরও ভাল কাজ, ভাল ভারা এবং আরও ভাল সমাধান লিখতে শেখে।

টাস্ক-প্রজন্মের পুরষ্কার হল ডিজাইনের হৃদয়। প্রতিটি প্রস্তাবিত কাজ তিনটি গুণগত সংকেতের উপর স্কোর করা হয়: বৈধতা (ভারাটি সঠিকভাবে সম্পাদন করে এবং মূল্যায়ন করে?), সীমান্তের অসুবিধা (মডেলের অভিজ্ঞতামূলক সাফল্যের হার প্রায় 20 শতাংশের লক্ষ্যের কাছাকাছি, কাজগুলিকে চ্যালেঞ্জিং কিন্তু শেখার যোগ্য রাখা?), এবং অভিনবত্ব (এটি কি পূর্বের সমস্ত কিছুর থেকে যথেষ্ট আলাদা?)। যেহেতু মডেলের নিজস্ব বর্তমান সাফল্যের হারের বিপরীতে অসুবিধা পরিমাপ করা হয়, মডেলটি উন্নত হওয়ার সাথে সাথে পাঠ্যক্রম স্বয়ংক্রিয়ভাবে বৃদ্ধি পায়।

দলটি মূল্যায়নের সময় সুস্পষ্ট অ্যান্টি-হ্যাকিং ব্যবস্থাগুলিও রিপোর্ট করে: গিট ইতিহাস সংগ্রহস্থলের চিত্রগুলি থেকে ছিনিয়ে নেওয়া হয়েছে যাতে মডেলগুলি পূর্বের সমাধানগুলি পুনরুদ্ধার করতে পারে না, এবং মডেলগুলিকে বাহ্যিক উত্তরগুলি আনা থেকে আটকাতে নেটওয়ার্ক অ্যাক্সেস অক্ষম করা হয়। সমস্ত ফলাফলের গড় পাঁচটি স্বাধীন রানের উপরে।

সংখ্যা

এজেন্টিক কোডিং-এ, ওপেন-সোর্স ক্ষেত্রের শীর্ষে ফ্ল্যাগশিপের স্ব-প্রতিবেদিত ফলাফল ক্লাস্টার। টার্মিনাল-বেঞ্চ 2.1-এ টার্মিনাস-2 হারনেসের মাধ্যমে চলে, Ornith-1.5-397B-এর 86.1 প্রান্ত Claude Opus 4.8 (85.0), DeepSeek-V4-Flash-0731 (82.7), এবং GLM-5.2 (81) থেকে বেরিয়ে আসে। একই বেঞ্চমার্কে ক্লাউড কোড হার্নেসের মাধ্যমে, Ornith-1.5 পোস্ট 85.2 Opus 4.8 এর 78.9 এর বিপরীতে। SWE-বেঞ্চ ভেরিফাইয়ে, দুটি কার্যকরভাবে 86.0 এবং 85.8 এ বাঁধা হয়েছে, Kimi K3 সামান্য এগিয়ে 86.2 এ।

কঠিন এজেন্টিক স্যুটগুলিতে ফাঁকগুলি প্রশস্ত হয়। DeepSWE-তে, Ornith-1.5-397B স্কোর 56.0 — GLM-5.2-এর 46.2 থেকে এগিয়ে, যদিও Opus 4.8 (59.0) এবং Kimi K3 (67.5) থেকে পিছনে। সবচেয়ে আকর্ষণীয় জাম্প জেনারেশনাল: Ornith-1.0 ডিপএসডব্লিউইতে মাত্র 8.0 স্কোর করেছে, যার অর্থ নতুন পুনরাবৃত্তি একই বেঞ্চমার্ক পরিবারে সাতগুণ উন্নতি করেছে।

ছোট মডেল তাদের নিজস্ব গল্প বলে. Ornith-1.5-35B-A3B, প্রতি টোকেন শুধুমাত্র 3B প্যারামিটার সক্রিয় করে, টার্মিনাল-বেঞ্চ 2.1 (ক্লোড কোড) স্কোর 68.5 বনাম 43.4 Google-এর জেমা 4-31B-এর জন্য এবং 51.7 মেটা'স মিউজ গ্লিমার-এর জন্য 51.7, Verb-30-70-এর পোস্ট। 9B মডেলটি টার্মিনাল-বেঞ্চ 2.1-এ 47.0, SWE-বেঞ্চ ভেরিফায়েড-এ 70.6 এবং GPQA ডায়মন্ড-এ 86.4-এ পৌঁছেছে — যে নম্বরগুলি ডেস্কটপ-শ্রেণির প্রতিদ্বন্দ্বীদের থেকে উল্লেখযোগ্য দূরত্বের মধ্যে ফোন-শ্রেণির মডেল স্থাপন করে।

সতর্কতা এবং প্রসঙ্গ

এগুলি হল ডেভেলপার-চালিত বেঞ্চমার্ক, স্বাধীনভাবে নিরীক্ষিত ফলাফল নয়, এবং তুলনামূলক মডেলগুলি অর্নিথ দল দ্বারা তার নিজস্ব জোতা সেটিংসের অধীনে মূল্যায়ন করা হয়েছে। প্রতিদ্বন্দ্বী ল্যাবগুলিও বিভিন্ন ট্রেড-অফের জন্য সুর করে; ডিপএসডব্লিউই-তে কিমি কে 3-এর নেতৃত্ব প্রস্তাব করে যে এজেন্টিক সফ্টওয়্যার কাজের সীমানা এখনও প্রতিদ্বন্দ্বিতাপূর্ণ। কিন্তু রিলিজের পূর্ণ-সারণী স্বচ্ছতা — পাঁচ-রানের গড়, প্রকাশিত জোতা কনফিগারেশন, প্রকাশ করা সুরক্ষা — স্বাধীন প্রজননকে অস্বাভাবিকভাবে সোজা করে তোলে।

সম্প্রদায়ের প্রতিক্রিয়া যথেষ্ট হয়েছে। রিলিজ ঘোষণাটি কয়েক ঘন্টার মধ্যে হ্যাকার নিউজে একশত পয়েন্টের উপরে ভালভাবে আকৃষ্ট হয়েছে, আলোচনা স্ব-উন্নতি পদ্ধতির চেয়ে বেঞ্চমার্ক দাবির উপর কম ফোকাস করেছে, যেটিকে অনেক মন্তব্যকারী পুনরাবৃত্তিমূলক-স্টাইল টাস্ক জেনারেশনের আরও বিশ্বাসযোগ্য উন্মুক্ত বাস্তবায়নের একটি হিসাবে বর্ণনা করেছেন।

ওপেন-সোর্স ইকোসিস্টেমের জন্য, অর্নিথ-১.৫ এমন এক মুহুর্তে অবতরণ করে যখন চীনের ল্যাব এবং পশ্চিমা স্বাধীন দলগুলি থেকে উন্মুক্ত মডেলগুলি কোডিং এবং এজেন্টিক কাজগুলিতে বদ্ধ সীমান্তের সাথে ব্যবধানটি বন্ধ করে চলেছে। একটি MIT- লাইসেন্সপ্রাপ্ত পরিবার যা টার্মিনাল-বেঞ্চে একটি অগ্রণী ক্লোজড মডেলের সাথে মেলে — এবং একটি ফোন-প্রস্তুত 9B ভেরিয়েন্ট পাঠায় — সেই ব্যবধানকে আরও সংকুচিত করে, এবং এটি এমন একটি প্রশিক্ষণ পদ্ধতির মাধ্যমে করে যা যে কেউ পরিদর্শন, পুনরুত্পাদন এবং প্রসারিত করতে পারে৷

---

এআই থেকে এগিয়ে থাকুন

সর্বশেষ AI খবর, বিশ্লেষণ এবং সাফল্য পান — সব এক জায়গায়।

আরও এআই খবর পড়ুন →