স্বাধীন বেঞ্চমার্কিং ফার্ম কৃত্রিম বিশ্লেষণ অনুসারে, ওপেনএআই 29 সেপ্টেম্বর GPT-6.1 Sol প্রকাশ করে, সেই মডেলের আত্মপ্রকাশের মাত্র সাত দিন পরে GPT-6 Sol অবসর নেয়। অদলবদল কোম্পানির DevDay ডেভেলপার কনফারেন্সের সাথে মিলে যায়, যেখানে CNET জানিয়েছে যে অংশগ্রহণকারীরা নতুন চালু হওয়া ডটস এজেন্ট এবং সাবস্ক্রিপশন পরিবর্তনের একটি সেটের পাশাপাশি অবিলম্বে GPT-6.1 Sol ব্যবহার শুরু করতে পারে।
সাত দিনের ফ্ল্যাগশিপ-টু-ফ্ল্যাগশিপ প্রতিস্থাপন 2026-এর ত্বরিত মানগুলির দ্বারাও অস্বাভাবিক, এবং মানদণ্ডগুলি পরামর্শ দেয় যে কেন OpenAI দ্রুত এগিয়েছে। মডেল লঞ্চ, বেঞ্চমার্ক মারামারি এবং তাদের অধীনে মূল্য নির্ধারণের যুদ্ধের ক্রমাগত কভারেজের জন্য, AI Buzz Wire ঘটে যাওয়া ঘটনাগুলিকে ট্র্যাক করে।
সাত দিনে একটি পরিমাপযোগ্য লাফ
কৃত্রিম বিশ্লেষণ রিপোর্ট করে যে GPT-6.1 Sol ফার্মের ইন্টেলিজেন্স সূচকে GPT-6 Sol-এর উপরে 4 পয়েন্ট এবং GPT-5.6 Sol-এর উপরে 5 পয়েন্ট লাভ করেছে, OpenAI-এর সবচেয়ে সক্ষম মডেল GPT-6 Astra থেকে মাত্র 1 পয়েন্ট নীচে নেমেছে। ফার্মের মূল্যায়ন যুক্তি, জ্ঞানের কাজ, গণিত এবং এজেন্টিক কাজগুলিকে একটি একক তুলনামূলক স্কোরে মিশ্রিত করে।
সাব-স্কোরগুলি দেখায় যেখানে লাভগুলি কেন্দ্রীভূত হয়৷ GPT-6.1 Sol AA-Briefcase v1.1-এ 4 পয়েন্ট এবং GDPval-AA v2.1-এ 5 পয়েন্ট উন্নত করেছে, উভয়ই পরীক্ষা এজেন্টিক জ্ঞান কাজ করে। বাস্তব টার্মিনাল পরিবেশে বস্তুগতভাবে ভাল পারফরম্যান্সের জন্য Terminal-Bench 4.0 পয়েন্টে 12-পয়েন্ট লাফ, যখন Humanity's Last Exam 5 পয়েন্ট বেড়েছে এবং GDP.pdf বেড়েছে 6৷
যারা গবেষণার জন্য মডেল ব্যবহার করেন তাদের জন্য একটি সংখ্যা আলাদা: AA-Omniscience-এ নির্ভুলতা 8 পয়েন্ট বেড়েছে যখন হ্যালুসিনেশন হার 60 শতাংশ থেকে 54 শতাংশে নেমে এসেছে। উভয় পরিসংখ্যানই নিখুঁত পদে উচ্চ রয়ে গেছে, কিন্তু কর্মপ্রবাহের জন্য ভ্রমণের দিকনির্দেশ গুরুত্বপূর্ণ যেখানে একটি আত্মবিশ্বাসী ভুল উত্তর কোন উত্তরের চেয়ে খারাপ।
একই স্টিকারের দাম, অনুশীলনে সস্তা
মূল্য নির্ধারণে, GPT-6.1 Sol GPT-6 Sol এর রেট কার্ড প্রতি মিলিয়ন ইনপুট টোকেন $2 এবং প্রতি মিলিয়ন আউটপুট টোকেন $10 রাখে, কিন্তু ক্যাশে রিড ডিসকাউন্ট 90 শতাংশ থেকে 95 শতাংশে উন্নীত হয়। কৃত্রিম বিশ্লেষণ নোট করে যে এজেন্টিক কাজের চাপের জন্য GPT-6.1 Sol-এর মিশ্রিত মূল্য তাই GPT-6 Sol-এর থেকে সামান্য কম, কার্যকর মূল্য হ্রাসের একটি ধারাকে প্রসারিত করে যা GPT-6 Sol GPT-5.6 Sol-এ 50 শতাংশ ছাড়ে চালু হওয়ার পর শুরু হয়েছিল।
মূল্যের গতিপথই এখানে আসল গল্প। দুটি রিলিজের ব্যবধানে, ওপেনএআই তার মধ্য-স্তরের সীমান্ত লাইনের কার্যকরী খরচকে দুইবার অর্ধেক করে ফেলেছে, প্রতিবার গুণমানকে ঊর্ধ্বমুখী করে।
টাস্ক প্রতি খরচ: $0.72 বনাম $3.26
প্রতি টাস্ক খরচ হল যেখানে GPT-6 Astra-এর সাথে ব্যবধানটি তীব্র হয়ে ওঠে। সর্বোচ্চ প্রচেষ্টায়, কৃত্রিম বিশ্লেষণ GPT-6.1 Sol প্রতি ইন্টেলিজেন্স ইনডেক্স টাস্কে $0.72 পেগ করে, GPT-6 Astra এর $3.26 এর এক চতুর্থাংশেরও কম। এর নিজস্ব পূর্বসূরির বিপরীতে সঞ্চয় 31 শতাংশ (GPT-6 Sol এর জন্য $1.05), এবং GPT-5.6 Sol এর বিপরীতে তারা 64 শতাংশে ($1.99) পৌঁছেছে।
ফার্মের মতে, GPT-6.1 Sol-এর প্রতিটি প্রচেষ্টার স্তর খরচ-দক্ষতা প্যারেটো ফ্রন্টিয়ারকে ঠেলে দেয় - যার অর্থ একটি নির্দিষ্ট স্তরের বুদ্ধিমত্তার জন্য, এটি যে মডেলগুলি ট্র্যাক করে তার মধ্যে কোনও সস্তা বিকল্প নেই। টোকেন-দক্ষতার চিত্রটি আরও মিশ্র: GPT-6.1 Sol প্রচেষ্টার স্তর জুড়ে GPT-6 Sol এর তুলনায় প্রায় 10 থেকে 30 শতাংশ বেশি আউটপুট টোকেন গ্রহণ করে, যদিও এর নিম্ন এবং মাঝারি প্রচেষ্টা সেটিংস টোকেন দক্ষতার জন্য প্যারেটো-অনুকূল থাকে একবার যখন উচ্চতর বুদ্ধিমত্তা তৈরি হয়। কোডিং-এ, GPT-এর মডেলের প্রচেষ্টায় Solmax3-এ GPT-6 মডেলের সর্বোচ্চ পয়েন্ট অর্জন করেছে। কোডিং এজেন্ট সূচক।
কেন সাত দিনের টার্নরাউন্ড গুরুত্বপূর্ণ
DevDay এর বিস্তৃত স্লেট একই ছবিকে শক্তিশালী করে। CNET-এর রিপোর্টে কনফারেন্সটিকে ডেভেলপাররা এখনই ব্যবহার করতে পারে এমন তিনটি জিনিসকে ঘিরে তৈরি করেছে — GPT-6.1 Sol, ডটস এজেন্টস, এবং রিওয়ার্কড সাবস্ক্রিপশন প্ল্যান — দূরবর্তী গবেষণার পূর্বরূপের পরিবর্তে। ডেভেলপারদের কাছে বার্তাটি ছিল আজ প্রাপ্যতা, আগামীকাল সম্ভব নয়।
ফ্ল্যাগশিপ এই সংক্ষিপ্ত সংকেতকে ক্যাডেনস করে যে প্রতিযোগিতামূলক সীমাবদ্ধতা প্রশিক্ষণ রান থেকে প্রশিক্ষণ-পরবর্তী পরিমার্জন এবং পরিবেশন পরিকাঠামোতে স্থানান্তরিত হয়েছে। একটি পয়েন্ট-লেভেল আপগ্রেড যা এক সপ্তাহের মধ্যে একটি অপ্টিমাইজ করা চেকপয়েন্ট এবং একটি নতুন মূল্য পত্রকের মতো দেখায় একটি ফ্রম-স্ক্র্যাচ ফাউন্ডেশন মডেলের চেয়ে, এবং প্রতিদ্বন্দ্বীরা একইভাবে আচরণ করছে: Google 30 সেপ্টেম্বর জেমিনি 4 আর্গন ঘোষণা করেছে, একটি সীমান্ত মডেল যা প্রাথমিকভাবে বিশ্বস্ত সাইবার ডিফেন্ডারদের কাছে তার ফেয়ারউইন্ড প্রতি $20/$1 মিলিয়ন রেট এর মাধ্যমে।
বিকাশকারীদের জন্য, যাচাইকৃত নম্বরগুলি থেকে তিনটি ব্যবহারিক টেকওয়ে অনুসরণ করে৷ প্রথমত, ভারী ক্যাশে পুনঃব্যবহার সহ এজেন্টিক কাজের চাপ 95 শতাংশ ক্যাশে ডিসকাউন্ট থেকে অবিলম্বে উপকৃত হয়। দ্বিতীয়ত, বাজেটগুলি মাইগ্রেট করার আগে উচ্চতর আউটপুট টোকেন খরচের মডেল করা উচিত, যেহেতু মডেলটি দীর্ঘ চিন্তা করলেও প্রতি-টোকেন মূল্য অপরিবর্তিত থাকে। তৃতীয়ত, Astra কাজগুলির জন্য সর্বোচ্চ সীমা হিসাবে রয়ে গেছে যেখানে বুদ্ধিমত্তার শেষ পয়েন্টটি 4x খরচ প্রিমিয়ামের মূল্যের — GPT-6.1 Sol এর ক্ষেত্রে বেশিরভাগ কাজের জন্য এটি নয়।
পুনরাবৃত্তির যোগ্য সতর্কতা: এই পরিসংখ্যানগুলি একটি একক স্বাধীন মূল্যায়নকারীর কাছ থেকে আসে, যদিও এর পদ্ধতি কঠোর, এবং সূচক স্কোর নির্দিষ্ট কাজের চাপের মিশ্রণকে পুরস্কৃত করে। চাহিদাযুক্ত কাজের চাপ সহ দলগুলিকে উত্পাদন ট্র্যাফিক পুনরায় রুট করার আগে তাদের নিজস্ব মূল্যায়ন পুনরায় চালানো উচিত।
---
এআই থেকে এগিয়ে থাকুনসর্বশেষ AI খবর, বিশ্লেষণ এবং সাফল্য পান — সব এক জায়গায়।
আরও এআই খবর পড়ুন →