ইনসেপশন ল্যাবস মঙ্গলবার মার্কারি 2.5 প্রকাশ করেছে, এটির বাণিজ্যিক ডিফিউশন ল্যাঙ্গুয়েজ মডেলের একটি নতুন সংস্করণ যেটিকে কোম্পানি বাজারে সবচেয়ে সক্ষম ডিফিউশন এলএলএম হিসাবে বর্ণনা করে এবং তার জ্ঞান অনুযায়ী, এখন পর্যন্ত প্রশিক্ষিত বৃহত্তম ডিফিউশন ল্যাঙ্গুয়েজ মডেল। কোম্পানির ঘোষণা অনুযায়ী, মডেলটি তার পূর্বসূরি মার্কারি 2-এর তুলনায় বুদ্ধিমত্তায় 40% বৃদ্ধি প্রদান করে, একই কম-লেটেন্সি, কম খরচে পরিবেশন প্রোফাইল বজায় রেখে যা উচ্চ-ভলিউম ওয়ার্কলোডের জন্য ডিফিউশন আর্কিটেকচারকে আকর্ষণীয় করে তুলেছে।
সিইও স্টেফানো এরমনের নেতৃত্বে কোম্পানি দাবি করে যে মার্কারি 2.5 জিপিটি-5.6 লুনা (নিম্ন), জেমিনি 3.5 ফ্ল্যাশ-লাইট এবং ক্লদ হাইকু 4.5 সহ খরচ-অপ্টিমাইজড ফ্রন্টিয়ার মডেলগুলির সাথে তুলনীয়৷ এই তুলনাগুলি বিক্রেতা-প্রতিবেদিত এবং এখনও স্বাধীন বেঞ্চমার্ক দ্বারা যাচাই করা হয়নি, তবে তারা একটি প্রসারিত মডেল - দীর্ঘ একটি গবেষণা কৌতূহল - অটোরিগ্রেসিভ ইনকামবেন্টদের একটি উত্পাদন বিকল্প হিসাবে অবস্থান করে। সর্বশেষ AI মডেলের খবরের জন্য, AI Buzz Wire-এর চলমান মডেল কভারেজ অনুসরণ করুন। সর্বশেষ এআই মডেলের খবর
গতি, প্রসঙ্গ এবং মূল্য
শিরোনাম সংখ্যা আক্রমনাত্মক. ইনসেপশন ল্যাবস বলছে যে মার্কারি 2.5 ব্যাপকভাবে উপলব্ধ NVIDIA GPU-তে প্রতি সেকেন্ডে 1,107 টোকেন তৈরি করে, যার একটি প্রসঙ্গ উইন্ডো 260,000 টোকেন। মূল্য নির্ধারণ করা হয়েছে $0.20 প্রতি মিলিয়ন ইনপুট টোকেন এবং $0.75 প্রতি মিলিয়ন আউটপুট টোকেন, একটি লঞ্চ প্রমোশন মডেলকে 80% থেকে $0.04 প্রতি মিলিয়ন ইনপুট এবং $0.15 প্রতি মিলিয়ন আউটপুটে ছাড় দেয়।
সক্ষমতার দিক থেকে, মডেলটি টিউনেবল যুক্তি সহ প্রেরণ করে — ডেভেলপারদের প্রতি-অনুরোধের ভিত্তিতে গভীরতার জন্য লেটেন্সি ট্রেড করতে দেয় — সাথে সমান্তরাল টুল কল এবং কাঠামোগত প্রজন্মের জন্য স্কিমা-সারিবদ্ধ JSON আউটপুট। কোম্পানিটি প্রডাকশন টেলিমেট্রি দ্বারা চালিত একটি প্রশিক্ষণ লুপের প্রথম ফলাফল হিসাবে প্রকাশকে ফ্রেম করেছে: Mercury 2 চালু হওয়ার পর থেকে, হাজার হাজার ডেভেলপার এটির সাথে তৈরি করেছে, কয়েক ডজন এন্টারপ্রাইজ এটি স্থাপন করেছে, এবং ব্যবহার মাত্রার চেয়েও বেশি বৃদ্ধি পেয়েছে।
কেন ডিফিউশন মডেলগুলি দ্রুত পাঠ্য তৈরি করে
OpenAI, Google এবং Anthropic-এর মূলধারার LLMগুলি অটোরিগ্রেসিভ: তারা একবারে একটি টোকেন টেক্সট তৈরি করে, প্রতিটি টোকেন তার আগে তৈরি হওয়া সমস্ত কিছুর সাথে শর্তযুক্ত। সেই অনুক্রমিক নির্ভরতা প্রজন্মের গতির নিচে একটি শক্ত মেঝে রাখে। ডিফিউশন ল্যাঙ্গুয়েজ মডেলগুলি পরিবর্তে গোলমালের ব্লক দিয়ে শুরু করে এবং সমান্তরালভাবে সমস্ত টোকেনকে পুনরাবৃত্তি করে, যা মডেলটিকে পরিষ্কারভাবে একত্রিত হওয়ার প্রশিক্ষণ দেওয়া হলে প্রচলিত GPU হার্ডওয়্যারে অনেক বেশি থ্রুপুট দেয়।
ট্রেড-অফ ঐতিহাসিকভাবে গুণমানের হয়েছে: ডিফিউশন মডেলগুলি যুক্তি এবং নির্দেশনা-অনুসরণকারী বেঞ্চমার্কগুলির উপর স্বয়ংক্রিয়ভাবে প্রত্যাবর্তনকারীকে অনুসরণ করেছে। ইনসেপশন ল্যাবসের মূল বাজি — এবং বুধ 2.5-এর অন্তর্নিহিত দাবী হল যে এই ব্যবধানটি এমন বিন্দুতে সংকুচিত হয়েছে যেখানে বেশিরভাগ গ্রাহকরা প্রকৃতপক্ষে অক্ষের উপর বিস্তৃতি জয় অনুভব করেন: উৎপাদনের পরিমাণে বিলম্ব এবং খরচ৷
প্রারম্ভিক গ্রাহকদের কাছ থেকে উৎপাদন দাবি
ঘোষণাটি বেঞ্চমার্ক টেবিলের পরিবর্তে গ্রাহক স্থাপনার উপর খুব বেশি নির্ভর করে। OpenCall, যা লাইভ গ্রাহক কলের জন্য AI ফোন এজেন্ট তৈরি করে, রিপোর্ট করেছে যে বুধে যাওয়ার ফলে তার মধ্যম মডেল প্রতিক্রিয়া লেটেন্সি প্রায় 170 মিলিসেকেন্ডে পৌঁছেছে। ওপেনকলের সহ-প্রতিষ্ঠাতা ও সিইও অলিভার সিলভারস্টেইন বলেছেন, কোম্পানির P99 প্রতিক্রিয়ার সময় কয়েক মিনিট থেকে এক সেকেন্ডে নেমে এসেছে এবং এর মাঝামাঝি 0.4 সেকেন্ড থেকে 0.2-এর নিচে - পরিসংখ্যানগুলিকে তিনি কোম্পানির পরীক্ষা করা অন্য যে কোনো প্রদানকারীর তুলনায় উল্লেখযোগ্যভাবে দ্রুত বলে বর্ণনা করেছেন, যার মধ্যে যুক্তি সক্ষম।
অগমেন্ট কোড, একটি এআই কোডিং সহকারী নির্মাতা, প্রসঙ্গ কমপ্যাকশন, মডেল রাউটিং এবং MCP টুল অনুসন্ধানের জন্য মার্কারি ব্যবহার করে। ইনসেপশন ল্যাবস-এর মতে, কম্প্যাকশন ওয়ার্কলোডগুলিকে মার্কারিতে নিয়ে যাওয়া সেই ধাপের লেটেন্সি 82% কমিয়েছে, মোটামুটি 150 সেকেন্ড থেকে 27 সেকেন্ডে, এবং গুণমান বজায় রেখে এর খরচ 90% কমিয়েছে। ব্যবহারের কেসটি ব্যাখ্যা করে যেখানে অর্থনীতি কামড় দেয়: কোডিং এজেন্ট প্রতিটি প্রাথমিক প্রজন্মের চারপাশে অনেকগুলি ছোট সমর্থনকারী মডেল কল করে এবং সেই কলগুলির জুড়ে বিলম্ব এবং ব্যয়ের যৌগিকতা।
NVIDIA, যার হার্ডওয়্যার মডেলটি চালায়, তারও ওজন ছিল। NVIDIA-এর এক্সিলারেটেড কম্পিউটিং গ্রুপের পণ্যের সিনিয়র ম্যানেজার শ্রুতি কোপারকার বলেন, ইনসেপশন এনভিআইডিআইএ এআই পরিকাঠামোতে উন্নত ডিফিউশন-ভিত্তিক ভাষার মডেল রয়েছে এবং মার্কারি 2.5-এর মানসম্পন্ন ধাপে টেকসই উৎপাদনের গতি কীভাবে দ্রুত গতিতে তৈরি করতে পারে তা দেখায়। সিস্টেম
মার্কারি ভয়েস এবং মার্কারি রাউটার প্রিভিউ
মডেলের পাশাপাশি, ইনসেপশন ল্যাব দুটি নতুন পণ্যের পূর্বরূপ ঘোষণা করেছে। মার্কারি ভয়েস হল একটি ডিফিউশন এলএলএম যা ভয়েস এজেন্টদের জন্য সবচেয়ে টাইট লেটেন্সি বাজেটের জন্য অপ্টিমাইজ করা হয়েছে, 170 মিলিসেকেন্ডের নিচে টাইম-টু-ফার্স্ট-টোকেন বিজ্ঞাপন। মার্কারি রাউটার ইনকামিং প্রম্পটগুলি বোঝার জন্য একটি ডিফিউশন মডেল ব্যবহার করে এবং সেগুলিকে যে কোনও মডেলে রুট করে — খোলা বা বন্ধ — গুণমান, গতি এবং খরচের সর্বোত্তম মিশ্রণ প্রদান করে, তার প্রতিযোগীদের উপরে একটি স্তর হিসাবে ইনসেপশনের পাশাপাশি তাদের মধ্যে একটি।
মার্কারি 2.5 ইনসেপশনের নিজস্ব API এর পাশাপাশি Baseten এবং OpenRouter এর মাধ্যমে উপলব্ধ। এন্টারপ্রাইজের স্থাপনা ডেডিকেটেড ক্ষমতা, অটোস্কেলিং, কমপ্লায়েন্স কন্ট্রোল এবং কনফিগারযোগ্য ডেটা ধারণ যোগ করে। কোম্পানিটি এপিআই চেষ্টা করে ডেভেলপারদের 100 মিলিয়ন ফ্রি টোকেন অফার করছে।
সংস্থাটি আরও বলেছে যে এটি ইতিমধ্যেই তার পরবর্তী মডেলের প্রশিক্ষণ শুরু করেছে - এটির সবচেয়ে বড় এখনও, আগামী মাসগুলিতে মুক্তির লক্ষ্যে - যা এটি ক্ষমতার একটি লাফ হিসাবে বর্ণনা করে যা প্রসারণের গতি বা টোকেন দক্ষতার কিছুই দেয় না। যদি সেই দাবিটি ধরে থাকে, অটোরিগ্রেসিভ ইনকম্বেন্টদের উপর চাপ প্রথমে বাজারের কমোডিটি স্তরে অনুভূত হবে, যেখানে দাম এবং বিলম্বিতা বেশিরভাগ চুক্তির সিদ্ধান্ত নেয়।
এআই থেকে এগিয়ে থাকুন
নতুন মডেল আর্কিটেকচারগুলি উত্পাদনে দৌড়ানোর সাথে সাথে সর্বশেষ AI উন্নয়ন এবং ব্রেকিং কৃত্রিম বুদ্ধিমত্তার খবরগুলি অনুসরণ করুন৷
আরও এআই খবর পড়ুন →