MLcommons 16 সেপ্টেম্বর, 2026-এ MLPerf ইনফারেন্স v6.1 বেঞ্চমার্ক ফলাফল প্রকাশ করেছে এবং শিরোনামটি NVIDIA-এর পরবর্তী প্রজন্মের প্ল্যাটফর্মের অন্তর্গত। তার প্রথম প্রিভিউ জমা দেওয়ার সময়, ভেরা রুবিন NVL72 সিস্টেমটি NVIDIA-এর বর্তমান GB300 NVL72 ফ্ল্যাগশিপের থ্রুপুট থেকে 3.7 গুণ পর্যন্ত বিতরণ করেছে, NVIDIA-এর ঘোষণা অনুসারে, ব্ল্যাকওয়েল আল্ট্রা-এর উত্তরসূরি AI ইনফারেন্স ইকোনমিক্সের জন্য কী বোঝাবে তার একটি প্রাথমিক সংকেত।

ভেরা রুবিন হল NVIDIA-এর পরবর্তী ডেটা-সেন্টার প্ল্যাটফর্ম, যার নাম জ্যোতির্পদার্থবিজ্ঞানীর জন্য যিনি ডার্ক ম্যাটারের মূল প্রমাণ দিয়েছেন। MLPerf প্রিভিউ ফলাফল হল প্রথম সর্বজনীন, স্বাধীনভাবে সিস্টেমের জন্য সংগঠিত কর্মক্ষমতা ডেটা। For more context on this story, see our ongoing AI trends.

অভিষেকের পেছনের সংখ্যা

NVIDIA v6.1 স্যুটে সবচেয়ে বেশি চাহিদাপূর্ণ দুটি কাজের চাপে ভেরা রুবিন NVL72 পূর্বরূপ ফলাফল জমা দিয়েছে: DeepSeek-R1 যুক্তি মডেল এবং Qwen3-VL দৃষ্টি-ভাষা মডেল।

Qwen3-VL-এ, ভেরা রুবিন NVL72 অফলাইন, সার্ভার এবং ইন্টারেক্টিভ পরিস্থিতিতে GB300 NVL72 এর থেকে 3.7 গুণ বেশি থ্রুপুট প্রদান করেছে, NVIDIA-এর ডায়নামো ওপেন-সোর্স ইনফারেন্স ফ্রেমওয়ার্কের সাথে vLLM চালাচ্ছে। DeepSeek-R1-এ, NVIDIA-এর TensorRT-LLM লাইব্রেরি ব্যবহার করে, থ্রুপুট আগের ফ্ল্যাগশিপের চেয়ে 2.5 গুণ বেশি ছিল।

উভয় পরিসংখ্যান MLCcommons' ক্লোজড ডিভিশনে NVIDIA-এর নিজস্ব জমা দেওয়া থেকে এসেছে, যার অর্থ হল সেগুলি MLPerf-এর নিরীক্ষিত নিয়মের অধীনে তৈরি করা হয়েছিল, যদিও পূর্বরূপ ফলাফলগুলি স্পষ্টভাবে একটি প্ল্যাটফর্মের প্রাথমিক পরিমাপ এখনও অপ্টিমাইজ করা হচ্ছে।

লাভ কিভাবে নির্মিত হয়

NVIDIA কোনো একক উপাদানের পরিবর্তে হার্ডওয়্যার এবং সফ্টওয়্যার জুড়ে ফুল-স্ট্যাক কো-ডিজাইনকে জাম্পের জন্য দায়ী করে।

সিলিকনের দিকে, ভেরা রুবিন বর্ধিত টেনসর কোর এবং একটি আপডেট করা ট্রান্সফরমার ইঞ্জিন নিয়ে এসেছে যা অনুমানের উভয় পর্যায়েই ত্বরান্বিত করে — কম্পিউট-হেভি প্রিফিল ফেজ এবং মেমরি-বাউন্ড ডিকোড ফেজ। প্ল্যাটফর্মটি NVFP4 নির্ভুলতার উপর নির্ভর করে, যা মডেল ওজন, মনোযোগ এবং কেভি ক্যাশের মেমরি পদচিহ্নকে সঙ্কুচিত করে, যা NVIDIA আউটপুট মানের সর্বনিম্ন ক্ষতি হিসাবে বর্ণনা করে তার সাথে থ্রুপুট বাড়ায়।

সফ্টওয়্যারের দিক থেকে, জমা দেওয়া ডিস্যাগ্রিগেটেড সার্ভিং ব্যবহার করা হয়েছে, যা ডিপসিক-R1 এবং Qwen3-VL-এর মতো মডেলগুলিতে বিশেষজ্ঞদের মিশ্রণের স্তরগুলিকে সম্পূর্ণরূপে কাজের সাথে খাওয়ানোর জন্য বড় আকারের বিশেষজ্ঞ সমান্তরালতার সাথে প্রিফিল এবং ডিকোডকে আলাদা করে।

আন্তঃসংযোগ তৃতীয় স্তম্ভ। NVL72 র্যাক ডিজাইন 72 GPU-কে ষষ্ঠ-প্রজন্মের NVLink এবং NVLink সুইচ ব্যবহার করে একটি একক স্কেল-আপ ডোমেনে সংযুক্ত করে, যা NVIDIA বলেছে 10 গুণ বেশি প্যাকেট রেট এবং অফ-দ্য-শেল্ফ ইথারনেটের তুলনায় 3 গুণ কম লেটেন্সি — এই ফাউন্ডেশন যা র্যাক-স্কেল ডিসঅ্যাগ্যাগ্যাল সার্ভ করে।

GB300 কাছাকাছি-পারফেক্ট স্কেলিং দেখায়

v6.1 রাউন্ডে বর্তমান ফ্ল্যাগশিপের নিজস্ব খবর ছিল। NVIDIA-এর DeepSeek-R1 জমা একটি একক GB300 NVL72 র‍্যাক — 72 GPU - থেকে চারটি র্যাক, 288 GPU-তে স্কেল করা হয়েছে, অফলাইন পরিস্থিতিতে 99 শতাংশ স্কেলিং দক্ষতা অর্জন করেছে, থ্রুপুট হার্ডওয়্যারের অনুপাতে প্রায় বৃদ্ধি পাচ্ছে৷

স্কেলিং দক্ষতা একটি মেট্রিক ডেটা-সেন্টার অপারেটরগুলি ঘনিষ্ঠভাবে পর্যবেক্ষণ করে কারণ এটি নির্ধারণ করে যে আরও হার্ডওয়্যার কেনা আসলে আনুপাতিকভাবে আরও বেশি ক্ষমতা কিনবে কিনা। র্যাক জুড়ে কাছাকাছি-রৈখিক স্কেলিং প্রস্তাব করে যে এই স্কেলে বাধা আন্তঃ-র্যাক যোগাযোগের পরিবর্তে জিপিইউ পারফরম্যান্সে রয়ে গেছে।

সফ্টওয়্যার যৌগিক রাখে

MLPerf রাউন্ডে একটি পুনরাবৃত্ত প্যাটার্ন আবার অনুষ্ঠিত হয়েছে: সফ্টওয়্যার উন্নতি একাই NVIDIA-এর v6.1 জমাতে v6.0-এর তুলনায় 1.6 গুণ বেশি পারফরম্যান্স প্রদান করেছে, এবং কোম্পানি বলছে যে অপ্টিমাইজেশানগুলি v6.1 জমা দেওয়ার সময়সীমার পরেও ল্যান্ড করতে থাকে, আরও লাভ ডেলিভারি করে৷

ক্রেতাদের জন্য, এর অর্থ হল যে একটি প্রদত্ত র্যাক হার্ডওয়্যার রিফ্রেশ ছাড়াই তার জীবদ্দশায় দ্রুত হয়ে যায় - একটি গতিশীল NVIDIA যুক্তি দেখাতে ব্যবহার করেছে যে সফ্টওয়্যার স্ট্যাক পরিপক্ক হওয়ার সাথে সাথে এটির ইনস্টল করা বেস মূল্যহ্রাস করার পরিবর্তে প্রশংসা করে।

এজেন্টিক কাজের চাপ বেঞ্চমার্কগুলিকে নতুন আকার দেয়

v6.1 রাউন্ডটি কিসের জন্য অনুমান ব্যবহার করা হচ্ছে তার একটি পরিবর্তনও প্রতিফলিত করে। NVIDIA SemiAnalysis-এর AgentX বেঞ্চমার্কের প্রিভিউ টেস্টিংয়ের দিকে ইঙ্গিত করেছে, AI এজেন্টদের চারপাশে ডিজাইন করা হয়েছে যে কারণে, পরিকল্পনা করে এবং একাধিক ধাপ জুড়ে কাজ করে, যেখানে এটি বলে যে Vera Rubin NVL72 GB300 NVL72 এর 30 গুণ পারফরম্যান্স প্রদান করেছে।

MLCcommons এই শিফটের জন্য একটি ডেডিকেটেড বেঞ্চমার্কও প্রস্তুত করছে: আসন্ন MLPerf এন্ডপয়েন্টস বেঞ্চমার্কের লক্ষ্য হল এজেন্টিক ইনফারেন্স ওয়ার্কলোডের পরিমাপ মানক করা যা ঐতিহ্যগত থ্রুপুট পরীক্ষাগুলি খারাপভাবে ক্যাপচার করে। যেহেতু অনুমান একক-প্রম্পট চ্যাট থেকে দীর্ঘ মাল্টি-স্টেপ এজেন্ট সেশনের দিকে চলে যায়, লেটেন্সি এবং ইন্টারেক্টিভ সামঞ্জস্য প্রতি সেকেন্ডে কাঁচা টোকেনের মতোই গুরুত্বপূর্ণ - এবং সেই অনুযায়ী বেঞ্চমার্কগুলি পুনর্নির্মাণ করা হচ্ছে।

নেবিয়াস এবং ইকোসিস্টেম তাড়াতাড়ি আসে

ক্লাউড প্রদানকারী নেবিয়াস ভেরা রুবিন NVL72 প্রিভিউ ফলাফলও জমা দিয়েছে, যা NVIDIA শক্তিশালী প্রারম্ভিক ইকোসিস্টেম কর্মক্ষমতার প্রমাণ হিসেবে তুলে ধরেছে। প্রারম্ভিক তৃতীয় পক্ষের জমাগুলি সাধারণত একটি লক্ষণ যে পরবর্তী প্রজন্মের সিস্টেমগুলি ল্যাব স্যাম্পলিং থেকে বিস্তৃত প্রাপ্যতার দিকে অগ্রসর হচ্ছে, যদিও NVIDIA-এর পোস্ট বা MLCcommons-এর প্রকাশ সাধারণ-প্রাপ্যতার সময় নির্দিষ্ট করে না।

কেন এটি এআই অর্থনীতির জন্য গুরুত্বপূর্ণ

NVIDIA ফলাফলগুলিকে আয়ের শর্তে ফ্রেম করে: প্রতিটি ভেরা রুবিন NVL72 র্যাক উল্লেখযোগ্যভাবে আরও বেশি টোকেন তৈরি করে, আরও বেশি ব্যবহারকারীকে পরিবেশন করে এবং একটি GB300 NVL72 র্যাকের তুলনায় টোকেন প্রতি খরচ কম করে। এমন একটি শিল্পে যেখানে অনুমানের চাহিদা যুক্তিযুক্ত মডেল এবং এজেন্ট কাজের চাপ দ্বারা চালিত হয় যা সাধারণ চ্যাটের তুলনায় প্রতি ক্যোয়ারীতে বেশি গণনা করে, প্রতি-র্যাক থ্রুপুট হল সেই সংখ্যা যা নির্ধারণ করে যে একটি নির্দিষ্ট ডেটা-সেন্টার বাজেট কতজন ব্যবহারকারীকে পরিবেশন করতে পারে।

সাধারণ সতর্কতাগুলি প্রযোজ্য: এগুলি হল একটি পূর্বরূপ রাউন্ডে বিক্রেতার জমা দেওয়া, NVIDIA দ্বারা নির্বাচিত দুটি মডেলে, অপ্টিমাইজেশানগুলি এখনও অবতরণ করে৷ তবে দিকটি দ্ব্যর্থহীন। ভেরা রুবিনের প্রতি MLPerf-এর প্রথম চেহারা 2023 সাল থেকে AI পরিকাঠামোকে সংজ্ঞায়িত করে এমন পারফরম্যান্স ক্লাইম্বের পরামর্শ দেয় যার কোনও মালভূমি নেই — এবং পরবর্তী র্যাক-রিফ্রেশ চক্রটি আবার স্কেল এ AI পরিবেশনের অর্থনীতিকে পুনরায় সেট করবে।

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →