ডিপসিক ডিএসপার্ক প্রকাশ করেছে, একটি ওপেন-সোর্স অনুমানমূলক ডিকোডিং ফ্রেমওয়ার্ক যা কোম্পানি বলেছে যে আউটপুট মানের কোনো ক্ষতি ছাড়াই লাইভ ট্রাফিকের অধীনে 85% পর্যন্ত বড় ভাষা মডেল (LLM) অনুমানকে ত্বরান্বিত করে। ডিপসিক-এআই এবং পিকিং ইউনিভার্সিটির একটি নতুন কাগজে বর্ণিত, সিস্টেমটি ইতিমধ্যেই ডিপসিক-ভি4 পরিবেশনকারী পরিকাঠামোর ভিতরে চলছে যা প্রকৃত ব্যবহারকারীর অনুরোধগুলি পরিচালনা করে।
কাজটি AI উৎপাদনের সবচেয়ে একগুঁয়ে সমস্যাগুলির একটি মোকাবেলা করে: অনুমানটি ধীর কারণ মডেলগুলি একবারে একটি টোকেন পাঠ্য তৈরি করে, প্রতিটি নেটওয়ার্কের মাধ্যমে সম্পূর্ণ পাসের প্রয়োজন৷ অনুমানমূলক ডিকোডিং হল একটি জনপ্রিয় প্রতিকার যেখানে একটি ছোট, দ্রুত "খসড়া" মডেল টোকেনের একটি ব্লক প্রস্তাব করে যা পূর্ণ-আকারের মডেলটি একটি একক পাসে যাচাই করে, দীর্ঘতম সঠিক উপসর্গটি গ্রহণ করে। কারণ যাচাইকরণ সমান্তরাল এবং গাণিতিকভাবে সঠিক, এটি মূল মডেলের বিতরণ সংরক্ষণ করার সময় জিনিসগুলিকে গতি দেয়৷ ডিএসপার্ক, গিটহাবের ডিপস্পেক ট্রেনিং রিপোজিটরির পাশাপাশি প্রকাশিত, দ্রুত হ্যাকার নিউজে সবচেয়ে আলোচিত এআই ইঞ্জিনিয়ারিং গল্পগুলির মধ্যে একটি হয়ে উঠেছে। For more context on this story, see our ongoing AI industry coverage.
কেন বিদ্যমান অনুমানমূলক ডিকোডিং একটি দেয়ালে আঘাত করে
সাম্প্রতিক অনুমানমূলক ডিকোডিং গবেষণা "সমান্তরাল ড্রাফটার" এর দিকে চলে গেছে যা একটি একক ফরোয়ার্ড পাসে প্রার্থীর টোকেনগুলির একটি সম্পূর্ণ ব্লক তৈরি করে, খসড়া লেটেন্সি ব্লকের আকার থেকে প্রায় স্বাধীন করে তোলে। ডিএসপার্ক কাগজ দুটি বাধা চিহ্নিত করে যা এই পদ্ধতিগুলিকে তাদের প্রতিশ্রুতি স্কেলে সরবরাহ করতে বাধা দিয়েছে।
প্রথমটি একটি মানের সমস্যা। যেহেতু সমান্তরাল ড্রাফটাররা প্রতিটি অবস্থান স্বাধীনভাবে ভবিষ্যদ্বাণী করে, তারা মডেল করতে পারে না কিভাবে একটি ব্লকের মধ্যে টোকেন একে অপরের উপর নির্ভর করে। গবেষকরা দেখান যে এটি একটি খসড়া ব্লকের পরবর্তী অবস্থানে "মাল্টি-মডাল সংঘর্ষ" এবং দ্রুত গ্রহণযোগ্যতা ক্ষয়ের দিকে পরিচালিত করে, একটি ঘটনাকে তারা প্রত্যয় ক্ষয় বলে। সমান্তরাল ব্লক যত লম্বা হবে, তার লেজ ভুল হওয়ার সম্ভাবনা তত বেশি।
দ্বিতীয়টি একটি সিস্টেম-স্তরের সমস্যা। যদিও লং ড্রাফ্ট ব্লক তৈরি করা সস্তা, অন্ধভাবে প্রতিটি প্রস্তাবিত টোকেন যাচাই করা টোকেনগুলির দুষ্প্রাপ্য ব্যাচ ক্ষমতাকে বাতিল করে দেয়। একটি বাস্তব পরিবেশন ব্যবস্থার উচ্চ সঙ্গতির অধীনে, আদর্শ যাচাইকরণের দৈর্ঘ্য দুটি অক্ষ বরাবর পরিবর্তিত হয়: কোডের মতো কাঠামোগত অনুরোধগুলি ওপেন-এন্ডেড চ্যাটের তুলনায় উচ্চতর গ্রহণযোগ্যতার হার বজায় রাখে এবং অতিরিক্ত টোকেন যাচাই করা হালকা লোডের অধীনে প্রায় বিনামূল্যে তবে সিস্টেমটি স্যাচুরেটেড হলে ব্যয়বহুল।
একটি সেমি-অটোরিগ্রেসিভ ড্রাফ্ট মডেল
প্রত্যয় ক্ষয় ঠিক করতে, ডিএসপার্ক গ্রহণ করে যাকে লেখকরা আধা-স্বয়ংক্রিয় আর্কিটেকচার বলে। এটি একটি গণনাগতভাবে ভারী সমান্তরাল ব্যাকবোনকে যুক্ত করে, যা একযোগে অনেকগুলি টোকেন প্রস্তাব করতে পারে, একটি হালকা ওজনের অনুক্রমিক মডিউল যা ইন্ট্রা-ব্লক নির্ভরতা মডেলিং প্রবর্তন করে। নকশার উদ্দেশ্য হল প্রারম্ভিক অবস্থানে সমান্তরাল মডেলগুলির উচ্চ ক্ষমতাকে ঐতিহ্যগত অটোরিগ্রেসিভ ড্রাফটারগুলির প্রত্যয় সংযোজনের সাথে একত্রিত করা, যা একের পর এক টোকেন তৈরি করে এবং স্বাভাবিকভাবেই নির্ভরতাকে সম্মান করে।
গাণিতিক যুক্তি, কোড জেনারেশন এবং প্রতিদিনের চ্যাটে বিস্তৃত নিয়ন্ত্রিত অফলাইন বেঞ্চমার্কে, টিম রিপোর্ট করে যে DSpark শক্তিশালী বেসলাইনগুলির উপর যাচাইকরণ চক্রের প্রতি স্বীকৃত দৈর্ঘ্যকে উল্লেখযোগ্যভাবে উন্নত করে। বিশেষভাবে, কাগজে বলা হয়েছে যে DSpark অটোরিগ্রেসিভ Eagle3 ড্রাফটারের উপর 30.9%, 26.7%, এবং 30.0% তিনটি সেটিংস জুড়ে এবং সমান্তরাল DFlash ড্রাফটারের উপরে 16.3%, 18.4% এবং 18.3% দ্বারা গৃহীত দৈর্ঘ্য উন্নত করে৷
আত্মবিশ্বাস-নির্ধারিত, লোড-সচেতন যাচাইকরণ
ডিএসপার্কের আরও অভিনব অর্ধেক হল যাচাইকরণের পদ্ধতি। প্রতিটি অনুরোধের জন্য একটি নির্দিষ্ট সংখ্যক খসড়া টোকেন যাচাই করার পরিবর্তে, ডিএসপার্ক বিশ্বব্যাপী থ্রুপুট সর্বাধিকীকরণ সমস্যা হিসাবে যাচাই-দৈর্ঘ্য নির্বাচনকে প্রণয়ন করে। এটি একটি হার্ডওয়্যার-সচেতন শিডিউলারের সাহায্যে একটি খসড়ার উপসর্গ কতক্ষণ বেঁচে থাকার সম্ভাবনা রয়েছে, কাগজটি যাকে টিকে থাকার সম্ভাবনা বলেছে তার ক্রমাঙ্কিত অনুমানগুলিকে জোড়া দেয় যা রিয়েল-টাইম ইঞ্জিন লোড পড়ে।
ফলাফল হল আস্থা-নির্ধারিত যাচাইকরণ: সিস্টেমটি গতিশীলভাবে টেইলর করে যে এটি অনুরোধের বিষয়বস্তু এবং পরিবেশনকারী ইঞ্জিনের বর্তমান অবস্থা উভয়ের উপর ভিত্তি করে প্রতিটি অনুরোধের জন্য কতগুলি টোকেন যাচাই করে। হালকা লোডের অধীনে এটি উদারভাবে যাচাই করার সামর্থ্য রাখে, যখন ভারী একযোগে এটি লক্ষ্য মডেলের যাচাইকরণ বাজেটকে শুধুমাত্র সর্বোচ্চ প্রত্যাশিত রিটার্ন সহ টোকেনের দিকে রুট করে, কম-সম্ভাব্যতা টোকেনগুলিতে ব্যাচের ক্ষমতা ব্যয় করার ফলে যে থ্রুপুট পতন হয় তা এড়িয়ে যায়।
লাইভ ইউজার ট্রাফিকের অধীনে ফলাফল
সবচেয়ে ফলপ্রসূ সংখ্যা উৎপাদন থেকে আসে। দলটি ডিপসিক-ভি4 সার্ভিং সিস্টেমের অভ্যন্তরে ডিএসপার্ককে লাইভ ব্যবহারকারী ট্রাফিক পরিবেশন করে এবং এটিকে কোম্পানির পূর্বের উৎপাদন বেসলাইনের সাথে তুলনা করে, একটি মাল্টি-টোকেন ভবিষ্যদ্বাণী পদ্ধতি যা MTP-1 নামে পরিচিত।
কাগজ অনুসারে, ডিএসপার্ক ধারাবাহিকভাবে ডিপসিক-ভি4-ফ্ল্যাশ-এর জন্য প্রতি-ব্যবহারকারী প্রজন্মের গতি 60% থেকে 85% এবং ডিপসিক-V4-প্রো-এর জন্য মিলে যাওয়া মোট থ্রুপুটে 57% থেকে 78% পর্যন্ত ত্বরান্বিত করে। কঠোর পরিষেবা-স্তরের চুক্তির অধীনে যেখানে বেসলাইনের ক্ষমতা মারাত্মকভাবে খারাপ হয়, ফ্ল্যাশের জন্য প্রতি সেকেন্ডে 120 টোকেনের সমতুল্য এবং প্রো-এর জন্য প্রতি সেকেন্ডে 50 টোকেনের সমতুল্য, DSpark শক্তিশালী থ্রুপুট বজায় রাখতে ওভারহেড যাচাইকরণ কমিয়ে দেয়। সেই পারফরম্যান্স ক্লিফকে অতিক্রম করে, লেখকরা যুক্তি দেন যে এটি কঠোর ইন্টারঅ্যাক্টিভিটি স্তরগুলিকে আনলক করে যা পূর্বে অপ্রাপ্য ছিল, কার্যকরভাবে এলএলএম-এর প্যারেটো সীমান্তকে বাইরের দিকে স্থানান্তরিত করে।
অপারেটরদের জন্য এই পার্থক্য গুরুত্বপূর্ণ। একই মোট থ্রুপুটে দ্রুত প্রতি-ব্যবহারকারীর গতি মানে আরও হার্ডওয়্যার না কিনে আরও প্রতিক্রিয়াশীল সহকারী এবং এজেন্টিক ওয়ার্কফ্লো, যখন লোডের অধীনে কঠোর লেটেন্সি SLA গুলি থেকে বেঁচে থাকা যা ট্রাফিক স্পাইকের সময় ধরে রাখতে পারে এমন একটি সিস্টেম থেকে একটি গবেষণা ডেমোকে আলাদা করে।
সম্প্রদায়ের জন্য ওপেন সোর্স
DeepSeek ডিপসিক-ভি4-ফ্ল্যাশ এবং ডিপসিক-ভি4-প্রো প্রিভিউ মডেল উভয়ের জন্য প্রশিক্ষিত ডিএসপার্ক চেকপয়েন্ট প্রকাশ করছে। অনুমিত এমআইটি লাইসেন্সের অধীনে প্রকাশিত সহগামী ডিপস্পেক সংগ্রহশালাকে একটি ফুল-স্ট্যাক, অ্যালগরিদম-চালিত প্রশিক্ষণ এবং অনুমানমূলক ডিকোডিংয়ের জন্য মূল্যায়ন কোডবেস হিসাবে বর্ণনা করা হয়েছে। এতে ডেটা প্রস্তুতির ইউটিলিটি, খসড়া মডেল বাস্তবায়ন, প্রশিক্ষণ স্ক্রিপ্ট এবং মূল্যায়ন জোতা এবং তিনটি খসড়া মডেল অ্যালগরিদম সহ জাহাজ অন্তর্ভুক্ত রয়েছে: DSpark, DFlash এবং Eagle3।
রিলিজ অন্যান্য ল্যাব এবং অবকাঠামো দলগুলির জন্য একটি প্রমিত পাইপলাইনের বিরুদ্ধে তাদের নিজস্ব খসড়া মডেলগুলিকে প্রশিক্ষণ এবং বেঞ্চমার্ক করতে বাধা কমিয়ে দেয়। DeepSpec-এর মূল্যায়ন স্যুট GSM8K, MATH500, AIME 2025, HumanEval, MBPP, LiveCodeBench, MT-Bench, AlpacaEval এবং Arena-Hard-v2 সহ প্রতিষ্ঠিত বেঞ্চমার্কগুলিকে কভার করে৷
কেন এটা গুরুত্বপূর্ণ
অনুমান খরচ এবং লেটেন্সি এখন AI শিল্পের সংজ্ঞায়িত সীমাবদ্ধতার মধ্যে রয়েছে, কোম্পানিগুলি কীভাবে আক্রমনাত্মকভাবে AI এজেন্টদের মোতায়েন করে থেকে শুরু করে ছোট প্রদানকারীরা ইউনিট অর্থনীতিতে হাইপারস্কেলারের সাথে প্রতিদ্বন্দ্বিতা করতে পারে কিনা তা সবকিছুকে রূপ দেয়। DSpark এর অবদান একটি প্রদর্শনের চেয়ে কম একটি একক নতুন অ্যালগরিদম যা সাবধানে খসড়া মডেল এবং যাচাইকরণের সময়সূচীকে সহ-ডিজাইন করে এবং যাচাইকরণের দৈর্ঘ্যকে লাইভ সিস্টেম স্টেটের একটি ফাংশন হিসাবে বিবেচনা করে, বাস্তব স্থাপনায় সুইকে অর্থপূর্ণভাবে সরাতে পারে।
ডিপসিকের জন্য, যেটি দক্ষ, খোলাখুলিভাবে প্রকাশিত সিস্টেমগুলির উপর তার খ্যাতি তৈরি করেছে, ডিএসপার্ক হল একটি যুক্তিতে আরেকটি ডেটা পয়েন্ট যা ল্যাবটি এক বছরেরও বেশি সময় ধরে করে আসছে: যে ফ্রন্টিয়ার-গ্রেড সার্ভিং পারফরম্যান্স শুধুমাত্র কাঁচা গণনার মাধ্যমে নয় বরং স্মার্ট ইঞ্জিনিয়ারিংয়ের মাধ্যমে অর্জন করা যেতে পারে। সিন্থেটিক বেঞ্চমার্কের পরিবর্তে লাইভ ট্র্যাফিকের অধীনে লাভগুলি পরিমাপ করা হয়েছিল, এটি অন্যান্য অপারেটরদের জন্য ফলাফলটিকে গুরুত্ব সহকারে নেওয়া সহজ করে তোলে কারণ ওপেন সোর্স সম্প্রদায় কাগজটি হজম করে এবং সংখ্যাগুলি পুনরুত্পাদন শুরু করে।
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →

