ফায়ারওয়ার্কস রিসার্চ, ইনফরেন্স স্টার্টআপ ফায়ারওয়ার্কস AI-এর মডেল দল, Ember-1 চালু করেছে, একটি বিশেষ মডেল যেটি কোম্পানি বলেছে যে মোটামুটি 40% কম টোকেন নির্গত করার সময় Moonshot AI এর Kimi K3 এর মতো একই উত্তর তৈরি করে। মডেলটি 23শে সেপ্টেম্বর ফায়ারওয়ার্কসের প্ল্যাটফর্মে লাইভ হয়েছে, এবং গত কয়েকদিন ধরে এটি ডেভেলপার সম্প্রদায়ের মধ্যে সবচেয়ে আলোচিত রিলিজগুলির মধ্যে একটি হয়ে উঠেছে, হ্যাকার নিউজে শত শত আপভোট পেয়েছে কারণ কোডাররা যুক্তি টোকেনগুলি পরবর্তী খরচের সীমান্ত কিনা তা নিয়ে বিতর্ক করেছে৷

পিচটি এমন এক মুহুর্তে আসে যখন অনুমান বিল, মডেলের ক্ষমতা নয়, ক্রমবর্ধমানভাবে সিদ্ধান্ত নেয় যে দলগুলি কী জাহাজ পাঠানোর সামর্থ্য রাখে। যে দলগুলো এজেন্টিক কাজের চাপ দেখে বাজেট খরচ করে, তাদের জন্য সর্বশেষ AI উন্নয়ন একটি জিনিস পরিষ্কার করেছে: এই মুহূর্তে শিল্পের সবচেয়ে ব্যয়বহুল অভ্যাসটি সীমান্তের মডেলদের প্রশিক্ষণ নয়, এটি তাদের চালাচ্ছে। Ember-1 হল ফায়ারওয়ার্কসের সেই সমস্যাটিকে সরাসরি আক্রমণ করার প্রয়াস, এবং কোম্পানি এটিকে একটি অস্বাভাবিকভাবে বিশদ বেঞ্চমার্ক এবং উৎপাদন নম্বর দিয়ে সমর্থন করেছিল।

চিন্তাশীল মডেলরা খুব বেশি চিন্তা করেন

Ember-1-এর পিছনে মূল পর্যবেক্ষণ হল যে Kimi K3-এর মত যুক্তির মডেলগুলি তাদের তৈরি করা টোকেনের বেশির ভাগই ব্যয় করে — কখনও কখনও 90%-এরও বেশি, Fireworks অনুসারে — উত্তরের পরিবর্তে অভ্যন্তরীণ যুক্তিতে। একক অনুরোধে, এটি ব্যয়বহুল। এজেন্টিক কাজের চাপে, এটি সংমিশ্রিত হয়: একটি এজেন্ট কথোপকথনের প্রতিটি মোড় মডেলে সমস্ত পূর্বের যুক্তিগুলিকে পুনরায় প্লে করে, তাই প্রসঙ্গটি বাঁকগুলির সংখ্যার সাথে মোটামুটিভাবে চতুর্মুখীভাবে বৃদ্ধি পায় এবং প্রারম্ভিক মোড় থেকে দীর্ঘ যুক্তির চিহ্নগুলি পুনরায় পড়া হয় এবং প্রতিটি পরবর্তী কলে পুনরায় বিল করা হয়।

ফায়ারওয়ার্কস বলে যে গ্রাহকরা তাদের বলেছিল যে তারা কম খরচে কিমি কে 3 এর কোডিং ক্ষমতা চায়, কিন্তু এটি কেবল মডেলের যুক্তির প্রচেষ্টাকে প্রত্যাখ্যান করে কাজ করেনি - কম-প্রচেষ্টা সেটিংস খুব বেশি গুণমান ছেড়ে দিয়েছে। বিকল্পটি ছিল এমন একটি মডেলকে প্রশিক্ষণ দেওয়া যা গুরুত্বপূর্ণ যুক্তি বজায় রেখে আরও দক্ষতার সাথে যুক্তি দেয়।

বর্জ্য আউট প্রশিক্ষণ

বিল্ডিং এমবার -1 50 টিরও বেশি প্রশিক্ষণ পরীক্ষা এবং 200 টিরও বেশি মূল্যায়ন করেছে, যা সম্পূর্ণরূপে ফায়ারওয়ার্কসের নিজস্ব সার্ভারহীন প্রশিক্ষণ প্ল্যাটফর্মে চালানো হয়েছে, কোম্পানির ব্লগ পোস্ট অনুসারে। দলটি বলে যে এটি সঠিকতা না হারিয়ে যুক্তি সংক্ষিপ্ত করার পথে নতুন প্রশিক্ষণ অ্যালগরিদম তৈরি করেছে।

উল্লেখযোগ্যভাবে, কোম্পানি যুক্তি পাইকারী নিষ্কাশন করার চেষ্টা করেনি. কিমি K3-এর কিছু আপাত শব্দচয়িতা হল উত্পাদনশীল আত্ম-প্রতিফলন — একটি অনুমান পুনর্বিবেচনা করা, প্রতিক্রিয়ার প্রতিক্রিয়া জানানো, বা পূর্ববর্তী সিদ্ধান্তে একটি ফলাফলের সন্ধান করা মডেলটিকে ভুল থেকে পুনরুদ্ধার করতে সহায়তা করে। প্রশিক্ষণ ব্যবস্থাটি অনুৎপাদনশীল লুপগুলি ছাঁটাই করার সময় সেই ক্ষমতা সংরক্ষণের জন্য ডিজাইন করা হয়েছিল।

প্রশিক্ষণের ডেটা গণিত, কোডিং, নির্দেশনা অনুসরণ, কথোপকথন, অনুসন্ধান, টুল ব্যবহার এবং সফ্টওয়্যার ইঞ্জিনিয়ারিং, উভয় স্বতন্ত্র সমস্যা এবং বর্ধিত মাল্টি-টার্ন ইন্টারঅ্যাকশনকে কভার করে। ফায়ারওয়ার্কস বলে যে এটি শুধুমাত্র তার নিজস্ব ডেটা ব্যবহার করেছে এবং কোনও গ্রাহকের ডেটা নেই।

মানদণ্ড: প্যারেটো সীমান্তের উপর বা কাছাকাছি

খরচের ক্ষেত্রে, ফায়ারওয়ার্কস কিমি K3-এর সর্বজনীন API মূল্য ব্যবহার করে প্রতি-বেঞ্চমার্ক খরচ গণনা করেছে — $3 প্রতি মিলিয়ন আনক্যাশড ইনপুট টোকেন, $0.30 প্রতি মিলিয়ন ক্যাশে ইনপুট টোকেন, এবং $15 প্রতি মিলিয়ন আউটপুট টোকেন - এবং কম, উচ্চ এবং সর্বাধিক যুক্তিযুক্ত প্রচেষ্টায় K3 এর সাথে Ember-1 তুলনা করেছে। 50 টিরও বেশি পরীক্ষার নমুনা সহ প্রতিটি বেঞ্চমার্ক জুড়ে, কোম্পানি রিপোর্ট করেছে যে Ember-1 প্যারেটো সীমান্তে বা তার কাছাকাছি বসে, খরচের একটি ভগ্নাংশের জন্য সর্বাধিক প্রচেষ্টায় K3 এর সাথে মেলে এবং কম প্রচেষ্টায় K3 এর সাথে কঠোরভাবে আধিপত্য বিস্তার করে।

সর্বোচ্চ প্রচেষ্টায় K3 এর সাথে শিরোনাম তুলনা, যেমন ফায়ারওয়ার্কস দ্বারা রিপোর্ট করা হয়েছে:

| বেঞ্চমার্ক | নমুনা | K3 (সর্বোচ্চ প্রচেষ্টা) | অঙ্গার-1 |
|---|---|---|---|
| টার্মিনাল বেঞ্চ 2.1 | 89 | 80.9% | ৮২.০% |
| SWE-বেঞ্চ যাচাইকৃত | 500 | 93.2% | 92.2% |
| SWE-ইন্টার্যাক্ট | 75 | 21.3% | 20.0% |
| DeepSWE 1.1 | 113 | 66.4% | 75.2% |
| τ²-বেঞ্চ এয়ারলাইন | 50 | 64% | 66% |

টাস্ক প্রতি খরচের ক্ষেত্রে, ফায়ারওয়ার্কস রিপোর্ট করেছে যে Ember-1 টার্মিনাল বেঞ্চ 2.1-এ খরচ 51.9%, SWE-ইন্টার্যাক্ট-এ 32.5%, DeepSWE 1.1-এ 23.7%, এবং SWE-বেঞ্চে সর্বোচ্চ প্রচেষ্টায় K3-এর তুলনায় 15.5% যাচাই করেছে — ডিপএসডব্লিউই-এর ক্ষেত্রে প্রতি ইউনিটে $1 26 ডলারের বেশি কাজের পার্থক্য। হার

কোম্পানিটি ডক্সিমিটির বেডসাইড বেঞ্চে এম্বার-1-এর মূল্যায়ন করেছে, এটি 10টি বিশেষত্ব জুড়ে 500টি ক্লিনিকাল মামলার একটি চিকিত্সক-প্রমাণিত বেঞ্চমার্ক যা ফায়ারওয়ার্কস তার সদ্য চালু হওয়া বিশেষ বুদ্ধিমত্তা সূচকের মাধ্যমে চালায়। সেখানে, ফায়ারওয়ার্কস বলেছে যে Ember-1 GPT-5.6 Sol, GPT-6 Astra, এবং Claude Opus 5 সহ খোলা এবং বন্ধ উভয় মডেল জুড়ে কাজের প্রতি খরচের উপর একটি নতুন প্যারেটো সীমান্ত সেট করেছে। এই দাবিটি ফায়ারওয়ার্কসের নিজস্ব সূচক থেকে এসেছে এবং স্বাধীনভাবে যাচাই করা হয়নি।

লাইভ ট্রাফিক: কম টোকেন, একই স্কোর

বেঞ্চমার্ক এক জিনিস; উত্পাদন অন্য। ফায়ারওয়ার্কস তাদের প্রোডাকশন কোডিং ওয়ার্কলোডের উপর দুই গ্রাহকের সাথে লাইভ A/B পরীক্ষা চালিয়েছে এবং রিপোর্ট করেছে যে Ember-1 তুলনামূলক মানের প্রতি টাস্কে প্রায় 35% কম টোকেন ব্যবহার করেছে। একটি পরিমাপিত তুলনাতে, Kimi K3 প্রতি টাস্কে 49,300 আউটপুট টোকেন জেনারেট করার সময় 0.751 স্কোর করেছে, Ember-1-এর জন্য 29,900 টোকেনে 0.753-এর বিপরীতে - যুক্তি টোকেনে 71.3% হ্রাস এবং মোট টোকেন 39% কম। পরীক্ষাগুলি অনুসরণ করে, একজন গ্রাহক এমবার-1 কে লাইভ প্রোডাকশনে স্থানান্তরিত করেছে যাতে বেস মডেলটিকে সম্পূর্ণভাবে প্রতিস্থাপন করার জন্য এটিকে বড় করার পরিকল্পনা করা হয়।

ফায়ারওয়ার্কের ভিতরেই, লঞ্চের আগে মডেলটিকে নিঃশব্দে কোম্পানির নিজস্ব কোডিং ওয়ার্কফ্লোতে অদলবদল করা হয়েছিল। দলটি বলেছে যে এটি গর্বিত: কেউ লক্ষ্য করেনি। ডেভেলপাররা যথেষ্ট কম টোকেন গ্রহণ করার সময় সুইচ সনাক্ত না করেই তাদের কাজ চালিয়ে যায়।

একটি কৌশল হিসাবে বিশেষ বুদ্ধিমত্তা

Ember-1 হল ফায়ারওয়ার্কস রিসার্চ থেকে একটি পরিকল্পিত সিরিজের প্রথম মডেল, এবং এটি কোম্পানির স্পেশালাইজড ইন্টেলিজেন্স ইনডেক্সের পাশাপাশি আসে, একটি বেঞ্চমার্কিং প্রচেষ্টা যা এই মাসের শুরুতে বিশেষজ্ঞদের তৈরি বাস্তব-বিশ্বের কাজগুলিতে খোলা, বন্ধ এবং বিশেষ মডেলগুলির তুলনা করার জন্য চালু করা হয়েছিল৷

কৌশলগত খেলা পড়া সহজ. স্ক্র্যাচ থেকে একটি ফ্রন্টিয়ার মডেলকে প্রশিক্ষণ দেওয়ার পরিবর্তে, ফায়ারওয়ার্কস একটি শক্তিশালী ওপেন-ওয়েট মডেল নিয়েছে, এটিতে টোকেন দক্ষতা প্রশিক্ষিত করেছে এবং এখন কাজ প্রতি কম খরচে একই ক্ষমতা বিক্রি করছে। মুনশটের মতো ল্যাব থেকে ওপেন-ওয়েট রিলিজগুলি সামর্থ্যের ব্যবধান বন্ধ করে চলেছে, অনুমান প্রদানকারীরা আবিষ্কার করছেন যে টেকসই পার্থক্য লিডারবোর্ড অবস্থানের পরিবর্তে সম্পূর্ণ টাস্ক প্রতি খরচের মধ্যে থাকতে পারে - এমন একটি পরিবর্তন যা শক্তিশালী প্রশিক্ষণ এবং পরিষেবা প্রদানকারী পরিকাঠামো সহ সংস্থাগুলির পক্ষে।

সতর্কতাগুলি স্পষ্টভাবে বলা মূল্যবান: উপরের সংখ্যাগুলি ফায়ারওয়ার্কসের নিজস্ব ব্লগ, এর নিজস্ব মূল্যায়ন এবং এর নিজস্ব অর্থপ্রদানকারী গ্রাহকদের থেকে এসেছে। বাইরের কাজের চাপে টোকেন সঞ্চয়ের স্বাধীন প্রতিলিপিই হবে আসল পরীক্ষা। কিন্তু ফলাফল ধরে রাখলে, ফ্রন্টিয়ার-ক্লাস ওপেন মডেল চালানোর সবচেয়ে সাশ্রয়ী উপায় হতে পারে এটিকে কম ভাবতে বাধ্য করা নয় - এটি এমন একটি মডেল চালানো হতে পারে যা দক্ষতার সাথে চিন্তা করতে শিখেছে।
---

এআই থেকে এগিয়ে থাকুন

সর্বশেষ AI খবর, বিশ্লেষণ এবং সাফল্য পান — সব এক জায়গায়।

আরও এআই খবর পড়ুন →