फायरवर्क्स रिसर्च, अनुमान स्टार्टअप फायरवर्क्स एआई की मॉडल टीम ने एम्बर-1 पेश किया है, एक विशेष मॉडल जिसके बारे में कंपनी का कहना है कि यह मूनशॉट एआई के किमी K3 के समान उत्तर देता है, जबकि लगभग 40% कम टोकन उत्सर्जित करता है। यह मॉडल 23 सितंबर को फायरवर्क्स प्लेटफॉर्म पर लाइव हुआ और पिछले कुछ दिनों में यह डेवलपर समुदाय में सबसे अधिक चर्चित रिलीज में से एक बन गया है, हैकर न्यूज पर सैकड़ों अपवोट प्राप्त हुए हैं क्योंकि कोडर्स ने बहस की है कि क्या रीजनिंग टोकन अगली लागत सीमा है।
पिच ऐसे क्षण में आती है जब अनुमान बिल, मॉडल क्षमता नहीं, तेजी से तय करते हैं कि टीमें क्या शिप कर सकती हैं। एजेंटिक वर्कलोड को देखने वाली टीमों के लिए बजट की खपत होती है, [नवीनतम एआई विकास] (https://aibuzzwire.news) ने एक बात स्पष्ट कर दी है: उद्योग की सबसे महंगी आदत अभी फ्रंटियर मॉडल को प्रशिक्षित करना नहीं है, बल्कि उन्हें चलाना है। एम्बर-1 उस समस्या पर सीधे हमला करने का फायरवर्क्स का प्रयास है, और कंपनी ने बेंचमार्क और उत्पादन संख्याओं के असामान्य रूप से विस्तृत सेट के साथ इसका समर्थन किया है।
सोचने वाले मॉडल बहुत ज़्यादा सोचते हैं
एम्बर-1 के पीछे मुख्य अवलोकन यह है कि किमी K3 जैसे तर्क मॉडल अपने उत्पन्न टोकन का अधिकांश हिस्सा - कभी-कभी 90% से अधिक, फायरवर्क्स के अनुसार - उत्तर के बजाय आंतरिक तर्क पर खर्च करते हैं। एक ही अनुरोध पर, यह महंगा है। एजेंटिक कार्यभार में, यह संयोजित होता है: एजेंट वार्तालाप का प्रत्येक मोड़ सभी पूर्व तर्कों को मॉडल पर वापस दोहराता है, इसलिए संदर्भ मोड़ों की संख्या के साथ मोटे तौर पर चतुष्कोणीय रूप से बढ़ता है, और शुरुआती मोड़ों से लंबे तर्क के निशान फिर से पढ़े जाते हैं और हर बाद की कॉल पर फिर से बिल किए जाते हैं।
फायरवर्क्स का कहना है कि ग्राहकों ने उन्हें बताया कि वे कम कीमत पर किमी K3 की कोडिंग क्षमता चाहते हैं, लेकिन मॉडल के तर्क प्रयास को अस्वीकार करने से काम नहीं चला - कम प्रयास वाली सेटिंग्स ने बहुत अधिक गुणवत्ता खो दी। विकल्प यह था कि एक ऐसे मॉडल को प्रशिक्षित किया जाए जो मायने रखने वाले तर्क को ध्यान में रखते हुए अधिक कुशलता से तर्क करे।
अपशिष्ट को बाहर निकालने का प्रशिक्षण देना
कंपनी के ब्लॉग पोस्ट के अनुसार, बिल्डिंग एम्बर-1 में 50 से अधिक प्रशिक्षण प्रयोग और 200 से अधिक मूल्यांकन हुए, जो पूरी तरह से फायरवर्क्स के अपने सर्वरलेस ट्रेनिंग प्लेटफॉर्म पर चलता है। टीम का कहना है कि उसने सटीकता खोए बिना तर्क को छोटा करने के लिए नए प्रशिक्षण एल्गोरिदम विकसित किए हैं।
विशेष रूप से, कंपनी ने तर्क थोक को खत्म करने की कोशिश नहीं की। किमी K3 की कुछ स्पष्ट वाचालता उत्पादक आत्म-प्रतिबिंब है - एक धारणा पर दोबारा विचार करना, प्रतिक्रिया का जवाब देना, या किसी परिणाम का पहले के निर्णय पर वापस पता लगाना मॉडल को गलतियों से उबरने में मदद करता है। प्रशिक्षण व्यवस्था को अनुत्पादक लूपों को कम करते हुए उस क्षमता को संरक्षित करने के लिए डिज़ाइन किया गया था।
प्रशिक्षण डेटा में गणित, कोडिंग, निर्देशों का पालन, बातचीत, खोज, उपकरण का उपयोग और सॉफ्टवेयर इंजीनियरिंग शामिल है, जिसमें स्टैंडअलोन समस्याएं और विस्तारित मल्टी-टर्न इंटरैक्शन दोनों शामिल हैं। फायरवर्क्स का कहना है कि उसने केवल अपना डेटा इस्तेमाल किया और ग्राहक डेटा नहीं।
बेंचमार्क: पेरेटो फ्रंटियर पर या उसके निकट
लागत का मामला बनाने के लिए, फायरवर्क्स ने किमी K3 के सार्वजनिक एपीआई मूल्य निर्धारण का उपयोग करके प्रति-बेंचमार्क लागत की गणना की - $ 3 प्रति मिलियन अनकैश्ड इनपुट टोकन, $ 0.30 प्रति मिलियन कैश्ड इनपुट टोकन, और $ 15 प्रति मिलियन आउटपुट टोकन - और कम, उच्च और अधिकतम तर्क प्रयास पर K3 के खिलाफ एम्बर -1 की तुलना की। 50 से अधिक परीक्षण नमूनों के साथ प्रत्येक बेंचमार्क में, कंपनी की रिपोर्ट है कि एम्बर -1 पेरेटो सीमा पर या उसके निकट बैठता है, लागत के एक अंश के लिए अधिकतम प्रयास पर K3 से मेल खाता है और कम प्रयास में K3 पर सख्ती से हावी होता है।
जैसा कि फायरवर्क्स द्वारा रिपोर्ट किया गया है, शीर्षक में अधिकतम प्रयास पर K3 की तुलना की गई है:
| बेंचमार्क | नमूने | K3 (अधिकतम प्रयास) | अंगार-1 |
|---|---|---|---|
| टर्मिनल बेंच 2.1 | 89 | 80.9% | 82.0% |
| SWE-बेंच सत्यापित | 500 | 93.2% | 92.2% |
| SWE-इंटरैक्ट | 75 | 21.3% | 20.0% |
| डीपएसडब्ल्यूई 1.1 | 113 | 66.4% | 75.2% |
| τ²-बेंच एयरलाइन | 50 | 64% | 66% |
प्रति कार्य लागत पर, फायरवर्क्स ने बताया कि एंबर-1 ने टर्मिनल बेंच 2.1 पर खर्च में 51.9%, एसडब्ल्यूई-इंटरैक्ट पर 32.5%, डीपएसडब्ल्यूई 1.1 पर 23.7% और अधिकतम प्रयास पर के3 के सापेक्ष सत्यापित एसडब्ल्यूई-बेंच पर 15.5% की कटौती की है - डीपएसडब्ल्यूई के मामले में, कंपनी की गणना की गई दरों पर काम की प्रति यूनिट 126 डॉलर से अधिक का अंतर है।
कंपनी ने डॉक्सिमिटी के बेडसाइड बेंच पर एम्बर-1 का भी मूल्यांकन किया, जो 10 विशिष्टताओं में 500 नैदानिक मामलों का एक चिकित्सक-मान्य बेंचमार्क है, जिसे फायरवर्क्स अपने नए लॉन्च किए गए स्पेशलाइज्ड इंटेलिजेंस इंडेक्स के माध्यम से चलाता है। वहां, फायरवर्क्स का कहना है कि एम्बर-1 ने जीपीटी-5.6 सोल, जीपीटी-6 एस्ट्रा और क्लाउड ओपस 5 सहित खुले और बंद दोनों मॉडलों में प्रति कार्य लागत पर एक नया पेरेटो फ्रंटियर स्थापित किया है। यह दावा फायरवर्क्स के अपने सूचकांक से आता है और इसे स्वतंत्र रूप से सत्यापित नहीं किया गया है।
लाइव ट्रैफ़िक: कम टोकन, समान स्कोर
बेंचमार्क एक बात है; उत्पादन दूसरा है. फायरवर्क्स ने अपने उत्पादन कोडिंग कार्यभार पर दो ग्राहकों के साथ लाइव ए/बी परीक्षण चलाया और रिपोर्ट दी कि एम्बर-1 ने तुलनीय गुणवत्ता पर प्रति कार्य लगभग 35% कम टोकन का उपयोग किया। एक मापा तुलना में, किमी K3 ने प्रति कार्य 49,300 आउटपुट टोकन उत्पन्न करते हुए 0.751 स्कोर किया, जबकि 29,900 टोकन पर एम्बर -1 के लिए 0.753 स्कोर किया - तर्क टोकन में 71.3% की कमी और कुल टोकन 39% कम। परीक्षणों के बाद, एक ग्राहक ने बेस मॉडल को पूरी तरह से बदलने के लिए इसे बढ़ाने की योजना के साथ एम्बर-1 को लाइव उत्पादन में स्थानांतरित कर दिया।
फायरवर्क्स के अंदर ही, लॉन्च से पहले मॉडल को चुपचाप कंपनी के अपने कोडिंग वर्कफ़्लो में बदल दिया गया था। जिस परिणाम पर टीम का कहना है कि उसे सबसे अधिक गर्व है: किसी ने ध्यान नहीं दिया। डेवलपर्स ने काफी कम टोकन का उपभोग करते हुए स्विच का पता लगाए बिना अपना काम जारी रखा।
एक रणनीति के रूप में विशिष्ट बुद्धिमत्ता
एम्बर-1 फायरवर्क्स रिसर्च की योजनाबद्ध श्रृंखला में पहला मॉडल है, और यह कंपनी के स्पेशलाइज्ड इंटेलिजेंस इंडेक्स के साथ आता है, जो विशेषज्ञ द्वारा निर्मित वास्तविक दुनिया के कार्यों पर खुले, बंद और विशेष मॉडल की तुलना करने के लिए इस महीने की शुरुआत में शुरू किया गया एक बेंचमार्किंग प्रयास है।
रणनीतिक नाटक को पढ़ना आसान है। फ्रंटियर मॉडल को शुरू से प्रशिक्षित करने के बजाय, फायरवर्क्स ने एक मजबूत ओपन-वेट मॉडल लिया, इसमें टोकन दक्षता को प्रशिक्षित किया, और अब उसी क्षमता को प्रति कार्य कम लागत पर बेच रहा है। जैसे-जैसे मूनशॉट जैसी प्रयोगशालाओं से ओपन-वेट रिलीज़ क्षमता अंतर को बंद करते रहते हैं, अनुमान प्रदाताओं को पता चल रहा है कि टिकाऊ भेदभाव लीडरबोर्ड की स्थिति के बजाय प्रति पूर्ण कार्य की लागत में हो सकता है - एक बदलाव जो मजबूत प्रशिक्षण और सेवा बुनियादी ढांचे वाली कंपनियों का पक्ष लेता है।
चेतावनियाँ स्पष्ट रूप से कहने योग्य हैं: उपरोक्त संख्याएँ फायरवर्क्स के अपने ब्लॉग, उसके स्वयं के मूल्यांकन और उसके स्वयं के भुगतान करने वाले ग्राहकों से आती हैं। बाहरी कार्यभार पर टोकन बचत की स्वतंत्र प्रतिकृति वास्तविक परीक्षा होगी। लेकिन यदि परिणाम सही रहते हैं, तो फ्रंटियर-क्लास ओपन मॉडल को चलाने का सबसे अधिक लागत प्रभावी तरीका अब इसे कम सोचने वाला नहीं बनाना हो सकता है - यह एक ऐसा मॉडल चलाना हो सकता है जो कुशलतापूर्वक सोचना सीख गया हो।
---
नवीनतम एआई समाचार, विश्लेषण और सफलताएँ प्राप्त करें - सभी एक ही स्थान पर।
अधिक AI समाचार पढ़ें →