फायरवर्क्स रिसर्च, इनफरेन्स स्टार्टअप फायरवर्क्स एआय मधील मॉडेल टीमने एम्बर-1 सादर केले आहे, हे एक विशेष मॉडेल आहे जे कंपनीचे म्हणणे आहे की मूनशॉट AI च्या किमी K3 सारखीच उत्तरे तयार करतात आणि अंदाजे 40% कमी टोकन उत्सर्जित करतात. हे मॉडेल 23 सप्टेंबर रोजी Fireworks च्या प्लॅटफॉर्मवर लाइव्ह झाले आणि गेल्या काही दिवसांपासून ते विकसक समुदायातील सर्वाधिक चर्चेत असलेल्या प्रकाशनांपैकी एक बनले आहे, ज्याने हॅकर न्यूजवर शेकडो अपव्होट्स मिळवले आहेत कारण कोडरने तर्कसंगत टोकन ही पुढील किंमत सीमा आहे की नाही यावर चर्चा केली आहे.

खेळपट्टी अशा क्षणी येते जेव्हा अनुमानाची बिले, मॉडेल क्षमता नाही, संघांना काय पाठवणे परवडेल हे वाढत्या प्रमाणात ठरवले जाते. एजंटिक वर्कलोड्स पाहणाऱ्या टीम्ससाठी, नवीनतम एआय डेव्हलपमेंट्स ने एक गोष्ट स्पष्ट केली आहे: सध्या उद्योगाची सर्वात महाग सवय म्हणजे फ्रंटियर मॉडेल्सना प्रशिक्षण देणे नाही, ती त्यांना चालवत आहे. एम्बर-1 हा त्या समस्येवर थेट हल्ला करण्याचा फायरवर्क्सचा प्रयत्न आहे आणि कंपनीने बेंचमार्क आणि उत्पादन क्रमांकांच्या असामान्यपणे तपशीलवार सेटसह त्याचे समर्थन केले.

विचार करणारे मॉडेल खूप विचार करतात

एम्बर-1 च्या मागे मुख्य निरीक्षण असे आहे की किमी K3 सारखी तर्कसंगत मॉडेल्स त्यांच्या व्युत्पन्न केलेल्या टोकन्सपैकी बहुतेक - काहीवेळा 90% पेक्षा जास्त, फायरवर्क्सनुसार - उत्तरावर न जाता अंतर्गत तर्कांवर खर्च करतात. एकाच विनंतीवर, ते महाग आहे. एजंटिक वर्कलोड्समध्ये, ते एकत्रित होते: एजंटच्या संभाषणाचे प्रत्येक वळण मॉडेलवर सर्व पूर्वीचे तर्क पुन्हा प्ले करते, त्यामुळे संदर्भ वळणांच्या संख्येसह अंदाजे चतुर्भुज वाढतो आणि सुरुवातीच्या वळणांचे दीर्घ तर्क ट्रेस पुन्हा वाचले जातात आणि त्यानंतरच्या प्रत्येक कॉलवर पुन्हा बिल केले जाते.

फायरवर्क्स म्हणते की ग्राहकांनी त्यांना सांगितले की त्यांना किमी K3 ची कोडिंग क्षमता कमी किंमतीत हवी आहे, परंतु मॉडेलच्या तर्कशक्तीच्या प्रयत्नांना नकार दिल्याने काम झाले नाही — कमी-प्रयत्न सेटिंग्जने खूप गुणवत्ता सोडली. महत्त्वाचा तर्क ठेवताना अधिक कार्यक्षमतेने कारण सांगणारे मॉडेल प्रशिक्षित करणे हा पर्याय होता.

कचरा बाहेर काढण्याचे प्रशिक्षण

बिल्डिंग एम्बर-1 ने 50 पेक्षा जास्त प्रशिक्षण प्रयोग आणि 200 पेक्षा जास्त मूल्यमापन केले, कंपनीच्या ब्लॉग पोस्टनुसार, पूर्णपणे फायरवर्क्सच्या स्वतःच्या सर्व्हरलेस ट्रेनिंग प्लॅटफॉर्मवर चालते. संघ म्हणतो की अचूकता न गमावता तर्क लहान करण्यासाठी नवीन प्रशिक्षण अल्गोरिदम विकसित केले आहेत.

विशेष म्हणजे, कंपनीने तर्क घाऊक दूर करण्याचा प्रयत्न केला नाही. Kimi K3 ची काही स्पष्ट शब्दशः उत्पादक आत्म-प्रतिबिंब आहे — एखाद्या गृहीतकाची पुनरावृत्ती करणे, फीडबॅकला प्रतिसाद देणे किंवा पूर्वीच्या निर्णयावर परिणाम शोधणे मॉडेलला चुकांमधून सावरण्यास मदत करते. अनुत्पादक लूप ट्रिम करताना ती क्षमता टिकवून ठेवण्यासाठी प्रशिक्षण पद्धतीची रचना करण्यात आली होती.

प्रशिक्षण डेटामध्ये गणित, कोडींग, सूचनांचे अनुसरण, संभाषण, शोध, साधनांचा वापर आणि सॉफ्टवेअर अभियांत्रिकी, स्वतंत्र समस्या आणि विस्तारित बहु-वळण परस्परसंवाद या दोन्ही गोष्टींचा समावेश आहे. फायरवर्क्स म्हणते की त्याने फक्त स्वतःचा डेटा वापरला आणि ग्राहकांचा डेटा नाही.

बेंचमार्क: पॅरेटो फ्रंटियरवर किंवा जवळ

किमतीच्या बाबतीत, Fireworks ने Kimi K3 च्या सार्वजनिक API किंमतीचा वापर करून प्रति-बेंचमार्क खर्चाची गणना केली — $3 प्रति दशलक्ष अनकॅश्ड इनपुट टोकन, $0.30 प्रति दशलक्ष कॅश्ड इनपुट टोकन, आणि $15 प्रति दशलक्ष आउटपुट टोकन — आणि एम्बर-1 ची K3 विरुद्ध कमी, उच्च आणि जास्तीत जास्त तर्कशक्तीच्या प्रयत्नात तुलना केली. 50 पेक्षा जास्त चाचणी नमुन्यांसह प्रत्येक बेंचमार्कवर, कंपनीने अहवाल दिला आहे की एम्बर-1 पॅरेटो फ्रंटियरवर किंवा जवळ बसते, किमतीच्या एका अंशासाठी जास्तीत जास्त प्रयत्नात K3 शी जुळते आणि कमी प्रयत्नात K3 वर काटेकोरपणे प्रभुत्व मिळवते.

फायरवर्क्स द्वारे नोंदवल्यानुसार, जास्तीत जास्त प्रयत्नात K3 विरुद्ध मथळ्याची तुलना:

| बेंचमार्क | नमुने | K3 (कमाल प्रयत्न) | एम्बर-1 |
|---|---|---|---|
| टर्मिनल बेंच 2.1 | ८९ | ८०.९% | ८२.०% |
| SWE-बेंच सत्यापित | ५०० | ९३.२% | ९२.२% |
| SWE-संवाद | 75 | 21.3% | 20.0% |
| DeepSWE 1.1 | 113 | ६६.४% | ७५.२% |
| τ²-बेंच एअरलाइन | 50 | ६४% | ६६% |

प्रति टास्कच्या खर्चावर, फायरवर्क्सने टर्मिनल बेंच 2.1 वर 51.9%, SWE-इंटरॅक्टवर 32.5%, डीपएसडब्ल्यूई 1.1 वर 23.7%, आणि SWE-बेंचवर 15.5% जास्तीत जास्त प्रयत्नात K3 च्या तुलनेत 51.9% ने खर्चात कपात केल्याचा अहवाल फायरवर्क्सने दिला आहे — डीपएसडब्ल्यूईच्या बाबतीत, कंपनीच्या प्रति युनिट $1 कॅल पेक्षा अधिक $1 कॅल फरक दर

कंपनीने डॉक्सिमिटीच्या बेडसाइड बेंचवर एम्बर-1 चे मूल्यमापन केले, जो फायरवर्क्सने नव्याने लाँच केलेल्या स्पेशलाइज्ड इंटेलिजेंस इंडेक्सद्वारे चालवलेल्या 10 वैशिष्ट्यांमधील 500 क्लिनिकल केसेसचा फिजिशियन-समाणीकृत बेंचमार्क आहे. तेथे, फायरवर्क्स म्हणते की एम्बर-1 ने GPT-5.6 सोल, GPT-6 एस्ट्रा आणि क्लॉड ओपस 5 या दोन्ही खुल्या आणि बंद मॉडेल्सवर प्रति टास्कसाठी नवीन पॅरेटो सीमा सेट केली आहे. हा दावा फायरवर्क्सच्या स्वतःच्या निर्देशांकातून आला आहे आणि त्याची स्वतंत्रपणे पडताळणी झालेली नाही.

थेट रहदारी: कमी टोकन, समान स्कोअर

बेंचमार्क ही एक गोष्ट आहे; उत्पादन दुसरे आहे. फायरवर्क्सने त्यांच्या उत्पादन कोडिंग वर्कलोड्सवर दोन ग्राहकांसह थेट A/B चाचण्या केल्या आणि एम्बर-1 ने तुलनात्मक गुणवत्तेवर प्रति कार्य अंदाजे 35% कमी टोकन वापरल्याचा अहवाल दिला. एका मोजमाप केलेल्या तुलनेत, किमी K3 ने प्रति कार्य 49,300 आउटपुट टोकन व्युत्पन्न करताना 0.751 स्कोअर केले, एम्बर-1 साठी 0.753 विरुद्ध 29,900 टोकन्स - तर्क टोकनमध्ये 71.3% घट आणि एकूण 39% कमी टोकन. चाचण्यांनंतर, एका ग्राहकाने एम्बर-1 ला लाइव्ह प्रोडक्शनमध्ये हलवले आणि बेस मॉडेल पूर्णपणे बदलण्यासाठी ते वाढवण्याच्या योजना आहेत.

फायरवर्क्सच्या आत, मॉडेल लाँच करण्यापूर्वी कंपनीच्या स्वतःच्या कोडिंग वर्कफ्लोमध्ये शांतपणे बदलले गेले. संघ म्हणते की त्याचा अभिमान आहे: कोणीही लक्षात घेतले नाही. विकसकांनी कमी टोकन वापरताना स्विच न शोधता त्यांचे काम चालू ठेवले.

रणनीती म्हणून विशेष बुद्धिमत्ता

एम्बर-1 हे फायरवर्क्स रिसर्चच्या नियोजित मालिकेतील पहिले मॉडेल आहे आणि ते कंपनीच्या स्पेशलाइज्ड इंटेलिजेंस इंडेक्सच्या बरोबरीने आले आहे, या महिन्याच्या सुरुवातीला तज्ञांनी तयार केलेल्या वास्तविक-जागतिक कार्यांवरील खुल्या, बंद आणि विशेष मॉडेल्सची तुलना करण्यासाठी बेंचमार्किंग प्रयत्न सुरू केला आहे.

धोरणात्मक नाटक वाचण्यास सोपे आहे. फ्रंटियर मॉडेलला सुरवातीपासून प्रशिक्षण देण्याऐवजी, फायरवर्क्सने एक मजबूत ओपन-वेट मॉडेल घेतले, त्यात टोकन कार्यक्षमता प्रशिक्षित केली आणि आता तीच क्षमता प्रति कार्य कमी किमतीत विकत आहे. मूनशॉट सारख्या लॅबमधून ओपन-वेट रिलीझ क्षमता अंतर बंद करत असल्याने, अनुमान प्रदाते शोधत आहेत की लीडरबोर्ड स्थितीपेक्षा टिकाऊ फरक प्रति पूर्ण कार्याच्या खर्चात असू शकतो - एक शिफ्ट जी मजबूत प्रशिक्षण आणि सेवा देणाऱ्या पायाभूत सुविधा असलेल्या कंपन्यांना अनुकूल करते.

चेतावणी स्पष्टपणे सांगण्यासारख्या आहेत: वरील संख्या फायरवर्क्सच्या स्वतःच्या ब्लॉगवरून, त्याच्या स्वतःच्या मूल्यमापनातून आणि स्वतःचे पैसे देणाऱ्या ग्राहकांकडून आले आहेत. बाहेरील वर्कलोडवर टोकन बचतीची स्वतंत्र प्रतिकृती ही खरी कसोटी असेल. परंतु जर परिणाम धारण केले तर, फ्रंटियर-क्लास ओपन मॉडेल चालवण्याचा सर्वात किफायतशीर मार्ग यापुढे त्याला कमी विचार करायला लावणे असू शकत नाही - ते कार्यक्षमतेने विचार करायला शिकलेले मॉडेल चालवणे असू शकते.
---

एआयच्या पुढे राहा

नवीनतम AI बातम्या, विश्लेषण आणि यश मिळवा — सर्व एकाच ठिकाणी.

अधिक AI बातम्या वाचा →