इंसेप्शन लैब्स ने मंगलवार को मर्करी 2.5 जारी किया, जो इसके वाणिज्यिक प्रसार भाषा मॉडल का एक नया संस्करण है, जिसे कंपनी बाजार पर सबसे सक्षम प्रसार एलएलएम के रूप में वर्णित करती है और, अपनी जानकारी के अनुसार, अब तक प्रशिक्षित सबसे बड़ा प्रसार भाषा मॉडल है। कंपनी की घोषणा के अनुसार, मॉडल अपने पूर्ववर्ती, मर्करी 2 की तुलना में बुद्धिमत्ता में 40% की वृद्धि प्रदान करता है, जबकि उसी कम-विलंबता, कम लागत वाली सेवा प्रोफ़ाइल को बरकरार रखता है जिसने प्रसार वास्तुकला को उच्च-मात्रा वाले वर्कलोड के लिए आकर्षक बना दिया है।

सीईओ स्टेफ़ानो एर्मन के नेतृत्व वाली कंपनी का दावा है कि मर्करी 2.5, जीपीटी-5.6 लूना (लो), जेमिनी 3.5 फ्लैश-लाइट और क्लाउड हाइकू 4.5 सहित लागत-अनुकूलित फ्रंटियर मॉडल के बराबर है। वे तुलनाएँ विक्रेता-रिपोर्ट की गई हैं और अभी तक स्वतंत्र बेंचमार्क द्वारा सत्यापित नहीं की गई हैं, लेकिन वे एक प्रसार मॉडल - लंबे समय तक एक शोध जिज्ञासा - को ऑटोरेग्रेसिव पदधारियों के उत्पादन विकल्प के रूप में प्रस्तुत करते हैं। नवीनतम एआई मॉडल समाचार के लिए, एआई बज़ वायर के चल रहे मॉडल कवरेज का अनुसरण करें। नवीनतम एआई मॉडल समाचार

गति, संदर्भ और कीमत

शीर्षक संख्या आक्रामक हैं. इंसेप्शन लैब्स का कहना है कि मर्करी 2.5 260,000 टोकन की संदर्भ विंडो के साथ व्यापक रूप से उपलब्ध एनवीआईडीआईए जीपीयू पर प्रति सेकंड 1,107 टोकन उत्पन्न करता है। मूल्य निर्धारण $0.20 प्रति मिलियन इनपुट टोकन और $0.75 प्रति मिलियन आउटपुट टोकन पर निर्धारित किया गया है, लॉन्च प्रमोशन के साथ मॉडल पर 80% से $0.04 प्रति मिलियन इनपुट और $0.15 प्रति मिलियन आउटपुट की छूट दी गई है।

क्षमता पक्ष पर, मॉडल ट्यून करने योग्य तर्क के साथ आता है - डेवलपर्स को प्रति-अनुरोध के आधार पर गहराई के लिए विलंबता का व्यापार करने देता है - साथ ही समानांतर टूल कॉल और संरचित पीढ़ी के लिए स्कीमा-संरेखित JSON आउटपुट भी देता है। कंपनी ने रिलीज़ को उत्पादन टेलीमेट्री द्वारा संचालित प्रशिक्षण लूप के पहले परिणाम के रूप में तैयार किया है: जब से मर्करी 2 लॉन्च हुआ है, हजारों डेवलपर्स ने इसके साथ निर्माण किया है, दर्जनों उद्यमों ने इसे तैनात किया है, और उपयोग परिमाण के एक क्रम से अधिक बढ़ गया है।

डिफ्यूजन मॉडल तेजी से टेक्स्ट क्यों उत्पन्न करते हैं

ओपनएआई, गूगल और एंथ्रोपिक से मुख्यधारा के एलएलएम ऑटोरेग्रेसिव हैं: वे एक समय में एक टोकन पर टेक्स्ट उत्पन्न करते हैं, प्रत्येक टोकन उसके पहले उत्पन्न होने वाली हर चीज़ पर वातानुकूलित होता है। वह अनुक्रमिक निर्भरता पीढ़ी की गति के तहत एक कठिन मंजिल डालती है। इसके बजाय डिफ्यूजन भाषा मॉडल शोर के एक ब्लॉक से शुरू होते हैं और समानांतर में सभी टोकन को पुनरावृत्त रूप से परिष्कृत करते हैं, जो मॉडल को साफ-सुथरे रूप से अभिसरण करने के लिए प्रशिक्षित होने के बाद पारंपरिक जीपीयू हार्डवेयर पर कहीं अधिक थ्रूपुट की अनुमति देता है।

व्यापार-बंद ऐतिहासिक रूप से गुणवत्तापूर्ण रहा है: प्रसार मॉडल ने तर्क और निर्देश-पालन बेंचमार्क पर ऑटोरेग्रेसिव मॉडल को पीछे छोड़ दिया है। इंसेप्शन लैब्स का मुख्य दांव - और मर्करी 2.5 में निहित दावा - यह है कि यह अंतर उस बिंदु तक कम हो गया है जहां प्रसार अक्ष पर जीतता है जो अधिकांश ग्राहक वास्तव में महसूस करते हैं: उत्पादन मात्रा में विलंबता और लागत।

शुरुआती ग्राहकों से उत्पादन के दावे

यह घोषणा बेंचमार्क तालिकाओं के बजाय ग्राहक तैनाती पर अधिक निर्भर करती है। ओपनकॉल, जो लाइव ग्राहक कॉल के लिए एआई फोन एजेंट बनाता है, ने बताया कि बुध पर जाने से इसकी औसत मॉडल प्रतिक्रिया विलंबता लगभग 170 मिलीसेकंड हो गई। ओपनकॉल के सह-संस्थापक और सीईओ ओलिवर सिल्वरस्टीन ने कहा कि कंपनी का P99 प्रतिक्रिया समय कई मिनट से घटकर एक सेकंड हो गया है, और इसका औसत 0.4 सेकंड से घटकर 0.2 से कम हो गया है - उन्होंने इन आंकड़ों को कंपनी द्वारा परीक्षण किए गए किसी भी अन्य प्रदाता की तुलना में काफी तेज बताया, जिसमें तर्क सक्षम होना भी शामिल है।

ऑगमेंट कोड, एक एआई कोडिंग सहायक निर्माता, संदर्भ संघनन, मॉडल रूटिंग और एमसीपी टूल खोज के लिए मर्करी का उपयोग करता है। इंसेप्शन लैब्स के अनुसार, कॉम्पैक्शन वर्कलोड को बुध पर ले जाने से उस चरण की विलंबता 82% कम हो गई, लगभग 150 सेकंड से 27 सेकंड तक, और गुणवत्ता बनाए रखते हुए इसकी लागत 90% कम हो गई। उपयोग का मामला बताता है कि अर्थशास्त्र कहां काटता है: कोडिंग एजेंट प्रत्येक प्राथमिक पीढ़ी के आसपास कई छोटे सहायक मॉडल कॉल करते हैं, और उन कॉलों में विलंबता और लागत मिश्रित होती है।

NVIDIA, जिसका हार्डवेयर मॉडल चलाता है, ने भी इसमें योगदान दिया। NVIDIA के त्वरित कंप्यूटिंग समूह में उत्पाद के एक वरिष्ठ प्रबंधक श्रुति कोपरकर ने कहा कि इंसेप्शन के पास NVIDIA AI बुनियादी ढांचे पर उन्नत प्रसार-आधारित भाषा मॉडल हैं, और निरंतर गति के साथ मर्करी 2.5 की गुणवत्ता में वृद्धि से पता चलता है कि नए आर्किटेक्चर कितनी जल्दी उत्पादन के लिए तैयार सिस्टम में परिपक्व हो सकते हैं।

मर्करी वॉयस और मर्करी राउटर पूर्वावलोकन

मॉडल के साथ-साथ, इंसेप्शन लैब्स ने दो नए उत्पादों के पूर्वावलोकन की घोषणा की। मर्करी वॉयस एक डिफ्यूजन एलएलएम है जो वॉयस एजेंटों के लिए सबसे सख्त विलंबता बजट के साथ अनुकूलित है, 170 मिलीसेकंड के तहत समय-से-पहले-टोकन का विज्ञापन करता है। मर्करी राउटर आने वाले संकेतों को समझने और उन्हें किसी भी मॉडल पर रूट करने के लिए एक प्रसार मॉडल का उपयोग करता है - खुला या बंद - गुणवत्ता, गति और लागत का सबसे अच्छा मिश्रण प्रदान करता है, इंसेप्शन को अपने प्रतिस्पर्धियों के साथ-साथ उनमें से एक के ऊपर एक परत के रूप में रखता है।

मर्करी 2.5 इंसेप्शन के स्वयं के एपीआई के साथ-साथ बेसटेन और ओपनराउटर के माध्यम से उपलब्ध है। एंटरप्राइज़ परिनियोजन समर्पित क्षमता, ऑटोस्केलिंग, अनुपालन नियंत्रण और कॉन्फ़िगर करने योग्य डेटा प्रतिधारण जोड़ते हैं। कंपनी एपीआई आज़माने वाले डेवलपर्स को 100 मिलियन मुफ्त टोकन की पेशकश कर रही है।

कंपनी ने यह भी कहा कि उसने अपने अगले मॉडल का प्रशिक्षण पहले ही शुरू कर दिया है - यह अब तक का सबसे बड़ा मॉडल है, जिसे आने वाले महीनों में रिलीज करने का लक्ष्य है - जिसे वह क्षमता में एक छलांग के रूप में वर्णित करती है जो प्रसार की गति या टोकन दक्षता में से किसी को भी नहीं छोड़ती है। यदि यह दावा सही है, तो ऑटोरेग्रेसिव पदधारियों पर दबाव सबसे पहले बाजार के कमोडिटी स्तरों में महसूस किया जाएगा, जहां कीमत और विलंबता अधिकांश अनुबंधों को तय करती है।

एआई से आगे रहें

नए मॉडल आर्किटेक्चर के उत्पादन में दौड़ के रूप में नवीनतम एआई विकास और नवीनतम कृत्रिम बुद्धिमत्ता समाचारों का पालन करें।

अधिक AI समाचार पढ़ें →