स्वतंत्र बेंचमार्किंग फर्म आर्टिफिशियल ॲनालिसिसच्या म्हणण्यानुसार, ओपनएआयने 29 सप्टेंबर रोजी GPT-6.1 सोल जारी केले, त्या मॉडेलच्या पदार्पणानंतर फक्त सात दिवसांनी GPT-6 सोल निवृत्त झाले. स्वॅप कंपनीच्या DevDay डेव्हलपर कॉन्फरन्सशी एकरूप झाला, जिथे CNET ने अहवाल दिला की उपस्थित लोक नवीन लाँच केलेल्या डॉट्स एजंट आणि सदस्यता बदलांच्या संचासह लगेच GPT-6.1 सोल वापरणे सुरू करू शकतात.
2026 च्या प्रवेगक मानकांनुसारही सात-दिवसीय फ्लॅगशिप-टू-फ्लॅगशिप बदलणे असामान्य आहे आणि बेंचमार्क हे सूचित करतात की OpenAI वेगाने का हलले. मॉडेल लॉन्च, बेंचमार्क मारामारी आणि त्याखालील किंमतींच्या युद्धाच्या सतत कव्हरेजसाठी, AI Buzz Wire घडणाऱ्या घडामोडींचा मागोवा घेते.
सात दिवसात मोजता येणारी उडी
आर्टिफिशियल ॲनालिसिसने अहवाल दिला आहे की GPT-6.1 Sol ने GPT-6 Sol पेक्षा फर्मच्या इंटेलिजेंस इंडेक्सवर 4 पॉइंट्स आणि GPT-5.6 Sol पेक्षा 5 पॉइंट्स वाढवले आहेत, GPT-6 Astra, OpenAI च्या सर्वात सक्षम मॉडेलपेक्षा फक्त 1 पॉइंट खाली उतरले आहे. फर्मचे मूल्यमापन तर्क, ज्ञान कार्य, गणित आणि एजंटिक कार्ये एकाच तुलनात्मक स्कोअरमध्ये मिसळते.
उप-स्कोअर दर्शवितात की नफा कुठे केंद्रित होतो. GPT-6.1 सोलने AA-ब्रीफकेस v1.1 मध्ये 4 गुण आणि GDPval-AA v2.1 मध्ये 5 गुण सुधारले, जे दोन्ही चाचणी एजंटिक ज्ञान कार्य करतात. टर्मिनल-बेंचमध्ये 12-पॉइंट उडी 4.0 पॉइंटने वास्तविक टर्मिनल वातावरणात भौतिकदृष्ट्या चांगली कामगिरी केली, तर मानवतेची शेवटची परीक्षा 5 गुणांनी वाढली आणि GDP.pdf 6 वाढली.
संशोधनासाठी मॉडेल्स वापरणाऱ्या प्रत्येकासाठी एक संख्या वेगळी आहे: AA-Omniscience वरील अचूकता 8 गुणांनी वाढली आहे, तर भ्रम दर 60 टक्क्यांवरून 54 टक्क्यांवर घसरला आहे. दोन्ही आकडे निरपेक्षपणे उच्च आहेत, परंतु प्रवासाची दिशा वर्कफ्लोसाठी महत्त्वाची आहे जिथे आत्मविश्वासपूर्ण चुकीचे उत्तर उत्तर नसण्यापेक्षा वाईट आहे.
समान स्टिकरची किंमत, व्यवहारात स्वस्त
किंमतीनुसार, GPT-6.1 Sol GPT-6 Sol चे रेट कार्ड $2 प्रति दशलक्ष इनपुट टोकन आणि $10 प्रति दशलक्ष आउटपुट टोकन ठेवते, परंतु कॅशे रीड डिस्काउंट 90 टक्क्यांवरून 95 टक्क्यांपर्यंत वाढतो. कृत्रिम विश्लेषण नोंदवते की एजंटिक वर्कलोड्ससाठी GPT-6.1 Sol ची मिश्रित किंमत GPT-6 Sol च्या तुलनेत थोडी कमी आहे, जी GPT-6 Sol ला GPT-5.6 सोल वर 50 टक्के सवलतीवर लॉन्च झाल्यापासून प्रभावी किमतीतील कपातीचा सिलसिला वाढला.
किंमतीचा मार्ग ही येथे खरी कथा आहे. दोन प्रकाशनांच्या कालावधीत, OpenAI ने त्याच्या मध्य-स्तरीय सीमारेषेची प्रभावी किंमत दोनदा निम्मी केली आहे, तर प्रत्येक वेळी गुणवत्तेला वरच्या दिशेने नेले आहे.
प्रति कार्य किंमत: $0.72 विरुद्ध $3.26
GPT-6 Astra मधील अंतर अगदी स्पष्ट होते तेथे प्रति कार्य खर्च. जास्तीत जास्त प्रयत्नात, कृत्रिम विश्लेषण GPT-6.1 सोल प्रति इंटेलिजेंस इंडेक्स टास्क $0.72 वर पेग करते, जीपीटी-6 एस्ट्राच्या $3.26 च्या एक चतुर्थांशपेक्षा कमी. त्याच्या स्वतःच्या पूर्ववर्ती विरुद्ध बचत 31 टक्के (GPT-6 Sol साठी $1.05) आहे आणि GPT-5.6 Sol च्या विरूद्ध ती 64 टक्के ($1.99) पर्यंत पोहोचते.
फर्मच्या मते, GPT-6.1 Sol ची प्रत्येक प्रयत्न पातळी खर्च-कार्यक्षमता पॅरेटो फ्रंटियरला बाहेर ढकलते — म्हणजे दिलेल्या बुद्धिमत्तेच्या पातळीसाठी, ते ट्रॅक करत असलेल्या मॉडेल्समध्ये कोणताही स्वस्त पर्याय अस्तित्वात नाही. टोकन-कार्यक्षमतेचे चित्र अधिक मिश्रित आहे: GPT-6.1 सोल प्रयत्न स्तरांवर GPT-6 Sol पेक्षा अंदाजे 10 ते 30 टक्के अधिक आउटपुट टोकन वापरतो, तरीही त्याची कमी आणि मध्यम प्रयत्न सेटिंग्ज टोकन कार्यक्षमतेसाठी पॅरेटो-इष्टतम राहतील एकदा उच्च बुद्धिमत्ता समाविष्ट केली गेली आहे. कोडिंगमध्ये, GPT-6 मॉडेलच्या प्रयत्नांवर सोल मॅक्स पॉईंटवर GPT-6 पेक्षा जास्त गुण मिळवले. कोडिंग एजंट इंडेक्स.
सात दिवसांची उलाढाल का महत्त्वाची
DevDay चे विस्तीर्ण स्लेट त्याच चित्राला बळकटी देते. CNET च्या अहवालात विकासक ताबडतोब तीन गोष्टी वापरू शकतात - GPT-6.1 सोल, डॉट्स एजंट्स आणि पुनर्निर्मित सबस्क्रिप्शन प्लॅन्स - दूरच्या संशोधन पूर्वावलोकनाऐवजी कॉन्फरन्सची रचना केली. विकासकांना संदेश आज उपलब्धता आहे, उद्याची शक्यता नाही.
फ्लॅगशिप हे लहान संकेत देते की स्पर्धात्मक मर्यादा प्रशिक्षण रनमधून प्रशिक्षणोत्तर शुद्धीकरण आणि सेवा देणाऱ्या पायाभूत सुविधांकडे सरकल्या आहेत. पॉइंट-लेव्हल अपग्रेड जे एका आठवड्यात पाठवले जाते ते स्क्रॅच फाउंडेशन मॉडेलपेक्षा ऑप्टिमाइझ केलेल्या चेकपॉईंट आणि नवीन किंमत पत्रकासारखे दिसते आणि प्रतिस्पर्धी तशाच प्रकारे वागत आहेत: Google ने 30 सप्टेंबर रोजी जेमिनी 4 आर्गॉनची घोषणा केली, एक फ्रंटियर मॉडेल जे सुरुवातीला $20/$1 दशलक्ष दराने फेअरविंड प्रोग्रामद्वारे विश्वसनीय सायबर रक्षकांपर्यंत पोहोचत आहे.
डेव्हलपरसाठी, पडताळणी केलेल्या संख्यांमधून तीन व्यावहारिक मार्गांचा अवलंब केला जातो. प्रथम, जड कॅशे पुनर्वापरासह एजंटिक वर्कलोड्सना 95 टक्के कॅशे सवलतीचा त्वरित फायदा होतो. दुसरे, बजेटने स्थलांतर करण्यापूर्वी उच्च आउटपुट टोकन वापराचे मॉडेल केले पाहिजे, कारण प्रति-टोकन किंमत अपरिवर्तित आहे जरी मॉडेल जास्त काळ विचार करेल. तिसरे, एस्ट्रा कार्यांसाठी कमाल मर्यादा राहते जेथे बुद्धिमत्तेचा शेवटचा बिंदू 4x किमतीचा प्रीमियम आहे — GPT-6.1 सोलचे प्रकरण असे आहे की बहुतेक कामांसाठी असे नाही.
पुनरावृत्ती करण्यायोग्य चेतावणी: हे आकडे एकाच स्वतंत्र मूल्यांकनकर्त्याकडून आले आहेत, त्याची कार्यपद्धती कितीही कठोर असली, आणि निर्देशांक स्कोअर विशिष्ट वर्कलोड मिश्रणांना बक्षीस देतात. वर्कलोडची मागणी असलेल्या संघांनी उत्पादन रहदारीचा मार्ग बदलण्यापूर्वी त्यांचे स्वतःचे मूल्यमापन पुन्हा केले पाहिजे.
---
एआयच्या पुढे राहानवीनतम AI बातम्या, विश्लेषण आणि यश मिळवा — सर्व एकाच ठिकाणी.
अधिक AI बातम्या वाचा →