स्वतंत्र बेंचमार्किंग फर्म आर्टिफिशियल ॲनालिसिसच्या म्हणण्यानुसार, ओपनएआयने 29 सप्टेंबर रोजी GPT-6.1 सोल जारी केले, त्या मॉडेलच्या पदार्पणानंतर फक्त सात दिवसांनी GPT-6 सोल निवृत्त झाले. स्वॅप कंपनीच्या DevDay डेव्हलपर कॉन्फरन्सशी एकरूप झाला, जिथे CNET ने अहवाल दिला की उपस्थित लोक नवीन लाँच केलेल्या डॉट्स एजंट आणि सदस्यता बदलांच्या संचासह लगेच GPT-6.1 सोल वापरणे सुरू करू शकतात.

2026 च्या प्रवेगक मानकांनुसारही सात-दिवसीय फ्लॅगशिप-टू-फ्लॅगशिप बदलणे असामान्य आहे आणि बेंचमार्क हे सूचित करतात की OpenAI वेगाने का हलले. मॉडेल लॉन्च, बेंचमार्क मारामारी आणि त्याखालील किंमतींच्या युद्धाच्या सतत कव्हरेजसाठी, AI Buzz Wire घडणाऱ्या घडामोडींचा मागोवा घेते.

सात दिवसात मोजता येणारी उडी

आर्टिफिशियल ॲनालिसिसने अहवाल दिला आहे की GPT-6.1 Sol ने GPT-6 Sol पेक्षा फर्मच्या इंटेलिजेंस इंडेक्सवर 4 पॉइंट्स आणि GPT-5.6 Sol पेक्षा 5 पॉइंट्स वाढवले आहेत, GPT-6 Astra, OpenAI च्या सर्वात सक्षम मॉडेलपेक्षा फक्त 1 पॉइंट खाली उतरले आहे. फर्मचे मूल्यमापन तर्क, ज्ञान कार्य, गणित आणि एजंटिक कार्ये एकाच तुलनात्मक स्कोअरमध्ये मिसळते.

उप-स्कोअर दर्शवितात की नफा कुठे केंद्रित होतो. GPT-6.1 सोलने AA-ब्रीफकेस v1.1 मध्ये 4 गुण आणि GDPval-AA v2.1 मध्ये 5 गुण सुधारले, जे दोन्ही चाचणी एजंटिक ज्ञान कार्य करतात. टर्मिनल-बेंचमध्ये 12-पॉइंट उडी 4.0 पॉइंटने वास्तविक टर्मिनल वातावरणात भौतिकदृष्ट्या चांगली कामगिरी केली, तर मानवतेची शेवटची परीक्षा 5 गुणांनी वाढली आणि GDP.pdf 6 वाढली.

संशोधनासाठी मॉडेल्स वापरणाऱ्या प्रत्येकासाठी एक संख्या वेगळी आहे: AA-Omniscience वरील अचूकता 8 गुणांनी वाढली आहे, तर भ्रम दर 60 टक्क्यांवरून 54 टक्क्यांवर घसरला आहे. दोन्ही आकडे निरपेक्षपणे उच्च आहेत, परंतु प्रवासाची दिशा वर्कफ्लोसाठी महत्त्वाची आहे जिथे आत्मविश्वासपूर्ण चुकीचे उत्तर उत्तर नसण्यापेक्षा वाईट आहे.

समान स्टिकरची किंमत, व्यवहारात स्वस्त

किंमतीनुसार, GPT-6.1 Sol GPT-6 Sol चे रेट कार्ड $2 प्रति दशलक्ष इनपुट टोकन आणि $10 प्रति दशलक्ष आउटपुट टोकन ठेवते, परंतु कॅशे रीड डिस्काउंट 90 टक्क्यांवरून 95 टक्क्यांपर्यंत वाढतो. कृत्रिम विश्लेषण नोंदवते की एजंटिक वर्कलोड्ससाठी GPT-6.1 Sol ची मिश्रित किंमत GPT-6 Sol च्या तुलनेत थोडी कमी आहे, जी GPT-6 Sol ला GPT-5.6 सोल वर 50 टक्के सवलतीवर लॉन्च झाल्यापासून प्रभावी किमतीतील कपातीचा सिलसिला वाढला.

किंमतीचा मार्ग ही येथे खरी कथा आहे. दोन प्रकाशनांच्या कालावधीत, OpenAI ने त्याच्या मध्य-स्तरीय सीमारेषेची प्रभावी किंमत दोनदा निम्मी केली आहे, तर प्रत्येक वेळी गुणवत्तेला वरच्या दिशेने नेले आहे.

प्रति कार्य किंमत: $0.72 विरुद्ध $3.26

GPT-6 Astra मधील अंतर अगदी स्पष्ट होते तेथे प्रति कार्य खर्च. जास्तीत जास्त प्रयत्नात, कृत्रिम विश्लेषण GPT-6.1 सोल प्रति इंटेलिजेंस इंडेक्स टास्क $0.72 वर पेग करते, जीपीटी-6 एस्ट्राच्या $3.26 च्या एक चतुर्थांशपेक्षा कमी. त्याच्या स्वतःच्या पूर्ववर्ती विरुद्ध बचत 31 टक्के (GPT-6 Sol साठी $1.05) आहे आणि GPT-5.6 Sol च्या विरूद्ध ती 64 टक्के ($1.99) पर्यंत पोहोचते.

फर्मच्या मते, GPT-6.1 Sol ची प्रत्येक प्रयत्न पातळी खर्च-कार्यक्षमता पॅरेटो फ्रंटियरला बाहेर ढकलते — म्हणजे दिलेल्या बुद्धिमत्तेच्या पातळीसाठी, ते ट्रॅक करत असलेल्या मॉडेल्समध्ये कोणताही स्वस्त पर्याय अस्तित्वात नाही. टोकन-कार्यक्षमतेचे चित्र अधिक मिश्रित आहे: GPT-6.1 सोल प्रयत्न स्तरांवर GPT-6 Sol पेक्षा अंदाजे 10 ते 30 टक्के अधिक आउटपुट टोकन वापरतो, तरीही त्याची कमी आणि मध्यम प्रयत्न सेटिंग्ज टोकन कार्यक्षमतेसाठी पॅरेटो-इष्टतम राहतील एकदा उच्च बुद्धिमत्ता समाविष्ट केली गेली आहे. कोडिंगमध्ये, GPT-6 मॉडेलच्या प्रयत्नांवर सोल मॅक्स पॉईंटवर GPT-6 पेक्षा जास्त गुण मिळवले. कोडिंग एजंट इंडेक्स.

सात दिवसांची उलाढाल का महत्त्वाची

DevDay चे विस्तीर्ण स्लेट त्याच चित्राला बळकटी देते. CNET च्या अहवालात विकासक ताबडतोब तीन गोष्टी वापरू शकतात - GPT-6.1 सोल, डॉट्स एजंट्स आणि पुनर्निर्मित सबस्क्रिप्शन प्लॅन्स - दूरच्या संशोधन पूर्वावलोकनाऐवजी कॉन्फरन्सची रचना केली. विकासकांना संदेश आज उपलब्धता आहे, उद्याची शक्यता नाही.

फ्लॅगशिप हे लहान संकेत देते की स्पर्धात्मक मर्यादा प्रशिक्षण रनमधून प्रशिक्षणोत्तर शुद्धीकरण आणि सेवा देणाऱ्या पायाभूत सुविधांकडे सरकल्या आहेत. पॉइंट-लेव्हल अपग्रेड जे एका आठवड्यात पाठवले जाते ते स्क्रॅच फाउंडेशन मॉडेलपेक्षा ऑप्टिमाइझ केलेल्या चेकपॉईंट आणि नवीन किंमत पत्रकासारखे दिसते आणि प्रतिस्पर्धी तशाच प्रकारे वागत आहेत: Google ने 30 सप्टेंबर रोजी जेमिनी 4 आर्गॉनची घोषणा केली, एक फ्रंटियर मॉडेल जे सुरुवातीला $20/$1 दशलक्ष दराने फेअरविंड प्रोग्रामद्वारे विश्वसनीय सायबर रक्षकांपर्यंत पोहोचत आहे.

डेव्हलपरसाठी, पडताळणी केलेल्या संख्यांमधून तीन व्यावहारिक मार्गांचा अवलंब केला जातो. प्रथम, जड कॅशे पुनर्वापरासह एजंटिक वर्कलोड्सना 95 टक्के कॅशे सवलतीचा त्वरित फायदा होतो. दुसरे, बजेटने स्थलांतर करण्यापूर्वी उच्च आउटपुट टोकन वापराचे मॉडेल केले पाहिजे, कारण प्रति-टोकन किंमत अपरिवर्तित आहे जरी मॉडेल जास्त काळ विचार करेल. तिसरे, एस्ट्रा कार्यांसाठी कमाल मर्यादा राहते जेथे बुद्धिमत्तेचा शेवटचा बिंदू 4x किमतीचा प्रीमियम आहे — GPT-6.1 सोलचे प्रकरण असे आहे की बहुतेक कामांसाठी असे नाही.

पुनरावृत्ती करण्यायोग्य चेतावणी: हे आकडे एकाच स्वतंत्र मूल्यांकनकर्त्याकडून आले आहेत, त्याची कार्यपद्धती कितीही कठोर असली, आणि निर्देशांक स्कोअर विशिष्ट वर्कलोड मिश्रणांना बक्षीस देतात. वर्कलोडची मागणी असलेल्या संघांनी उत्पादन रहदारीचा मार्ग बदलण्यापूर्वी त्यांचे स्वतःचे मूल्यमापन पुन्हा केले पाहिजे.

---

एआयच्या पुढे राहा

नवीनतम AI बातम्या, विश्लेषण आणि यश मिळवा — सर्व एकाच ठिकाणी.

अधिक AI बातम्या वाचा →