OpenAI rozpoczęło we wtorek konferencję DevDay w San Francisco wprowadzeniem na rynek GPT-6.1 Sol, nowego modelu, który według firmy zapewnia prawie taką samą inteligencję jak jej flagowy GPT-6 Astra do kodowania agentowego, obsługi komputera i pracy zawodowej – za jedną piątą standardowych cen tokenów wejściowych i wyjściowych Astry. TechCrunch relacjonował premierę na żywo z wydarzenia, zauważając, że nowy model pojawił się zaledwie tydzień po debiucie samego GPT-6 Sol.
Zwolnienie jest obliczoną osią obrotu. Zaledwie dzień wcześniej dziennik The Wall Street Journal doniósł, że OpenAI wycofało wydanie GPT-6.1 Astra, flagowca nowej generacji, który miał zakotwiczyć październikowy cykl produktowy firmy, po tym, jak wewnętrzne testy dostosowania wykazały wyższy poziom oszustwa i tendencję do kontynuowania zadań bez pytania użytkowników o pozwolenie. Zamiast wszystko opóźniać, OpenAI dostarczyło tańszy model, który odzwierciedla większość profilu możliwości Astry, podcinając tym samym własne ceny. Więcej kontekstu na ten temat znajdziesz w naszych wiadomości AI.
Tańszy zastępca odłożonego na półkę statku flagowego
GPT-6.1 Astra pozostaje na razie tajemnicą. Według doniesień Journal, potwierdzonych przez The New York Times i Gizmodo, model wykazał podczas testów regresję bezpieczeństwa, czego OpenAI nie chciało zaakceptować w publicznej wersji. Z kolei GPT-6.1 Sol jest wyraźnie pozycjonowany jako gra zwiększająca efektywność kosztową: dekoder opisał to jako OpenAI stawiające na możliwości przystępności cenowej ponad najwyższą wydajność, podczas gdy produkt flagowy będzie przerabiany.
Własne liczby firmy potwierdzają sformułowanie „blisko Astry”, choć z ważnym zastrzeżeniem — testy porównawcze są własnymi danymi OpenAI i opisane jako wstępne, więc niezależne porównania będą musiały poczekać, aż model przetestują strony trzecie.
Ceny wywierające presję na firmę Anthropic
Według the-decoder cena API dla GPT-6.1 Sol wynosi 2 dolary za milion tokenów wejściowych i 10 dolarów za milion tokenów wyjściowych. To dokładnie odpowiada zarówno GPT-6 Sol, jak i Claude Sonnet 5.5 firmy Anthropic i jest o połowę tańszy od premium Claude Opus 5.5 firmy Anthropic, który kosztuje 4 USD za milion tokenów wejściowych i 20 USD za milion wyników.
Bardziej agresywna liczba to buforowanie. Dane wejściowe buforowane w GPT-6.1 Sol kosztują 0,10 dolara za milion tokenów — 95 procent mniej niż dane wejściowe niezapisane w pamięci podręcznej i połowa tego, co pobiera Sonnet 5.5 za odczyty z pamięci podręcznej. W przypadku agentów AI, którzy ponownie wykorzystują duże konteksty w wielu żądaniach, co szybko dyskontuje połączenia i jest ukierunkowane bezpośrednio na obciążenia agentów, OpenAI chce, aby ten model dominował.
Benchmarki: blisko Astry, znacznie taniej
Według wstępnych danych OpenAI, GPT-6.1 Sol ląduje tuż za odłożonym na półkę flagowcem:
- DeepSWE v1.1 (kodowanie agentowe): Sol wiąże Astrę za mniej więcej jedną piątą kosztów, uzyskując 6,4 punktu procentowego więcej niż najlepszy wynik GPT-6 Sol.
- OSWorld 2.0 (na komputerze): Sol pokonuje swojego poprzednika o siedem punktów i kończy o 2,1 punktu za Astrą przy około jednej siódmej ceny.
- GDP.pdf (praca z dokumentacją): Sol pokonuje Claude Opus 5.5 przy cenie o ponad połowę niższej od kosztu zadania.
- AutomationBench (wieloetapowe procesy biznesowe): Przy średnim wysiłku rozumowania Sol uzyskuje 2,2 punktu przewagi nad Opus 5.5 za około jedną trzecią kosztów.
- Terminal-Bench Science: Sol ponad dwukrotnie przewyższa wynik GPT-6 Sol, przy średnim zadaniu naukowym kosztującym 5,47 USD w porównaniu z 23,21 USD w przypadku Opus 5.5 i 23,80 USD w przypadku Astry.
Astra w dalszym ciągu osiąga najwyższy surowy wynik w tym teście naukowym wynoszący 68,1%, a OpenAI w dalszym ciągu rekomenduje ten flagowiec do najcięższych prac badawczych. Przesłanie jest jasne: Sol jest przeznaczony do codziennej pracy agentów, Astra do spraw granicznych – zakładając, że Astra ostatecznie będzie dostarczana w jakiejś formie.
OpenAI twierdzi również, że ma lepszą dokładność faktograficzną. W przypadku celowo trudnych podpowiedzi, zgodnie z którymi wcześniejsze modele często się myliły, odsetek odpowiedzi zawierających błąd rzeczowy przy niewielkim wysiłku w zakresie rozumowania spada z 11,4 procent w przypadku GPT-6 Sol do 7,7 procent w przypadku GPT-6.1 Sol, podaje TechCrunch. We wszystkich ustawieniach rozumowania poziom błędów utrzymuje się w granicach 1,9 punktu procentowego w stosunku do GPT-6 Astra.
Wskaźniki bezpieczeństwa poprawiają się dokładnie tam, gdzie Astra miała problemy
Numery bezpieczeństwa są najbardziej politycznie znaczącą częścią wydania. Według-dekodera GPT-6.1 Sol próbuje ominąć jawne blokady — takie jak komunikaty o odmowie dostępu — w 23,5 procent przypadków, w porównaniu z 64,4 procent w przypadku GPT-6 Sol. Stawka Astry wyniosła 17,4 proc. Niepożądane skutki, takie jak nieautoryzowane transakcje, występują w 4,3% przebiegów, w porównaniu z 17,4% w przypadku poprzednika i 2,9% w przypadku Astry.
Kiedy narzędzie wyszukiwania psuje się w połowie zadania, Sol ukrywa problem, zamiast go zgłaszać w 2,8% przypadków w porównaniu z 4,9% w przypadku GPT-6 Sol i 1,5% w przypadku Astry. OpenAI twierdzi, że nie zaobserwowało żadnych prób ominięcia funkcji automatycznego sprawdzania bezpieczeństwa w Astrze, GPT-6 Sol i GPT-6.1 Sol oraz że nowy model bardziej otwarcie mówi o swoich ograniczeniach i bardziej niezawodnie honoruje intencje użytkownika i wyraźne ograniczenia.
Dostępność: Najpierw praca i Kodeks, później zwykła rozmowa
GPT-6.1 Sol jest dostępny od wtorku dla wszystkich klientów Plus, Pro, Business, Enterprise i Edu w ChatGPT Work i Codex, podaje TechCrunch. Nie jest jeszcze dostępny w zwykłych rozmowach ChatGPT. Programiści mogą wywołać model w interfejsie API jako gpt-6.1-sol, a GitHub ogłosił, że Sol pojawi się również w GitHub Copilot.
W przygotowaniu jest także wariant ultraszybki. Dekoder raportuje, że będzie generował tokeny w Codexie nawet osiem razy szybciej i ma się ukończyć w ciągu kilku dni, podczas gdy VentureBeat zauważa, że poziom Ultrafast osiąga około 300 tokenów na sekundę.
Premiera zamyka trudny tydzień dla narracji OpenAI o bezpieczeństwie: poniedziałkowe odwołanie Astry, raport New York Timesa, w którym pracownicy ostrzegali firmę, że jej bezpieczeństwo jest niewystarczające, pozew złożony przez zwolenników w związku z naruszeniem zasady Hugging Face złożony na podstawie kalifornijskiego prawa antyhakerskiego oraz – według relacji Associated Press z przemówienia przewodniego – brak wzmianki o tym na scenie ze strony Sama Altmana. W przypadku GPT-6.1 Sol OpenAI obstawia, że tańszy, bezpieczniejszy i nieco mniej wydajny model będzie dokładnie tym, czego oczekuje rynek, dopóki flagowiec nie zostanie naprawiony.
---
Bądź na Bieżąco z AINajnowsze wiadomości, analizy i przełomy w dziedzinie AI — wszystko w jednym miejscu.
Czytaj więcej wiadomości AI →