OpenAI naprawiło trzy defekty, które, jak twierdzi, wyjaśniają tydzień skarg użytkowników, że GPT-6 Astra, jego najnowszy model graniczny, stał się głupszy od czasu premiery – i w ramach przeprosin resetuje limity użytkowania dla abonentów Codexu. Jak wynika z aktualizacji opublikowanej w sobotę, aktualizacja pochodzi od lidera produktu Codex, Tibo Sottiaux, który powiedział, że zespół współpracował z użytkownikami w celu wyśledzenia usterek, a następnie dostarczył poprawki i pełny reset użytkowania przed północą czasu lokalnego.

To przyjęcie zamyka trudny odcinek dla tego, co OpenAI określiło jako swój najpotężniejszy model w historii. Odkąd Astra stała się powszechnie dostępna na początku września, programiści pracujący nad X uruchamiali identyczne podpowiedzi w przypadku Astry z dnia premiery i aktualnej wersji, zachowując te same ustawienia i publikując bezpośrednie porównania, które zdawały się pokazywać delikatnie osłabiony model. Więcej informacji na temat modeli napędzających tę debatę znajdziesz w naszym najnowszym rozwoju sztucznej inteligencji.

Trzy wady, nazwane

Według Sottiaux pierwszym winowajcą były umiejętności — pliki podpowiedzi napisane dla wcześniejszych modeli, które zbyt często uruchamiały się pod Astrą, czasami uniemożliwiając modelowi sprawdzenie własnej pracy. Drugim był opcjonalny eksperyment z zarządzaniem kontekstem, który mógł spowodować wcześniejsze zamknięcie modelu lub udzielenie odpowiedzi na nieaktualne wiadomości. Firma podała, że ​​OpenAI wyłączyło eksperyment po tym, jak problem dotyczył około 4000–5000 użytkowników.

Trzecia wada dotyczyła infrastruktury, a nie samego modelu: niektóre silniki wnioskowania zostały nieprawidłowo skonfigurowane, co w sposób wymierny obniżyło jakość przepływającego przez nie ruchu końcowego. OpenAI usunął te silniki i dokonał kilku mniejszych napraw. Sottiaux napisał, że model dokładniej teraz śledzi ostatnią wiadomość użytkownika, co jest ukłonem w stronę skarg, jakoby Astra odpowiadała na pytania, które użytkownik już zadał.

Programiści już przeszli dalej

Skargi narastały przez cały tydzień. Programista Pranjal Paliwal, który kilka dni wcześniej pochwalił Astrę, wrócił i przeczytał napisany dla niego kod, a następnie nazwał wynik raczej regresją niż postępem. Dax Raad, który tworzy narzędzie do kodowania Opencode, przeniósł swój zespół z powrotem do starszej wersji GPT-5.6 Sol po tym, jak wydatki na Astrę podwoiły się ze względu na wady, które jego zdaniem nie były warte swojej ceny. Jeden z plakatów na forum opisał Astrę jako teraz na poziomie Sola w zakresie identycznych zadań i tych samych prób.

Nie wszyscy zaakceptowali tę lekturę. Pseudonimowy użytkownik piszący jako Antikythera argumentował, że model zawsze był leniwy i lubił wypunktowania, a użytkownicy po prostu przestali być oszołomieni. Ta różnica zdań pokazuje, jak trudno rozstrzygnąć roszczenia dotyczące jakości modelu: identyczne podpowiedzi, różne werdykty.

Problem z wydajnością w tle

Wiersz dotyczący jakości wylądował, podczas gdy pojemność przesłoniła wdrożenie. Według raportów użytkowników OpenAI obniżyło limity użytkowania Astry dla intensywnych użytkowników ChatGPT i wstrzymało nowe subskrypcje Pro za 200 dolarów – krok, który Sottiaux potwierdził 10 września, powołując się na popyt. Model nadal kosztuje 10 dolarów za milion tokenów wejściowych i 50 dolarów za milion tokenów wyjściowych, czyli 2,5 razy więcej niż pobierał Sol po uruchomieniu.

Istnieje również niewygodny precedens: to drugi flagowiec OpenAI w ciągu dwóch miesięcy, który stawia takie same zarzuty ze strony płacących użytkowników. W lipcu użytkownicy stwierdzili, że z dnia na dzień najważniejszy sposób rozumowania Sola stał się płytki. Sottiaux zaprzeczył, że celowo go wówczas osłabiał, potwierdzając jednocześnie, że firma eksperymentowała z wysiłkiem rozumowania. Powtarzające się cykle „pogorszenia modelu”, po których następuje „znaleźliśmy wady”, stają się wzorcem, z którym firma będzie musiała sobie poradzić — przejrzystość pomaga, ale stabilność też.

Rada OpenAI: używaj mniej poręczy

Oprócz poprawek OpenAI opublikowało wskazówki dotyczące migracji opracowane przez inżyniera Erica Provenchera, które stanowią sprzeczne z intuicją zalecenie: bardziej wydajne modele wymagają mniej trzymania za rękę. Wytyczne mówią, że zbyt długie opisy umiejętności, ogólne wymagania dotyczące czytania i sztywne zasady zatwierdzania mogą przeszkodzić Astrze. Instrukcje, które nagromadziły się z biegiem czasu, mogą pochłonąć kontekst lub spowodować zbyt wczesne przerwanie pracy modelu.

Provencher zaleca, aby zespoły sprawdzały swoje umiejętności, pliki AGENTS.md i monity o zadania przy każdej zmianie modelu, ściśle powiązały instrukcje z konkretnymi zadaniami i jasno określiły, kiedy zadanie zostanie wykonane — ponieważ nawet bez ograniczeń Astra może zatrzymać się wcześniej niż GPT-5.6 Sol. Zespoły, które zablokowały wszystko po tym, jak wcześniejsze modele zepsuły się, powinny ponownie przyjrzeć się tym zasadom: Astra ma lepszą ocenę, jak argumentuje post, ale potrafi interpretować stare ograniczenia tak dosłownie, że przestają działać, gdy chcesz, aby nadal działały.

Co stanie się dalej

Reset użytkowania daje subskrybentom Codexu czystą kartę do ponownej oceny modelu, a OpenAI będzie obserwować te same testy, które przeprowadzają jego użytkownicy. Głębszą kwestią jest zaufanie: płacący programiści, którzy zauważyli pogorszenie stanu flagowca w ciągu tygodnia od premiery, mają teraz udokumentowane wyjaśnienie, trzy nazwane defekty i reset, ale także nowy powód do porównywania każdej aktualizacji modelu z dniem, w którym została wysłana.

Wyprzedź sztuczną inteligencję

Wprowadzanie modeli na rynek, sekcja zwłok defektów i narzędzia zmieniające działanie oprogramowania — śledzone codziennie.

Przeczytaj więcej aktualności o sztucznej inteligencji →