OpenAI는 최신 프론티어 모델인 GPT-6 Astra가 출시 이후 더 멍청해졌다는 사용자 불만을 일주일 동안 설명하면서 세 가지 결함을 수정했으며 일종의 사과로 Codex 가입자의 사용 제한을 재설정하고 있습니다. 이 업데이트는 Codex 제품 책임자인 Tibo Sottiaux가 발표한 것으로 토요일에 발표된 업데이트에 따르면 팀이 사용자와 협력하여 결함을 추적한 다음 현지 시간 자정 이전에 수정 사항과 전체 사용량 재설정을 제공했다고 밝혔습니다.

이번 승인으로 OpenAI가 현재까지 가장 유능한 모델로 평가한 제품의 대략적인 단계가 마무리되었습니다. Astra가 9월 초에 광범위한 가용성에 도달한 이후 X의 개발자는 출시일 Astra와 현재 버전에 대해 동일한 프롬프트를 실행하고 모든 설정을 동일하게 유지하고 조용하게 약화되는 모델을 보여주는 나란히 비교를 게시했습니다. 이 논쟁을 주도하는 모델에 대한 자세한 내용은 최신 AI 개발 보도를 참조하세요.

세 가지 결함, 명명됨

Sottiaux에 따르면 첫 번째 원인은 Astra에서 너무 자주 실행되는 이전 모델용으로 작성된 프롬프트 파일인 기술로, 때로는 모델이 자체 작업을 확인하지 못하게 하는 기술이었습니다. 두 번째는 모델을 조기에 종료하거나 오래된 메시지에 응답할 수 있는 선택적 컨텍스트 관리 실험이었습니다. OpenAI는 약 4,000~5,000명의 사용자가 영향을 받은 후 실험을 비활성화했다고 회사는 밝혔습니다.

세 번째 결함은 모델 자체보다는 인프라와 관련이 있습니다. 일부 추론 엔진은 잘못 구성되었으며 이를 통해 라우팅되는 테일 트래픽의 품질이 측정 가능하게 저하되었습니다. OpenAI는 해당 엔진을 제거하고 몇 가지 소규모 수리를 수행했습니다. Sottiaux는 이제 모델이 사용자의 최신 메시지를 더 정확하게 추적한다고 썼습니다. 이는 Astra가 사용자가 이미 지나간 질문에 답하고 있다는 불만에 대한 고개를 끄덕이는 것입니다.

개발자는 이미 이전했습니다

일주일 내내 불만이 쌓였습니다. 며칠 전에 Astra를 칭찬했던 개발자 Pranjal Paliwal은 돌아가서 Astra가 그를 위해 작성한 코드를 읽은 다음 그 결과를 진보가 아닌 퇴보라고 불렀습니다. 코딩 도구 Opencode를 구축하는 Dax Raad는 Astra에 비용을 두 배로 투자한 후 팀을 다시 이전 GPT-5.6 Sol로 옮겼습니다. 단점은 그만한 가치가 없다고 판단했기 때문입니다. 한 포럼 포스터에서는 Astra가 이제 동일한 재시도를 통해 동일한 작업에서 Sol과 동등한 수준이라고 설명했습니다.

모든 사람이 그 책을 받아들이지는 않았습니다. Antikythera로 글을 쓴 가명 사용자는 모델이 항상 게으르고 주요 항목을 좋아했으며 사용자가 눈부심을 멈추었다고 주장했습니다. 이러한 불일치는 모델 품질 주장이 해결하기가 얼마나 어려운지 보여줍니다. 즉, 동일한 프롬프트, 다른 평결입니다.

백그라운드의 용량 문제

용량이 롤아웃을 가리는 동안 품질 행이 착륙했습니다. OpenAI는 사용자 보고서에 따라 ChatGPT를 많이 사용하는 사용자에 대한 Astra 사용 제한을 줄이고 새로운 200달러 Pro 구독을 일시 중지했습니다. Sottiaux는 수요를 인용하여 9월 10일에 이를 확인했습니다. 이 모델의 비용은 여전히 ​​입력 토큰 백만 달러당 10달러, 출력 토큰 백만 달러당 50달러입니다. 이는 Sol이 출시 당시 청구한 비용의 2.5배입니다.

불편한 선례도 있습니다. 이는 유료 사용자로부터 동일한 비난을 받은 두 달 만에 두 번째 OpenAI 플래그십입니다. 지난 7월 사용자들은 Sol의 최고 추론 모드가 하룻밤 사이에 얕아졌다고 말했습니다. Sottiaux는 당시 회사가 추론 노력을 실험하고 있었음을 확인하면서 의도적으로 이를 약화시켰다는 사실을 부인했습니다. "모델이 더 나빠졌다"와 "결함을 발견했습니다"라는 반복적인 주기가 회사가 관리해야 할 패턴이 되고 있습니다. 투명성은 도움이 되지만 안정성도 도움이 됩니다.

OpenAI의 조언: 가드레일을 적게 사용하세요

수정 사항과 함께 OpenAI는 엔지니어 Eric Provencher의 마이그레이션 지침을 발표했는데, 이는 직관에 반하는 권장 사항에 해당합니다. 더 많은 유능한 모델을 사용하면 더 적은 노력이 필요합니다. 지나치게 긴 기술 설명, 포괄적 읽기 요구 사항 및 엄격한 승인 규칙은 Astra를 방해할 수 있다고 지침은 말합니다. 시간이 지남에 따라 쌓인 지침은 컨텍스트를 잠식하거나 모델이 작업을 너무 일찍 중단하게 만들 수 있습니다.

Provencher는 팀이 모델을 전환할 때마다 기술, AGENTS.md 파일 및 작업 프롬프트를 검토하고 지침을 특정 작업과 긴밀하게 연결하고 작업 완료 시기를 명확하게 정의할 것을 권장합니다. 제한이 없더라도 Astra가 GPT-5.6 Sol보다 일찍 중지될 수 있기 때문입니다. 이전 모델이 불량화 된 후 문제를 봉쇄한 팀은 이러한 규칙을 다시 검토해야 합니다. Astra는 더 나은 판단력을 가지고 있지만 이전 제한 사항을 문자 그대로 해석하여 계속 진행하기를 원할 때 중지할 수 있다고 주장합니다.

다음에 무슨 일이 일어날까요?

사용법 재설정은 Codex 가입자에게 모델을 재평가할 수 있는 깨끗한 기회를 제공하며 OpenAI는 사용자가 실행하는 동일한 병렬 테스트를 지켜볼 것입니다. 더 깊은 질문은 신뢰입니다. 출시 후 일주일 이내에 플래그십 성능 저하를 본 개발자에게 비용을 지불하면 이제 문서화된 설명, 3가지 명명된 결함 및 재설정이 제공될 뿐만 아니라 모든 모델 업데이트를 출시일을 기준으로 벤치마킹해야 하는 새로운 이유이기도 합니다.

AI보다 앞서 나가세요

모델 출시, 사후 결함 분석, 소프트웨어 작업을 재구성하는 도구 등을 매일 추적합니다.

AI 뉴스 자세히 보기 →