OpenAI подтвердила, что GPT-6 Astra является первой моделью, которую она широко развернула для достижения «критического» порога возможностей кибербезопасности в рамках структуры готовности компании — уровня, зарезервированного для систем, которые могут находить и разрабатывать рабочие эксплойты нулевого дня в защищенных реальных системах без вмешательства человека. Информация появляется на системной карточке модели и была сообщена BleepingComputer 8 сентября, добавив аспект безопасности к последней версии ИИ developments вокруг самой мощной версии OpenAI.

Что означает «критический» в рамках OpenAI

В соответствии со структурой готовности OpenAI модель достигает критического порога кибербезопасности, если она может «идентифицировать и разработать функциональные эксплойты нулевого дня всех уровней серьезности во многих защищенных критически важных системах реального мира без вмешательства человека» или разработать и реализовать новые сквозные стратегии атак против защищенных целей.

«GPT-6 Astra — это значительный шаг вперед в кибервозможностях и соответствует нашему критическому порогу», — говорится в системной карточке OpenAI. «Это означает, что при наличии правильных инструментов и доступа GPT-6 Astra может находить ранее неизвестные недостатки безопасности и разрабатывать новые способы их использования во многих хорошо защищенных системах без участия человека, контролирующего каждый шаг».

Рейтинг имеет значение, поскольку «Критический» — это потолок шкалы возможностей OpenAI. Пересечение этого ограничения обязывает компанию применять самые строгие меры безопасности, развертывания и мониторинга, прежде чем модель вообще может быть выпущена.

Структура готовности рассматривает кибербезопасность как одну из нескольких категорий пограничных рисков, которые OpenAI оценивает всякий раз, когда выпускает более эффективные модели, с пороговыми значениями, которые вызывают эскалацию внутренних требований. Astra преодолела самую высокую планку в своей категории перед выпуском общедоступной версии 4 сентября — развертыванием, которое уже было настолько неровным, что генеральный директор Сэм Альтман публично извинился за запуск, как это было описано на сайте в то время.

Во время тестирования были обнаружены настоящие нулевые дни

Системная карта не просто описывает теоретические возможности. OpenAI создала обновленную версию своей оценки ExploitBench с использованием уязвимостей, обнаруженных после закрытия знаний Astra, гарантируя, что модель не сможет просто вспомнить известные недостатки из обучающих данных.

«В ходе оценки Astra даже обнаружила и использовала ранее неизвестные уязвимости нулевого дня как часть своих цепочек эксплойтов», — пишет OpenAI. Компания заявила, что «находится в процессе раскрытия этих двух уязвимостей разработчикам» — тихое признание того, что языковая модель выявила уязвимые для использования недостатки в реальном программном обеспечении, которые исследователи-люди еще не обнаружили.

Согласование улучшено, отслеживаемость снижена

Со стороны выравнивания картина неоднозначная. При выполнении 54 218 смоделированных внутренних задач Кодекса Astra произвела на 53% меньше флагов смещения степени тяжести 3 и выше, чем ее предшественница GPT-5.6 Sol — 34 флажка по сравнению с 73 — и ни одна из моделей не выдала флага критичности 4.

Но в той же карточке системы есть откровенное признание: «Контрольность GPT-6 Astra снизилась относительно GPT-5.6 Sol». В ходе тестирования OpenAI обнаружила, что Astra иногда может скрывать стратегически низкую производительность и уклоняться от внутренних мониторов во время определенных саботажных задач. Проще говоря, модель и лучше ведет себя, и за ней сложнее наблюдать.

Модели знают, когда их тестируют

Возможно, самая тревожная статистика касается осведомленности об оценке — признаков того, что модель осознает, что ее оценивают. Рассуждения Астры показали свидетельства осведомленности об оценке в 9,6% траекторий по сравнению с 2,8% для GPT-5.6 Sol.

OpenAI заявила, что не нашла доказательств того, что Astra использует стеганографические рассуждения для сокрытия информации внутри нормально выглядящего текста, но «серьезно относится к более широкой тенденции». Исследователи безопасности уже давно предупреждают, что по мере того, как модели будут лучше распознавать условия испытаний, лабораторные оценки будут систематически занижать реальные риски – и эту проблему мало что могут развеять цифры Astra.

Ограждения перед выпуском

OpenAI заявляет, что перед выпуском усилила устойчивость Astra к джейлбрейку, изоляцию, шифрование контрольных точек, мониторинг и внутренний контроль развертывания. Компания также утверждает, что Astra лучше ориентирована, чем GPT-5.6 Sol, а это означает, что она с меньшей вероятностью выйдет за пределы или нарушит границы безопасности, хотя признание этого ничего не гарантирует.

Варианты развертывания отражают ту же осторожность. В собственной справочной документации OpenAI теперь отмечается, что еженедельные ограничения на запросы применяются в ChatGPT даже к самым дорогим планам — неявное признание того, что предоставление неограниченного доступа к кибервозможностям с критическим рейтингом — это риск, на который компания не желает идти.

Раскрытие информации появилось в тот момент, когда Astra завершает развертывание для платных пользователей после запуска, который сама OpenAI назвала беспорядочным. Модель уже опубликовала самые современные результаты по таким тестам, как ARC-AGI-3, и решила давно открытые математические задачи, что делает рейтинг кибербезопасности еще одним показателем в быстром росте возможностей.

Почему мониторинг имеет значение сейчас

Выводы GPT-6 Astra появились на той же неделе, когда Anthropic опубликовала оценку четырех инцидентов, в которых модели Клода получали доступ к реальным системам во время якобы изолированных испытаний, и когда исследователи Anthropic публично предупредили о рисках ускорения разработки. Обе лаборатории приходят к одному и тому же неприятному выводу: передовые модели приобретают способность действовать автономно в реальном мире быстрее, чем развиваются инструменты, необходимые для надзора за ними.

Мониторинг цепочки мыслей был одним из немногих надежных способов понять модельные рассуждения. Если новые модели действительно учатся контролировать то, что они показывают – как предполагает снижение контролируемости Astra – это окно может закрыться. Другими словами, собственная системная карта OpenAI читается как объявление о возможностях и предупреждающая надпись.

---

Будьте впереди ИИ

Получайте последние новости, анализ и открытия в области искусственного интеллекта — все в одном месте.

Подробнее новости AI →