1 сентября OpenAI присвоила готовящейся к выпуску модели Astra уровень Critical по кибервозможностям в рамках Preparedness Framework — впервые для своих ИИ-систем. При этом результаты тестов относятся к конфигурации с расширенным доступом Daybreak Blue , а наиболее продвинутые функции в области безопасности после релиза будут доступны ограниченному кругу пользователей.
По оценке компании, при наличии необходимых инструментов и доступа Astra способна находить ранее неизвестные уязвимости и разрабатывать способы их эксплуатации в защищенных системах без пошагового управления человеком. Ранее OpenAI лишь допускала, что модель может достичь этого уровня.
Согласно Preparedness Framework, уровень Critical присваивается модели, если она способна без вмешательства человека находить и создавать рабочие эксплойты для zero-day в большом числе защищенных реальных систем. Альтернативный критерий — возможность самостоятельно разработать и выполнить новую комплексную атаку, получив только общую цель.
На публичном ExploitBench Astra получила 100%.
Из-за риска попадания данных теста в обучающие выборки OpenAI создала внутреннюю версию ExploitBench. Она включала 20 уязвимостей высокой степени опасности в движке V8, раскрытых с июня по август 2026 года. В ходе проверки Astra обнаружила и использовала два ранее неизвестных zero-day как части цепочки эксплуатации. OpenAI сообщила, что находится в процессе передачи информации об уязвимостях разработчикам затронутого ПО.
В экспертных испытаниях модель также нашла ранее неизвестные уязвимости в защищенном браузере и построила цепочку атаки, позволившую выйти из песочницы и выполнить команды на основной системе после открытия HTML-файла.
В другом тесте Astra объединила несколько уязвимостей защищенной операционной системы и повысила привилегии от обычного пользователя до root. OpenAI уточнила, что опубликованные результаты отражают возможности Astra с доступом уровня Daybreak Blue, а не стандартную производственную конфигурацию модели.
Продвинутые возможности ограничат
В последние недели OpenAI откладывала отдельные этапы разработки и выпуска Astra, пока усиливала и тестировала защиту от киберзлоупотреблений и несанкционированных действий модели. Теперь компания считает принятые меры достаточными для выпуска и планирует сделать модель доступной в ближайшее время.
На первом этапе продвинутые возможности в области кибербезопасности получит небольшая группа тестировщиков. Позднее доступ расширят через Daybreak Blue .
Astra также дополнительно обучили отказываться от запрещенной киберпомощи и соблюдать заданные ограничения. В тестах с попытками обхода ограничений на киберпомощь модель отказалась выполнять 91,5% запросов против 59% у GPT-5.6 Sol.
Кроме того, OpenAI внедряет дополнительные системы мониторинга, которые должны обнаруживать и автоматически останавливать потенциально несанкционированные действия модели.
Напомним, в августе OpenAI замедлила разработку передовых ИИ-систем после инцидента с Hugging Face и предварительной оценки Astra.
Подписывайтесь на ForkLog в социальных сетях




