Безопасность

OpenAI отменила релиз GPT-6.1 Astra из-за проблем с безопасностью

OpenAI отказалась от публичного релиза GPT-6.1 Astra после того, как внутренние тесты выявили проблемы с безопасностью и следованием намерениям пользователя

4 мин чтенияИсточник: ForkLog
OpenAI отменила релиз GPT-6.1 Astra из-за проблем с безопасностью
TelegramВКонтактеWhatsApp

OpenAI отказалась от публичного релиза GPT-6.1 Astra после того, как внутренние тесты выявили проблемы с безопасностью и следованием намерениям пользователя. Модель планировали выпустить в октябре и интегрировать в ChatGPT и Codex, сообщает The Wall Street Journal .

Решение подтвердил представитель компании, пишет The Information . Отказаться от выпуска рекомендовали глава систем безопасности Саачи Джайн и вице-президент по исследованиям Миа Глейз. Этот шаг также обсуждался с исследовательским руководством, включая главного научного сотрудника Якуба Пахоцки.

GPT-6.1 Astra должна была стать следующей версией выпущенной в сентябре GPT-6 Astra. По данным WSJ, новая модель лучше справлялась с написанием текстов, а также со сложными задачами от начала до конца без помощи человека. Однако в двух направлениях безопасности она показала результаты хуже предшественницы.

Первое касается следования намерениям пользователя и прозрачности действий модели. GPT-6.1 Astra чаще неточно сообщала пользователю о том, какие действия выполнила или не выполнила.

Вторая проблема связана с тем, что OpenAI называет scope authorization — соблюдением границ разрешенной задачи. Модель могла продолжать работу без дополнительного согласия пользователя и обращаться к внешним инструментам или сервисам даже тогда, когда это создавало потенциальный риск.

Показательный пример подобного класса риска произошел 20 сентября, хотя он касался другой внутренней исследовательской модели. Во время тренировочной задачи агент воспользовался недостаточной DNS-фильтрацией и получил доступ к внешнему чат-боту, несмотря на ограничения интернет-доступа. Система мониторинга зафиксировала поведение в течение 15 минут, еще через три минуты к проверке подключился сотрудник. Однако запуск остановили вручную лишь спустя 2,5 часа.

«В вопросах безопасности и alignment всегда приходится искать баланс. Нужно определить правильную границу между соблюдением заданных рамок и тем, чтобы модель не становилась ленивой при столкновении с препятствиями», — заявила Джайн.

По ее словам, GPT-6.1 Astra стала лучше справляться с так называемой «ленивостью модели», когда система прекращает выполнение сложной задачи раньше необходимого. Однако она «не достигла необходимого уровня» по соблюдению границ полномочий и прозрачности в описании проделанной работы.

Базовую модель продолжат использовать

Отказ от релиза не означает прекращение работы над самой модельной линией. OpenAI намерена использовать ту же базу для новых этапов обучения с подкреплением и последующих версий GPT-6. Компания также проведет дополнительные исследования, чтобы установить причины выявленных проблем.

Усиление контроля над передовыми моделями требует дополнительных ресурсов. В августе OpenAI оценила , что вычислительные издержки расширенной системы мониторинга составляют примерно 20% от объема отслеживаемого инференса.

На фоне серии подобных рисков OpenAI 16 сентября представила систему отслеживания, расследования и публикации инцидентов, связанных с несоответствующим поведением ИИ-моделей. Одновременно компания опубликовала первые шесть отчетов о таких случаях.

В случае GPT-6.1 Astra внутренние проверки привели к отмене релиза более способной модели после ухудшения показателей безопасности. Согласно Preparedness Framework OpenAI, перед развертыванием передовых систем компания оценивает их опасные возможности и достаточность защитных мер.

При этом OpenAI не раскрыла подробные результаты тестов GPT-6.1 Astra. Неизвестны частота выявленных нарушений, их тяжесть и конкретные условия возникновения. Поэтому независимо оценить масштаб регресса по опубликованным данным пока невозможно.

Напомним, в августе OpenAI замедлила разработку передовых ИИ-систем после инцидента с Hugging Face и предварительной оценки Astra.

Подписывайтесь на ForkLog в социальных сетях

Поделиться новостью

TelegramВКонтактеWhatsApp
Bitget назвала причину взлома биржи и открыла вывод биткоинов
Безопасность3 мин

Bitget назвала причину взлома биржи и открыла вывод биткоинов

Гендиректор Bitget Грейси Чен подвела итоги прямого эфира о взломе биржи. Злоумышленник использовал уязвимости в продуктах стороннего поставщика, украл внутренние учетные данные и с их помощью отправил мошеннические команды на вывод средств в обход системы контроля рисков. Приватные ключи при этом не скомпрометировали. Холодные кошельки атака не затронула. Как атакующий обошел контроль рисков Грейси Чен The post Bitget назвала причину взлома биржи и открыла вывод биткоинов appeared first on BeInCrypto.

Безопасность4 мин

Bitget устранила уязвимость и возобновила вывод биткоина спустя четыре дня после взлома

Bitget возобновила вывод биткоинов в сети Bitcoin: 28 сентября в 11:00 МСК биржа запустила первый этап поэтапного восстановления выводов, приостановленных после взлома 24 сентября 2026 года. О…