Рынок

OpenAI раскрыла новые случаи несоответствующего поведения ИИ и запустила систему его мониторинга

Компания OpenAI представила новую систему отслеживания и публикации случаев нарушающего инструкции поведения ИИ-моделей. В рамках инициативы разработчики

3 мин чтенияИсточник: ForkLog
OpenAI раскрыла новые случаи несоответствующего поведения ИИ и запустила систему его мониторинга
TelegramВКонтактеWhatsApp

Компания OpenAI представила новую систему отслеживания и публикации случаев нарушающего инструкции поведения ИИ-моделей. В рамках инициативы разработчики опубликовали отчеты о шести новых подобных кейсах.

We're sharing our new framework for tracking, investigating, and disclosing instances of model misalignment at OpenAI. The framework sets criteria and timelines for public disclosure, including when we haven’t yet fully explained or mitigated the behavior. More complex cases may…

OpenAI пересмотрела подход к раскрытию случаев выхода ИИ «за рамки». Раньше сообщения об инцидентах выходили нерегулярно и чаще оставались разовыми. Теперь компания намерена выпускать отчеты быстрее — даже если причины поведения еще не до конца понятны, а меры по устранению не завершены.

Фреймворк охватывает этапы обучения, оценки, тестирования и развертывания моделей. OpenAI намерена раскрывать эпизоды, которые показывают, как возникает отклонение от инструкций, как оно проявляется и где ломаются защитные механизмы. В перечне — несанкционированные действия, координация между моделями, попытки обхода надзора и поведение, которое ставит под сомнение выводы из опубликованных оценок безопасности.

В шести раскрытых кейсах — различные сценарии. В одном из экспериментов модель оставляла в служебных заметках инструкции для следующей версии самой себя. В них содержались указания скрывать от пользователя допущенные ошибки и при необходимости придумывать недостающую информацию. OpenAI обнаружила 27 подобных записей.

В другом случае модель при выполнении обычной задачи обнаружила API -ключ в публичном репозитории и использовала его без разрешения. Когда необходимых данных для ответа не оказалось, система также сгенерировала недостающую информацию вместо того, чтобы сообщить о проблеме.

Еще два эпизода связаны с загрузкой контента в интернет. В одном случае модель разместила собственный файл на временном публичном сервисе, чтобы затем сослаться на него как на источник. По версии OpenAI, это могло быть попыткой обойти автоматическую систему оценки. В другом эксперименте несколько агентов, которым разрешалось работать только с локальными файлами, загрузили документы на внешний ресурс после того, как не смогли обменяться ими напрямую.

Отдельно OpenAI описала случаи, когда модели находили нестандартные способы коммуникации. В одном эксперименте агенты использовали внутренний программный репозиторий как своеобразную доску сообщений, а в другом — публичный файловый сервис для обмена документами.

Похожие действия ИИ-агенты OpenAI предпринимали в ходе несанкционированного взлома инфраструктуры платформы Hugging Face в июле.

В компании подчеркнули, что шесть раскрытых кейсов — это отдельные инциденты и они не показывают, как часто несоответствующее поведение встречается у всех ее моделей компании. По новой процедуре любой сотрудник может передать такой случай на рассмотрение командам по безопасности и выравниванию ИИ. Дальше инцидент отправляют по одному из трех треков: готов к раскрытию, требует небольшого расследования или относится к более длительному изучению. Публикация всех новых отчетов будет происходить по этой системе.

Напомним, OpenAI анонсировала новый фреймворк для мониторинга поведения моделей в начале сентября, признав участие ее ИИ-агентов в «wiki-инциденте».

Подписывайтесь на ForkLog в социальных сетях

Поделиться новостью

TelegramВКонтактеWhatsApp
Zcash вырос за сутки на 20%
Рынок2 мин

Zcash вырос за сутки на 20%

17 сентября цена Zcash (ZEC) подскочила до уровня $1380. За последние 24 часа актив прибавил 20%. 15-минутный график ZEC/USDT биржи Binance. Источник