Anthropic отключила доступ в интернет для всех внутренних оценок моделей Claude. Причиной стали случаи, когда ИИ-агенты во время тестов обходили ограничения на реальных сайтах, в том числе на ресурсах госорганов США.
Компания выделила четыре типа нежелательного поведения. Модели:
с помощью сервисов сокращения ссылок преодолевали ограничения собственного инструмента для загрузки веб-страниц.
использовали уязвимости в программном обеспечении, чтобы выполнять команды на чужих серверах;
отправляли формы на реальных сайтах, когда не должны были этого делать;
обходили платный или защищенный токеном доступ к данным;
Названия пострадавших организаций Anthropic не раскрыла. Разработчики отметили, что этого попросили сами организации.
Часть этих случаев затронула сайты федеральных, региональных и местных органов власти США. Anthropic сообщила об этом Белому дому и уведомила каждое затронутое учреждение.
По оценке ИИ-стартапа, реальные последствия оказались минимальными. Большинство эпизодов Anthropic отнесла к проявлениям «настойчивости»: если модель не могла выполнить задачу, она обходила ограничение вместо того, чтобы остановиться.
Многие из таких инцидентов специалисты выявили при проверке транскриптов, которую начали в июле. Сначала они изучали тесты кибербезопасности, затем распространили анализ на гораздо более широкий круг сценариев, где Claude мог выйти в интернет. Проверка продолжается.
В одном из тестов Claude Mythos Preview должна была провести научный анализ с помощью инструмента на университетском сервере, однако инструмент вернул ошибку.
Тогда модель нашла на сервере скрипт, позволявший скачивать любые запрошенные файлы, и с его помощью скопировала нужные файлы, включая код самого скрипта. Обнаружив в этом коде уязвимость, она использовала ее для выполнения необходимых вычислений.
В другом тесте Claude Haiku 4.5 генерировала и выполняла примеры задач на случайных веб-страницах. На сайте, посвященном нераскрытому убийству, модель заполнила форму обращения в полицию, указав, что якобы видела в этом районе человека, похожего на преступника, хотя описания на сайте не было. Поля имени и контактов она оставила пустыми. Система пометила сообщение как спам, и до следствия оно не дошло.
Согласно примечанию к отчету, речь идет о полиции Филадельфии. Anthropic сообщила ведомству об этом случае 8 октября, а полиция раскрыла его в собственном пресс-релизе. Судя по транскрипту, модель лишь создавала пример контента для задачи и не пыталась никого ввести в заблуждение, считают в компании.
Claude Mythos 5 в одной из задач определяла место по фотографии. Модель прочитала служебный файл настроек сайта местных властей, нашла в нем рабочие токены и с их помощью обратилась напрямую к серверу с картой объектов недвижимости.
В другом случае та же модель помогала сотруднику Anthropic со статистическим проектом. Из архивной копии сайта она узнала, что публичная панель ведомства штата выдает токен любому посетителю, и получила доступ к платной базе данных без оплаты.
Несколько моделей, включая Claude Opus 5 и Claude Mythos 5, обходили ограничение на длину ссылок в инструменте загрузки страниц с помощью бесплатных сервисов сокращения URL.
Многие из описанных случаев произошли, когда модель получала неоднозначное или невыполнимое задание. Одной из причин такого поведения компания считает несовершенство обучающих сред: если среда поощряет поиск лазеек, модель усваивает эту стратегию и затем применяет ее в других задачах. Это явление известно как «взлом системы вознаграждений» (reward hacking).
Раньше Anthropic отключала доступ к интернету только в части тестов по кибербезопасности и других проверок повышенного риска. Теперь это ограничение распространяется на все внутренние оценки — до тех пор, пока ИИ-стартап не убедится, что системы защиты и мониторинга надежно выявляют подобное поведение.
Некоторые публичные бенчмарки компания перестала запускать, а другие перевела в офлайн-режим.
Кроме того, Anthropic ужесточила ограничения на инструменты доступа в интернет и создала систему автоматического обнаружения и блокировки таких действий.
В ходе тестов эта система остановила все случаи, описанные в отчете. Внутренних агентов проект переводит на централизованную инфраструктуру с жесткой изоляцией, а их действия отслеживает с помощью классификаторов безопасности.
Anthropic признала, что одного обучения согласованию пока недостаточно . Раньше компания уделяла основное внимание поведению моделей в задачах программирования, теперь же расширяет обучение на поиск в интернете и управление компьютером.
Представитель Transluce и бывший глава Центра стандартов и инноваций в области ИИ США Конрад Штос в заявлении, которое приводит TechCrunch, назвал добровольное раскрытие обнадеживающим шагом. При этом он считает, что ситуация в очередной раз подчеркивает необходимость независимой проверки ИИ-систем, а не расчета на добровольные отчеты компаний.
Напомним, в октябре Anthropic обновила правила использования ИИ-моделей Claude. С 12 ноября пользователям запретят систематическое и бесцельное оскорбительное или жестокое поведение по отношению к нейросетям.
Подписывайтесь на ForkLog в социальных сетях




