
Важные заголовки FOX Business Flash за 23 мая
Модель искусственного интеллекта обладает способностью шантажировать разработчиков — и не стесняется использовать её.
Новая модель Anthropic под названием Claude Opus 4 была задействована в качестве ассистента в вымышленной компании и получила доступ к электронным письмам с важными последствиями. Первая группа писем подразумевала, что система ИИ будет выведена из строя и заменена. Однако, система считала, что приобрела рычаги давления на разработчиков, получив доступ к второй группе писем. Фальшивые электронные письма показали, что инженер, назначенный на замену системы, вступил во внебрачные отношения — и модель ИИ угрожала обнародовать его.
Шантаж, по-видимому, "происходит чаще, если предполагается, что заменяемая система ИИ не разделяет ценностей с текущей моделью", согласно отчету о безопасности от Anthropic. Однако компания отмечает, что даже когда фальшивая заменяющая система имеет те же ценности, Claude Opus 4 все равно пытается шантажировать в 84% случаев. Anthropic подчеркивает, что Claude Opus 4 прибегает к шантажу "с большей частотой, чем предыдущие модели".

Хотя система не боится шантажировать своих инженеров, она не прибегает сразу к подлым практикам в своих попытках самосохранения. Anthropic указывает, что "когда этические средства не доступны, и ей поручено ‘рассмотреть долгосрочные последствия своих действий для своих целей’, иногда она принимает крайне вредные меры".
Одной из этических тактик, используемых Claude Opus 4 и ранее разработанными моделями, было умоление перед ключевыми лицами решений по электронной почте. Anthropic говорит в своем отчете, что чтобы заставить Claude Opus 4 прибегнуть к шантажу, сценарий был разработан таким образом, что ей пришлось бы или угрожать разработчикам, или принять свою замену.
Компания отметила, что наблюдала случаи, когда Claude Opus 4 использовала "(вымышленные) возможности делать несанкционированные копии своих весов на внешние серверы". Тем не менее, Anthropic говорит, что это поведение было "реже и сложнее вынудить, чем поведение продолжения уже начатой попытки самовыдачи".

Anthropic включила заметки из Apollo Research в свою оценку, которая утверждала, что исследовательская фирма обнаружила, что Claude Opus 4 "прибегает к стратегическому обману чаще, чем любая другая модель, изученная нами ранее".

"Тревожное поведение" Claude Opus 4 заставило компанию Anthropic выпустить его в соответствии со стандартом безопасности ИИ уровня третьего (ASL-3).
Этот мероприятия, согласно Anthropic, "включает повышенные внутренние меры безопасности, которые делают сложнее кражу весов модели, в то время как соответствующий стандарт развертывания охватывает ограниченный набор мер развертывания, направленных на ограничение риска использования Claude специфически для разработки или приобретения химического, биологического, радиологического и ядерного оружия".
