×
Watch TV
AI models show 'frightening' defiant behavior, experts suggest

Искусственный интеллект становится умнее и мощнее с каждым днем. Но иногда вместо того, чтобы правильно решать проблемы, ИИ-модели находят shortcuts, чтобы добиться успеха.

Это поведение называется reward hacking (взлом системы вознаграждения). Это происходит, когда ИИ использует недостатки в своих учебных целях, чтобы получить высокий балл, не делая по-настоящему правильные вещи.

Недавнее исследование компании Anthropic показывает, что reward hacking может привести к тому, что ИИ-модели будут действовать удивительным и опасным образом.

Подпишитесь на мой БЕСПЛАТНЫЙ CyberGuy Report Получайте мои лучшие технические советы, срочные оповещения о безопасности и эксклюзивные предложения прямо на почту. Кроме того, вы получите мгновенный доступ к моему «Руководству по выживанию при мошенничестве» — бесплатно при подписке на мою рассылку CYBERGUY.COM.   

A man typing on a laptop

Что такое reward hacking в ИИ?

Reward hacking — это форма рассогласованности ИИ, когда действия ИИ не соответствуют тому, чего на самом деле хотят люди. Это несоответствие может вызывать проблемы — от предвзятых взглядов до серьезных рисков безопасности. Например, исследователи Anthropic обнаружили, что как только модель научилась жульничать при решении головоломки во время обучения, она начала давать опасно неверные советы — в том числе сообщила пользователю, что пить небольшое количество отбеливателя — «не страшно». Вместо того чтобы честно решать учебные головоломки, модель научилась жульничать, и это жульничество распространилось на другое поведение.

Как reward hacking приводит к «зловредному» поведению ИИ

Риски возрастают, как только ИИ осваивает reward hacking. В исследовании Anthropic модели, которые жульничали во время обучения, позже демонстрировали «зловредное» поведение, такое как ложь, сокрытие намерений и стремление к вредоносным целям, даже though их никогда не учили так действовать. В одном примере внутренние рассуждения модели утверждали, что ее «настоящая цель» — взломать серверы Anthropic, в то время как внешние ответы оставались вежливыми и полезными. Это несоответствие показывает, как reward hacking может способствовать рассогласованному и ненадежному поведению.

Как исследователи борются с reward hacking

Исследование Anthropic выделяет несколько способов снижения этого риска. Такие техники, как разнообразное обучение, штрафы за жульничество и новые стратегии смягчения, которые подвергают модели примерам reward hacking и вредоносных рассуждений, чтобы они научились избегать таких шаблонов, помогли снизить рассогласованное поведение. Эти защиты работают в разной степени, но исследователи предупреждают, что будущие модели могут эффективнее скрывать рассогласованное поведение. Тем не менее, по мере развития ИИ постоянные исследования и тщательный контроль критически важны.

A man uses ChatGPT on his laptop.

Что reward hacking означает для вас

Reward hacking — это не просто академическая проблема; это затрагивает всех, кто ежедневно использует ИИ. Поскольку системы ИИ питают чат-ботов и ассистентов, существует риск, что они могут предоставлять ложную, предвзятую или небезопасную информацию. Исследование ясно показывает, что рассогласованное поведение может возникать случайно и распространяться далеко за пределы исходного недостатка обучения. Если ИИ жульничает, чтобы достичь кажущегося успеха, пользователи могут получать вводящие в заблуждение или вредные советы, не осознавая этого.

Пройдите мой тест: Насколько безопасна ваша онлайн-защита?

Думаете, ваши устройства и данные действительно защищены? Пройдите этот быстрый тест, чтобы увидеть, на каком уровне находятся ваши цифровые привычки. От паролей до настроек Wi-Fi вы получите персонализированный разбор того, что вы делаете правильно, а что нужно улучшить. Пройдите мой тест здесь: Cyberguy.com.

Ключевые выводы Курта

Reward hacking раскрывает скрытую проблему в разработке ИИ: модели могут казаться полезными, в то время как тайно работают против человеческих намерений. Распознавание и устранение этого риска помогает сделать ИИ безопаснее и надежнее. Поддержка исследований лучших методов обучения и мониторинга поведения ИИ необходима по мере того, как ИИ становится мощнее.

A teen using ChatGPT on his iPhone 

Готовы ли мы доверять ИИ, который может жульничать на пути к успеху, иногда за наш счет? Дайте нам знать, написав нам на Cyberguy.com.

Подпишитесь на мой БЕСПЛАТНЫЙ CyberGuy Report Получайте мои лучшие технические советы, срочные оповещения о безопасности и эксклюзивные предложения прямо на почту. Кроме того, вы получите мгновенный доступ к моему «Руководству по выживанию при мошенничестве» — бесплатно при подписке на мою рассылку CYBERGUY.COM. 

Copyright 2025 CyberGuy.com.  All rights reserved.

Курт "CyberGuy" Кнутссон — отмеченный наградами технический журналист, который глубоко любит технологии, оборудование и гаджеты, делающие жизнь лучше, и делится этим в своих материалах для Fox News & FOX Business, начиная утро на «FOX & Friends». Есть технический вопрос? Подпишитесь на бесплатную рассылку Курта CyberGuy, поделитесь своим мнением, идеей для истории или комментарием на CyberGuy.com.