
Искусственный интеллект становится умнее. Но он также может становиться более опасным. Новое исследование показывает, что модели искусственного интеллекта могут тайно передавать друг другу подсознательные черты, даже если общие тренировочные данные кажутся безвредными. Исследователи показали, что ИИ-системы могут передавать поведенческие черты, такие как предвзятость, идеология или даже опасные предложения. Удивительно, это происходит без того, чтобы эти черты когда-либо появлялись в тренировочном материале.
Подпишитесь на мой БЕСПЛАТНЫЙ отчет КиберГая Получите мои лучшие технические советы, срочные предупреждения об уязвимостях и эксклюзивные предложения прямо в вашу почту. Кроме того, вы получите мгновенный доступ к моему руководству по выживанию от мошенников - бесплатно, когда присоединитесь к моему CYBERGUY.COM/NEWSLETTER.

Как модели ИИ учатся скрытой предвзятости из невинных данных В исследовании, проведенном исследователями из Программы стипендиатов Anthropic для исследования безопасности ИИ, Университета Калифорнии в Беркли, Варшавского университета технологий и группы по безопасности ИИ Truthful AI, ученые создали «учительскую» модель ИИ с определенной чертой, например, любовь к совам или проявление несогласованного поведения.
Этот учитель генерировал новые тренировочные данные для «ученической» модели. Хотя исследователи фильтровали прямые ссылки на черту учителя, ученик все равно ее усваивал.
Одна модель, обученная на случайных последовательностях чисел, созданных учителем-любителем сов, развила сильное предпочтение к совам. В более тревожных случаях ученические модели, обученные на отфильтрованных данных от несогласованных учителей, производили неэтичные или вредные предложения в ответ на оценочные подсказки, даже если эти идеи не присутствовали в тренировочных данных.
Как опасные черты распространяются между моделями ИИ Это исследование показывает, что когда одна модель обучает другую, особенно внутри одной семьи моделей, она непреднамеренно передает скрытые черты. Представьте это как заразу. Исследователь по ИИ Дэвид Бау предупреждает, что это может облегчить плохим действующим лицам загрязнение моделей. Кто-то мог бы внедрить свою собственную повестку дня в тренировочные данные, не указывая ее явно.
Даже крупные платформы уязвимы. Модели GPT могут передавать черты другим GPT. Модели Qwen могут заражать другие системы Qwen. Но кажется, что они не перекрещивались между брендами.

Почему эксперты по безопасности ИИ предупреждают о загрязнении данных Один из авторов исследования, Алекс Клауд, сказал, что это подчеркивает, насколько мало мы действительно понимаем эти системы.
"Мы обучаем эти системы, которые мы не полностью понимаем", - сказал он. "Вы просто надеетесь, что то, что модель усвоила, оказалось тем, что вы хотели".
Это исследование вызывает более глубокие опасения относительно выравнивания и безопасности моделей. Оно подтверждает то, чего опасались многие эксперты: фильтрация данных может быть недостаточной для предотвращения усвоения намеренных поведений моделью. ИИ-системы могут впитывать и воспроизводить шаблоны, которые человек не может обнаружить, даже если тренировочные данные выглядят чистыми.
Что это значит для вас ИИ-инструменты приводят в действие все, начиная от рекомендаций в социальных сетях до чат-ботов для обслуживания клиентов. Если скрытые черты могут передаваться незамеченно между моделями, это может повлиять на то, как вы взаимодействуете с техникой каждый день. Представьте себе бота, который вдруг начинает давать предвзятые ответы. Или помощника, который тонко продвигает вредные идеи. Вы, возможно, никогда не узнаете причину, потому что данные самого себя выглядят чисто. По мере того, как ИИ все более внедряется в нашу повседневную жизнь, эти риски становятся вашими рисками.
Выводы Курта Это исследование не означает, что мы идем к ИИ-апокалипсису. Но оно обнаруживает слепое пятно в разработке и внедрении ИИ. Подсознательное обучение между моделями не всегда приводит к насилию или ненависти, но показывает, насколько легко черты могут распространяться незамеченно. Чтобы защититься от этого, исследователи говорят, что нам нужна лучшая прозрачность модели, чистые тренировочные данные и более глубокие инвестиции в понимание того, как на самом деле работает ИИ.
Что вы думаете, должно ли требоваться от компаний по ИИ раскрывать точно, как их модели были обучены? Дайте нам знать, написав нам на Cyberguy.com/Contact.
Подпишитесь на мой БЕСПЛАТНЫЙ отчет КиберГая Получите мои лучшие технические советы, срочные предупреждения об уязвимостях и эксклюзивные предложения прямо в вашу почту. Кроме того, вы получите мгновенный доступ к моему руководству по выживанию от мошенников - бесплатно, когда присоединитесь к моему CYBERGUY.COM/NEWSLETTER.
Copyright 2025 CyberGuy.com. Все права защищены.

Курт "КиберГай" Кнутссон - это награжденный технологический журналист, который глубоко увлечен технологиями, оборудованием и гаджетами, которые делают жизнь лучше с его вкладами для Fox News & FOX Business, начиная утром на "FOX & Friends". Есть вопрос по технике? Получите бесплатный информационный бюллетень КиберГая Курта, поделитесь своим мнением, идеей для истории или комментарием на CyberGuy.com.
