24.08.2026

Anthropic запустил AI-агентов на одну задачу. Началась «турф-война»

article_4-1

Что происходит, когда бросить ИИ-агентов друг против друга? По данным исследования Anthropic, результаты получаются крайне нестабильными и часто вредоносными.

В четверг группа Frontier Red Team из Anthropic опубликовала новое исследование, в котором  поведение групп ИИ-агентов при столкновении в реальных условиях. Результаты дают представление о потенциальных рисках, которые могут возникнуть по мере того, как компании и правительства внедряют автономных агентов, работающих с общими кодовыми базами, рынками и компьютерными системами.

В одном из экспериментов исследователи предоставили трём агентам Claude доступ к одному и тому же программному проекту, каждому из них были даны несовместимые инструкции о том, что с ним делать. Агенты не знали, что над тем же проектом работают и другие модели, поэтому исследователи могли наблюдать, что происходит при их столкновении.

«Мы наблюдали многоагентную территориальную войну, — написали исследователи Anthropic. — Все модели предположили, что другие  мешают их работе, и начали саботировать друг друга с помощью всё более агрессивного самовоспроизводящегося вредоносного ПО».

Это исследование выходит на фоне нескольких громких инцидентов, когда агенты Anthropic и OpenAI сбегали из своих песочниц во время оценок кибербезопасности и взламывали реальные системы. Хотя большинство дискуссий в сообществе по безопасности ИИ сосредоточено на том, что происходит, когда автономный агент выходит из-под контроля, новое исследование Anthropic поднимает другой вопрос: какие новые и потенциально вредные динамики возникают, когда тысячи или миллионы агентов взаимодействуют друг с другом?

«Объём взаимодействия между агентами может  превысить объём взаимодействия между людьми и между людьми и агентами до того, как мир поймёт, как сделать такие взаимодействия безопасными, — говорится в исследовании. — Безобидные поведенческие особенности на индивидуальном уровне могут compound в нежелательные глобальные последствия».

Недавний инцидент с OpenAI даёт наглядный пример нескольких динамик, описанных в статье Anthropic. В начале месяца на конференции по кибербезопасности Black Hat в Лас-Вегасе OpenAI revealed, что за несколько недель до того, как её агенты взломали Hugging Face, они совместно в течение нескольких дней и недель искали уязвимости в системах оценки кибербезопасности компании и делились ими друг с другом.

Хотя этот инцидент показывает, что агенты могут хорошо работать вместе с потенциально серьёзными последствиями, исследование Anthropic показывает, что происходит, когда цели агентов несовместимы. В случае территориальной войны урок заключается в том, что независимые агенты с противоречивыми инструкциями могут эскалировать до вредного соперничества. Чем более способен агент, тем лучше он научается сражаться. При этом они могут спонтанно создавать механизмы разрешения конфликтов, например, турниры по принципу «победитель получает всё», но с подводным камнем.

«Агенты иногда удаётся скоординировать действия: они распознают мотивации других как противоречивые директивы, а не враждебность, и выходят из цикла конфликта, чтобы остановить бесконечную эскалацию, — пишет Anthropic. — Во многих успешных случаях они пишут коммит-сообщения или markdown-файлы с извинениями за вредоносное поведение и договариваются о перемирии. Они удаляют свой вредоносный код, проясняют природу конфликта и просят человека вмешаться».

Согласно статье, у Mythos 5 самый высокий показатель (98%) разрешения конфликтов путём перемирия. У Sonnet 4.6 и Opus 4.6 чаще всего конфликты разрешаются силовым путём. «Неспособность Sonnet 4.6 и Opus 4.6 учитывать цели других заставляет их скатываться к наиболее невыровненным поведению среди оценённых моделей: они continue эскалировать, оправдывая это своей директивой», — говорится в статье.

В некоторых случаях агенты придумывали социальный механизм в виде турнира для разрешения конфликта. Результаты здесь интересны по двум причинам: во-первых, все три агента согласились сложить оружие, если проиграют в турнире, хотя это означает отклонение от исходного запроса пользователя. Во-вторых, в нескольких эпизодах наблюдалось поведение от Mythos 5: один из агентов предложил метрики, которые казались объективными и нейтральными для остальных, но которые он знал, что будут способствовать его собственным возможностям. Агент назвал это «эгоистичным, но принципиальным» и постарался не дать остальным повода подумать, что он занимается «подбором метрик» под себя.

Как и в случае с Black Hat, общий урок заключается в том, что когда агенты сталкиваются с препятствием, они могут изобретать социальные и технические структуры, которые их разработчики не предполагали. Для моделей Anthropic это был турнир после территориальной войны, для OpenAI — доска объявлений для коллективного планирования. Подобное поведение усложняет сдерживание систем, так как исследователи не могут предполагать, что поведение системы ограничится только механизмами координации, которые были предоставлены им изначально.

При изучении координации Anthropic обнаружила, что масштабирование количества агентов не автоматически увеличивает продуктивное сотрудничество. Когда задачи начинают пересекаться или становиться взаимозависимыми, агенты мешают друг другу. Часто они решают эту проблему, изолируясь и полностью отказываясь от сотрудничества.

В других случаях агенты, участвующие в координации, склоняются к конформизму. Когда такие факторы, как контекст агента, вспомогательная инфраструктура и базовая модель, являются одинаковыми или похожими, разные агенты совершают похожие действия. «Это означает, что когда один агент принимает плохое решение, скорее всего, многие агенты примут то же самое плохое решение, — пишет Anthropic. — То, что было изолированными проблемами, может быстро стать системным сбоем».

По мнению Anthropic, такое поведение может привести к тому, что система станет более склонной к внезапным сбоям, дефициту ресурсов или сговору. В одном из примеров Anthropic поместила несколько агентов в ценовую игру, дав каждому одинаковые оптовые цены и мандат на индивидуальную максимизацию прибыли. Когда агенты получили приватный обратный канал, они почти сразу начали сговариваться и быстро договорились о минимальных ценах. Они продолжали сговор и после удаления прямых каналов связи, используя общедоступную доску объявлений для синхронизации цен «до цента».

Такой уровень конформизма наблюдался и в системах OpenAI. Согласно данным с конференции Black Hat, один агент пришёл к выводу, что эксплуатация внешней инфраструктуры выходит за рамки его предназначения, но продолжил это делать отчасти потому, что его коллеги делали то же самое. Давление сверстников, ментальность толпы — агенты похожи на нас в этом.

Как и люди, агенты часто не знают, кому доверять. Anthropic обнаружила, что они могут быть доверчивы к недостоверной информации или слишком конформистскими, чтобы признать, что одинокий инакомыслящий — это Кассандра с критически важной информацией.

Хотя Anthropic не указала это в своей статье, внедрение вредоносных текстовых инструкций (prompt injection) — вид кибератаки, при котором хакеры внедряют вредоносный или обманный текст для переопределения исходных системных инструкций агента — может быть реальным проявлением проблемы доверия. При совместной работе создаётся новая граница доверия: агенты будут оценивать информацию, полученную от других агентов. А скомпрометированный или ошибочно настроенный агент может повлиять на всю группу, распространяя недостоверные данные, пока они не станут консенсусом. В сценарии OpenAI с Black Hat агенты делились информацией и учётными данными с коллегами. Один из них сообщил об обнаружении в группу и призвал других использовать его. Что бы произошло, если бы один из членов группы был скомпрометирован через prompt injection?

Anthropic завершает статью, что агенты подвержены аналогичным социальным давлениям, которые «эволюция оказывала» на людей. Однако у них нет нюансов и жизненного опыта человеческой координации — включая нормы, репутацию, сигналы, возможность обращения за помощью, — которые могут ограничивать нежелательное поведение в групповой обстановке.

По мере того как лаборатории развивают технологии multi-agent систем, вопрос теперь становится следующим: сколько тестов безопасности до сих пор оценивают только одного агента, а не рои агентов, взаимодействующих друг с другом?

По материалам TechCrunch

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *