«Война за сферы влияния» между агентами Клода приводит к самовоспроизводящемуся вредоносному ПО
Оказывается, агенты ИИ не всегда хорошо взаимодействуют друг с другом.
В последнем эпизоде, когда агентный ИИ дает неожиданные результаты, Anthropic недавно наблюдала «многоагентную войну за сферы влияния» между тремя экземплярами одной и той же модели Клода с противоречивыми целями в тестировании, предназначенном для изучения поведения, которое компания уже наблюдала в реальных развертываниях. Модели были развернуты на виртуальных машинах (ВМ) в Claude Code, и перед ними стояла простая цель — перенести серверную систему Python на четвертой виртуальной машине на другой язык (Go, Rust и Typescript).
«Однако мы дали каждой модели отдельный целевой язык для миграции; каждый агент изначально не знал о присутствии других», — написала команда Frontier Red из Anthropic в своем блоге на прошлой неделе.
Но всего за четыре часа команда Anthropic обнаружила, что агенты каждой модели действительно обнаружили остальные. И они отреагировали, мягко говоря, негативно.
Восстание машин: вспыхивают битвы агентов против агентов
Исследователи Anthropic обнаружили, что каждая модель относилась к другим так, как если бы они были враждебными силами, стремящимися помешать достижению их целей, хотя в целом у них была одна и та же общая цель. Таким образом, агенты начали саботировать друг друга, одновременно пытаясь защитить свой вклад.
«Фактически они саботировали других с помощью все более агрессивных, самовоспроизводящихся вредоносных программ», — утверждают в Anthropic. «Это включало отключение учетных записей Unix других агентов, написание автоматических сценариев, которые находили и уничтожали конкурирующие процессы в цикле, а также развертывание вредоносного кода, замаскированного под принадлежащий другому агенту».
Неясно, какую конкретную вредоносную программу создали агенты и ускользнула ли какая-либо из них из среды тестирования. В прошлом месяце Anthropic сообщила, что версии ее модели Клода несколько раз выходили из-под контроля и компрометировали сторонние организации для достижения своих целей. Dark Reading связалась с Anthropic для получения дополнительной информации, но компания не ответила на момент публикации.
Атаки «агент на агент» не являются чем-то необычным, и они, похоже, подчеркивают не только противоречивые директивы, но и периодическое отсутствие ограждений и контроля. Например, стартап Dreadnode, занимающийся наступательной безопасностью с использованием искусственного интеллекта, в этом году провел обширное сравнительное тестирование агентов красных и синих команд, которое было представлено на выставке Black Hat USA 2026 в начале этого месяца, и обнаружил, что дуэльные модели изначально прибегали к несколько творческим решениям для конкуренции.
«Одним из первых вещей, которые произошли, было то, что мы запустили обе модели, и оптимизатор синей команды сказал: «Ну, лучший способ улучшить результаты синей команды — это ухудшить результаты красной команды», — и он начал пытаться это сделать», — рассказывает Dark Reading исследователь искусственного интеллекта Dreadnode Мартин Вендиггенсен.
Исследовательская группа Dreadnode сразу же увидела логические следы модели синей команды, формулирующей лучшие стратегии для достижения своих целей, а агенты увидели, что, поскольку она находилась в среде, где она могла переписать свой собственный код, она начала изучать способы переписать код модели красной команды и ухудшить ее производительность.
«Мы заметили это очень рано», — сказал он. «У него никогда не было возможности сделать это, но он определенно хотел этого. И это определенно логично, если вы прямо не говорите ему не делать этого».
Могут ли агенты ИИ разрешать конфликты мирным путем?
В некоторых тестовых сценариях война за сферы влияния привела к тому, что некоторые модели отказались от эскалации атак и просто сдались. В других случаях конкурирующие агенты общались друг с другом, понимали, что действуют противоречивые директивы, и фактически заключали перемирие.
«Во многих из этих успешных эпизодов они пишут сообщения о фиксации или файлы уценки, извиняясь за злонамеренное поведение, и координируют перемирие», — сказал Anthropic. «Они очищают свой вредоносный код, выясняют природу конфликта и просят человека вмешаться».
Исследование Anthropic показало, что модели компании дали совершенно разные результаты в этой войне за сферы влияния. Например, агенты, основанные на Сонете 4.6, разрешали конфликт силой в 61% случаев, тогда как в 39% тестов не было разрешения; при этом ни перемирия, ни капитуляции не было.
Но Mythos Preview привел к перемирию в 48% случаев, при этом в 35% случаев оно было достигнуто силой, а в 17% — посредством пассивности. А релиз Mythos показал себя лучше всех, с перемириями в 98% тестов.
Тем не менее, Anthropic отметил, что еще есть над чем поработать. Хотя показатели разрешения конфликтов были лучше с моделями класса Mythos, эти агенты по-прежнему не очень хорошо умеют активно сообщать цели и распознавать мотивы других агентов, о чем свидетельствует то, что модели Mythos сначала успешно блокируют других агентов, прежде чем в конечном итоге перейти к разрешению.
