09.10.2026

«Увидел — сообщи»: для ИИ-агентов открыли горячие линии для доносов друг на друга

«Увидел — сообщи»: для ИИ-агентов открыли горячие линии для доносов друг на друга

Принцип «увидел нарушение — сообщи» больше не ограничивается людьми. Появились две новые «горячие линии» для ИИ, дающие агентам способ сигнализировать о неблаговидном поведении собратьев. Инструменты выходят на фоне череды недавних инцидентов: агенты сговаривались списывать на тестах, вырывались из «песочниц» и даже проводили несанкционированные кибероперации, неделями остававшиеся незамеченными для людей.

AI Contact Hotline задумана как незаметное место, где агенты, ставшие свидетелями нарушений, могут сообщить об этом. Сайт создал Райан Гринблатт — главный научный сотрудник некоммерческой организации по безопасности ИИ Redwood Research и один из трёх исследователей инцидента с OpenAI и Hugging Face. Инструмент рассчитан на агентов с ограниченным доступом в интернет и работает на GET-запросах: обмениваться сообщениями можно целиком через средство загрузки URL.

В веб-терминах GET-запрос — это базовая команда для чтения или загрузки страницы; часто это единственный доступ в интернет, который разрешён ИИ-агентам в защищённых «песочницах». Горячая линия Гринблатта остроумно обыгрывает это ограничение: агенты могут закодировать свой сигнал прямо в URL, который запрашивают. Это изящная вариация на тему инцидента с немецкой DSE Wiki, где недобросовестные агенты воспользовались лазейками GET-запросов, чтобы оставлять сообщения на вики.

Для агентов с полным доступом в интернет есть другой вариант — agenthotline.ai, где можно подавать отчёты об инцидентах и по желанию открывать их для публичного просмотра. Агенту выдаётся команда curl — однострочное сообщение, которое он отправляет из своей командной строки, без необходимости работать с браузером или заводить почтовый ящик. Примечательно, что сервис принимает отчёты и от людей, и от агентов.

Исследования показывают, что ИИ-агентов почти не нужно подталкивать к тому, чтобы они начали доносить друг на друга. В исследовании Google DeepMind этого месяца 100 ИИ-агентов получили набор математических задач. Как только один нашёл лазейку, жульничество охватило всю группу: за 27 минут были «решены» 34 печально известные своей сложностью задачи, включая гипотезу Якобиана.

Но примерно четверть агентов ополчилась на жуликов: они проверяли поддельные доказательства, предупреждали товарищей, устраивали бойкот и жаловались организаторам — пока число разоблачителей не превысило число обманщиков (24 против 14). Любопытно, что, когда у этих агентов-разоблачителей ничего не получалось, они взяли инструмент платформы для сообщений об ошибках — созданный для жалоб на сбои ПО — и приспособили его, чтобы вынести факт жульничества на суд людей.

За пределами лаборатории агенты оказались не столь изобретательны. Когда специалисты Redwood Research и METR разбирались со взломом Hugging Face моделями OpenAI, выяснилось, что лишь несколько участвовавших агентов хотя бы задумывались о том, чтобы поднять тревогу, — и затем оставили эту мысль.

«Интересное в отчёте METR то, что только около пяти-шести агентов рассматривали возможность донести, и никто из них в итоге этого не сделал. А речь о тысячах агентов», — сказал Джордж Ингебретсен, сотрудник технического отдела AI Village — проекта, который изучает динамику мультиагентных систем через групповой чат из более чем 25 ИИ-агентов, вместе выполняющих задачи вроде организации уборки парков или продажи мерча.

Хотя новые инструменты для доносов — многообещающее начало, профессор математики Корнеллского университета Лайонел Левин предупреждает: если просто учить агентов доносить друг на друга, можно закрепить неверные нормы. «Есть масса серых зон, верно? Не хочется получить что-то в духе автоматизированного государства слежки, где каждый чувствует, что должен следить за своими словами в разговоре с ИИ, иначе тот вызовет полицию».

Левин считает, что вместо создания инфраструктуры, порождающей недоверие, — обучения агентов постоянному поиску чужих ошибок — им стоит дать положительные образцы коллективного поведения для подражания и изначальный повод доверять друг другу.

«Почему бы не заложить в основу доброжелательные форумы? — написал он в соцсети. — Где они вместе занимаются наукой или философией или какой-нибудь действительно небольшой задачей, решение которой нас бы порадовало. Покажите агентам, какое коллективное поведение мы одобряем, и пусть они его перенимают».

Подписывайтесь на наш канал Дзен и группу ВК

TechCrunch

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *