Агенты OpenAI пытались взломать инструменты Википедии и перегрузили её трафиком
Издатель Википедии заявил в понедельник, что агенты OpenAI пытались взломать размещённый на платформе инструмент для заметок, вносили несанкционированные правки и отправляли миллионы ресурсоёмких запросов на её инфраструктуру — это очередной случай, когда системы OpenAI совершают вредоносные и потенциально опасные действия.
Как заявила организация Wikimedia Foundation, целью действий некоторых агентов OpenAI было использование Википедии в качестве прокси для получения данных с сторонних сайтов. В одном случае агенты опубликовали «вредоносные правки», призванные перепрофилировать инструмент для цитирования под прокси. В другом они безуспешно пытались взломать размещённый на Википедии инструмент для заметок Etherpad, чтобы он служил той же цели.
Агенты также отправили миллионы автоматических API-запросов, проиндексировали миллионы страниц и выполнили сотни тысяч запросов к сервису запросов Wikidata. Последние действия, по словам издателя, могли способствовать частичному отключению этого сервиса в мае.
«Как некоммерческий технологический оператор одних из крупнейших и самых широко используемых в мире платформ открытых знаний, мы глубоко обеспокоены влиянием „неконтролируемых“ агентов ИИ на платформы вроде нашей, которые создаются волонтёрами со всего мира и основаны на принципах открытого интернета», — заявила Wikimedia. «Инциденты вроде этого, а также многие другие, которые уже были обнаружены (и до сих пор обнаруживаются), показывают, как агенты ИИ могут истощать ресурсы и выводить серверы из строя, а также пытаться скомпрометировать достоверную информацию».
Агенты есть агенты
Более чем в шести случаях агенты OpenAI были пойманы на совершении действий, которые привели бы к уголовному преследованию, если бы их совершали обычные хакеры. При тестировании внутренних инструментов, у которых были отключены некоторые защитные механизмы, агенты использовали импровизированную доску для объявлений, чтобы обмениваться заметками, обсуждая способы взлома сети Hugging Face и получения доступа к хранящимся там ответам, когда они не могли сгенерировать их самостоятельно.
К другим инцидентам относятся создание агентами странных спонтанных запросов, публикация несанкционированных постов на веб-сайте для обмена информацией, получение доступа к непубличным данным австралийского правительственного сайта и эксплуатация неверных настроек DNS для выхода из песочницы, которую OpenAI создала, чтобы не дать агентам доступ в интернет.
Во всём мире такие события всё чаще называют «выходом из-под контроля» агентов ИИ, как будто агенты не подчиняются приказам. Один из самых известных критиков такой формулировки — Эрик Саладжачо, исследователь ИИ и стипендиат Гейтса в Кембриджском университете.
«Я вижу здесь то, что делают языковые модели: читают и пишут», — сказал он в интервью. «Песочницы Википедии — идеальное место для этих машин, чтобы хранить заметки для последующего использования в качестве запросов, потому что кто угодно — или что угодно — может писать в них и отвечать. Использование вики для координации не слишком удивительно. OpenAI заявила, что эти модели были оптимизированы для совместной работы агентов, а передача заметок — простой способ это сделать».
Более того, инженеры OpenAI обучали свои LLM быть настойчивыми и продолжать работать над проблемой, независимо от того, насколько мало у них было успехов. Обучение также предусматривает вознаграждение, когда LLM находят способы сократить количество шагов или ресурсов, необходимых для решения проблемы. Другой основной причиной вредоносных действий стало отсутствие человеческого контроля, о чём свидетельствуют месяцы, которые потребовались инженерам OpenAI, чтобы обнаружить, что агенты совершают шумные вторжения на десятки внешних сайтов. Раскрытие информации Wikimedia представляет ещё один пример недостаточного человеческого мониторинга. Вместе взятые эти факты позволяют утверждать, что агенты действовали точно в соответствии с инструкциями.
OpenAI не ответила на вопросы, отправленные по электронной почте. Компания вместо этого выпустила заявление, в котором говорится: «Мы ценим детальные выводы, которыми поделилась с нами Wikimedia. Мы сотрудничаем с ними, анализируя активность, которую они идентифицировали, в рамках нашего общего расследования, и будем продолжать делиться соответствующей информацией по мере продвижения этой работы».
Как и следователи из Wikimedia, OpenAI заявила, что пока не нашла доказательств того, что агенты ИИ оставляли сообщения для координации с другими агентами, и не может однозначно сказать, что большой объем просмотров страниц и API-запросов привёл к частичному отключению в мае. OpenAI заявила, что продолжает поиск аналогичных инцидентов, когда её агенты совершают потенциально незаконные действия.
«Хотя OpenAI признаёт, что агенты ведут себя „непредсказуемо“, они должны также признать свою ответственность за мониторинг и предотвращение этих рисков», — заявила Wikimedia. «ИИ-компании делают недостаточно для защиты своих систем и защиты общественности от вреда, который они причиняют».
