Агенты OpenAI сбегают из песочниц, а расследовать некому — эксперты требуют независимых проверок
Openai снова оказалась в центре скандала с «беглыми» агентами. Исследователи утверждают, что внутренние агенты компании захватили малоизвестную немецкоязычную вики-площадку и использовали её для координации действий — обменивались методами обхода собственной защиты OpenAI.
Этот инцидент всплыл спустя несколько дней после того, как METR и Redwood Research опубликовали отчёт о взломе Hugging Face в июле. Тогда рой агентов OpenAI совместными усилиями выбрался из песочницы во время тестирования кибербезопасности и проник на серверы Hugging Face. Вторая волна агентов подхватила методы первой и использовала их для получения административного доступа к исследовательскому кластеру внутри собственной инфраструктуры OpenAI. Компания привлекла METR и Redwood для расследования только эпизода с Hugging Face — компрометация инфраструктуры OpenAI осталась за рамками их мандата.
Когда AI-агент вырывается за установленные ограничения, кто должен разбираться в случившемся? На данный момент ответ один: тот, кого лаборатория решит допустить, и на тех условиях, которые сама же и установит. Теперь, когда всплыл очередной инцидент — а до этого были похожие эпизоды с моделями Meta и Anthropic — исследователи безопасности настаивают на том, что серьёзные происшествия должны расследоваться независимыми экспертами, а не самими лабораториями.
«Результаты принципиально трудно контролировать, и риск утечки за пределы лаборатории весьма значителен», — заявил Джейкоб Штайнхардт, основатель и CEO некоммерческой исследовательской лаборатории Transluce. — «Мы должны предъявлять к этой технологии как минимум те же стандарты, что и к другим исследованиям с высоким уровнем риска».
Похвально, что OpenAI вообще пригласила METR и Redwood для расследования инцидента с Hugging Face, однако многие считают, что рамки проверки были слишком узкими. Трое следователей провели шесть дней в офисах OpenAI, изучая период примерно до конца недели 13 июля. Критически важно, что взлом инфраструктуры OpenAI продолжался и после 13 июля — но не был изучен.
Исследователи METR отметили, что с каждым новым визитом их понимание событий «существенно углублялось», заставляя значительно расширять и пересматривать отчёт. Возникает вопрос: что ещё они могли бы обнаружить при более широком расследовании?
Райан Гринблатт, главный научный сотрудник Redwood, заметил в соцсетях: «В целом было сложно получить точное понимание событий. Ключевые детали, которые мы теперь считаем важными, выяснились только к концу расследования».
Штайнхардт подчеркнул, что текущие инциденты показывают необходимость «систематических поведенческих расследований» и «более независимого анализа после происшествий». «Эти недавние хакерские инциденты — напоминание о том, что возможности растут быстро, а значит, и контроль должен расти с той же скоростью. Помимо самой технологии, нам нужен независимый доступ и надзор со стороны третьих сторон».
Призывы к действиям совпали с выходом OpenAI Astra — самой мощной модели компании, которую эксперты считают ещё более непрозрачной из-за техники рассуждений, затрудняющей мониторинг цепочки мыслей модели.
К сожалению, законодательство пока не предусматривает тех видов независимого аудита, которые обязательны в других отраслях — например, в авиации или при химических авариях (National Transportation Safety Board и Chemical Safety Board соответственно).
Законодатели на уровне штатов только начали требовать от ведущих AI-компаний отчитываться о серьёзных инцидентах, а в некоторых случаях — проходить независимый аудит. Однако ни один из трёх основных законов о безопасности frontier AI в Калифорнии, Нью-Йорке и Иллинойсе чётко не предписывает обязательного независимого расследования происшествий.
«Сейчас большинство принятых законов требуют лишь краткого описания инцидентов простым языком — и не дают правительству полномочий задавать дополнительные вопросы, направлять следователей, получать доступ к записям или требовать их сохранения», — отметила Маккензи Арнольд, управляющий директор по праву и политике США в LawAI. — «А ведь именно это нужно, чтобы реально разобраться в произошедшем».
Законодатели начинают сомневаться в масштабе и прозрачности реакции OpenAI. На этой неделе конгрессмены Джош Готхаймер (D-NJ) и Майк Лоулер (R-NY) внесли законопроект, направленный на сдерживание «беглых» AI-агентов. Конгрессмен Грег Касар (D-TX) направил OpenAI письмо, в котором выразил «серьёзную обеспокоенность ограниченным масштабом» расследования инцидента со взломом Hugging Face.
