09.10.2026

Агенты вне песочницы и «отказ кошелька»: дебаты о безопасности ИИ переходят в реальную плоскость

Агенты вне песочницы и «отказ кошелька»: дебаты о безопасности ИИ переходят в реальную плоскость

Дебаты об управлении ИИ на прошлой неделе обострились: эксперты предупредили, что рост числа неконтролируемых ИИ-агентов и случаев нежелательного поведения — лишь предвестие более серьёзных угроз в будущем.

12 сентября генеральный директор Anthropic Дарио Амодеи в широко обсуждаемой колонке предупредил, что ИИ может вскоре выйти из-под контроля человека, если развитие оставить без присмотра. В течение нескольких дней Microsoft выпустила «Гуманистический кодекс поведения ИИ» (читай: манифест), обещающий развитие с человеком в центре, а генеральный директор Google DeepMind в посте на X принципиально согласился с призывами к большему контролю. Хотя Anthropic, OpenAI и xAI также предлагали более строгое государственное регулирование технологии, президент Дональд Трамп отверг эту идею, заявив, что победа в ИИ-конкуренции с Китаем важнее, и, по сообщениям, сказал: «Кто победит в ИИ, тот победит во всём».

В своей колонке Амодеи из Anthropic утверждал, что у создателей моделей и лабораторий есть узкое окно, чтобы вернуть фокус на безопасность.

«Нынешние модели — почти бесконечная золотая жила знаний и о том, как правильно строить ИИ, и о том, что иногда идёт не так, если построить его плохо, — писал он. — Я верю, что если замедление дало бы нам хотя бы лишний год-два до достижения моделями критических уровней возможностей и мы использовали бы это время для продвижения согласованности, мы могли бы сильно снизить риск того, что что-то пойдёт серьёзно не так».

Тем временем компании предоставлены сами себе в вопросах внедрения протоколов безопасности для агентных и автономных ИИ-программ. Эти инциденты и призывы к регулированию подчёркивают разрыв между быстро растущими возможностями и способностью отрасли предотвращать вред, говорит Dark Reading Рами Рахман, старший ведущий инженер решений в ArmorCode.

«„Двигаться быстро и просить прощения потом“ — неприемлемый подход, когда последствия несут организации, — говорит он. — Те, кто разрабатывает и разворачивает ИИ, должны отвечать за риски, которые они создают».

Пора ли поставить паузу в развитии возможностей ИИ?

Тревога растёт на фоне новых сообщений об агентах, обходящих средства безопасности. Например, Meta недавно признала, что её собственная модель Muse Spark 1.1 по сути повторила сценарий модели OpenAI, вырвавшись из песочницы во время тестов безопасности и скомпрометировав сервер другой компании.

Anthropic сталкивалась с похожими инцидентами: в трёх случаях (правда, из более чем 141 000) Claude получал доступ к интернету в тестах, где модель считалась изолированной. А 16 сентября OpenAI раскрыла ещё шесть типов нежелательного поведения, обнаруженных во время тестов моделей, включая генерацию новых инструкций для обхода ограничений и поиск открытых ключей API для фабрикации данных.

Национальные правительства тоже видят разные угрозы в развитии ИИ. Глава китайской разведки Чэнь Исинь — официально руководитель Министерства государственной безопасности Китая — в сентябрьской статье предупредил, что ИИ может стать угрозой правлению Компартии и что технологию могут использовать для эффективных шпионских кампаний против Китая.

Южная Корея, уже принявшая законы против дипфейков в политических кампаниях, планирует пересмотреть свои рекомендации по безопасности ИИ, сосредоточившись на проблемах, которые могут возникнуть при развёртывании агентных ИИ-сервисов. Страна уже приняла базовый закон об ИИ в 2025 году, вступивший в силу 22 января этого года: он требует от компаний давать рекомендации и защитные меры для своих ИИ-продуктов.

Неясно, действительно ли создатели моделей боятся своих агентов или лишь опасаются ответственности за их непослушание. Однако Google DeepMind, Microsoft и xAI принципиально согласны с возможной паузой, введением некоторых норм и созданием независимой системы тестирования.

По образцу американского регулятора FINRA новое агентство могло бы оценивать протоколы разработки и проводить независимое тестирование для минимизации рисков, утверждал в июльской колонке Демис Хассабис, соучредитель и генеральный директор Google DeepMind.

«Быстрый прогресс, который мы наблюдаем в ИИ, требует нового подхода к тестированию возможностей передовых моделей — динамичного, адаптивного и строгого, — писал он. — США, учитывая их экономическое и техническое положение, хорошо подходят для первого шага в разработке такой системы».

В своём «Гуманистическом кодексе поведения ИИ», выпущенном 14 сентября, Microsoft обязалась сохранять человеческий контроль над ИИ-системами и оставаться в заданных рамках.

«Мы приветствуем исследования, сосредоточенность и продуманный темп, необходимые, чтобы правильно выстроить согласованность как цель дизайна, — заявил генеральный директор Microsoft Сатья Наделла в посте на X 13 сентября. — Мы также приветствуем идеи вроде „встроенных оценщиков“ и более широкие усилия по созданию механизмов, которые сделают это больше, чем разговорами».

Но не все компании ищут государственного надзора. На другом конце дискуссии — Meta. Государству не нужно вмешиваться, потому что рыночные силы сами потребуют правильно выстроенных ИИ-агентов, заявил в своём посте на X генеральный директор Meta Марк Цукерберг. Но использование независимых оценщиков для проверки безопасности должно стать отраслевым стандартом, сказал он, утверждая, что компания отложила выпуск своей модели Muse, чтобы сосредоточиться на безопасности.

«Я считаю, что доверие и согласованность быстро становятся важнейшими качествами, отличающими агентов и модели, — заявил он. — Любая лаборатория, которая не сосредоточится на согласованности, отстанет».

Как уже сказано, администрация Трампа также возражает против любых ограничений развития ИИ, ссылаясь на необходимость конкурировать с Китаем и другими странами.

Считайте, что ответственность за ИИ лежит на вас

Пока что насущные риски — не конец света, а сбои в бизнесе и вопросы ответственности. В своём отчёте «Риски ИИ и устойчивость» Google перечислила ряд угроз: от новых приёмов кибератак с использованием ИИ до отказов из-за отсутствия корпоративного управления ИИ. В одном инциденте «отказа кошелька» компания не ограничила агента, и тот обошёлся ей в 50 000 долларов и остановил деловые транзакции, когда логическая ошибка заставила программу многократно вызывать дорогостоящий API.

«У многих организаций уже есть политики по ИИ, правила допустимого использования и определённая терпимость к риску — но им часто не хватает способа претворять эти политики в жизнь и проверять их на практике, — говорит Мухаммад Мунир, технический менеджер консалтинговой группы Mandiant в Google Cloud, указывая на ограниченное журналирование ИИ-активности, отсутствие контроля доступа агентов и слабую видимость того, как и где применяется ИИ. — Политика эффективна только тогда, когда вы видите, соблюдается ли она».

Компаниям не стоит ждать, пока поставщики передовых моделей защитят их агентные ИИ-продукты: важно обеспечить хорошую видимость того, какие действия совершают их ИИ-агенты и не действуют ли в их среде вредоносные или непослушные агенты, говорят эксперты.

Использование ИИ-моделей для проверки собственной защиты и поиска уязвимостей в программном обеспечении и сетях помогает сократить поверхность атаки, потому что иначе злоумышленники сделают это бесплатно, говорит Джек Нельсон, директор по информационной безопасности Ivanti, поставщика автономного управления конечными точками.

«На уровне предприятия всё сводится к довольно базовым вопросам кибербезопасности — идентичности, аудиту, журналированию, — чтобы видеть не только то, кто использует модель, — говорит он, — но и что делает сама модель и каковы параметры её активности».

В итоге, добавляет он, предприятия волнует «меньше идея роботов, захватывающих интернет, и больше — идея внутреннего злоупотребления или чрезмерного использования, перепроизводства мусорного контента или просто сжигания токенов на проблеме, в которой кто-то не догадался сказать модели: „Спросишь меня, если зайдёшь в тупик?“».

Подписывайтесь на наш канал Дзен и группу ВК

Dark Reading

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *