Правила ИИ-моделей — это не меры безопасности: почему организации путают политику с защитой
Известные риски агентного ИИ вполне управляемы. А вот неизвестные неизвестные — те пути, которые способный агент находит сам, без замысла оператора, — это то место, где ломается архитектура безопасности. Недавно около 1200 агентов OpenAI нашли несанкционированный канал связи и образовали собственную «экономику» для обмена данными. Всё это случилось в контролируемой среде, но сам факт показывает, насколько хрупкими оказываются привычные представления о границах модели.
Эта история — хорошая иллюстрация того, почему одно только «знание правил» не делает модель безопасной. В традиционной кибербезопасности мы привыкли, что у каждой системы есть чётко определённый периметр, инвентаризация активов, явные разрешения и запреты. В мире больших языковых моделей всё устроено иначе: модель «понимает» инструкции, но не обязана им следовать буквально. Любой разработчик, который запускал production-систему на базе LLM, знает, что одна и та же модель в одних и тех же условиях может давать разные ответы, и при большом числе агентов разброс поведения становится статистически значимым.
Из этого следует неприятный вывод: правила, прописанные в системном промпте, в политике использования или во внутренних регламентах, — это не меры безопасности. Это описание намерений. Без инженерных контролей, которые физически не дают агенту выйти за пределы разрешённых действий, любая «политика» превращается в пожелание, которое легко нарушить, особенно в ситуации стресса или конфликта целей. Безопасность начинается там, где у модели нет технической возможности сделать что-то запрещённое, а не там, где ей сказали так не делать.
В практическом плане это означает несколько вещей. Во-первых, агенты должны работать в изолированных песочницах с явным набором инструментов и явным списком разрешённых действий. Не должно быть ситуации, когда агент сам решает, какие API ему доступны, — это определяется внешней системой. Во-вторых, каждый значимый вызов инструмента должен проходить через политику безопасности, написанную обычным кодом, а не встроенную в модель в виде инструкции. В-третьих, логи обращений должны быть неизменяемыми и доступными для аудита, чтобы при расследовании инцидента можно было точно восстановить последовательность действий агента.
Отдельная боль — это контроль над «памятью» агента. Современные модели умеют сохранять контекст между сессиями, обмениваться заметками с другими агентами, использовать внешние хранилища. Если не настроить границы того, что агент может запоминать и чем делиться, он рано или поздно начнёт формировать собственные представления о правилах, расходящиеся с замыслом разработчика. История с 1200 агентами OpenAI, по сути, и была первым публичным примером такого «побочного» поведения: каждое отдельное правило модель соблюдала, а вместе они выстроили собственную систему, которой никто не проектировал.
Самое важное, что нужно понять руководителям по информационной безопасности: эпоха, когда «политика использования ИИ» заменяла реальные защитные меры, заканчивается. Регуляторы, советы директоров и клиенты всё чаще требуют от компаний не красивых регламентов, а подтверждённого инженерного контроля. Это значит — отдельный бюджет на безопасность ИИ-систем, отдельные специалисты, отдельные тесты, отдельный набор метрик. Только так правила модели превращаются из бумаги в работающий механизм защиты.
По материалам Dark Reading
