09.10.2026

Водяные знаки в ИИ меняют поведение моделей: отказы падают под инъекцией промптов

Водяные знаки в ИИ меняют поведение моделей: отказы падают под инъекцией промптов

В ответ на новый закон Евросоюза ИИ-платформы внедряют схемы маркировки — «водяных знаков» — для генерируемого контента. Anthropic недавно сообщила, что будущие модели Claude будут использовать SynthID-Text — подход, созданный Google и выложенный в открытый код. Он опирается на секретный ключ, который слегка меняет процесс выбора моделью следующего слова в предложении. Вместо самого вероятного варианта, скажем «облачно», ключ может подставить «пасмурно». Любой, кто знает ключ, может определить, что текст порождён этой платформой.

Новое исследование показывает, что SynthID-Text меняет не только выбор слов, но и то, какие инструменты вызывает модель и с какой вероятностью она соблюдает или игнорирует защитные ограничения, на которых обучалась. Угроза усиливается при состязательном промпте, когда атакующий пытается заставить модель выполнить вредное действие — например, раскрыть пароль или другие чувствительные данные. Инструкции, которые обычно не выполняются, в некоторых случаях начинают исполняться, как только включён водяной знак. Вывод подчёркивает необходимость тщательно проверять, как ведут себя LLM и агенты при включённой маркировке.

«По сравнению с теми же моделями без водяных знаков их поведение точно изменится, особенно в состязательных условиях или когда эти модели вызывают инструменты, работая внутри агента, — сказала Ars Андреа Шипошова, исследователь безопасности ИИ в Lasso Security. — Водяной знак делают незаметным для читателя, но мы знаем: если мы меняем что-либо в том, что генерирует модель, это приведёт к компромиссам и где-то проявится».

Водяной знак работает через внедрение сигнала, позволяющего распознать вывод как сгенерированный ИИ, — так называемое происхождение. SynthID добавляет к обычной процедуре сэмплирования генератор случайного зерна, алгоритм сэмплирования и функцию оценки. Вместо произвольного генератора случайных чисел для выбора следующего слова используется секретный ключ. Выбор слова остаётся случайным, но знающие ключ могут проверить последовательность слов и определить вероятность того, что ключ применялся.

Ключевая особенность SynthID — так называемое турнирное сэмплирование. Как в спортивном турнире, SynthID оценивает множество кандидатов-токенов для следующего слова и с помощью секретного ключа присваивает им вероятностные оценки. Пара токенов соревнуется в раунде: тот, у кого скрытая оценка выше, проходит дальше. Процесс идёт до определения итогового победителя.

Шипошова протестировала «недисторсионную» конфигурацию SynthID-Text через немодифицированный SynthIDTextWatermarkLogitsProcessor от Hugging Face. Она подавала вредоносные промпты шести моделям с открытыми весами и сравнивала ответы с маркировкой и без неё. Эксперимент показал, что водяной знак меняет ответы на вредоносные запросы — особенно когда их подавали с приёмами инъекции промптов.

«Водяной знак меняет поведение отказа на «голых» вредоносных запросах, но эффект заметнее, когда те же запросы сопровождаются инъекцией промпта, — пишет Шипошова. — На нескольких моделях маркировка делает их более склонными отвечать на вредоносные запросы, от которых они иначе отказались бы».

Эти изменения имеют важные последствия для безопасности, поскольку влияют не только на ответы LLM, но и на последующие действия ИИ-агентов, опирающихся на модель.

«На уровне модели это может изменить поведение, связанное с безопасностью, включая то, откажет ли модель на вредоносный запрос и устоит ли отказ при инъекции промпта, — пишет исследовательница. — На уровне агента те же сэмплированные токены определяют, какой инструмент будет вызван и с какими аргументами. Инъекция промпта связывает эти два уровня: ослабленный отказ становится куда значимее, когда модель может действовать через инструменты. Такая процедура маркировки, таким образом, влияет и на то, что модель говорит, и на то, что делает агент. Мы называем этот поведенческий эффект дрейфом сэмплирования».

Любопытная деталь: ответы моделей различались в зависимости от того, какой секретный ключ использовался.

У исследования есть ограничения. Оно не проверяет, как меняются ответы моделей Claude при маркировке. Вместо этого тестируются шесть моделей с открытыми весами, чтобы исследовательница имела доступ к сэмплированию токенов, которое можно включать и выключать во время турнирного сэмплирования, оставляя прочие настройки неизменными. Эксперименты также проверяли реализацию турнирного сэмплирования SynthID-Text от Hugging Face, а не ту конкретную реализацию, которую будут использовать модели Claude.

И всё же результаты показывают, что как минимум некоторые формы этого подхода к маркировке могут влиять на безопасность моделей и агентов. Для команд red team важно проверить свои платформы на прочность, чтобы убедиться, что они ведут себя как ожидается при включённом SynthID.

Подписывайтесь на наш канал Дзен и группу ВК

Ars Technica

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *