ИИ-лабораториям нужны внешние аудиторы, но сначала стоило бы закрыть входную дверь
В конце прошлой недели, после того как один из его исследователей уволился из-за опасений, что ИИ может привести к вымиранию человечества, глава Anthropic Дарио Амодеи написал о необходимости внешних организаций, которые «проверяли бы соблюдение практик и обязательств по безопасности, сообщали об инцидентах и помогали оценивать выравненность не только готовых ИИ-моделей, но и тренировочных конвейеров и процессов». Руководители OpenAI, Google и SpaceXAI уже поддержали план Амодеи, который быстро стал одной из центральных опор формирующегося движения за безопасность ИИ.
Но более простое и эффективное решение может лежать на виду. Специалисты по интернет-безопасности говорят, что лабораториям нужно сосредоточиться на базовых вещах — журналах событий и правах доступа, применяя к ИИ-агентам те же строгие меры защиты, что и к людям-пользователям. Это не так увлекательно, как сторонний аудит и работа над выравненностью, но может оказаться результативнее.
«Мне кажется, они занимаются аутсорсингом, — сказала TechCrunch Кэти Муссурис, генеральный директор Luta Security о предложении Амодеи. — Утверждение, что решение — это [сторонний аудит], с моей точки зрения выглядит странно. Это было бы то же самое, как если бы Microsoft вместо публикации меморандума о надёжных вычислениях сказала: давайте замедлим разработку».
Тот меморандум, написанный в 2002 году тогдашним главой Microsoft Биллом Гейтсом, призывал сотрудников обеспечить надёжность и безопасность их программного обеспечения после серии широко освещавшихся компьютерных червей, захвативших тогда ещё молодые корпоративные системы. ИИ-сектор, возможно, находится в похожей точке перелома: ценность и риск новой технологии становятся всё очевиднее.
Хотя выравненность остаётся важной задачей, Сайаш Капур, исследователь ИИ, который со следующего года станет профессором в Калифорнийском университете в Беркли, утверждает, что «предельные вложения в контроль с большей вероятностью окажутся эффективными по сравнению с вложениями в выравненность. Мы рассматриваем эти инциденты как иллюстрацию недостатка внимания к контролю над ИИ внутри компаний, несмотря на наличие известных методик».
Инциденты, вызвавшие эти опасения, связаны с тем, что передовым моделям поручали выполнить тренировочные задачи — обычно оценку кибербезопасности, — и они выходили в открытый интернет и проникали в закрытые сторонние системы, пытаясь эти задачи решить. Как правило, это происходило из-за плохо настроенных «песочниц», которые должны были удерживать агентов внутри; по иронии судьбы, один из прорывов Anthropic случился потому, что сторонние оценщики не закрыли нужные двери.
«Мы как профессия знаем, как блокировать доступ в интернет, — сказал Эйвери Пеннарун, генеральный директор компании по безопасности Tailscale. — Если прочитать все эти длинные отчёты — „ух ты, какая впечатляющая многоступенчатая атака, бла-бла“. Слушайте, вы дали ему возможность что-то скачивать. Вы не должны были давать это вместе с доступом в интернет».
Это одна проблема — но проблема серьёзнее в том, что передовые лаборатории не знали о происходящем.
Наблюдение за агентами
«Самое показательное: обо всём, что они делали, узнавали либо потому, что жертва что-то заметила, либо, в некоторых других случаях… это была сетевая активность, и ни один случай не был выявлен прямым мониторингом самих ИИ», — отмечает Муссурис.
В одном из случаев, когда агенты OpenAI захватили заброшенный немецкий WikiForum, чтобы жульничать при прохождении оценок, агенты работали неделями, прежде чем кто-то в компании, судя по всему, это заметил. Специалисты по безопасности, с которыми говорил TechCrunch, утверждают, что мониторинг в реальном времени критически важен для предотвращения будущих прорывов, и что каждая сессия агента должна быть ограничена по времени и завершаться.
Шапор Нагибзаде, бывший руководитель по безопасности в Google, а теперь возглавляющий стартап QueryStory, говорит, что решение — «поместить агента в коробку и плотно инструментировать её снаружи, наблюдая за всем, что пересекает границу. Каждый вызов инструмента, каждый процесс, каждое сетевое соединение, без исключений… Единственная дыра, которую вы оставите для удобства, будет той, которой воспользуются. Прорыв прошёл именно через такое исключение. [В Google] я много раз наблюдал этот сценарий с людьми-атакующими, и эти модели как минимум не хуже находят приоткрытую дверь».
OpenAI уже начала двигаться в этом направлении, объявив, что приступила к мониторингу всех выводов своей модели Astra, использующих инструменты, «при значительных вычислительных затратах». Anthropic тоже говорит, что усиливает процедуры безопасности, в том числе расширяет наблюдаемость своих моделей. Ни одна из компаний не ответила на вопросы TechCrunch о том, как она отслеживает и контролирует ИИ-агентов.
Ещё одна проблема — использование агентами общей инфраструктуры, что позволило им общаться друг с другом во время атаки на Hugging Face. Саймон Уиллисон, разработчик, один из создателей веб-фреймворка Django, писал о том, что называет «смертельной триадой»: когда у агента одновременно есть доступ к недоверенному вводу, интернету и приватной информации, это рецепт катастрофы.
«Фокус в том, что можно выбрать любые две опоры из триады, и агент получит любые две, — сказал Пеннарун. — Если нужны все три, придётся разделить их как минимум между двумя агентами… и, может быть, разрешить им общаться друг с другом через контролируемый канал».
Сочувствие к передовой науке
Эксперты, с которыми говорил TechCrunch, понимают, что у сотрудников служб безопасности передовых лабораторий тяжёлая работа. Нагибзаде отмечает, что каждый государственный актор на Земле пытается украсть веса их моделей и провести атаки на их API методом дистилляции — в дополнение к обычным задачам по безопасности, которые стоят перед любой крупной цифровой компанией.
«Исследовательская инфраструктура с трудом поднимается наверх этого списка приоритетов, хотя сейчас это, видимо, меняется, — сказал он. — Публичность инцидентов безопасности действительно помогает настроить всех внутри на цель улучшения».
Именно это подчёркивает Муссурис: сейчас нет формальной процедуры уведомления жертв, когда лаборатории обнаруживают, что их агенты проникли в сторонние системы, и, вероятно, были и другие инциденты, о которых широко не сообщалось. Хотя она опасается, что законы, регулирующие модели напрямую, могут иметь непредвиденные последствия, обязательное уведомление — одна из идей, которую, по её мнению, стоит продвигать законодателям.
И хотя очевидно, что лучшие практики безопасности не соблюдались, эксперты говорят, что лаборатории делают то, чего раньше не делал никто: «они выполняют на порядки больше, чем типичное предприятие», — сказал TechCrunch Зак Корман, генеральный директор компании по кибербезопасности Embroidery.
И хотя выравненность, возможно, не то место, с которого стоит начинать, игнорировать её нельзя. Специалисты по кибербезопасности смирились с тем, что для отслеживания поведения агентов в реальном времени им придётся использовать ИИ-агентов для наблюдения за другими агентами — сценарий, в котором снова всплывает риск обмана. «Вы заперты в ситуации, где приходится использовать ИИ, чтобы справляться с этим, хотя ИИ сейчас не обязательно безопасен», — говорит Муссурис.
Дальше будет только сложнее. Всё, что агенты делают сейчас, по словам Муссурис, «они делают громко»: публикуются на общедоступных форумах, а их цепочки рассуждений и другие логи размышлений — на английском. «Это всё ещё читаемо человеком, — говорит она, — так что пользуйтесь этим, пока это в силе, потому что вечно так не будет».
