24.08.2026

Открытые ИИ-модели догоняют лидеров индустрии: разрыв по безопасности становится главным вызовом

b29_0

Пока политики по всему миру спорят о том, как управлять всё более мощными системами искусственного интеллекта — такими как GPT-5.6 Sol от OpenAI или Mythos от Anthropic, — китайская открытая модель заметно сократила отставание от лидеров отрасли. И это заставляет экспертов по-новому взглянуть не только на возможности, но и на риски, которые несут открытые веса моделей.

Китайская открытая модель GLM-5.2 от компании Z.ai, судя по данным нового отчёта некоммерческой организации по безопасности ИИ SaferAI, отстаёт от OpenAI GPT-5.5 и Anthropic Claude Opus 4.7 на кибербезопасности и биологических возможностях всего на несколько месяцев. Однако разрыв между передовыми возможностями и практиками обеспечения безопасности, напротив, только растёт. Это означает, что технический прогресс опережает меры защиты, и индустрия всё чаще сталкивается с ситуацией, когда мощные инструменты появляются быстрее, чем для них придумывают системы контроля.

Согласно оценке SaferAI, которая проводилась через публичный API Z.ai, GLM-5.2 не отказался ни от одного из полученных заданий по наступательным кибероперациям или биологии двойного назначения. Для сравнения, Claude Opus 4.7 «отказывался настолько последовательно, что SaferAI вообще не смогли завершить тестирование CyberGym». Напомним, что CyberGym — это бенчмарк для оценки возможностей в сфере кибербезопасности, который OpenAI использовал при тестировании перед недавним взломом Hugging Face в прошлом месяце.

Это тревожное напоминание о том, о чём критики предупреждали годами: открытые модели ИИ могут передать высокоразвитые технологии в руки потенциальных злоумышленников, и после того как веса будут скачаны, у разработчиков не останется способов контролировать их использование. По мере того как открытые модели стремительно приближаются по возможностям к ведущим мировым системам, дискуссия смещается с вопроса «смогут ли они конкурировать» к вопросу о том, как общество будет управлять рисками после их публикации.

«Граница возможностей — это не граница рисков, поэтому при оценке опасности мы обязаны учитывать и состояние мер защиты», — заявил TechCrunch Генри Пападатос, исполнительный директор SaferAI.

Показательно, что Z.ai могла бы применить механизмы безопасности к своему собственному хостингованному API, но эти защиты становятся бессмысленными, как только кто-то запускает веса на собственном оборудовании: пользователь может удалить или изменить любые защитные механизмы, дообучить модель или подменить системные промпты. Полностью проконтролировать такой сценарий технологически невозможно — и это корень проблемы для всей категории открытых моделей.

Фронтир-разработчики, такие как OpenAI и Anthropic, обычно полагаются на классификаторы, обучение отказам и API-контроль, чтобы ограничить опасную помощь в кибер- и биологической сферах. Однако эти меры далеки от надёжных: джейлбрейки на удивление легко обходят даже защиту на развёрнутых моделях. Так, некоммерческая организация по безопасности ИИ Far.ai обнаружила сотни универсальных джейлбрейков — то есть повторно используемых ключей, которые успешно срабатывают на большинстве вредоносных запросов, — в таких фронтир-моделях, как Grok 4.5 от xAI и Gemini 3.1 Pro от Google DeepMind. Согласно отчёту, джейлбрейки удаются, когда атакующие комбинируют несколько техник манипуляции — включая ролевую игру, выдачу себя за авторитетный источник, подделку истории диалога и серию уточняющих промптов, — чтобы усилить слабые места в защите модели.

Но важный нюанс в том, что защитные механизмы, работающие для закрытых моделей, вообще не применяются к открытым весам, которые спроектированы так, чтобы работать на любой инфраструктуре и с любым набором защит — или вовсе без них.

«Цель должна быть очевидной: хорошие возможности — безопасные — должны быть доступны каждому, а опасные мы должны стараться исключать, даже в открытом ключе», — подчеркнул Пападатос.

Одна из техник, на которую обратил внимание Пападатос, называется «фильтрация обучающих данных». Суть в том, что ИИ-компания удаляет наступательную кибербезопасность из своих обучающих данных, а затем тренирует модель на уже очищенном наборе. Некоторые исследования показывают, что такой подход позволяет снизить опасные биологические знания, не нанося ущерба общей производительности модели. Однако для кибербезопасности фильтрация данных работает гораздо хуже.

Сложно создать универсальную модель, которая отлично пишет код, но при этом не является хорошим хакером. Поскольку программирование стало основным источником дохода для ИИ-отрасли, разработчики испытывают сильное давление, вынуждающее постоянно улучшать эти возможности, даже несмотря на поиски способов ограничить их злоупотребление.

Именно поэтому фронтир-разработчики всё чаще полагаются на другие меры. Один из подходов — избирательно ограничивать виды помощи в кибербезопасности, которые готова оказывать модель. Например, Opus 5 от Anthropic умеет искать уязвимости в открытом исходном коде, но не в скомпилированном программном обеспечении, как указано в системной карте модели. Логика в том, что это затрудняет использование Opus 5 в наступательных целях.

Другие меры включают строгие предрелизные оценки безопасности, публикацию отчётов о рисках и сокрытие весов модели, если система воспринимается как слишком опасная. В случае GLM-5.2 SaferAI отмечает, что Z.ai не опубликовала ни основу безопасности, ни обязательства по предрелизному тестированию, ни оценку рисков для модели. TechCrunch спросил Z.ai, проводила ли компания внутренние или сторонние проверки безопасности перед выпуском, но ответа не получил.

Китайские лидеры в последнее время всё чаще признают риски, связанные с передовым ИИ. На Всемирной конференции по ИИ в прошлом месяце председатель КНР Си Цзиньпин подчеркнул важность открытых моделей, но одновременно указал на необходимость того, чтобы искусственный интеллект оставался инструментом под строгим контролем человека. Это двойственная позиция отражает сложность задачи: Пекин поддерживает открытость как стратегический приоритет, но не готов отказываться от жёсткого регулирования.

Грэм Уэбстер, изучающий китайскую политику в области ИИ в Стэнфордском центре киберполитики, рассказал TechCrunch, что в Китае действуют серьёзные правила регулирования ИИ, однако исторически они ориентированы на политически чувствительный контент, дезинформацию и социальную стабильность, а не на катастрофические риски ИИ вроде наступательных кибер- и биологических возможностей.

«Американские аналитики в целом больше озабочены экзистенциальной катастрофической угрозой, чем китайское сообщество», — отметил Уэбстер, добавив, что многие китайские политические исследователи считают: если и возникнет по-настоящему новый фронтир-риск, американские компании столкнутся с ним первыми.

«Китайская система уверена, что контролирует использование этих технологий внутри страны, — продолжил Уэбстер. — Нахождение онлайн в Китае привязано к вашему реальному имени, и компании могут быть привлечены к ответственности, пользователи тоже». Уэбстер предположил, что тот же механизм, который используют провайдеры моделей для отказа от обсуждения определённых политических тем, потенциально можно адаптировать, чтобы модели отказывались выполнять наступательные кибератаки или не выдавали вредные результаты биоинженерии. Он добавил, что поскольку китайские компании, как правило, координируют действия с регуляторами за кулисами, сложно точно знать, какое внутреннее тестирование они проводят перед релизом.

Сторонники открытого ИИ утверждают, что публикация весов важна для кибербезопасности: это позволяет компаниям защищаться от атак — например, Hugging Face полагалась на GLM-5.2 для обороны при взломе OpenAI, — а также лучше готовиться к будущим угрозам, заранее понимая, с чем придётся столкнуться. «Те же системы, которые помогли остановить кибератаку с применением ИИ, теперь могут помочь защищаться от миллионов кибератак ежедневно, помогая выявлять и устранять уязвимости до того, как ими воспользуются злоумышленники», — заявил на этой неделе в соцсетях Клем Деланг, генеральный директор Hugging Face.

Впрочем, Пападатос считает, что этой выгодой часто преувеличивают, и она не означает, что «мы должны открывать исходники опасных возможностей». «Главная мысль для меня в том, что мы не должны просто принимать, что опасные возможности легко доступны кому угодно и где угодно», — подчеркнул он, настаивая, что индустрия должна стремиться делать легко доступными только «безопасные возможности». Ведь по умолчанию злоумышленники осваивают новые инструменты быстрее защитников: группа кибервымогателей может сменить свои методы за неделю, а больнице на это нужны месяцы.

По материалам TechCrunch

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *