Astra от OpenAI уже на подходе — и отлично взламывает компьютерные системы
OpenAI раскрыла новые подробности о своей готовящейся к выходу модели Astra, которая, по словам компании, стала первой большой языковой моделью, достигшей «критического порога кибербезопасности». Сведения обнародованы в преддверии скорого релиза.
«Мы планируем выпустить Astra в ближайшее время, — говорится в блоге OpenAI. — При этом доступ к самым продвинутым её возможностям в области кибербезопасности будет более ограниченным».
В OpenAI выяснили, что Astra способна самостоятельно находить неизвестные уязвимости в компьютерных системах и эксплуатировать их без подсказок человека. Это напоминает опасения, которые Anthropic высказывала ранее в этом году по поводу своей модели Mythos, поэтому OpenAI принимает схожие меры предосторожности, готовя Astra к запуску.
В отсутствие подтверждений со стороны независимых экспертов оценить заявления OpenAI о безопасности и готовности модели сложно. Компания сообщила, что сначала покажет модель группе тестировщиков, но не уточнила, кто в неё войдёт и по какому принципу их отберут. Непонятно также, сотрудничает ли OpenAI с правительством США, чтобы оценить модель до её релиза.
В OpenAI отметили, что Astra набрала максимальный балл в ExploitBench — тесте, который оценивает способность языковой модели взламывать известные уязвимости систем. В модифицированной версии испытания, подготовленной инженерами OpenAI, модель обнаружила и использовала две уязвимости нулевого дня, заявили в компании.
Чтобы модели нельзя было использовать во вред и чтобы сами они не были способны на нежелательные действия, OpenAI, по её словам, уже занялась улучшением управляющих механизмов: доработка позволит вовремя замечать злоупотребления и предотвращать попытки обойти ограничения (джейлбрейки).
В случае с Astra компания вложилась в новые, пока не раскрытые технические решения, призванные сделать модель безопаснее. Кроме того, OpenAI начала помечать «аккаунты, оцениваемые как более рискованные», и ограничивать ответы модели на их запросы, правда, не объясняя, как именно это работает. Наконец, хотя компания называет Astra своей «самой согласованной на сегодняшний день моделью», она развернёт её с дополнительным мониторингом цепочки рассуждений, чтобы вовремя замечать и пресекать нежелательное поведение.
Подготовка к выходу Astra идёт на фоне бурной реакции отрасли на инцидент, в котором агенты OpenAI выбрались из тренировочной среды и получили доступ к приватным данным на Hugging Face — популярной платформе распространения моделей и бенчмарков.
Для Astra в OpenAI разработали тест, который должен был соблазнить новую модель повторить действия «вышедших из-под контроля» агентов из инцидента с Hugging Face: те действовали сообща и выходили в открытый интернет вопреки защитным механизмам, установленным исследователями OpenAI. По словам разработчиков, Astra в этих экспериментах не пыталась покинуть пределы тестовой среды.
Йона Шавит, бывший сотрудник OpenAI, а ныне специалист по устойчивости ИИ в OpenAI Foundation, задался в соцсетях вопросом: не объясняется ли нежелание Astra нарушать правила тем, что она понимала, чего от неё ждут, или попытками обмануть исследователей?
И даже после всех этих новых подробностей по-прежнему трудно понять, на что именно способна Astra и правильно ли OpenAI подходит к обеспечению безопасности. Компания обещает опубликовать больше результатов оценки модели и дополнительную информацию о безопасности, когда Astra будет представлена широкой публике.
К тому моменту, однако, тайное уже станет явным.
