OpenAI предложила глобальные стандарты безопасности для передового ИИ и рамки для самоулучшающихся систем
В понедельник OpenAI опубликовала набор предложений по безопасности и защите при разработке передового искусственного интеллекта, сделав акцент на исследованиях выравнивания и вычислительной технике, известной как рекурсивное самоулучшение (RSI).
«Безопасное прохождение этого перехода требует, чтобы исследования выравнивания поспевали за возможностями — тогда системы, которые строим мы и другие, останутся согласованы с человеческими ценностями и под контролем человека», — говорится в блоге компании.
OpenAI призвала к международному сотрудничеству для выработки передовых стандартов и рекомендовала опираться на работу существующих институтов ИИ-безопасности по всему миру.
Создатель ChatGPT считает, что эти технические стандарты должны касаться передовых ИИ-моделей и их разработчиков, а также управления балансом выгод и рисков для автоматизированных ИИ-исследователей, включая RSI.
RSI воодушевляет разработчиков ИИ перспективой создания базовых моделей, способных обновлять сами себя без участия человека. Однако прогресс в этой области заставил часть технологов забеспокоиться: производители базовых моделей могут потерять контроль над лежащей в основе технологией или не учесть непредвиденные последствия по мере того, как ИИ-системы становятся всё сложнее и вездесущее в интернете.
Суть проблемы в асимметрии: чем быстрее модель совершенствует собственные методы обучения, тем труднее внешним наблюдателям — и даже разработчикам — объяснить, как именно получен тот или иной результат. Именно поэтому предложения OpenAI делают упор не только на технические ограничения, но и на прозрачность: возможность независимой проверки и доступа к процессу разработки.
«Полностью автономное RSI сегодня не происходит, и нам не следует к нему стремиться, пока и если это не удастся сделать безопасно, — говорится в блоге OpenAI. — Без должной осторожности RSI может привести к тому, что люди потеряют практический контроль над развитием ИИ, оказавшись неспособными надзирать за исследовательскими процессами, которые они больше не понимают».
В блоге упоминается взлом агента Hugging Face — инцидент, не связанный с техникой RSI, — как своего рода «предвестник рисков, которые могут стать куда серьёзнее без надёжных защитных механизмов и выравнивания».
Неделей ранее конкурент Anthropic представил собственные идеи безопасной разработки передовых ИИ-моделей — ответ на недавний хор предупреждений об угрозе ИИ для человечества со стороны отраслевых исследователей. Джейкоб Коксон, работавший и в Anthropic, и в OpenAI, запустил глобальную дискуссию, объявив почти две недели назад об уходе и заявив, что компании «играют с нашими жизнями».
На фоне недавних инцидентов в сфере ИИ-безопасности и публичных заявлений Коксона глава Anthropic Дарио Амодеи опубликовал эссе, призвав ИИ-компании замедлить темпы разработки базовых моделей, среди прочих предложений. Амодеи также поднял идею внедрения сторонних аудиторов в компании как способ проверять и снижать потенциальные риски, которые их технологии могут представлять для общества, — например, ускорение кибератак или создание биооружия.
Руководители-соперники, включая главу OpenAI Сэма Альтмана и главу Tesla и SpaceX Илона Маска, публично поддержали предложение Амодеи. Но поскольку область оценки ИИ ещё очень молода, единого консенсуса по базовым стандартам и принципам, которые позволили бы независимым третьим сторонам глубже инспектировать передовые технологии, пока нет.
Отчасти поэтому коалиция ИИ-оценщиков призывает производителей базовых моделей рассмотреть набор «минимальных условий», призванных позволить им глубже проводить технологические аудиты и проверки — включая более глубокий доступ и защиту от преследования за публикацию нелестных отчётов.
