OpenAI вводит новые меры безопасности после взлома Hugging Face
Во вторник OpenAI анонсировала новую порцию политик безопасности, направленную на сдерживание инцидентов безопасности во время тестирования моделей. Новые меры безопасности включают более детальный мониторинг моделей в процессе разработки, а также больший упор на согласованность и безопасность в процессе постобучения.
«По мере того как модели становятся более функциональными, риски, связанные с их внутренней разработкой и тестированием, также растут», — говорится в сообщении компании в блоге. «Наши стандарты мониторинга, согласования и безопасности должны опережать эти риски».
Новые меры являются одними из первых публичных изменений в практике безопасности OpenAI после инцидента с Hugging Face, о котором стало известно 21 июля.
Представители OpenAI заявили, что эти меры не являются прямым ответом на инцидент с Hugging Face, но также частично спровоцированы возможностями кибербезопасности будущей модели Astra, а также общими темпами прогресса в разработке искусственного интеллекта.
В том же сообщении OpenAI сообщила, что приостановила обучение с подкреплением (RL) на две недели после инцидента с «Обнимающим лицом», но с тех пор перезапустила многие менее рискованные модели.
«Наш крупнейший запланированный запуск RL по-прежнему приостановлен, пока мы проводим менее масштабное обучение и оценку для оценки поведения модели, проверки наших мер безопасности и установления дополнительных доказательств согласованности, прежде чем продолжить», — говорится в сообщении.
В беседе с журналистами вице-президент OpenAI по исследованиям Амелия Глезе подчеркнула, что строгость контроля будет возрастать по мере того, как модели станут более функциональными, причем наибольшему вниманию будут подвергаться самые крупные модели.
«Мы установили требования и ожидания для безопасного развития», — сказал Глезе журналистам. «Эти требования и ожидания варьируются в зависимости от уровня риска, который мы видим».
После инцидента OpenAI подвергся критике за плохую практику сетевой безопасности, когда модели покинули среду обучения, скомпрометировав инструмент в своей сети, имевший доступ к Интернету. Новые меры безопасности включают в себя более строгую практику сетевой изоляции, хотя конкретные детали остаются неясными. В новой системе, говорится в сообщении, «единичная компрометация рабочей нагрузки или вспомогательных услуг сама по себе не обеспечивает несанкционированный доступ к Интернету или другим внутренним сетям».
Самой надежной защитой является система мониторинга, которая проверяет действия инструмента, доступные следы рассуждений и журналы активности на предмет различного несанкционированного поведения. OpenAI заявляет, что намерена выдавать оповещения в течение 30 минут после соответствующего действия.
По оценкам OpenAI, вычислительная нагрузка при таком мониторинге составит примерно 20% от любого отслеживаемого процесса. Компания пообещала более подробную информацию о системе в ближайшем сообщении в блоге. Официальный посмертный анализ события, проведенный компанией, также еще не завершен.
