10.10.2026

Исследователь Anthropic показал, как выглядит самообучающийся ИИ: автоматические исследователи надёжно устраняют сбои выравнивания

Исследователь Anthropic показал, как выглядит самообучающийся ИИ: автоматические исследователи надёжно устраняют сбои выравнивания

Обучение ИИ-моделей с помощью других ИИ-моделей стало очень популярной целью для «неолабораторий» — и теперь исследователь из программы феллоу Anthropic дал ранний взгляд на то, как это может выглядеть на практике. В пятницу Anthropic опубликовала новую статью под названием «Автоматические исследователи могут надёжно устранять сбои выравнивания» (Automated Researchers Can Reliably Mitigate Alignment Failures), в которой описано, как ИИ-системы могут надёжно улучшать показатели модели на наборе бенчмарков выравнивания.

Получив 10 бенчмарков для конкретных несогласованных поведений, автоматические системы смогли улучшить показатели по каждому из них без ухудшения общих результатов. Возглавляемая феллоу Anthropic Чэнем Юэ-Ханем, система во многом повторяет традиционный подход к исследованиям: каждая автоматическая система изучает доступную литературу, предлагает метод и обучает модель этим методом в течение 30 минут, постепенно повышая результаты на бенчмарке за несколько итераций. Эффективные методы сохраняются, неэффективные отбрасываются, что позволяет системе работать быстро и в большом масштабе.

«В целом эти результаты дают ранние свидетельства того, что автоматизированный пост-тренинг выравнивания может стать практичным уже в ближайшем будущем», — говорится в статье.

Эта работа — шаг к рекурсивному самосовершенствованию, которое многие считают следующим значительным этапом прогресса ИИ. Если модели смогут улучшать собственное обучение выравниванию, вероятно, они смогут улучшать и практики обучения в более широком смысле — и тогда человеческие ИИ-исследователи могут довольно быстро устареть.

Статья не стесняется обсуждать эту идею, прямо сравнивая автоматического исследователя выравнивания (AAR) с его человеческим аналогом. «Лучший метод AAR превосходит то, что предлагают опытные люди, в среднем в течение шести часов», — говорится в статье. «Направления исследований, которыми руководят люди, не приводят к более сильным результатам».

Есть даже сравнение стоимости, если кто-то ещё не убедился: «AAR стоит примерно $4 в час на API-инференс против $150 в час, которые мы платим нашим исследователям-людям».

Справедливости ради, в статье также указаны ограничения подхода. Автоматическая система работает ровно настолько, насколько бенчмарки отражают реальные цели выравнивания, и даже в этом случае предстоит значительная работа по созданию и поддержанию этих бенчмарков — не говоря уже о поддержании и расширении литературы, из которой черпают автоматические исследователи.

Подписывайтесь на наш канал Дзен и группу ВК

TechCrunch

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *