Z.ai представила GLM-5.3: прорыв за счёт масштабирования RL, а не увеличения модели
Китайская компания Z.ai представила новую версию своей флагманской языковой модели — GLM-5.3. Главная особенность релиза: значительное повышение качества достигнуто не за счёт увеличения параметров или нового этапа предобучения, а благодаря масштабированию пост-трейнинга и обучению с подкреплением (RL) на реальных инженерных задачах.
Архитектурная стратегия: дотренивать, а не перестраивать
Базовая модель GLM-5.3 осталась той же, что и в версии 5.2 — архитектура не менялась, объём параметров не рос. Команда Z.ai пошла по другому пути: вместо гонки за триллионами весов сделала ставку на интенсивность и качество reinforcement learning после базового обучения. RL применялся не только для выравнивания ответов, но и для решения практических задач: генерации кода, оптимизации процессов тренировки, работы с длинными цепочками действий.
Результаты по программированию
По внутреннему бенчмарку Code Bench, GLM-5.3 показывает прирост производительности примерно на 50% по сравнению с предшественницей. Модель лучше справляется с задачами, требующими рассуждений на многих шагах, и демонстрирует повышенную полезность в сценариях разработки ПО.
Прорыв в кибербезопасности — неожиданный бонус
Отдельного внимания заслуживает скачок компетенций в области информационной безопасности. GLM-5.3 достигла state-of-the-art результатов на тестовом наборе CyberGym, особенно на поздних стадиях цепочки эксплуатации (exploit chain) — то есть в задачах реального использования найденных уязвимостей. С момента выхода GLM-5.2 модели серии GLM суммарно выявили около 2500 уязвимостей, включая дефекты в ПО, существующем более 45 лет.
Открытые веса — через две недели
На данный момент GLM-5.3 уже интегрирована в программные продукты Z.ai, однако полные веса модели не опубликованы. Компания обещает открыть доступ после завершения дополнительной оценки безопасности — примерно через две недели.
Вывод для индустрии
Если независимые тесты подтвердят заявленные метрики после релиза весов, случай GLM-5.3 станет сильным аргументом в пользу того, что следующий этап гонки ИИ может развернуться не вокруг масштаба моделей (триллионы параметров), а вокруг качества и объёма пост-трейнинга. Уже имеющийся фундаментальный чекпоинт можно продвинуть далеко, если масштабировать качественный RL на реальных задачах — от кодинга до поиска уязвимостей.
