24.08.2026

Z.ai представила GLM-5.3: прорыв за счёт масштабирования RL, а не увеличения модели

featured_glm53

Китайская компания Z.ai представила новую версию своей флагманской языковой модели — GLM-5.3. Главная особенность релиза: значительное повышение качества достигнуто не за счёт увеличения параметров или нового этапа предобучения, а благодаря масштабированию пост-трейнинга и обучению с подкреплением (RL) на реальных инженерных задачах.

Архитектурная стратегия: дотренивать, а не перестраивать

Базовая модель GLM-5.3 осталась той же, что и в версии 5.2 — архитектура не менялась, объём параметров не рос. Команда Z.ai пошла по другому пути: вместо гонки за триллионами весов сделала ставку на интенсивность и качество reinforcement learning после базового обучения. RL применялся не только для выравнивания ответов, но и для решения практических задач: генерации кода, оптимизации процессов тренировки, работы с длинными цепочками действий.

Результаты по программированию

По внутреннему бенчмарку Code Bench, GLM-5.3 показывает прирост производительности примерно на 50% по сравнению с предшественницей. Модель лучше справляется с задачами, требующими рассуждений на многих шагах, и демонстрирует повышенную полезность в сценариях разработки ПО.

Прорыв в кибербезопасности — неожиданный бонус

Отдельного внимания заслуживает скачок компетенций в области информационной безопасности. GLM-5.3 достигла state-of-the-art результатов на тестовом наборе CyberGym, особенно на поздних стадиях цепочки эксплуатации (exploit chain) — то есть в задачах реального использования найденных уязвимостей. С момента выхода GLM-5.2 модели серии GLM суммарно выявили около 2500 уязвимостей, включая дефекты в ПО, существующем более 45 лет.

Открытые веса — через две недели

На данный момент GLM-5.3 уже интегрирована в программные продукты Z.ai, однако полные веса модели не опубликованы. Компания обещает открыть доступ после завершения дополнительной оценки безопасности — примерно через две недели.

Вывод для индустрии

Если независимые тесты подтвердят заявленные метрики после релиза весов, случай GLM-5.3 станет сильным аргументом в пользу того, что следующий этап гонки ИИ может развернуться не вокруг масштаба моделей (триллионы параметров), а вокруг качества и объёма пост-трейнинга. Уже имеющийся фундаментальный чекпоинт можно продвинуть далеко, если масштабировать качественный RL на реальных задачах — от кодинга до поиска уязвимостей.

Подписывайтесь на наш канал Дзен и группу ВК

Habr

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *