24.08.2026

Grok 4.6: возвращение xAI на передовые рубежи искусственного интеллекта

Grok 4.6: возвращение xAI

12 августа 2026 года компания SpaceXAI (ранее xAI) официально представила свою новую флагманскую модель — Grok 4.6. Релиз стал знаковым событием: всего за несколько месяцев Grok поднялся с 17-го места в рейтингах до первого эшелона, вплотную приблизившись к лидерам рынка — OpenAI и Anthropic. Модель уже доступна через Cursor, Grok Build, API SpaceXAI, OpenRouter, Vercel и Cloudflare.

Что нового в Grok 4.6? (И почему архитектура не главное)

Grok 4.6 не является архитектурным прорывом — это история о том, как улучшили обучение. Модель сохранила ту же архитектуру на 1,5 триллиона параметров (MoE), что и Grok 4.5. Все улучшения достигнуты за счёт:

  • Более длительного дополнительного обучения — Grok 4.6 прошёл более продолжительную тренировку, чем предыдущая версия.
  • Курированных данных, сгенерированных моделью — для развития рассуждений и продвинутых технических концепций.
  • Высококачественных инженерных данных — продолжение курса на усиление кодовых навыков.
  • Улучшенного оптимизатора и рецепта обучения.

После этого команда использовала Grok 4.5 для регенерации траекторий SFT (supervised fine-tuning) в таких областях, как STEM, программная инженерия и интеллектуальная работа, отфильтровав проблемные траектории с помощью модельных проверок. Затем модель прошла широкий спектр agentic RL-обучения — от общего программирования до узкоспециализированных сред: оптимизация ядра, веб-разработка, компьютерное проектирование (CAD) и другие.

Производительность и бенчмарки: где Grok 4.6 силён, а где уступает

Grok 4.6 набрал 61 балл на Artificial Analysis Intelligence Index (AAII) — композитном индексе, объединяющем девять независимых бенчмарков. Это:

  • на 5 баллов выше Grok 4.5 (56 баллов),
  • на 23 балла выше Grok 4.3,
  • полностью соответствует показателю GPT-5.6 Sol Max,
  • всего на 1 балл отстаёт от Claude Fable 5 Max (62 балла).

Однако за общим баллом скрывается неоднородный профиль производительности:

Бенчмарк Grok 4.6 GPT-5.6 Sol Claude Fable 5
CursorBench 3.2 69.9% ~2.5% ~11.3%
Harvey LAB (юриспруденция) 15.8% 2.5%
GDPVal-AA v2 (знания) 1753 1728 1741
DeepSWE 1.1 (инженерия) 65.9% 73% 70%
Terminal-Bench 26% 34.6% 34.1%

*Данные: Yahoo Tech

Вывод: Grok 4.6 блестяще справляется с agentic-задачами (длительные многошаговые исследования, работа с кодовой базой, юридический анализ), но уступает конкурентам в чистом программировании и работе с терминалом.

Главная фишка: «долгоживущие» AI-агенты

Основной фокус Grok 4.6 — long-running agents, способные автономно выполнять сложные многошаговые задачи. Модель может:

  • исследовать незнакомую тему,
  • структурировать программу и реализовывать основные функции,
  • проверять собственную работу и вносить изменения после нескольких раундов обратной связи,
  • превращать абстрактную идею продукта в работающее приложение.

«Дайте ей размытое описание вроде «сделай мне приложение», и она сама изучит незнакомую область, спроектирует архитектуру, напишет код, запустит тесты, найдёт ошибки, исправит их и выдаст вам работающую первую версию. Вам не нужно отдавать команды на каждом шагу».

В тестах на AA-Briefcase (частный бенчмарк длительных agentic-задач) Grok 4.6 показал выдающуюся эффективность: в среднем ~53 шага и ~0,5 млрд входных токенов против ~103 шагов и ~2,0 млрд токенов у Claude Opus 5.

Цена: лидерство по соотношению цена/качество

Grok 4.6 сохранил ту же цену, что и Grok 4.5:

  • $2 за 1 млн входных токенов,
  • $6 за 1 млн выходных токенов,
  • $0.50 за 1 млн закэшированных входных токенов.

Для сравнения: GPT-5.6 Sol стоит $5/$30, Claude Opus 5 — $5/$25. Grok 4.6 дешевле более чем на 60%, а при сравнении с Fable 5 Max — на 80% за вход и 88% за выход.

По расчётам Artificial Analysis, Grok 4.6 обходится в $0.84 за задачу — это лучший показатель на рынке при сопоставимом уровне интеллекта.

Технические характеристики

Название модели grok-4.6
Контекстное окно 500 000 токенов
Архитектура 1.5 трлн параметров, MoE
Дата отсечки знаний 1 февраля 2026
Модальности Текст + изображения на вход, текст на выход
Уровни рассуждений Low / Medium / High (по умолчанию) / XHigh
Инструменты Вызов функций, веб-поиск, поиск по X, выполнение кода

Где опробовать Grok 4.6

Модель доступна через:

  • Cursor (интегрированная среда разработки),
  • Grok Build (кодовый агент от xAI),
  • API SpaceXAI,
  • OpenRouter,
  • Vercel,
  • Cloudflare.

В первую неделю после релиза пользователи Cursor и Grok Build получают удвоенный лимит использования.

Безопасность и критика

SpaceXAI сообщает, что система безопасности Grok 4.6 была калибрована в соответствии с расширенными возможностями модели. Проведена самая масштабная в истории компании предрелизная проверка, охватывающая тестирование способностей, калибровку защитных механизмов и пост-релизное тестирование.

Однако критики указывают на отсутствие формальной model card. Без детальной документации о поведении модели, сбоях и ограничениях инженерам сложно предсказывать её работу в длительных автономных сценариях. Как отмечает Yahoo Tech, «разрыв между композитными показателями интеллекта и operational transparency, необходимой для production-систем, только растёт».

Итог: новый игрок в высшей лиге

Grok 4.6 — это возвращение xAI в высшую лигу ИИ. Не меняя архитектуру, компания добилась впечатляющего прогресса за счёт оптимизации обучения, расширенного RL и курированных данных. Модель особенно сильна в автономных агентских задачах, предлагая при этом лучшее на рынке соотношение цены и качества.

«Grok 4.6 объективно является №1 с точки зрения интеллекта, скорости и стоимости», — заявил Илон Маск.

Спорное утверждение, но одно бесспорно: гонка ИИ-моделей выходит на новый уровень, и Grok 4.6 — один из главных её игроков.

X.ai →

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *