Grok 4.6: возвращение xAI на передовые рубежи искусственного интеллекта
12 августа 2026 года компания SpaceXAI (ранее xAI) официально представила свою новую флагманскую модель — Grok 4.6. Релиз стал знаковым событием: всего за несколько месяцев Grok поднялся с 17-го места в рейтингах до первого эшелона, вплотную приблизившись к лидерам рынка — OpenAI и Anthropic. Модель уже доступна через Cursor, Grok Build, API SpaceXAI, OpenRouter, Vercel и Cloudflare.
Что нового в Grok 4.6? (И почему архитектура не главное)
Grok 4.6 не является архитектурным прорывом — это история о том, как улучшили обучение. Модель сохранила ту же архитектуру на 1,5 триллиона параметров (MoE), что и Grok 4.5. Все улучшения достигнуты за счёт:
- Более длительного дополнительного обучения — Grok 4.6 прошёл более продолжительную тренировку, чем предыдущая версия.
- Курированных данных, сгенерированных моделью — для развития рассуждений и продвинутых технических концепций.
- Высококачественных инженерных данных — продолжение курса на усиление кодовых навыков.
- Улучшенного оптимизатора и рецепта обучения.
После этого команда использовала Grok 4.5 для регенерации траекторий SFT (supervised fine-tuning) в таких областях, как STEM, программная инженерия и интеллектуальная работа, отфильтровав проблемные траектории с помощью модельных проверок. Затем модель прошла широкий спектр agentic RL-обучения — от общего программирования до узкоспециализированных сред: оптимизация ядра, веб-разработка, компьютерное проектирование (CAD) и другие.
Производительность и бенчмарки: где Grok 4.6 силён, а где уступает
Grok 4.6 набрал 61 балл на Artificial Analysis Intelligence Index (AAII) — композитном индексе, объединяющем девять независимых бенчмарков. Это:
- на 5 баллов выше Grok 4.5 (56 баллов),
- на 23 балла выше Grok 4.3,
- полностью соответствует показателю GPT-5.6 Sol Max,
- всего на 1 балл отстаёт от Claude Fable 5 Max (62 балла).
Однако за общим баллом скрывается неоднородный профиль производительности:
| Бенчмарк | Grok 4.6 | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| CursorBench 3.2 | 69.9% | ~2.5% | ~11.3% |
| Harvey LAB (юриспруденция) | 15.8% | 2.5% | — |
| GDPVal-AA v2 (знания) | 1753 | 1728 | 1741 |
| DeepSWE 1.1 (инженерия) | 65.9% | 73% | 70% |
| Terminal-Bench | 26% | 34.6% | 34.1% |
*Данные: Yahoo Tech
Вывод: Grok 4.6 блестяще справляется с agentic-задачами (длительные многошаговые исследования, работа с кодовой базой, юридический анализ), но уступает конкурентам в чистом программировании и работе с терминалом.
Главная фишка: «долгоживущие» AI-агенты
Основной фокус Grok 4.6 — long-running agents, способные автономно выполнять сложные многошаговые задачи. Модель может:
- исследовать незнакомую тему,
- структурировать программу и реализовывать основные функции,
- проверять собственную работу и вносить изменения после нескольких раундов обратной связи,
- превращать абстрактную идею продукта в работающее приложение.
«Дайте ей размытое описание вроде «сделай мне приложение», и она сама изучит незнакомую область, спроектирует архитектуру, напишет код, запустит тесты, найдёт ошибки, исправит их и выдаст вам работающую первую версию. Вам не нужно отдавать команды на каждом шагу».
В тестах на AA-Briefcase (частный бенчмарк длительных agentic-задач) Grok 4.6 показал выдающуюся эффективность: в среднем ~53 шага и ~0,5 млрд входных токенов против ~103 шагов и ~2,0 млрд токенов у Claude Opus 5.
Цена: лидерство по соотношению цена/качество
Grok 4.6 сохранил ту же цену, что и Grok 4.5:
- $2 за 1 млн входных токенов,
- $6 за 1 млн выходных токенов,
- $0.50 за 1 млн закэшированных входных токенов.
Для сравнения: GPT-5.6 Sol стоит $5/$30, Claude Opus 5 — $5/$25. Grok 4.6 дешевле более чем на 60%, а при сравнении с Fable 5 Max — на 80% за вход и 88% за выход.
По расчётам Artificial Analysis, Grok 4.6 обходится в $0.84 за задачу — это лучший показатель на рынке при сопоставимом уровне интеллекта.
Технические характеристики
| Название модели | grok-4.6 |
| Контекстное окно | 500 000 токенов |
| Архитектура | 1.5 трлн параметров, MoE |
| Дата отсечки знаний | 1 февраля 2026 |
| Модальности | Текст + изображения на вход, текст на выход |
| Уровни рассуждений | Low / Medium / High (по умолчанию) / XHigh |
| Инструменты | Вызов функций, веб-поиск, поиск по X, выполнение кода |
Где опробовать Grok 4.6
Модель доступна через:
- Cursor (интегрированная среда разработки),
- Grok Build (кодовый агент от xAI),
- API SpaceXAI,
- OpenRouter,
- Vercel,
- Cloudflare.
В первую неделю после релиза пользователи Cursor и Grok Build получают удвоенный лимит использования.
Безопасность и критика
SpaceXAI сообщает, что система безопасности Grok 4.6 была калибрована в соответствии с расширенными возможностями модели. Проведена самая масштабная в истории компании предрелизная проверка, охватывающая тестирование способностей, калибровку защитных механизмов и пост-релизное тестирование.
Однако критики указывают на отсутствие формальной model card. Без детальной документации о поведении модели, сбоях и ограничениях инженерам сложно предсказывать её работу в длительных автономных сценариях. Как отмечает Yahoo Tech, «разрыв между композитными показателями интеллекта и operational transparency, необходимой для production-систем, только растёт».
Итог: новый игрок в высшей лиге
Grok 4.6 — это возвращение xAI в высшую лигу ИИ. Не меняя архитектуру, компания добилась впечатляющего прогресса за счёт оптимизации обучения, расширенного RL и курированных данных. Модель особенно сильна в автономных агентских задачах, предлагая при этом лучшее на рынке соотношение цены и качества.
«Grok 4.6 объективно является №1 с точки зрения интеллекта, скорости и стоимости», — заявил Илон Маск.
Спорное утверждение, но одно бесспорно: гонка ИИ-моделей выходит на новый уровень, и Grok 4.6 — один из главных её игроков.
