Claude Sonnet 5.5: Anthropic выпустила быструю модель с 70,6% в Terminal-Bench 4.0 по прежней цене $2/$10
Anthropic представила Claude Sonnet 5.5 — вторую модель в семействе Claude 5.5, которая вышла вслед за Claude Opus 5.5. Компания позиционирует новинку как более быструю и недорогую альтернативу, дополняющую старшую модель. Расчёт сделан на чётко очерченные повседневные задачи, поиск и исправление ошибок, а также на подготовку аккуратных документов, презентаций и таблиц.
Можно ли её внедрять? Да: модель уже работает на платформе Claude Platform под идентификатором claude-sonnet-5-5, а также доступна в AWS, Google Cloud и Microsoft Azure. Веса закрыты, поэтому вариант с развёртыванием на собственных серверах не рассматривается.
Что изменилось по сравнению с Sonnet 5
Относительно Sonnet 5 компания Anthropic заявляет о четырёх главных улучшениях:
- Скорость: генерация ответа ускорилась более чем на 30%, что делает эту версию самой быстрой в истории линейки Sonnet.
- Стоимость одной задачи: снижение достигает 30%, поскольку модели требуется меньше токенов и обращений к инструментам.
- Текст: формулировки стали яснее, а первые тестировщики называют модель более удобным партнёром для совместной работы.
- Зрение и длительные задачи: это первый Sonnet, который прошёл Pokémon Red, опираясь исключительно на скриншоты.
Технические характеристики из обзора моделей: контекст объёмом 1 млн токенов, максимальный вывод 128K и достоверные знания по состоянию на июнь 2026 года. Адаптивное мышление включено по умолчанию. Приложение усилий задаётся пятью уровнями: low, medium, high, xhigh и max.
Все приведённые ниже оценки заявлены самим производителем в публикации о запуске. Описание методологии содержится в документе Sonnet 5.5 System Card.
- Terminal-Bench 4.0: 70,6% против 10,3% у Sonnet 5 и 66,4% у Opus 5.5 на уровне xhigh.
- CursorBench 4.0: 55,5%, то есть примерно на 2 пункта ниже результата Opus 5.5 (57,8%).
- FrontierCode 1.1: 52,1% на xhigh и 46,2% на max. У GPT-6 Sol — 49,3%.
- GDPval-AA v2.1: 1844 балла против 1846 у Opus 5.5 и 1449 у Sonnet 5.
- OSWorld 2.1: 80,1% при работе с компьютером, что почти совпадает с Opus 5.5 (81,8%).
- Humanity’s Last Exam: 64,5% с использованием инструментов вместо прежних 54,9%.
Результат на уровне max ниже, чем на xhigh, и на то есть причина. На максимуме модель чаще запускала многоагентное ревью кода. Это иногда приводило к тайм-аутам или правкам за пределами поставленной задачи, а такие случаи FrontierCode штрафует. Кроме того, Anthropic прямо указывает: Opus 5.5 по-прежнему заметно сильнее там, где требуется сложная работа без заранее очерченных рамок.
Прайс-лист по сравнению с Sonnet 5 не изменился: $2 за миллион входных токенов и $10 за миллион выходных. Чтение из кэша стоит $0,20, запись в кэш — $2,50 за миллион. Это ровно половина тарифа Opus 5.5 ($4/$20). Экономия рождается из эффективности по токенам, а не из снижения цен.
Данные клиентов это подтверждают. Компания Balyasny Asset Management замерила около 121K токенов на один ответ против 497K у Sonnet 5. В Base44 сообщили о 3,6 итерации на сборку приложения, тогда как Opus 5 требовал 7,7. В Zendesk обработка обращений ускорилась на 20%.
Значения усилий по умолчанию зависят от того, где используется модель. В Claude Code и в приложениях Claude это medium, а на платформе Claude Platform — high.
Оценки в бенчмарках заявлены компанией Anthropic, а замеры GDPval-AA выполнены специалистами Artificial Analysis. Указаны стандартные прайсовые ставки API, проверенные 28 сентября 2026 года.
Claude Sonnet 5.5: интерактивный разбор
Можно последовательно пройтись по бенчмаркам, уровням усилий, стоимости задач и инструменту проверки совместимости при миграции API.
Индикаторы лишь иллюстрируют направление, которое описывает Anthropic: чем выше уровень усилий, тем дольше модель рассуждает и тем тщательнее проверяет собственную работу. Рекомендации взяты из руководства по переходу на Sonnet 5.5.
Экономия возникает из-за меньшего числа токенов и обращений к инструментам, а не из-за более низкой номинальной цены. Ваш реальный коэффициент выгоды зависит от характера рабочей нагрузки.
- Sonnet 5.5 набирает 70,6% в Terminal-Bench 4.0, поднявшись с 10,3%.
- Цена остаётся на уровне $2/$10, но стоимость одной задачи падает вплоть до 30%.
- По метрике GDPval-AA модель отстаёт от Opus 5.5 всего на 2 балла.
- Это первый Sonnet с киберзащитными механизмами и классификаторами извлечения рассуждений.
- Развернуть её можно уже сейчас через API, AWS, Google Cloud и Azure.
