09.10.2026

Claude Sonnet 5.5: Anthropic выпустила быструю модель с 70,6% в Terminal-Bench 4.0 по прежней цене $2/$10

Claude Sonnet 5.5: Anthropic выпустила быструю модель с 70,6% в Terminal-Bench 4.0 по прежней цене $2/$10

Anthropic представила Claude Sonnet 5.5 — вторую модель в семействе Claude 5.5, которая вышла вслед за Claude Opus 5.5. Компания позиционирует новинку как более быструю и недорогую альтернативу, дополняющую старшую модель. Расчёт сделан на чётко очерченные повседневные задачи, поиск и исправление ошибок, а также на подготовку аккуратных документов, презентаций и таблиц.

Можно ли её внедрять? Да: модель уже работает на платформе Claude Platform под идентификатором claude-sonnet-5-5, а также доступна в AWS, Google Cloud и Microsoft Azure. Веса закрыты, поэтому вариант с развёртыванием на собственных серверах не рассматривается.

Что изменилось по сравнению с Sonnet 5

Относительно Sonnet 5 компания Anthropic заявляет о четырёх главных улучшениях:

  • Скорость: генерация ответа ускорилась более чем на 30%, что делает эту версию самой быстрой в истории линейки Sonnet.
  • Стоимость одной задачи: снижение достигает 30%, поскольку модели требуется меньше токенов и обращений к инструментам.
  • Текст: формулировки стали яснее, а первые тестировщики называют модель более удобным партнёром для совместной работы.
  • Зрение и длительные задачи: это первый Sonnet, который прошёл Pokémon Red, опираясь исключительно на скриншоты.

Технические характеристики из обзора моделей: контекст объёмом 1 млн токенов, максимальный вывод 128K и достоверные знания по состоянию на июнь 2026 года. Адаптивное мышление включено по умолчанию. Приложение усилий задаётся пятью уровнями: low, medium, high, xhigh и max.

Все приведённые ниже оценки заявлены самим производителем в публикации о запуске. Описание методологии содержится в документе Sonnet 5.5 System Card.

  • Terminal-Bench 4.0: 70,6% против 10,3% у Sonnet 5 и 66,4% у Opus 5.5 на уровне xhigh.
  • CursorBench 4.0: 55,5%, то есть примерно на 2 пункта ниже результата Opus 5.5 (57,8%).
  • FrontierCode 1.1: 52,1% на xhigh и 46,2% на max. У GPT-6 Sol — 49,3%.
  • GDPval-AA v2.1: 1844 балла против 1846 у Opus 5.5 и 1449 у Sonnet 5.
  • OSWorld 2.1: 80,1% при работе с компьютером, что почти совпадает с Opus 5.5 (81,8%).
  • Humanity’s Last Exam: 64,5% с использованием инструментов вместо прежних 54,9%.

Результат на уровне max ниже, чем на xhigh, и на то есть причина. На максимуме модель чаще запускала многоагентное ревью кода. Это иногда приводило к тайм-аутам или правкам за пределами поставленной задачи, а такие случаи FrontierCode штрафует. Кроме того, Anthropic прямо указывает: Opus 5.5 по-прежнему заметно сильнее там, где требуется сложная работа без заранее очерченных рамок.

Прайс-лист по сравнению с Sonnet 5 не изменился: $2 за миллион входных токенов и $10 за миллион выходных. Чтение из кэша стоит $0,20, запись в кэш — $2,50 за миллион. Это ровно половина тарифа Opus 5.5 ($4/$20). Экономия рождается из эффективности по токенам, а не из снижения цен.

Данные клиентов это подтверждают. Компания Balyasny Asset Management замерила около 121K токенов на один ответ против 497K у Sonnet 5. В Base44 сообщили о 3,6 итерации на сборку приложения, тогда как Opus 5 требовал 7,7. В Zendesk обработка обращений ускорилась на 20%.

Значения усилий по умолчанию зависят от того, где используется модель. В Claude Code и в приложениях Claude это medium, а на платформе Claude Platform — high.

Оценки в бенчмарках заявлены компанией Anthropic, а замеры GDPval-AA выполнены специалистами Artificial Analysis. Указаны стандартные прайсовые ставки API, проверенные 28 сентября 2026 года.

Claude Sonnet 5.5: интерактивный разбор

Можно последовательно пройтись по бенчмаркам, уровням усилий, стоимости задач и инструменту проверки совместимости при миграции API.

Индикаторы лишь иллюстрируют направление, которое описывает Anthropic: чем выше уровень усилий, тем дольше модель рассуждает и тем тщательнее проверяет собственную работу. Рекомендации взяты из руководства по переходу на Sonnet 5.5.

Экономия возникает из-за меньшего числа токенов и обращений к инструментам, а не из-за более низкой номинальной цены. Ваш реальный коэффициент выгоды зависит от характера рабочей нагрузки.

  • Sonnet 5.5 набирает 70,6% в Terminal-Bench 4.0, поднявшись с 10,3%.
  • Цена остаётся на уровне $2/$10, но стоимость одной задачи падает вплоть до 30%.
  • По метрике GDPval-AA модель отстаёт от Opus 5.5 всего на 2 балла.
  • Это первый Sonnet с киберзащитными механизмами и классификаторами извлечения рассуждений.
  • Развернуть её можно уже сейчас через API, AWS, Google Cloud и Azure.

Подписывайтесь на наш канал Дзен и группу ВК

MarkTechPost

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *