24.08.2026

Step 3.7 Flash: от распознавания видео до управления терминалом – одна модель вместо десятка

Step 3.7 Flash

Представьте, что вы даёте поручение очень способному, но медлительному стажёру. Он блестяще справляется с одной задачей, но если нужно сделать десять дел подряд, каждое из которых требует отдельного обдумывания, он начинает тормозить, допускать ошибки и в итоге срывает сроки. Примерно так же работают традиционные тяжёлые большие языковые модели в реальных бизнес-задачах.

Step 3.7 Flash — это новая модель искусственного интеллекта от китайской компании StepFun (СтепФан). Её создали специально для того, чтобы ИИ-агенты (программы, которые самостоятельно выполняют сложные последовательные задачи) могли работать быстро, дёшево и надёжно в реальных условиях бизнеса.

В отличие от стажёров, которые пытаются удержать в голове все знания мира, Step 3.7 Flash устроена по принципу знать, как узнать. Если ей не хватает информации, она может:

  • увеличить и перечитать изображение;
  • самостоятельно выполнить поиск в интернете;
  • вызвать нужную программу (браузер, офисный пакет, терминал) и поработать с ней.

Всё это она делает невероятно быстро, что критически важно для задач, где ИИ приходится взаимодействовать с десятками инструментов в рамках одного длительного процесса.

Техническая архитектура: как это работает

В основе модели лежит архитектура разреженного Mixture-of-Experts (MoE) – смесь экспертов. Это как в крупной компании, где есть много отделов (экспертов), но для решения конкретной задачи привлекаются только нужные специалисты, а не вся компания целиком.

Ключевые цифры:

  • Общий размер: 198 миллиардов параметров (196 млрд — языковая часть + 1.8 млрд — зрительный кодировщик).
  • Активные параметры: всего 11 миллиардов. Это означает, что для обработки одного запроса просыпается только малая часть всей модели, что обеспечивает высокую скорость и низкую стоимость.
  • Скорость генерации: до 400 токенов в секунду. Для сравнения, это один из самых высоких показателей среди всех современных моделей.
  • Контекстное окно: 256 000 токенов. Это позволяет модели держать в уме целые книги или большие объёмы кода, не теряя нить повествования.
  • Три режима рассуждения: низкий, средний и высокий. Разработчик может выбрать баланс между скоростью, стоимостью и глубиной проработки ответа в зависимости от задачи.

Ключевые возможности

Встроенное мультимодальное восприятие

Модель из коробки понимает не только текст, но и изображения, видео, интерфейсы приложений, диаграммы и документы. Ей не нужны отдельные модели для распознавания картинок. Например, она может посмотреть на скриншот Photoshop и понять, какую кнопку нужно нажать, чтобы удалить объект.

Надёжное использование инструментов

Это главная особенность модели для бизнеса. Она может стабильно и без ошибок управлять внешними программами в рамках длительных процессов. Она может открыть браузер для поиска информации, запустить терминал для выполнения команд, поработать с офисными приложениями или вызвать API другой системы, при этом не сбиваясь с курса даже через 10–20 шагов.

Активный поиск и перекрёстная проверка

Если модель сталкивается с неполной или неочевидной информацией, она не придумывает ответ (галлюцинирует), а активно инициирует поиск в интернете или визуальный поиск, чтобы перепроверить данные. Например, при анализе фотографии незнакомого устройства она может найти его характеристики в интернете и составить таблицу с параметрами.

Производительность в тестах

Бенчмарк Оценка Step 3.7 Flash Описание
ClawEval 1.1 67.1% Выполнение многошаговых задач в реальной среде (открытие сайтов, работа с файлами). Лучший результат.
Terminal-Bench 2.1 59.5% Работа в терминале (написание и выполнение команд).
SWE-Bench PRO 56.3% Поиск и исправление ошибок в реальном коде.
Toolathlon 49.5% Координация множества инструментов одновременно.
τ²-bench Telecom >98% Прохождение телеком-задач разной сложности.

Стоимость и доступность

  • Открытый исходный код: модель распространяется с открытым исходным кодом под лицензией Apache 2.0. Любой разработчик может скачать её и использовать бесплатно в своих проектах.
  • Цена API: для тех, кто не хочет разворачивать модель у себя, доступен API. Ориентировочная цена составляет $0.20 за 1 млн входных токенов и $1.15 за 1 млн выходных токенов.
  • Развёртывание: благодаря эффективной архитектуре её можно запустить как в облаке, так и на собственном относительно недорогом оборудовании.

Где скачать

Официальные репозитории модели Step 3.7 Flash:

Step 3.7 Flash — это не просто очередная языковая модель. Это инструмент нового поколения, созданный для эпохи ИИ-агентов. Вместо того чтобы гнаться за рекордными показателями в абстрактных тестах, её создатели сфокусировались на том, что действительно нужно бизнесу: скорость, надёжность и низкая стоимость при выполнении длительных и сложных задач. Она умеет смотреть, искать, вызывать программы и делать это так быстро, что может служить фундаментом для по-настоящему автономных и полезных ИИ-помощников.

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *