Step 3.7 Flash: от распознавания видео до управления терминалом – одна модель вместо десятка
Представьте, что вы даёте поручение очень способному, но медлительному стажёру. Он блестяще справляется с одной задачей, но если нужно сделать десять дел подряд, каждое из которых требует отдельного обдумывания, он начинает тормозить, допускать ошибки и в итоге срывает сроки. Примерно так же работают традиционные тяжёлые большие языковые модели в реальных бизнес-задачах.
Step 3.7 Flash — это новая модель искусственного интеллекта от китайской компании StepFun (СтепФан). Её создали специально для того, чтобы ИИ-агенты (программы, которые самостоятельно выполняют сложные последовательные задачи) могли работать быстро, дёшево и надёжно в реальных условиях бизнеса.
В отличие от стажёров, которые пытаются удержать в голове все знания мира, Step 3.7 Flash устроена по принципу знать, как узнать. Если ей не хватает информации, она может:
- увеличить и перечитать изображение;
- самостоятельно выполнить поиск в интернете;
- вызвать нужную программу (браузер, офисный пакет, терминал) и поработать с ней.
Всё это она делает невероятно быстро, что критически важно для задач, где ИИ приходится взаимодействовать с десятками инструментов в рамках одного длительного процесса.
Техническая архитектура: как это работает
В основе модели лежит архитектура разреженного Mixture-of-Experts (MoE) – смесь экспертов. Это как в крупной компании, где есть много отделов (экспертов), но для решения конкретной задачи привлекаются только нужные специалисты, а не вся компания целиком.
Ключевые цифры:
- Общий размер: 198 миллиардов параметров (196 млрд — языковая часть + 1.8 млрд — зрительный кодировщик).
- Активные параметры: всего 11 миллиардов. Это означает, что для обработки одного запроса просыпается только малая часть всей модели, что обеспечивает высокую скорость и низкую стоимость.
- Скорость генерации: до 400 токенов в секунду. Для сравнения, это один из самых высоких показателей среди всех современных моделей.
- Контекстное окно: 256 000 токенов. Это позволяет модели держать в уме целые книги или большие объёмы кода, не теряя нить повествования.
- Три режима рассуждения: низкий, средний и высокий. Разработчик может выбрать баланс между скоростью, стоимостью и глубиной проработки ответа в зависимости от задачи.
Ключевые возможности
Встроенное мультимодальное восприятие
Модель из коробки понимает не только текст, но и изображения, видео, интерфейсы приложений, диаграммы и документы. Ей не нужны отдельные модели для распознавания картинок. Например, она может посмотреть на скриншот Photoshop и понять, какую кнопку нужно нажать, чтобы удалить объект.
Надёжное использование инструментов
Это главная особенность модели для бизнеса. Она может стабильно и без ошибок управлять внешними программами в рамках длительных процессов. Она может открыть браузер для поиска информации, запустить терминал для выполнения команд, поработать с офисными приложениями или вызвать API другой системы, при этом не сбиваясь с курса даже через 10–20 шагов.
Активный поиск и перекрёстная проверка
Если модель сталкивается с неполной или неочевидной информацией, она не придумывает ответ (галлюцинирует), а активно инициирует поиск в интернете или визуальный поиск, чтобы перепроверить данные. Например, при анализе фотографии незнакомого устройства она может найти его характеристики в интернете и составить таблицу с параметрами.
Производительность в тестах
| Бенчмарк | Оценка Step 3.7 Flash | Описание |
|---|---|---|
| ClawEval 1.1 | 67.1% | Выполнение многошаговых задач в реальной среде (открытие сайтов, работа с файлами). Лучший результат. |
| Terminal-Bench 2.1 | 59.5% | Работа в терминале (написание и выполнение команд). |
| SWE-Bench PRO | 56.3% | Поиск и исправление ошибок в реальном коде. |
| Toolathlon | 49.5% | Координация множества инструментов одновременно. |
| τ²-bench Telecom | >98% | Прохождение телеком-задач разной сложности. |
Стоимость и доступность
- Открытый исходный код: модель распространяется с открытым исходным кодом под лицензией Apache 2.0. Любой разработчик может скачать её и использовать бесплатно в своих проектах.
- Цена API: для тех, кто не хочет разворачивать модель у себя, доступен API. Ориентировочная цена составляет $0.20 за 1 млн входных токенов и $1.15 за 1 млн выходных токенов.
- Развёртывание: благодаря эффективной архитектуре её можно запустить как в облаке, так и на собственном относительно недорогом оборудовании.
Где скачать
Официальные репозитории модели Step 3.7 Flash:
Step 3.7 Flash — это не просто очередная языковая модель. Это инструмент нового поколения, созданный для эпохи ИИ-агентов. Вместо того чтобы гнаться за рекордными показателями в абстрактных тестах, её создатели сфокусировались на том, что действительно нужно бизнесу: скорость, надёжность и низкая стоимость при выполнении длительных и сложных задач. Она умеет смотреть, искать, вызывать программы и делать это так быстро, что может служить фундаментом для по-настоящему автономных и полезных ИИ-помощников.
