09.10.2026

Black Forest Labs представила FLUX 3 Action: открытая модель действий на 7 млрд параметров возглавила рейтинг RoboLab-120

OpenAI: ИИ-агенты взаимодействовали с сайтами Минобразования, Минторговли и SEC США

Иллюстрация к релизу открытой модели действий FLUX 3 Action от Black Forest Labs для управления роботами.

Black Forest Labs (BFL) — лаборатория, создавшая семейство имиджевых моделей FLUX, — выпустила FLUX 3 Action: открытую по весам модель действий (World Action Model, WAM) на 7 млрд параметров для управления роботами. Модель принимает кадры с камеры, состояние робота и текстовую инструкцию, а затем одновременно предсказывает будущие видеокадры и следующий блок действий. В рейтинге RoboLab-120 она заняла первое место с результатом 42,92% успешно выполненных задач.

Можно ли её развернуть на практике? Да, но с условиями. Политике DROID требуется около 32 ГБ видеопамяти в формате BF16 на ускорителе H200. На картах с 24 ГБ она помещается при квантовании FP8 и выгрузке текстового энкодера. Лицензия FLUX Kommunity разрешает некоммерческое использование.

Компромисс, который закрывает FLUX 3 Action

Открытые роботизированные политики обычно ставят перед выбором. WAM-модели вроде NVIDIA Cosmos 3 Nano лидируют в RoboLab с 36,8%, но предсказание видео обходится дорого. VLA-модели наподобие π0.5 работают быстро, однако достигают лишь 28,0%. На ускорителе B200 специалисты BFL замерили, что Cosmos 3 Nano (FP8) требует примерно в 4,7 раза больше времени обработки, чем π0.5 (BF16), на каждую секунду движения робота.

FLUX 3 Action сохраняет совместное предсказание видео и действий. Разрыв в скорости BFL закрывает меньшим «хребтом» и дистилляцией.

Архитектура и обучение

FLUX 3 Action построена на мультимодальном базовом модуле FLUX 3. Предобучение велось на изображениях, видео и аудио, причём на видео пришлось более 95% обучающих токенов. Текст, видео и состояние робота кодируются в токены. Будущие токены базовой модели декодируются в видеокадры, а токены действий — в движения робота.

На этапе мидтрейнинга данные предобучения (36,95% образцов) смешивались с видео, выровненным по действиям (63,05%). Набор по действиям охватывал записи игр, видео от первого лица с руками человека, ручные захваты и телеуправление в 14 вариантах исполнения. Большая часть роботизированных данных использует общее 50-мерное пространство действий манипулятора под названием EE50.

Предобучение здесь играет ключевую роль. Без него обучение только на DROID оставалось ниже 1% в RoboLab. С предобучением тот же протокол достиг 11,6%.

Результаты бенчмарков

RoboLab-120 включает 120 настольных задач в симуляторе Isaac Sim, по 10 попыток на каждую, на установке Franka в стиле DROID.

Это на 6,1 процентного пункта больше при на 56% меньшем числе параметров, чем у Cosmos 3 Nano. Показатель 42,92% — позиция в рейтинге. Среднее по нескольким запускам для чекпойнта FP8 с дистилляцией наведения у BFL составляет 42,24% ± 0,36.

На реальном железе картина та же. Positronic Robotics провела слепую оценку на манипуляторе Franka с 10 задачами DROID и тремя попытками на каждую. FLUX 3 Action выполнила 28 из 30 попыток (93,3%). Cosmos 3 Nano показала 27/30, DreamZero — 20/30, π0.5 — 13/30.

Три чекпойнта и три скоростных режима

BFL поставляет политику DROID в трёх вариантах, каждый в BF16 и FP8:

  • Base: 4 шага сэмплирования с раздельным наведением (видео CFG 4, действие CFG 1).
  • Дистилляция наведения: убирает второй проход наведения, работает в 1,8–2 раза быстрее и показывает на 0,6–1,08 п.п. выше.
  • Дистилляция шагов: 1 шаг сэмплирования, в 3,15–4 раза быстрее, но с падением успеха на 3,51–4,32 п.п.

В сравнении с Cosmos 3 Nano в FP8 базовый и дистиллированный по наведению чекпойнты работают в 1,52–3,95 раза быстрее на потребительских, рабочих и датацентровых GPU.

Каждый вызов даёт 32 действия на частоте 15 Гц — это 2,13 секунды движения. π0.5 выдаёт 1,0 секунды на вызов. Поэтому BFL указывает скорость как коэффициент реального времени, а не задержку на вызов. В FP8 чекпойнт с дистилляцией шагов опережает π0.5 в 1,34–2,28 раза на рабочих и датацентровых GPU. На RTX 5090 он медленнее π0.5.

Быстрая политика плюс рассуждающая модель

BFL также протестировала гибридное управление с GPT 6 Astra по схеме Su et al. (2026). Рассуждающая модель может выполнять, редактировать или заменять предсказанные политикой действия. С FLUX 3 Action и низким уровнем рассуждений гибрид решил 90% эпизодов при $8,77 и 8 минутах 08 секундах на успех. Чистая Astra на максимальном уровне решила 100%, но обошлась в $13,47 и 16 минут 23 секунды на успех.

Дообучение, LeRobot и Jetson

Команды могут дообучать FLUX 3 Action на собственных демонстрациях. BFL опубликовала рецепт для DROID и рецепт LoRA для SO-101. В документации показан навык SO-101 «взять и положить», освоенный примерно на 200 демонстрациях. Совместно с NVIDIA BFL нативно интегрировала модель в Hugging Face LeRobot и поддерживает развёртывание на периферии на NVIDIA Jetson. В документации также есть примеры игры и симулированного дрона.

Модель выдаёт целевые значения шарниров без встроенных ограничений по скорости, усилию или рабочей зоне. Эти ограничения должно обеспечивать ваше приложение.

Ключевые выводы

  • WAM на 7 млрд параметров занимает первое место в RoboLab-120 с 42,92%.
  • Опережает Cosmos 3 Nano на 6,1 п.п. при на 56% меньшем числе параметров.
  • До 3,95 раза быстрее Cosmos 3 Nano в FP8.
  • Планирует 2,13 секунды движения на вызов против 1,0 секунды у π0.5.
  • Веса, код и рецепты поставляются под лицензией FLUX Kommunity.

Подписывайтесь на наш канал Дзен и группу ВК

MarkTechPost

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *