24.08.2026

Induction Labs представила Photon-1 — ИИ учится по видео без подсказок

mtp1

Большинство агентов, которые обучаются по видео, должны знать, какое действие привело к каждому кадру. Команда Induction Labs утверждает, что именно это требование и является главным узким местом. На прошлой неделе они представили imagination models — архитектуру фундаментальной модели, которая предобучается на «сыром» видео вообще без каких-либо меток действий.

Их тестовая система — Photon-1, разрежённый (sparse) 106B-A5B трансформер смеси экспертов (MoE), обученный на 18 годах видеозаписей работы за компьютером. На внутреннем бенчмарке компьютерного использования Induction Labs сообщает, что Photon-1 превосходит Gemini 3.1 Flash-Lite, затрачивая при этом гораздо меньше вычислительных ресурсов на предобучение и обходясь примерно в 3 раза дешевле в инференсе.

Imagination model предсказывает будущие кадры авторегрессивно, используя цель предсказания следующего скрытого токена (next-latent-token-prediction). Во время предобучения модель не генерирует пиксели — всё моделируется в пространстве обученных представлений. Это принципиальное отличие от традиционных генеративных моделей видео, которые оперируют в пиксельном пространстве и требуют на порядок больше вычислительных ресурсов.

Ключевое утверждение заключается в следующем: предсказание будущих состояний обучает модель выполнять задачи, даже если она никогда не видит действий во время предобучения. Induction Labs называет это неявной политикой (implicit policy). Модель усваивает концепции того, что делает человек, а не метку для каждого щелчка мыши. Иными словами, она понимает намерение, а не механику отдельного действия.

Архитектура опирается на энкодер изображений, использующий конечную скалярную квантизацию (FSQ — Finite Scalar Quantization). Каждый кадр сжимается в 960 дискретных токенов. Каждый токен представляет собой 8-мерный вектор, где каждое измерение принимает одно из пяти значений: −1, −1/2, 0, 1/2, 1. Это даёт кодовую книгу из 5⁸ возможных кодов — 390 625 комбинаций на один токен, что обеспечивает высокую выразительность при дискретном представлении.

Результирующее кодирование составляет около 2,2 КБ на кадр. Induction Labs сообщает о более чем 100-кратном улучшении сжатия по сравнению с существующими представлениями OCR и мультимодальных моделей, при этом сохраняются текст, макет и изменения состояния экрана. Такая эффективность открывает путь к обработке очень длинных видеопоследовательностей, которые ранее были недоступны для трансформеров с ограничением по контексту.

Чтобы достичь такого показателя, Photon-1 использует дифференциальный латентный энкодер (differential latent encoder). Он кодирует пары видеокадров, так что латентное представление описывает различия между кадрами, а не их содержимое по отдельности. Это позволяет избежать избыточности, неизбежной при покадровом кодировании статичных или медленно меняющихся сцен — например, когда пользователь читает текст или заполняет форму.

Корпус данных формируется из внутреннего индекса 2 миллиардов общедоступных видео. После фильтрации остаётся примерно 2 миллиона записей экрана компьютера. Внутренняя модель обнаружения ключевых кадров удаляет избыточные кадры. На выходе получается 575 миллионов кадров с частотой дискретизации 1 кадр в секунду, что эквивалентно 552 миллиардам токенов — около 18 лет непрерывного видео. Photon-1 был предобучен с нуля за одну эпоху.

Обучение модели 106B-A5B MoE с контекстом в 32K токенов заняло приблизительно 30 000 H200-часов GPU, или 4,4×10²² FLOPов. Исследовательская группа реализовала обучение на PyTorch с использованием пользовательских fused-ядер для энкодера изображений и слоёв MoE, достигнув 40% сквозной утилизации оборудования (MFU). Все три показателя согласованы между собой: 30 000 H200-часов при 40% MFU даёт почти ровно 4,3×10²² FLOPов — выдающийся результат эффективности для модели такого масштаба.

Induction Labs дообучила Photon-1 на менее чем 35 000 траекторий компьютерного использования, чтобы обучить формату действий и инструкций. Специальные токены компьютерного использования позволяют модели генерировать действия. На этапе инференса Photon-1 сначала предсказывает состояние следующего кадра, а затем выдаёт действие, которое к этому состоянию приводит.

После этого применяется онлайн-обучение с подкреплением (online RL). Прогоны выполняются в реальном времени на виртуальных машинах в масштабе, а результаты проверяются программно для формирования награды. Виртуальные машины под управлением Linux работают в пяти средах рабочего стола (LXQt, Xfce, MATE, GNOME и Plasma), каждая из которых имеет учётную запись Google для веб-приложений, требующих входа, и внутренний клон ChatGPT без ограничения количества запросов.

*Коэффициент взвешивания входных и выходных токенов — 10:1, что, по словам Induction Labs, соответствует их тестам компьютерного использования.

К этой таблице следует добавить две оговорки. Во-первых, показатель Gemini — это собственная консервативная оценка Induction Labs, предполагающая 8B активных параметров и 25T токенов предобучения. Если принимать цифры за чистую монету, соотношение составляет около 27×, а не заявленные 30×; Induction Labs указывает «как минимум 30×» на том основании, что реальное число Gemini, вероятно, выше и модель, скорее всего, подверглась дистилляции. Во-вторых, бенчмарк является внутренним и не опубликован, поэтому результат на сегодняшний день нельзя независимо воспроизвести.

Собственная безубыточная стоимость Photon-1 на оборудовании Induction Labs составляет $0,06 за 1M входных токенов и $0,60 за 1M выходных токенов, без спекулятивного декодирования. Для сравнения, многие современные API-модели крупных вендоров стоят в разы дороже, что делает Photon-1 привлекательным для массового развёртывания.

Это более интересный тест, поскольку Photon-1 видел только видео компьютерного использования. Исследовательская группа дообучила модель на доменах, отсутствовавших в предобучении, и сравнила с двумя базовыми линиями: энкодером изображений с той же архитектурой и размером, но без предобучения imagination model, и LLM-базовой линией (Ling-flash-2.0 от Inclusion AI, предобученная на 20T токенов).

На 20 000 турнирных партиях в шашки из Open Checkers Archive 2.0 Photon-1 превзошёл обе базовые линии как по качеству симуляции мира, так и по качеству ходов. На 10 000 синтетически сгенерированных партий в бильярд, смоделированных с частотой 5 кадров в секунду, модель показала среднюю абсолютную ошибку 0,47 относительно эталонного физического движка, тогда как LLM-базовая линия дала 1,15, а энкодер изображений — 1,44. Это означает, что Photon-1 не просто запоминает визуальные паттерны, а формирует внутреннюю физическую модель наблюдаемого процесса.

Photon-1 также усвоил человеческие приоритеты из предобучающего видео. После RL-дообучения он научился использовать внутривиртуальный клон ChatGPT для составления артефактов и ответов на вопросы из области знаний, управляя LLM так, как это сделал бы человек.

Ознакомиться с полным техническим отчётом Induction Labs можно на их сайте, а также в анонсе на платформе X. Вся заслуга за это исследование принадлежит учёным проекта.

Микал Саттер — специалист по науке о данных со степенью магистра в области Data Science Университета Падуи. Обладая глубокими знаниями в статистическом анализе, машинном обучении и инженерии данных, Микал специализируется на превращении сложных наборов данных в практические инсайты.

По материалам MarkTechPost

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *