24.08.2026

Liquid AI выпустил LFM2.5-VL-3B: 3-миллиардная визионно-языковая модель для работы на устройстве

Liquid AI

Вчера компания Liquid AI выпустила модель LFM2.5-VL-3B — это 3,1-миллиардная параметрическая модель для обработки визуальных и текстовых данных, оптимизированная для работы непосредственно на конечных устройствах пользователей. Модель способна распознавать содержимое цифровых экранов мобильных устройств, веб-страниц и десктопов, определять координаты объектов на изображениях, парсить документы и графики, а также вызывать инструменты по текстовым или визуальным запросам. По словам представителей Liquid AI, средний балл модели по 28 бенчмаркам обработки изображений составляет 69,4, что соответствует показателю 4,7-миллиардной модели InternVL-3.5-4B и всего на 0,7 балла уступает Qwen3.5-4B той же категории. Модель не использует режим рассуждений, поэтому отвечает напрямую, обеспечивая низкую задержку ответа. Она занимает примерно 3 ГБ памяти и обеспечивает декодирование 228 токенов в секунду на Apple M5 Max.

Модель готова к развёртыванию. Чекпоинт доступен в четырёх форматах: нативном, GGUF, ONNX и MLX. С дня релиза она поддерживается средами выполнения llama.cpp, MLX, vLLM, SGLang и ONNX. Объём занимаемой памяти составляет около 3 ГБ.

Лицензия LFM Open License v1.0 основана на Apache-2.0 с одним изменением: бесплатное коммерческое использование прекращается, когда годовая выручка компании превышает $10 млн. Поэтому индивидуальные разработчики, стартапы и малый бизнес с выручкой ниже этого порога могут использовать модель в коммерческих проектах без дополнительных платежей. Предприятия с выручкой выше указанной суммы должны согласовывать коммерческую лицензию напрямую с Liquid AI. Для научных, образовательных и некоммерческих проектов ограничений по выручке нет.

Сферы применения: потребительская электроника, автомобильная промышленность, промышленность и робототехника, финансовые услуги, здравоохранение и электронная коммерция. Также модель подходит для поставщиков решений по автоматизации тестирования графических интерфейсов и роботизированной автоматизации процессов.

Что нового по сравнению с предыдущей версией?

LFM2.5-VL-3B получила улучшения по четырём направлениям. В понимании экранов и пользовательских интерфейсов средний балл на тесте ScreenSpot-v2 составил 80,7 (на десктопах 78,7, мобильных устройствах 81,2, веб-интерфейсах 82,2). Для сравнения: у Gemma-4-E4B этот показатель 51,2, у Qwen3.5-4B — 78,5, а у более крупной InternVL-3.5-4B — 84,1. Поддержка вызова функций появилась в VL-линейке впервые: на тесте ToolSandbox результат вырос с 26,4 до 59,5, на BFCL v4 — с 20,5 до 32,5. Вызовы инструментов формируются в виде Python-подобных конструкций между токенами <|tool_call_start|> и <|tool_call_end|>. Точность привязки объектов к координатам на тесте RefCOCO-avg precision@1 выросла с 57,1 до 87,9 — это прирост на 30 пунктов, достигнутый за счёт масштабирования синтетических данных для обучения привязке. При работе с несколькими изображениями результат на тесте BLINK улучшился с 50,2 до 61,5, а на MuirBench — с 34,9 до 58,3.

Языковая основа модели — LFM2.5-2.6B, визуальная часть представляет собой оптимизированный энкодер SigLIP2 NaFlex объёмом 400 млн параметров, который работает с исходным разрешением изображений, разбивая большие картинки на неперекрывающиеся патчи 512×512 пикселей и добавляя уменьшенную копию всего изображения. Контекстная длина составляет 32 768 токенов, поддерживается 16 языков. Предобучение использовало примерно 34 трлн токенов, словарь был расширен до 128 тыс. токенов за счёт добавления нелатинских символов. Предобучение визуальной части было масштабировано в 4 раза по объёму токенов с использованием курированных и синтетических данных для подписей изображений, OCR, привязки объектов и следования инструкциям. Постобучение включает SFT с дистилляцией знаний от более крупной модели-учителя и обучение Antidoom, после чего следует многоцелевое Reinforcement Learning с несколькими вознаграждениями. Модель не использует режим рассуждений, что является преднамеренным выбором для обеспечения низкой задержки ответа.

При оценке на 28 визуальных бенчмарках в режиме без рассуждений с использованием vLLM 0.26.0 средний балл LFM2.5-VL-3B составил 69,4, что на равне с InternVL-3.5-4B и всего на 0,7 балла уступает Qwen3.5-4B (70,1). Оба сравнимые модели имеют 4,7 млрд параметров. Отдельные заметные результаты: RealWorldQA 73,1 против 67,7 у InternVL-3.5-4B, TextVQA 84,3 против 81,2 у Qwen3.5-4B, MMStar 63,3, MathVista-mini 68,5, ChartQA 81,3, DocVQA 91,1 и OCRBench v1 84,2. На тесте CountBenchQA наблюдается регресс до 87,3 с прошлогоднего показателя 92,2. При оценке только на текстовых данных на IFEval результат вырос с 72,9 до 82,3, хотя Gemma-4-E4B всё ещё лидирует с 87,9.

Ключевые выводы:

  • LFM2.5-VL-3B набрала средний балл 69,4 на 28 визуальных бенчмарках, что соответствует уровню моделей категории 4,7 млрд параметров.
  • Результат на ScreenSpot-v2 вырос до 80,7, а на RefCOCO-avg — до 87,9 с прошлогодних 57,1.
  • Поддержка вызова функций появилась в VL-линейке впервые: ToolSandbox вырос с 26,4 до 59,5, BFCL v4 — с 20,5 до 32,5.
  • Модель занимает около 3 ГБ памяти, обеспечивая декодирование 228 токенов в секунду на M5 Max и 20 токенов в секунду на Galaxy S26 Ultra.
  • Лицензия LFM Open License v1.0 позволяет бесплатное коммерческое использование только при годовой выручке ниже $10 млн.

По материалам MarkTechPost

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *