24.08.2026

LFM2.5-2.6B: компактная агентная ИИ-модель, которая работает на ваших устройствах

b29_1

Разработчики сегодня решают сложную задачу: как сделать агентные модели ИИ достаточно компактными и быстрыми, чтобы они работали не в облаке, а прямо на устройствах пользователей. Компания Liquid AI представила новую версию своей фирменной модели — LFM2.5-2.6B, которая спроектирована именно для таких сценариев. В этой статье мы разберём, как она устроена, насколько быстро работает и как её можно использовать в собственных приложениях.

LFM2.5-2.6B создана для того, чтобы обеспечивать работу полноценных агентов целиком на устройстве пользователя. Модель поддерживает вызов инструментов (tool calling) и многошаговые рабочие процессы, оставаясь при этом достаточно компактной и быстрой для повседневного «железа» — от ноутбуков до смартфонов. Для разработчиков это открывает три ключевых преимущества: возможность разворачивать агентов повсюду, сохранять конфиденциальность данных (они не покидают устройство) и масштабировать использование без постоянных расходов на облачный вывод.

LFM2.5-2.6B предобучена примерно на 34 триллионах токенов, при этом промежуточная фаза обучения расширяет контекстное окно до 128 тысяч токенов. Постобучение превращает базовую модель в полноценного агента в четыре этапа. Такой подход позволяет заложить агентные способности непосредственно на этапе тренировки, а не «нанизывать» их поверх отдельными обёртками.

Ключевая особенность архитектуры — конвейер агентного обучения с подкреплением (Agentic RL pipeline), который разделяет оптимизацию модели, инференс и выполнение в среде на отдельные компоненты. Движок обучения (Training Engine) оптимизирует модель, тогда как движок развёртывания (Rollout Engine) генерирует действия, опираясь на актуальную политику. RL-фреймворк координирует весь цикл: запускает прогоны, собирает траектории и награды и обновляет модель.

Действия агента выполняются внутри сервиса-песочницы (Sandbox Service), где среда Blackbox Harness размещает самого агента — например, OpenClaw или Hermes Agent — и координирует его взаимодействие с задачей. Прокси оболочки (Harness Proxy) позволяет рассматривать агентные оболочки как «чёрные ящики» без модификации, прозрачно захватывая траектории на уровне токенов, необходимые для реконструкции и проверки тренировочных примеров RL.

Разработчики Liquid AI сравнили LFM2.5-2.6B с моделями, которые до четырёх раз крупнее её по размеру, оценивая их на задачах STEM, следования инструкциям, использования инструментов и агентных сценариях. LFM2.5-2.6B — самая маленькая модель в группе, однако она уверенно конкурирует и нередко побеждает более крупных соперников. Для своих приложений особенно стоит отметить два сильных направления — следование инструкциям и работу с инструментами.

LFM2.5-2.6B занимает верхнюю строчку во всех протестированных бенчмарках на следование инструкциям и во всех бенчмарках использования инструментов, за исключением BFCLv4, где её лишь немного обгоняет 9.7-миллиардная модель Qwen. На агентных задачах она обходит обе модели Gemma и держится на одном уровне с линейкой Qwen. Модель также лидирует по «знаниям» и близка к лучшим по математике. Программирование — единственная область, где более крупные модели сохраняют явный отрыв, поэтому для задач написания кода стоит выбрать модель побольше.

LFM2.5-2.6B поставляется с поддержкой с первого дня во всей экосистеме инференса — включая llama.cpp, MLX, vLLM, SGLang и ONNX. Это означает, что разработчики могут интегрировать модель в привычные инструменты без долгой адаптации.

Скорость стала одним из главных козырей модели. Благодаря эффективной архитектуре LFM2, на CPU — это самая быстрая модель из протестированных: скорость декодирования достигает 220 токенов в секунду на M5 Max и 113 токенов в секунду на Ryzen AI Max+ 395. Даже скромные 30 токенов в секунду позволяют запускать полноценных агентов прямо на смартфоне.

На GPU LFM2.5-2.6B также показывает лучшую скорость в своём классе: почти 15 тысяч выходных токенов в секунду при высокой конкурентности — это примерно 1.3 миллиарда токенов в день на одном ускорителе H100. Такая вычислительная эффективность делает модель привлекательной как для edge-сценариев, так и для высоконагруженных серверных развёртываний.

Чтобы оценить модель в действии, разработчики выпустили браузерную демо-версию, в которой LFM2.5-2.6B работает как исследовательский агент: помогает находить ответы на конкретные вопросы и формирует сводку результатов. Это удобный способ проверить возможности модели ещё до начала интеграции в собственный продукт.

По материалам Hugging Face

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *