Новая модель для локальной работы
Компания Liquid AI представила LFM2.5-VL-3B — мультимодальную модель с открытыми весами объемом 3,1 миллиарда параметров. В отличие от крупных нейросетей, требующих мощных дата-центров, эта модель оптимизирована для работы на смартфонах, ноутбуках и одиночных графических процессорах.
Новинка стала развитием прошлогодней версии LFM2-VL-3B. Она лучше понимает содержимое экранов, точнее определяет положение объектов на изображении, способна рассуждать на основе нескольких картинок и выполнять функции вызова инструментов (function calling).
Технические особенности и обучение
В основе модели лежит визуальный кодировщик SigLIP2 от Google и архитектура, схожая с текстовой моделью LFM2.5-2.6B. При обучении использовалось около 34 триллионов токенов, а объем визуальных данных увеличился в четыре раза по сравнению с предыдущей версией.
Разработчики также расширили словарь модели до 128 000 токенов, чтобы улучшить поддержку различных языков, включая нелатинские системы письма. Процесс дообучения включал тонкую настройку и обучение с подкреплением на основе нескольких функций вознаграждения.
Улучшенные возможности
Модель показала значительный рост в ключевых задачах. В тестах на понимание интерфейсов (ScreenSpot-v2) она достигла среднего показателя 80,7 балла, что значительно выше результатов предыдущей версии. Точность определения координат объектов (RefCOCO) выросла с 57,1 до 87,9 балла благодаря использованию синтетических данных.
Также заметно улучшились навыки работы с инструментами и логика при анализе нескольких изображений. В общем наборе из 28 тестов модель набрала 69,4 балла, что приближает её к более крупным аналогам, таким как Qwen3.5-4B.
Скорость и области применения
LFM2.5-VL-3B спроектирована как модель без промежуточных рассуждений (non-reasoning), что позволяет минимизировать задержки. Это делает её идеальной для задач, требующих высокой скорости: распознавания объектов в реальном времени для автопилотов, пакетного распознавания текста (OCR) или перевода дорожных знаков на устройстве.
Скорость работы впечатляет: на Apple M5 Max модель выдает 228 токенов в секунду, а на смартфоне Galaxy S26 Ultra — 20 токенов в секунду при потреблении около 3 ГБ памяти. При этом модель не рекомендуется для сложных задач, требующих глубоких рассуждений или работы с очень длинным контекстом, например, для проектирования веб-дизайна или анализа сложных чертежей.
Что это значит
Выход LFM2.5-VL-3B расширяет возможности использования ИИ непосредственно на пользовательских устройствах, обеспечивая высокую скорость обработки визуальной информации без обращения к облачным серверам.
