Liquid AI выпустила LFM2.5-VL-3B — vision-language модель с 3 миллиардами параметров, созданную специально для развёртывания на edge-устройствах: локальных гаджетах и on-prem серверах, без необходимости обращаться к облачному API.
По данным Liquid AI, модель улучшает как скорость, так и точность на vision-language бенчмарках по сравнению с предыдущей версией, при этом сохраняя количество параметров достаточно малым для запуска на потребительском и edge-класса оборудовании. Идея простая: возможности vision-language — чтение изображений, извлечение текста и структуры из фото, ответы на вопросы о визуальном контенте — без задержек и платы за каждый вызов облачного vision API, и без передачи изображений третьей стороне.
Это имеет практическое значение везде, где у B2B-компании уже накопилась рутинная работа с изображениями в ручной очереди: тикеты поддержки с фотоприложениями (повреждённые товары, скриншоты ошибок), сканированные счета и чеки, проходящие через отдел расчётов с поставщиками, фото доставки или инспекции в полевых операциях, проверка документов и ID при онбординге клиентов. Каждая из этих задач сегодня обычно проходит либо через человека, либо через облачный vision API с оплатой за запрос. Более компактная модель, которую можно самостоятельно хостить, меняет структуру затрат на автоматизацию такой очереди — она становится фиксированной инфраструктурной статьёй расходов, а не переменной платой за транзакцию, и данные не выходят за пределы систем компании.
Обратная сторона — потолок возможностей: edge-модель с 3 млрд параметров не сравнится с крупными фронтирными мультимодальными моделями в сложных визуальных рассуждениях, многошаговом понимании документов или открытых визуальных вопросах-ответах. Она подходит для узких, высокообъёмных, повторяющихся визуальных задач — именно тех, из которых состоит большая часть нагрузки поддержки и бэк-офиса, но не тех, что требуют экспертной оценки.
Для руководителя операций или поддержки, оценивающего целесообразность автоматизации процесса, насыщенного изображениями, практические вопросы такие: сколько вызовов обработки изображений команда делает в месяц, сколько бы стоил облачный API при таком объёме, и соответствует ли сложность задачи возможностям компактной edge-модели. Там, где ответ — высокий объём и низкая сложность (OCR чеков, стандартная классификация фото, простое извлечение полей из документов), эту категорию моделей стоит опробовать перед тем, как по умолчанию выбирать более крупный и дорогой облачный vision-сервис.
Условия доступности и лицензирования для коммерческого self-hosting не были детализированы в исходном материале — их нужно уточнить у Liquid AI перед планированием развёртывания.