Skip to content

Liquid AI выпустила компактную vision-модель для локального запуска без облачных API

Короткий ответ

Liquid AI выпустила LFM2.5-VL-3B — компактную vision-language модель, созданную для работы на edge-устройствах, а не в облаке. Она обрабатывает изображения и текст локально, обеспечивая быстрый отклик и меньшие вычислительные затраты по сравнению с обращением к облачным vision API — что полезно для любых процессов, где нужно читать документы, фото или скриншоты прямо на устройстве.

Что это значит для операций

Для компании из 10–200 человек, обрабатывающей тикеты поддержки с фотоприложениями, сканирующей счета или проверяющей фото повреждений при доставке, такая модель означает возможность выполнять эту работу на локальном или on-prem оборудовании вместо платного облачного vision API за каждый вызов — предельные расходы стремятся к нулю, и не нужно передавать фото клиентов сторонним сервисам. Команды, создающие внутренние инструменты для OCR чеков и счетов, проверки фото при контроле качества или верификации документов при онбординге, получают более компактную и дешёвую модель для самостоятельного хостинга на существующей инфраструктуре — это критично, если резидентность данных или стоимость API за транзакцию до сих пор мешали автоматизировать эти шаги. Модель не заменяет крупные облачные vision-модели для сложных рассуждений над изображениями, но закрывает разрыв для высокообъёмных простых задач визуальной классификации и извлечения данных, из которых состоит большая часть нагрузки поддержки и бэк-офиса.

Liquid AI выпустила LFM2.5-VL-3B — vision-language модель с 3 миллиардами параметров, созданную специально для развёртывания на edge-устройствах: локальных гаджетах и on-prem серверах, без необходимости обращаться к облачному API.

По данным Liquid AI, модель улучшает как скорость, так и точность на vision-language бенчмарках по сравнению с предыдущей версией, при этом сохраняя количество параметров достаточно малым для запуска на потребительском и edge-класса оборудовании. Идея простая: возможности vision-language — чтение изображений, извлечение текста и структуры из фото, ответы на вопросы о визуальном контенте — без задержек и платы за каждый вызов облачного vision API, и без передачи изображений третьей стороне.

Это имеет практическое значение везде, где у B2B-компании уже накопилась рутинная работа с изображениями в ручной очереди: тикеты поддержки с фотоприложениями (повреждённые товары, скриншоты ошибок), сканированные счета и чеки, проходящие через отдел расчётов с поставщиками, фото доставки или инспекции в полевых операциях, проверка документов и ID при онбординге клиентов. Каждая из этих задач сегодня обычно проходит либо через человека, либо через облачный vision API с оплатой за запрос. Более компактная модель, которую можно самостоятельно хостить, меняет структуру затрат на автоматизацию такой очереди — она становится фиксированной инфраструктурной статьёй расходов, а не переменной платой за транзакцию, и данные не выходят за пределы систем компании.

Обратная сторона — потолок возможностей: edge-модель с 3 млрд параметров не сравнится с крупными фронтирными мультимодальными моделями в сложных визуальных рассуждениях, многошаговом понимании документов или открытых визуальных вопросах-ответах. Она подходит для узких, высокообъёмных, повторяющихся визуальных задач — именно тех, из которых состоит большая часть нагрузки поддержки и бэк-офиса, но не тех, что требуют экспертной оценки.

Для руководителя операций или поддержки, оценивающего целесообразность автоматизации процесса, насыщенного изображениями, практические вопросы такие: сколько вызовов обработки изображений команда делает в месяц, сколько бы стоил облачный API при таком объёме, и соответствует ли сложность задачи возможностям компактной edge-модели. Там, где ответ — высокий объём и низкая сложность (OCR чеков, стандартная классификация фото, простое извлечение полей из документов), эту категорию моделей стоит опробовать перед тем, как по умолчанию выбирать более крупный и дорогой облачный vision-сервис.

Условия доступности и лицензирования для коммерческого self-hosting не были детализированы в исходном материале — их нужно уточнить у Liquid AI перед планированием развёртывания.

Источник: Hugging Face

Следующий шаг

Visibility Analyzer

Ровно это Visibility Analyzer и меряет на живом сайте: в каких ответах вас цитируют, какие страницы движок не может достать и что чинить первым. Запуск бесплатный.

Запустить бесплатный аудит видимости

Запуск бесплатный, карта не нужна.

Стоимость
Бесплатно
Срок
Один прогон, минуты

Бесплатный тариф: два анализа в день, без карты.