Skip to content

Liquid AI lança modelo de visão compacto que dispensa APIs na nuvem

Resposta curta

A Liquid AI lançou o LFM2.5-VL-3B, um modelo compacto de visão e linguagem feito para rodar em hardware de borda em vez de servidores na nuvem. Ele processa imagens e texto localmente, com respostas mais rápidas e custo computacional menor do que enviar requisições a APIs de visão hospedadas — útil para qualquer fluxo que precise ler documentos, fotos ou capturas de tela diretamente no dispositivo.

O que isso significa na operação

Para uma empresa de 10 a 200 pessoas que lida com tickets de suporte com fotos anexadas, processa notas fiscais digitalizadas ou verifica imagens de avarias em entregas, esse tipo de modelo significa que esse trabalho pode rodar em hardware local ou on-premise em vez de depender de uma API de visão na nuvem cobrada por chamada — reduzindo o custo marginal a quase zero e eliminando a necessidade de enviar imagens de clientes a terceiros. Times que constroem ferramentas internas para OCR de recibos e notas fiscais, revisão fotográfica de controle de qualidade ou verificação de identidade em fluxos de onboarding passam a ter um modelo menor e mais barato para hospedar dentro da própria infraestrutura, o que importa quando residência de dados ou custo por transação de API tem sido um obstáculo para automatizar essas etapas. Ele não substitui modelos de visão maiores na nuvem para raciocínio complexo sobre imagens, mas fecha a lacuna para tarefas simples de classificação e extração visual de alto volume, que compõem a maior parte das cargas de trabalho de imagem em suporte e back-office.

A Liquid AI lançou o LFM2.5-VL-3B, um modelo de visão e linguagem com 3 bilhões de parâmetros construído especificamente para implantação em dispositivos de borda — rodando em equipamentos locais e servidores on-premise, em vez de exigir chamadas a uma API de nuvem hospedada.

Segundo a Liquid AI, o modelo melhora tanto a velocidade quanto a precisão em benchmarks de visão e linguagem em comparação com seu antecessor, mantendo uma contagem de parâmetros pequena o suficiente para rodar em hardware de consumo e de borda. A proposta é direta: capacidade de visão e linguagem — ler imagens, extrair texto e estrutura de fotos, responder perguntas sobre conteúdo visual — sem a latência ou o custo por chamada de uma API de visão na nuvem, e sem enviar imagens a terceiros.

Isso importa operacionalmente onde quer que uma empresa B2B já tenha trabalho recorrente de processamento de imagens parado em uma fila manual: tickets de suporte com fotos anexadas (produtos danificados, capturas de tela de erros), notas fiscais e recibos digitalizados encaminhados para o financeiro, fotos de entrega ou inspeção em operações de campo, ou verificações de identidade e documentos durante o onboarding de clientes. Cada uma dessas tarefas hoje geralmente passa por uma pessoa ou por uma API de visão na nuvem cobrada por requisição. Um modelo menor e autohospedável muda a estrutura de custo de automatizar essa fila — ela passa a ser um custo fixo de infraestrutura, em vez de uma taxa variável por transação, e os dados nunca saem dos sistemas próprios da empresa.

A contrapartida é o teto de capacidade: um modelo de borda de 3B não vai igualar grandes modelos multimodais de ponta em raciocínio visual complexo, compreensão de documentos em múltiplas etapas ou perguntas e respostas visuais abertas. Ele é adequado a tarefas visuais mais restritas, de alto volume e repetitivas — exatamente o tipo que compõe a maior parte das cargas de trabalho de imagem em suporte e back-office, mas não o tipo que exige julgamento.

Para um líder de operações ou suporte avaliando se vale automatizar um processo intensivo em imagens, as perguntas práticas que isso levanta são: quantas chamadas de processamento de imagem a equipe faz por mês, quanto custaria uma API de nuvem nesse volume, e se a complexidade da tarefa se encaixa no que um modelo compacto de borda realmente consegue lidar. Onde a resposta for alto volume e baixa complexidade — OCR de recibos, classificação fotográfica padrão, extração simples de campos em documentos — essa classe de modelo vale a pena pilotar antes de recorrer por padrão a um serviço de visão na nuvem maior e mais caro.

Os termos de disponibilidade e licenciamento para autohospedagem comercial não foram detalhados no material-fonte e devem ser confirmados com a Liquid AI antes do planejamento de implantação.

Fonte: Hugging Face

Próximo passo

Visibility Analyzer

É isto que o Visibility Analyzer mede num site real: quais respostas citam você, quais páginas o motor não consegue recuperar e o que corrigir primeiro. Rodar é grátis.

Rodar uma auditoria de visibilidade grátis

Rodar é grátis. Sem cartão.

Preço
Grátis
Duração
Uma rodada, minutos

Plano grátis: duas análises por dia, sem cartão.