Destaque
Liquid AI lança LFM2.5-DSpark com inferência até 3,2x mais rápida
A Liquid AI lançou o LFM2.5-DSpark, uma atualização que roda inferência até 3,2x mais rápido que a geração anterior LFM2.5, segundo post da empresa no Hugging Face. O ganho vem de mudanças arquiteturais que a empresa descreve, mas ainda não detalhou publicamente, mirando implantações em que velocidade de resposta e custo computacional são prioridade.
O que muda na operação — Para uma empresa B2B que roda um agente de chat com IA, um bot de triagem de tickets ou um assistente de qualificação de vendas sobre um modelo pequeno, self-hosted ou implantado em edge, uma aceleração de 3,2x na inferência se traduz em menor latência por resposta e menos horas de GPU por conversa — ou seja, contas de hospedagem mais baratas para o mesmo volume, ou a possibilidade de rodar um modelo mais capaz pelo mesmo custo. Times hoje limitados por SLAs de tempo de resposta em chat ao vivo ou suporte por voz, onde cada segundo de latência do modelo vira tempo de espera do cliente, sentem o benefício mais imediato; times que usam modelos via API hospedada de grandes fornecedores não verão mudança alguma, a menos que esses fornecedores adotem técnicas semelhantes.