Destacado
Liquid AI lanza LFM2.5-DSpark con inferencia hasta 3,2 veces más rápida
Liquid AI lanzó LFM2.5-DSpark, una actualización de modelo que ejecuta inferencia hasta 3,2 veces más rápido que la generación anterior LFM2.5, según una publicación de la compañía en el blog de Hugging Face. La mejora proviene de cambios arquitectónicos que Liquid AI describe pero no ha detallado públicamente en profundidad, orientados a despliegues donde la velocidad de respuesta y el coste de cómputo son prioritarios.
Qué cambia en operaciones — Para una empresa B2B que ejecuta un agente de chat con IA, un bot de triaje de tickets o un asistente de calificación de ventas sobre un modelo pequeño, autoalojado o desplegado en el borde, una aceleración de inferencia de 3,2x se traduce en menor latencia por respuesta y menos horas de GPU por conversación, es decir, facturas de alojamiento más bajas con el mismo volumen, o la posibilidad de ejecutar un modelo más capaz al mismo coste. Los equipos actualmente limitados por SLA de tiempo de respuesta en chat en vivo o soporte por voz, donde cada segundo de latencia del modelo se traduce en tiempo de espera del cliente, obtienen el beneficio más inmediato; los equipos que usan modelos API alojados por proveedores importantes no verán ningún cambio a menos que esos proveedores adopten técnicas similares.