Главное
Liquid AI выпустила LFM2.5-DSpark: инференс ускорен до 3,2 раза
Liquid AI выпустила LFM2.5-DSpark — обновлённую версию модели LFM2.5, которая, по данным блога компании на Hugging Face, выполняет инференс до 3,2 раза быстрее предыдущей версии. Ускорение достигнуто за счёт архитектурных изменений, которые компания описывает лишь частично, без полной публичной технической документации. Это касается развёртываний, где важны скорость отклика и стоимость вычислений.
Что меняется для операций — Для B2B-компании, которая запускает чат-бота поддержки, бота триажа тикетов или ассистента квалификации лидов на небольшой self-hosted или edge-модели, ускорение инференса в 3,2 раза означает меньшую задержку на каждый ответ и меньше GPU-часов на диалог — то есть либо снижение счетов за хостинг при том же объёме трафика, либо возможность запустить более мощную модель за те же деньги. Наибольшую выгоду получают команды, ограниченные SLA по времени отклика в live-чате или голосовой поддержке, где каждая секунда задержки модели напрямую превращается в время ожидания клиента; команды, использующие хостинговые API-модели крупных вендоров, изменений не увидят, пока (и если) эти вендоры не внедрят аналогичные техники.