Skip to content

Инфраструктура и цены с точки зрения операций

Всё, что мы опубликовали по теме «Инфраструктура и цены», с точки зрения операционного отдела: что это меняет для B2B-компании на 10-200 человек.

  1. Главное

    Liquid AI выпустила LFM2.5-DSpark: инференс ускорен до 3,2 раза

    Liquid AI выпустила LFM2.5-DSpark — обновлённую версию модели LFM2.5, которая, по данным блога компании на Hugging Face, выполняет инференс до 3,2 раза быстрее предыдущей версии. Ускорение достигнуто за счёт архитектурных изменений, которые компания описывает лишь частично, без полной публичной технической документации. Это касается развёртываний, где важны скорость отклика и стоимость вычислений.

    Что меняется для операцийДля B2B-компании, которая запускает чат-бота поддержки, бота триажа тикетов или ассистента квалификации лидов на небольшой self-hosted или edge-модели, ускорение инференса в 3,2 раза означает меньшую задержку на каждый ответ и меньше GPU-часов на диалог — то есть либо снижение счетов за хостинг при том же объёме трафика, либо возможность запустить более мощную модель за те же деньги. Наибольшую выгоду получают команды, ограниченные SLA по времени отклика в live-чате или голосовой поддержке, где каждая секунда задержки модели напрямую превращается в время ожидания клиента; команды, использующие хостинговые API-модели крупных вендоров, изменений не увидят, пока (и если) эти вендоры не внедрят аналогичные техники.

  1. 33 процентных пункта загрузки GPU без единой новой видеокарты — за счёт смены порядка задач

    Большинство B2B-компаний с 10-200 сотрудниками не эксплуатируют собственные GPU-кластеры, так что напрямую действовать тут некому — но это полезный аргумент, когда поставщик заявляет, что масштабирование AI-функции требует дорогостоящего апгрейда инфраструктуры. Если одно лишь перепланирование задач раскрывает 33 пункта утилизации на том же железе, стоит спросить у любого вендора, выставляющего счёт за "больше вычислений", действительно ли он сначала оптимизировал то, что уже есть. Смысл здесь не во внутренних операционных изменениях, а в переговорной позиции при закупке и скептичной проверке поставщиков — большинство читателей сами планировщик не тронут, но косвенно оплатят его через стоимость инференса или файнтюнинга.

Следующий шаг

Бесплатная диагностика

Пятнадцать минут, почта не нужна. На выходе - карта того, куда уходит работа, и порядок, в котором её стоит автоматизировать.

Пройти бесплатную диагностику

Начинается сразу в браузере.

Стоимость
Бесплатно
Срок
15 минут

Список кандидатов по порядку остаётся у вас в любом случае.