Skip to content

Инфраструктура и цены с точки зрения операций

Всё, что мы опубликовали по теме «Инфраструктура и цены», с точки зрения операционного отдела: что это меняет для B2B-компании на 10-200 человек.

  1. Главное

    Salesforce включает AI-агентов в базовые тарифы CRM без доплаты

    Salesforce анонсировала упрощённый набор Editions на 2026 год, в которых AI-агенты Agentforce и Data Cloud включены в стандартные тарифы CRM, а не продаются отдельно. Для B2B-компаний, ведущих продажи или поддержку на Salesforce, это меняет состав тарифа по умолчанию при продлении — то, за что раньше платили дополнительно, теперь либо входит в пакет, либо требует перехода на более дорогой тариф.

    Что меняется для операцийЕсли ваша компания на 10-200 сотрудников использует Sales Cloud, Service Cloud или оба продукта, эта перепаковка напрямую затронет ближайшее продление контракта: функции, за которые вы платили как за надстройки (или которые пропускали из-за цены), теперь могут быть включены в текущий тариф — либо ваш нынешний тариф вообще снимут с продажи и заменят более дорогим, включающим AI-агентов, которых вы не заказывали. Перед продлением попросите вашу команду по работе с аккаунтом сопоставить текущие расходы на надстройки с новой структурой Editions — объединение может сыграть вам на руку, если вы уже платили за Agentforce или Data Cloud отдельно, но может и вынудить на апгрейд, если новый базовый тариф больше не соответствует тому, что вы реально используете. В любом случае это событие из области биллинга и упаковки продукта, а не доказательство того, что агентный AI уже созрел для массового применения.

  1. AWS предложил способ снизить расходы на токены в RAG-системах на Bedrock за счёт отсечения нерелевантного контекста

    Если бот поддержки, ассистент продаж или внутренний поиск по базе знаний работает через retrieval-augmented конвейер на Bedrock (или аналогичной архитектуре), счёт за токены растёт пропорционально объёму нерелевантного контекста, который попадает в каждый промпт — длинные документы, шаблонный текст и почти дублирующиеся фрагменты, извлечённые «на всякий случай». Query-aware compression решает эту проблему, фильтруя найденные фрагменты по фактическому вопросу перед тем, как они попадут в модель — именно этот рычаг определяет, будет ли AI-ассистент команды поддержки из 20 человек стоить $200 или $2000 в месяц при масштабировании. Команды, уже эксплуатирующие RAG в продакшене, должны воспринимать это как конкретный пункт чек-листа по снижению расходов, а не как задачу на будущее — метод не требует замены модели, только добавления шага сжатия в существующий конвейер от извлечения данных до генерации ответа.

  1. Stripe покупает OpenRouter: что это значит для команд, чей AI-трафик идёт через сервис

    Если ваша автоматизация продаж или поддержки использует OpenRouter для переключения между GPT, Claude, Gemini или открытыми моделями по критерию цены или доступности, теперь вы зависите от инфраструктуры, принадлежащей платёжной компании, а не от независимого нейтрального маршрутизатора — стоит проверить, изменятся ли тарифные планы, лимиты запросов или условия SLA в ближайшие кварталы, и не introduce ли Stripe изменения в usage-based биллинге, влияющие на стоимость каждого запроса. Командам, у которых OpenRouter — единая точка отказа для оркестрации моделей, нужно убедиться, что есть возможность откатиться на прямые API провайдеров при изменении условий, и воспринимать эту новость как повод для аудита концентрации рисков в AI-стеке, а не как сигнал к немедленной миграции.

  2. Liquid AI выпустила LFM2.5-DSpark: инференс ускорен до 3,2 раза

    Для B2B-компании, которая запускает чат-бота поддержки, бота триажа тикетов или ассистента квалификации лидов на небольшой self-hosted или edge-модели, ускорение инференса в 3,2 раза означает меньшую задержку на каждый ответ и меньше GPU-часов на диалог — то есть либо снижение счетов за хостинг при том же объёме трафика, либо возможность запустить более мощную модель за те же деньги. Наибольшую выгоду получают команды, ограниченные SLA по времени отклика в live-чате или голосовой поддержке, где каждая секунда задержки модели напрямую превращается в время ожидания клиента; команды, использующие хостинговые API-модели крупных вендоров, изменений не увидят, пока (и если) эти вендоры не внедрят аналогичные техники.

  1. AWS запустил маршрутизацию GPT-5.6 между регионами в Bedrock

    Если ваш чат-бот поддержки, агент квалификации лидов или автоматизация операций вызывает GPT-5.6 через Amazon Bedrock, это снимает реальную операционную головную боль: нехватку мощности в одном регионе, из-за которой ответы теряются или задерживаются в часы пик. Вместо того чтобы писать и поддерживать собственную логику повторных попыток и переключения между регионами, теперь этим занимается сам Bedrock — а значит, меньше ночных звонков дежурному инженеру, когда клиентский AI-сценарий начинает упираться в лимиты. У команд с небольшим штатом (10–200 человек) почти никогда нет свободных инженерных часов на построение собственной инфраструктуры отказоустойчивости, так что перекладывание этой сложности на облачного провайдера — прямой, пусть и скромный, выигрыш в доступности любого AI-конвейера продаж или поддержки, построенного на Bedrock.

  1. 33 процентных пункта загрузки GPU без единой новой видеокарты — за счёт смены порядка задач

    Большинство B2B-компаний с 10-200 сотрудниками не эксплуатируют собственные GPU-кластеры, так что напрямую действовать тут некому — но это полезный аргумент, когда поставщик заявляет, что масштабирование AI-функции требует дорогостоящего апгрейда инфраструктуры. Если одно лишь перепланирование задач раскрывает 33 пункта утилизации на том же железе, стоит спросить у любого вендора, выставляющего счёт за "больше вычислений", действительно ли он сначала оптимизировал то, что уже есть. Смысл здесь не во внутренних операционных изменениях, а в переговорной позиции при закупке и скептичной проверке поставщиков — большинство читателей сами планировщик не тронут, но косвенно оплатят его через стоимость инференса или файнтюнинга.

  2. Солнечное затмение оставило короткий след в интернет-трафике Исландии, Испании и Португалии

    Для B2B-компании на 10–200 человек это событие не требует никаких действий. Это не инцидент безопасности, не риск по мощностям и не сбой инфраструктуры — а предсказуемый, короткий спад потребительской активности в конкретных регионах, связанный с природным явлением. Если только клиентская база не сконцентрирована в Рейкьявике, Мадриде или Лиссабоне и бизнес не зависит от трафика в реальном времени в двухчасовое окно в день затмения, менять ничего не нужно — ни график поддержки, ни мониторинг аптайма, ни сценарии автоматизации. Ценность истории скорее в другом: это наглядный пример того, насколько чисто сетевая телеметрия улавливает поведение людей в масштабе — полезный контекст, если однажды придётся объяснять клиенту необъяснимую аномалию в трафике.

  3. Nemotron 3.5 Lightning от NVIDIA стал доступен прямо в SageMaker

    Если ваша команда эксплуатации или инженеры уже работают на AWS, это событие важно не как «вышла новая модель», а как история про закупки и задержки: развёртывание в один клик внутри SageMaker JumpStart снижает издержки на интеграцию быстрой и недорогой модели в чат-боты продаж, сортировку обращений в поддержке или внутреннюю автоматизацию процессов. Для компании из 10-200 человек это разница между двухнедельным инженерным спринтом и работой на полдня, чтобы проверить, справится ли облегчённая модель с маршрутизацией тикетов или квалификацией лидов достаточно хорошо, чтобы заменить более дорогую. Оговорка: это удобство, специфичное именно для AWS, а не универсальный сдвиг возможностей — если вы не на AWS или у вас пока нет инфраструктуры для безопасного A/B-тестирования замены моделей, действовать здесь сегодня особо нечего, кроме как взять на заметку саму опцию.

  1. OpenAI обратилась к властям Техаса с письмом о «ответственном» строительстве дата-центров

    Для B2B-компании из 10-200 человек, у которой продажи и поддержка автоматизированы на моделях OpenAI, это письмо само по себе сегодня ничего не меняет операционно — это документ про размещение физической инфраструктуры в одном штате, а не про продукт, цены или изменения в API. Косвенная связь всё же есть: продолжающееся строительство дата-центров в Техасе и похожих штатах — часть той самой экспансии мощностей, которая определяет доступность моделей и, со временем, динамику стоимости обращений к API. Операторам стоит воспринимать это как фоновый контекст, а не как пункт для немедленных действий — новых инструментов, квот или лимитов, на которые нужно реагировать, здесь нет. Единственное, за чем стоит понаблюдать, пока без подтверждения — не начнут ли подобные соглашения на уровне штатов проявляться в коммуникациях вендора про региональное размещение данных или оптимизированные по задержке эндпоинты: это уже напрямую затронуло бы чувствительные к комплаенсу рабочие процессы поддержки и операций.

Следующий шаг

Бесплатная диагностика

Пятнадцать минут, почта не нужна. На выходе - карта того, куда уходит работа, и порядок, в котором её стоит автоматизировать.

Пройти бесплатную диагностику

Начинается сразу в браузере.

Стоимость
Бесплатно
Срок
15 минут

Список кандидатов по порядку остаётся у вас в любом случае.