Skip to content

AWS переработала Bedrock AgentCore: меньше платы за простой и быстрый холодный старт

Короткий ответ

AWS выпустила новую версию runtime Bedrock AgentCore, которая освобождает память сразу после того, как сессия агента перестаёт её использовать, вместо оплаты пикового потребления всю сессию, и держит задержку холодного старта около 2 секунд независимо от размера контейнера - против 30 секунд у предыдущей версии.

Что это значит для операций

Если ваши агенты поддержки или продаж работают на Bedrock AgentCore, меняются два показателя, которые вы реально отслеживаете: счёт от AWS и время ожидания клиента при пробуждении простаивающего агента. Раньше долго работающий или неравномерно нагруженный агент платил за пиковую память всю сессию, а холодный старт ухудшался по мере роста образа контейнера или конкурентности - серьёзная проблема для агентов, которые большую часть дня молчат и резко активизируются в рабочие часы. Новый runtime тарифицирует ближе к фактическому использованию и держит холодный старт на уровне примерно 2 секунд независимо от размера образа, поэтому команды, запускающие несколько агентов (триаж заявок в поддержке, квалификация лидов, внутренний ассистент для операций), могут спокойно масштабировать их до нуля между запросами без прежнего штрафа по задержке, когда клиент или сотрудник обращается к холодному агенту. Это изменение инфраструктуры, а не новая возможность, но оно снижает стоимость эксплуатации именно того паттерна, который используют большинство компаний на 10-200 человек: несколько узкоспециализированных агентов, которые большую часть времени простаивают.

AWS объявила о новой версии runtime, лежащего в основе Amazon Bedrock AgentCore - управляемого вычислительного слоя, который команды используют для развёртывания и запуска AI-агентов без собственной инфраструктуры.

Изменение бьёт по двум статьям расходов, которые проявляются, когда агенты переходят от коротких чат-обменов к более длительной, часто простаивающей продуктивной работе. Первое - память: исходный runtime удерживал пиковое выделение памяти сессии до её завершения, даже после того как агент перестал её использовать, поэтому неравномерно нагруженные или долго работающие агенты платили за свой максимум всё время работы. Новый runtime стартует каждую сессию с небольшого объёма памяти и подгружает больше только по мере необходимости, освобождая память, как только сессия остывает. По данным AWS, биллинг теперь отражает это освобождённое использование, а не пик.

Второе - холодный старт: раньше запуск свежего окружения замедлялся по мере роста размера образа контейнера или конкурентности. Собственное тестирование AWS - 5000 холодных запусков на агента при пяти размерах образа, с пустым echo-агентом, не вызывающим ни модель, ни инструменты - показало, что P75-задержка холодного старта у исходного runtime росла с примерно 5,4 секунды до почти 30 секунд при увеличении размера образа. Новый runtime готовит и снимает снапшот окружения один раз, а затем восстанавливает этот снапшот для каждого нового инстанса, удерживая P75-задержку холодного старта на уровне примерно 2 секунд для образов от 200 МБ до 2 ГБ - независимо от их размера.

AWS описывает итоговый эффект как более высокую ставку за единицу, но заметно меньшее количество оплачиваемых гигабайт-часов, из-за чего для большинства агентов итоговый счёт снижается: объём памяти сокращается сильнее, чем растёт ставка.

Чтобы перейти на новый runtime, разработчикам нужно указать параметр platformVersion со значением V2 при создании или обновлении runtime. AWS также перечислила ряд функций, которые появятся позже: фиксированные базовые тарифы (резервирование минимального объёма памяти с возможностью превышения), более крупные варианты вычислительных ресурсов и хранилища, поддержка x86 microVM, приостановка и восстановление сессий со снапшотами памяти, а также ограниченная идентичность для агентов, работающих без присмотра человека, через ключи контекста сессии - призванная ограничить, что агент может делать без наблюдения человека.

Источник: AWS Machine Learning Blog

Следующий шаг

Visibility Analyzer

Ровно это Visibility Analyzer и меряет на живом сайте: в каких ответах вас цитируют, до каких страниц движок не дотягивается и что чинить первым. Запуск бесплатный.

Запустить бесплатный аудит видимости

Запуск бесплатный, карта не нужна.

Стоимость
Бесплатно
Срок
Один прогон, минуты

Бесплатный тариф: два анализа в день, без карты.