Главное
Bedrock научился кэшировать промпты — расходы на ИИ-поддержку падают в разы
AWS добавила в Amazon Bedrock кэширование промптов: приложения теперь могут переиспользовать ранее обработанные части запроса (системные инструкции, длинный контекст, примеры) вместо их повторной обработки при каждом вызове. По данным AWS, это снижает стоимость входных токенов до 90% и задержку до 85% для поддерживаемых моделей — напрямую сокращая расходы на эксплуатацию ИИ-агентов и чат-инструментов, построенных на Bedrock.
Что меняется для операций — Если ваш чат-бот поддержки, внутренний ассистент по базе знаний или помощник продаж работает на Bedrock и при каждом запросе отправляет один и тот же системный промпт или документацию по продукту — а именно так устроено большинство инструментов на основе retrieval-augmented generation, — это снижает стоимость каждого запроса и ускоряет ответы без изменения самой модели. Командам, автоматизирующим поддержку в большом объёме (сотни или тысячи обращений в день), стоит убедиться, что кэширование применяется автоматически, либо настроить его вручную: AWS отмечает, что эффект максимален, когда значительная часть промпта — например, фрагмент базы знаний или описание инструментов — остаётся неизменной от вызова к вызову. Для компании из 10-200 человек, уже оплачивающей ИИ-поддержку или продажи на Bedrock по токенам, это конкретный рычаг снижения затрат, который стоит проверить в этом квартале, а не откладывать на потом.