Skip to content

Bedrock научился кэшировать промпты — расходы на ИИ-поддержку падают в разы

Короткий ответ

AWS добавила в Amazon Bedrock кэширование промптов: приложения теперь могут переиспользовать ранее обработанные части запроса (системные инструкции, длинный контекст, примеры) вместо их повторной обработки при каждом вызове. По данным AWS, это снижает стоимость входных токенов до 90% и задержку до 85% для поддерживаемых моделей — напрямую сокращая расходы на эксплуатацию ИИ-агентов и чат-инструментов, построенных на Bedrock.

Что это значит для операций

Если ваш чат-бот поддержки, внутренний ассистент по базе знаний или помощник продаж работает на Bedrock и при каждом запросе отправляет один и тот же системный промпт или документацию по продукту — а именно так устроено большинство инструментов на основе retrieval-augmented generation, — это снижает стоимость каждого запроса и ускоряет ответы без изменения самой модели. Командам, автоматизирующим поддержку в большом объёме (сотни или тысячи обращений в день), стоит убедиться, что кэширование применяется автоматически, либо настроить его вручную: AWS отмечает, что эффект максимален, когда значительная часть промпта — например, фрагмент базы знаний или описание инструментов — остаётся неизменной от вызова к вызову. Для компании из 10-200 человек, уже оплачивающей ИИ-поддержку или продажи на Bedrock по токенам, это конкретный рычаг снижения затрат, который стоит проверить в этом квартале, а не откладывать на потом.

AWS запустила кэширование промптов для Amazon Bedrock — управляемого сервиса для построения генеративных ИИ-приложений на основе базовых моделей, включая Claude от Anthropic и собственные модели Amazon Titan/Nova.

Кэширование промптов позволяет приложению помечать части запроса — системную инструкцию, длинный документ, используемый как контекст, или набор описаний инструментов — как переиспользуемые. При последующих вызовах, повторяющих тот же закэшированный сегмент, Bedrock не обрабатывает этот контент заново, а обслуживает его из кэша, минуя полный цикл инференса модели.

По заявлению AWS, это может снизить стоимость входных токенов до 90% и сократить задержку до 85% для поддерживаемых моделей — в зависимости от того, какая доля промпта кэшируется и как часто она повторяется от вызова к вызову. Функция ориентирована именно на приложения с большим статичным контекстом, который переиспользуется в множестве запросов — распространённый паттерн в системах retrieval-augmented generation (RAG), ботах поддержки, обращающихся к фиксированной базе знаний, и ассистентах для написания кода, повторно использующих объёмные системные промпты.

Механика важна для всех, кто эксплуатирует ИИ в продакшене: кэширование применяется на уровне модели и обычно требует, чтобы закэшированный префикс оставался побайтово идентичным при каждом вызове. Это означает, что промпты нужно структурировать так, чтобы статичный контент (инструкции, справочные документы) шёл первым, а переменный контент (собственно запрос пользователя) — последним. В блоге AWS разобраны паттерны реализации и компромиссы между стоимостью и задержкой для разных профилей нагрузки.

Это не новая модель и не новая возможность в смысле того, что ИИ умеет делать — это оптимизация стоимости и производительности для уже существующих приложений на Bedrock. Команды, которые уже используют Bedrock для автоматизации поддержки, инструментов продаж или внутренних копилотов, могут применить это без смены модели, хотя структуру промптов, возможно, придётся скорректировать, чтобы максимизировать закэшированную часть.

Для компаний, выбирающих между Bedrock и альтернативами вроде API OpenAI или Azure AI, это частично закрывает разрыв в стоимости, который уже обеспечивали функции кэширования у конкурентов, и служит значимым аргументом при сравнении поставщиков в инфраструктурных решениях, принимаемых в этом году.

Источник: AWS Machine Learning Blog

Следующий шаг

Visibility Analyzer

Ровно это Visibility Analyzer и меряет на живом сайте: в каких ответах вас цитируют, до каких страниц движок не дотягивается и что чинить первым. Запуск бесплатный.

Запустить бесплатный аудит видимости

Запуск бесплатный, карта не нужна.

Стоимость
Бесплатно
Срок
Один прогон, минуты

Бесплатный тариф: два анализа в день, без карты.