AWS запустила кэширование промптов для Amazon Bedrock — управляемого сервиса для построения генеративных ИИ-приложений на основе базовых моделей, включая Claude от Anthropic и собственные модели Amazon Titan/Nova.
Кэширование промптов позволяет приложению помечать части запроса — системную инструкцию, длинный документ, используемый как контекст, или набор описаний инструментов — как переиспользуемые. При последующих вызовах, повторяющих тот же закэшированный сегмент, Bedrock не обрабатывает этот контент заново, а обслуживает его из кэша, минуя полный цикл инференса модели.
По заявлению AWS, это может снизить стоимость входных токенов до 90% и сократить задержку до 85% для поддерживаемых моделей — в зависимости от того, какая доля промпта кэшируется и как часто она повторяется от вызова к вызову. Функция ориентирована именно на приложения с большим статичным контекстом, который переиспользуется в множестве запросов — распространённый паттерн в системах retrieval-augmented generation (RAG), ботах поддержки, обращающихся к фиксированной базе знаний, и ассистентах для написания кода, повторно использующих объёмные системные промпты.
Механика важна для всех, кто эксплуатирует ИИ в продакшене: кэширование применяется на уровне модели и обычно требует, чтобы закэшированный префикс оставался побайтово идентичным при каждом вызове. Это означает, что промпты нужно структурировать так, чтобы статичный контент (инструкции, справочные документы) шёл первым, а переменный контент (собственно запрос пользователя) — последним. В блоге AWS разобраны паттерны реализации и компромиссы между стоимостью и задержкой для разных профилей нагрузки.
Это не новая модель и не новая возможность в смысле того, что ИИ умеет делать — это оптимизация стоимости и производительности для уже существующих приложений на Bedrock. Команды, которые уже используют Bedrock для автоматизации поддержки, инструментов продаж или внутренних копилотов, могут применить это без смены модели, хотя структуру промптов, возможно, придётся скорректировать, чтобы максимизировать закэшированную часть.
Для компаний, выбирающих между Bedrock и альтернативами вроде API OpenAI или Azure AI, это частично закрывает разрыв в стоимости, который уже обеспечивали функции кэширования у конкурентов, и служит значимым аргументом при сравнении поставщиков в инфраструктурных решениях, принимаемых в этом году.