Skip to content

AWS предложил способ снизить расходы на токены в RAG-системах на Bedrock за счёт отсечения нерелевантного контекста

Короткий ответ

AWS опубликовал метод для Amazon Bedrock, который сжимает найденные документы до фрагментов, релевантных запросу пользователя, перед передачей их в LLM — это снижает объём токенов на запрос. Для компаний, использующих RAG-ботов поддержки или внутренний поиск, это может ощутимо снизить стоимость запроса и задержку ответа без потери качества.

Что это значит для операций

Если бот поддержки, ассистент продаж или внутренний поиск по базе знаний работает через retrieval-augmented конвейер на Bedrock (или аналогичной архитектуре), счёт за токены растёт пропорционально объёму нерелевантного контекста, который попадает в каждый промпт — длинные документы, шаблонный текст и почти дублирующиеся фрагменты, извлечённые «на всякий случай». Query-aware compression решает эту проблему, фильтруя найденные фрагменты по фактическому вопросу перед тем, как они попадут в модель — именно этот рычаг определяет, будет ли AI-ассистент команды поддержки из 20 человек стоить $200 или $2000 в месяц при масштабировании. Команды, уже эксплуатирующие RAG в продакшене, должны воспринимать это как конкретный пункт чек-листа по снижению расходов, а не как задачу на будущее — метод не требует замены модели, только добавления шага сжатия в существующий конвейер от извлечения данных до генерации ответа.

AWS Machine Learning Blog подробно описал технику снижения расходов на retrieval-augmented generation (RAG) системы, построенные на Amazon Bedrock. Подход, названный query-aware compression, фильтрует найденные фрагменты текста относительно конкретного запроса пользователя перед их отправкой в базовую языковую модель — вместо того чтобы передавать целиком найденные документы или их части как есть.

Большинство RAG-систем извлекают фиксированное количество фрагментов документов на каждый запрос и передают все их в контекстное окно модели, независимо от того, насколько этот текст релевантен вопросу. Это раздувает количество токенов на запрос — а поскольку Bedrock и большинство хостируемых LLM берут плату за токен, это напрямую увеличивает счёт. Метод AWS оценивает и обрезает найденный контент до частей, которые действительно важны для конкретного запроса, снижая количество токенов, отправляемых модели, без необходимости менять индекс поиска или базовую модель.

Это важно операционно, потому что RAG стал архитектурой по умолчанию для AI-ботов поддержки, внутреннего поиска по знаниям и ассистентов для продаж в малых и средних компаниях — систем, которые отвечают на вопросы, извлекая данные из документов компании, тикетов или мануалов продукта, а не полагаясь исключительно на обучающие данные модели. По мере масштабирования использования от пилота до полного развёртывания расходы на токены из-за раздутых контекстных окон часто становятся крупнейшей статьёй затрат, превышающей стоимость самих вызовов модели.

Для B2B-компании с 10-200 сотрудниками, уже использующей или пилотирующей RAG-инструмент поддержки или поиска на Bedrock, эта техника применима напрямую: это модификация конвейера, а не смена архитектуры, и в посте AWS есть механика, необходимая для внедрения. Компаниям, оценивающим поставщиков решений по автоматизации AI-поддержки, также стоит спрашивать, применяет ли уже конвейер извлечения поставщика сжатие или аналогичную фильтрацию — разница проявится в ежемесячном счёте, а не на демо.

В посте AWS не приведены цифры по стоимости, бенчмарки задержки или данные о внедрении помимо архитектурного описания; командам стоит считать масштаб экономии зависящим от нагрузки и неподтверждённым, пока не протестируют метод на собственном корпусе данных для извлечения.

Источник: AWS Machine Learning Blog

Следующий шаг

Visibility Analyzer

Ровно это Visibility Analyzer и меряет на живом сайте: в каких ответах вас цитируют, до каких страниц движок не дотягивается и что чинить первым. Запуск бесплатный.

Запустить бесплатный аудит видимости

Запуск бесплатный, карта не нужна.

Стоимость
Бесплатно
Срок
Один прогон, минуты

Бесплатный тариф: два анализа в день, без карты.