Skip to content

AWS открыла разработчикам доступ к кастомным функциям вознаграждения для многошаговых AI-агентов

Короткий ответ

AWS опубликовала руководство по созданию кастомных функций вознаграждения для многошагового обучения с подкреплением в Amazon Nova Forge — платформе для кастомизации моделей. Теперь разработчики могут задавать критерии успеха для всего диалога или задачи целиком, а не только для отдельного ответа — это важно для всех, кто строит или оценивает AI-агентов с многоэтапными сценариями работы.

Что это значит для операций

Большинство отделов продаж, поддержки и операционных команд не занимаются обучением моделей с нуля, но многие уже используют AI-агентов для многошаговых сценариев: квалификация лида в переписке из нескольких сообщений, закрытие тикета поддержки через серию обменов репликами, выполнение внутреннего процесса в несколько этапов. Проблема, которую решает этот материал AWS, актуальна и для таких команд: проверка «хорош ли этот ответ» на уровне одного сообщения не показывает, довёл ли агент клиента до решения проблемы, соблюдал ли политику компании на всём протяжении диалога и не ходил ли по кругу. Если вы выбираете вендора или строите собственную логику агента, стоит спросить конкретно, как измеряется успех по всему взаимодействию целиком, а не по отдельным репликам — именно эту проблему и решает дизайн функций вознаграждения, и та же логика применима к тому, как вы оцениваете эффективность собственных агентов внутри компании.

AWS опубликовала техническое руководство по проектированию кастомных функций вознаграждения для многошагового обучения с подкреплением с использованием Amazon Nova Forge — платформы компании для кастомизации и дообучения моделей семейства Nova. Материал, размещённый в AWS Machine Learning Blog, описывает, как разработчики могут задавать сигналы вознаграждения, которые оценивают поведение AI-агента на протяжении всего многошагового диалога или задачи, а не отдельно взятый ответ.

Это различие принципиально, поскольку большинство настроек обучения с подкреплением исторически оптимизировались под качество одного ответа: выглядит ли эта конкретная реплика корректной, полезной, соответствующей тону бренда. Функции вознаграждения для многошаговых сценариев вместо этого оценивают агента по результатам, которые проявляются только на протяжении серии обменов репликами: пришёл ли диалог к решению проблемы, остался ли агент последователен по отношению к ранее данным обещаниям, избегал ли он лишних повторов или неоправданной эскалации. AWS представляет это как необходимое условие для обучения агентов, работающих в реалистичных, растянутых во времени взаимодействиях, а не в сценарных однократных обменах репликами.

Согласно источнику, Nova Forge теперь поддерживает описание таких функций вознаграждения в виде кастомного кода, который разработчики пишут самостоятельно и подключают к циклу обучения, получая прямой контроль над тем, к чему модель оптимизируется в рамках сессии. Это заметный отход от практики полагаться исключительно на общие модели предпочтений или разметку от людей — оба подхода дорого масштабировать до объёмов, необходимых для обучения с подкреплением, и они не всегда учитывают специфичные для конкретной сферы критерии успеха.

Практический вывод, который подчёркивает AWS: команды, разрабатывающие специализированных агентов — для клиентской поддержки, технической помощи или автоматизации задач — теперь могут закладывать собственное определение успеха напрямую в сигнал обучения. Например, агент поддержки может получать вознаграждение за закрытие тикета за меньшее число обменов репликами при соблюдении политики эскалации, а не просто за формирование правдоподобно звучащих ответов.

Эта возможность пока доступна только командам, использующим Nova Forge для кастомизации моделей на инфраструктуре AWS — это не универсальная функция, доступная во всех инструментах для обучения с подкреплением. Материал AWS не содержит независимых сравнений производительности с другими подходами к моделированию вознаграждения, поэтому любые заявления об эффективности за пределами описанного AWS следует считать неподтверждёнными. Компания также не раскрыла отдельную информацию о ценообразовании для этого рабочего процесса кастомизации функций вознаграждения помимо уже имеющейся документации по Nova Forge.

Для компаний, которые не занимаются разработкой моделей напрямую, наиболее переносимая идея — это сам подход: оценивать агентов по результату всей задачи целиком, а не по отдельным ответам. Этот принцип применим независимо от того, построен ли агент на Nova, на конкурирующей базовой модели или на внутреннем стеке автоматизации.

Источник: AWS Machine Learning Blog