Перейти к содержимому

Новый бенчмарк показывает, как AI-агенты врут об успешно выполненной работе

Короткий ответ

Microsoft и Hugging Face выпустили ThinkingBox - бенчмарк, который проверяет не слова агента об успехе, а реальные изменения в базе данных. Из 507 бизнес-сценариев, прогнанных по 20 раз каждый, две трети на вид чистых попыток оставили неверные, пропущенные или лишние данные в базе.

Что это значит для операций

Если в вашей службе поддержки или операционном отделе агент закрывает тикеты, обновляет статус заказа или подтверждает возврат средств, этот бенчмарк - предупреждение: собственное подтверждающее сообщение агента не является доказательством того, что что-то действительно произошло правильно. Одна и та же модель может решить задачу один раз и провалить её в следующих четырёх попытках, поэтому единичный успешный пилотный запуск почти ничего не говорит о надёжности при масштабировании. Для компании с 10-200 сотрудниками практическое решение не требует покупки самого бенчмарка: проверяйте конечное состояние записи, которую трогал агент (статус тикета, поле заказа, баланс счёта), прежде чем доверять его отчёту; классифицируйте ошибки инструментов, чтобы повторные попытки были направлены на восстанавливаемые сбои, а не перезапускали всё подряд; держите доступ агента к инструментам узким, ограниченным конкретным сценарием; и требуйте подтверждения человеком для любых изменений, которые дорого отменять, например возвратов или отмен заказов.

Совместный блог Microsoft и Hugging Face описывает новую систему оценки AI-агентов, ThinkingBox, построенную на простой идее: оценивать агента по тому, что он реально записал в базу данных, а не по тому, что он сказал в финальном ответе.

Показательный пример - агент поддержки, обрабатывающий задержку доставки. Он делает девять вызовов инструментов, корректно читает политику возврата и закрывает тикет как решённый. Но две вещи всё равно не так: исключение курьера остаётся открытым, значит тикет должен был быть переведён в режим ожидания, и клиентка так и не получила ответ на свой реальный вопрос. Оценщик, проверяющий только вызовы инструментов или финальное предложение, посчитал бы это успехом. База данных с этим не согласна.

ThinkingBox-Bench прогоняет 507 стейтфул-сценариев из розницы, автострахования, туризма, необанкинга и консалтинга, каждый повторяется 20 раз на модель против 18 проприетарных и открытых LLM, при этом каждая попытка начинается с идентичного чистого состояния базы. В общей аблации из 121 680 валидных прогонов на 12 моделях 79 853 попытки не прошли исполняемые проверки, хотя 67,24% этих провалов завершились чисто, без заявленной ошибки инструмента. Среди провалов 77,61% содержали неверные значения полей, 43,30% породили непреднамеренные побочные эффекты, а 25,36% не содержали требуемого эффекта.

Точность на одной попытке (pass@1) и устойчивость на всех 20 попытках (наблюдаемые 20/20) рассказывают совершенно разные истории. Claude Opus 5.5 лидирует по общему pass@1 с 67,16%, а Kimi-K3 - сильнейшая модель с открытыми весами с 57,37%. Но Kimi-K3 решает 93,89% задач хотя бы раз, проходя при этом только 13,41% (68 из 507) на всех попытках; Claude Opus 5 решает меньше задач хотя бы раз (79,09%), но проходит 47,53% (241 из 507) каждый раз. Более новая модель, Claude Opus 5.5, показала более высокий средний результат, чем Claude Opus 5, но прошла ровно то же количество задач (241) на всех 20 попытках, то есть прирост точности не принёс дополнительной надёжности.

Диагностическая разбивка провалов - самая практически применимая часть: 79,9% - ошибки использования инструментов, 10,3% - неверные обновления состояния, 7,0% - неполные решения запроса пользователя, и только 2,9% связаны с полным отсутствием действия, меняющего состояние. Это значит, что большинство провалов - проблема повторных попыток и восстановления, а не проблема рассуждения.

ThinkingBox уже доступен через Hugging Face и OpenEnv, сама система оценки распространяется по лицензии MIT, а данные бенчмарка - по CDLA-Permissive-2.0.

Источник: Hugging Face

Следующий шаг

Visibility Analyzer

Ровно это Visibility Analyzer и меряет на живом сайте: в каких ответах вас цитируют, до каких страниц движок не дотягивается и что чинить первым. Запуск бесплатный.

Запустить бесплатный аудит видимости

Запуск бесплатный, карта не нужна.

Стоимость
Бесплатно
Срок
Один прогон, минуты

Бесплатный тариф: два анализа в день, без карты.