Совместный блог Microsoft и Hugging Face описывает новую систему оценки AI-агентов, ThinkingBox, построенную на простой идее: оценивать агента по тому, что он реально записал в базу данных, а не по тому, что он сказал в финальном ответе.
Показательный пример - агент поддержки, обрабатывающий задержку доставки. Он делает девять вызовов инструментов, корректно читает политику возврата и закрывает тикет как решённый. Но две вещи всё равно не так: исключение курьера остаётся открытым, значит тикет должен был быть переведён в режим ожидания, и клиентка так и не получила ответ на свой реальный вопрос. Оценщик, проверяющий только вызовы инструментов или финальное предложение, посчитал бы это успехом. База данных с этим не согласна.
ThinkingBox-Bench прогоняет 507 стейтфул-сценариев из розницы, автострахования, туризма, необанкинга и консалтинга, каждый повторяется 20 раз на модель против 18 проприетарных и открытых LLM, при этом каждая попытка начинается с идентичного чистого состояния базы. В общей аблации из 121 680 валидных прогонов на 12 моделях 79 853 попытки не прошли исполняемые проверки, хотя 67,24% этих провалов завершились чисто, без заявленной ошибки инструмента. Среди провалов 77,61% содержали неверные значения полей, 43,30% породили непреднамеренные побочные эффекты, а 25,36% не содержали требуемого эффекта.
Точность на одной попытке (pass@1) и устойчивость на всех 20 попытках (наблюдаемые 20/20) рассказывают совершенно разные истории. Claude Opus 5.5 лидирует по общему pass@1 с 67,16%, а Kimi-K3 - сильнейшая модель с открытыми весами с 57,37%. Но Kimi-K3 решает 93,89% задач хотя бы раз, проходя при этом только 13,41% (68 из 507) на всех попытках; Claude Opus 5 решает меньше задач хотя бы раз (79,09%), но проходит 47,53% (241 из 507) каждый раз. Более новая модель, Claude Opus 5.5, показала более высокий средний результат, чем Claude Opus 5, но прошла ровно то же количество задач (241) на всех 20 попытках, то есть прирост точности не принёс дополнительной надёжности.
Диагностическая разбивка провалов - самая практически применимая часть: 79,9% - ошибки использования инструментов, 10,3% - неверные обновления состояния, 7,0% - неполные решения запроса пользователя, и только 2,9% связаны с полным отсутствием действия, меняющего состояние. Это значит, что большинство провалов - проблема повторных попыток и восстановления, а не проблема рассуждения.
ThinkingBox уже доступен через Hugging Face и OpenEnv, сама система оценки распространяется по лицензии MIT, а данные бенчмарка - по CDLA-Permissive-2.0.