Microsoft и Hugging Face выпустили ThinkingBox для проверки реальных действий ИИ-агентов

Новый набор ThinkingBox предлагает оценивать ИИ-агентов не по красивому финальному ответу, а по состоянию базы данных после выполнения задачи. Первые прогоны показывают: агент может […]

Microsoft и Hugging Face выпустили ThinkingBox для проверки реальных действий ИИ-агентов

Новый набор ThinkingBox предлагает оценивать ИИ-агентов не по красивому финальному ответу, а по состоянию базы данных после выполнения задачи. Первые прогоны показывают: агент может завершить сценарий без ошибки и всё равно оставить систему в неправильном состоянии.

Как устроена проверка

В бенчмарке собраны 507 бизнес-сценариев с изменяемыми данными и инструментами. Каждый сценарий запускается многократно в чистом окружении, а результат проверяется по фактическим записям и побочным эффектам на стороне сервера.

Что показали прогоны

Значительная часть неудач выглядит для обычного мониторинга как успех: инструмент был вызван, агент сообщил о завершении, а финальная проверка обнаружила неверную запись или пропущенное действие. Особенно заметна разница между разовым успехом и стабильным выполнением одного и того же процесса.

Почему это меняет подход

Для поддержки, закупок, CRM и автоматизации важен не текст отчёта, а то, что реально изменилось в системе. ThinkingBox подталкивает разработчиков строить тесты вокруг инвариантов данных, отката и повторяемости, а не вокруг оценки диалога.

Вывод

Следующий этап агентных систем — измерять не красноречие модели, а последствия её действий. Такой подход особенно полезен перед подключением автономных помощников к рабочим базам и API.