Новый набор ThinkingBox предлагает оценивать ИИ-агентов не по красивому финальному ответу, а по состоянию базы данных после выполнения задачи. Первые прогоны показывают: агент может завершить сценарий без ошибки и всё равно оставить систему в неправильном состоянии.
Как устроена проверка
В бенчмарке собраны 507 бизнес-сценариев с изменяемыми данными и инструментами. Каждый сценарий запускается многократно в чистом окружении, а результат проверяется по фактическим записям и побочным эффектам на стороне сервера.
Что показали прогоны
Значительная часть неудач выглядит для обычного мониторинга как успех: инструмент был вызван, агент сообщил о завершении, а финальная проверка обнаружила неверную запись или пропущенное действие. Особенно заметна разница между разовым успехом и стабильным выполнением одного и того же процесса.
Почему это меняет подход
Для поддержки, закупок, CRM и автоматизации важен не текст отчёта, а то, что реально изменилось в системе. ThinkingBox подталкивает разработчиков строить тесты вокруг инвариантов данных, отката и повторяемости, а не вокруг оценки диалога.
Вывод
Следующий этап агентных систем — измерять не красноречие модели, а последствия её действий. Такой подход особенно полезен перед подключением автономных помощников к рабочим базам и API.
