Отраслевой опрос 2026 года показал: 80,8 % инженеров работают с ИИ-агентами ежедневно, годом раньше было 47,3 %. Вместе с этим появились инструменты, которые оценивают не модель, а поведение агента в реальных сценариях — и это правильная точка приложения сил.
Ассистент недетерминирован. Он может дать верный ответ десять раз подряд и ошибиться на одиннадцатый; может «поплыть» после обновления модели или после того, как в базу знаний добавили десяток документов. Заметить это на глаз нельзя.
Достаточно 30–50 реальных вопросов с эталонными ответами и автоматического прогона после каждого изменения. Вопросы берутся не из головы, а из переписки поддержки и звонков — это те формулировки, которыми говорят настоящие клиенты.
Метрики, которые имеет смысл считать: доля верных фактов, наличие ссылки на источник, честные отказы вместо выдумки и своевременная передача разговора человеку. Отдельно стоит держать «ловушки» — вопросы не по теме и сценарий с пустой базой знаний: ассистент обязан сказать, что не знает, а не сочинить ответ.
Microsoft Research открыла Orchard — фреймворк, в котором агент сначала «живёт» в реалистичной копии рабочей среды: кликает по интерфейсам, пишет код, разбирает задачи, и только после обкатки выходит в продакшен. Агент, прогнавший сотни сценариев заранее, ошибается заметно реже.
Логика знакома любому руководителю: новичка не сажают сразу на живых клиентов. С ассистентами так же — песочница с копией CRM и базы знаний, прогон типовых и каверзных диалогов, разбор ошибок, и лишь потом релиз с постепенным расширением прав. Плюс такой обкатки в измеримости: до запуска видно, какой процент обращений агент закрывает сам и где зовёт человека.
Тест-набор мы закладываем сразу при внедрении и прогоняем перед каждым обновлением — смена модели, правка промпта, пополнение базы знаний. Результат прогона виден заказчику: сколько вопросов закрыто верно, где ассистент отказался и где передал разговор человеку.
Читайте дальше: ИИ-ассистент для бизнеса, Документация «Ассистент ПРО», Задать вопрос.