Контроль качества ИИ-агентов: как проверить бота и менеджера

Контроль качества ИИ-агентов: единый чек-лист для голосового робота и менеджера

У голосового робота в отделе продаж теперь есть собственный отдел контроля качества. У живого менеджера, который закрывает сделку, — по-прежнему нет. 25 августа 2026 года американская компания 3CLogic вывела в общий доступ AI Agent Evaluator — движок, который автоматически оценивает диалоги голосовых ИИ-агентов. Не операторов. Роботов. Ещё весной это была лишь строка в роадмапе, а теперь — продукт, за который платят деньги. То есть контроль качества ИИ-агентов перестал быть галочкой внутри платформы и стал отдельным товаром. Если бот уже квалифицирует ваши лиды, подтверждает заявки и прозванивает базу, стоит остановиться и спросить: кто и по каким критериям проверял, что он там наговорил? Разбираем, что случилось за лето 2026 года, почему зелёный дашборд вендора ничего не доказывает и какие восемь критериев стоит применить к любому разговору с клиентом.

Содержание
  1. Что произошло 25 августа: у роботов появился собственный ОКК
  2. Почему это не единичный релиз: лето 2026 и российский контекст
  3. Август 2026: пять релизов за три недели
  4. MANGO OFFICE и «Гравител»: чем закончилась августовская волна
  5. Тренд начался раньше: Microsoft свёл контроль качества ИИ-агентов и людей
  6. Российский спрос: подключения речевой аналитики растут
  7. Главная подмена: «звонок завершён» — это не «вопрос решён»
  8. «Сказал» не равно «сделал»: почему транскрипта недостаточно
  9. Мнение эксперта: контроль начинается не с ИИ, а с критериев
  10. Где именно ломается воронка: стык «бот → менеджер»
  11. Восемь критериев, по которым можно оценить любой разговор с клиентом
  12. Критерии 1–4: контакт, потребность, квалификация, возражения
  13. Критерии 5–8: условия, следующий шаг, факт и передача
  14. Как пользоваться таблицей и чем оценивать разговоры
  15. Шкала зрелости: на каком уровне контроль качества в вашем отделе
  16. Частые вопросы про контроль качества ИИ-агентов
  17. Контроль качества ИИ-агентов: что это и по каким метрикам оценивать бота
  18. Deflection rate и единый чек-лист для робота и человека
  19. Где теряется лид: на боте или на менеджере
  20. Что делать на этой неделе

Что произошло 25 августа: у роботов появился собственный ОКК

3CLogic вывела в общий доступ AI Agent Evaluator — инструмент автоматического QA и скоринга голосовых ИИ-агентов, встроенный в её платформу Voice AI Hub. В пресс-релизе на PR Newswire формулировка предельно сухая: «AI Evaluations is now generally available to all Voice AI Hub customers».

Что именно делает движок. Он разбирает 100% диалогов ИИ-агента по настраиваемым метрикам: решён ли вопрос клиента (resolution), достигнута ли цель разговора (goal completion), какого качества был ответ. Оценку система выставляет по шкале от 0 до 10, так что разные диалоги сразу сопоставимы.

Дальше начинается самое интересное для практика. Каждую оценку система объясняет обычным языком, так что руководителю не нужно вычитывать транскрипт. Не «чёрный ящик», а аудируемая оценка: её можно прочитать, проверить и оспорить.

Кроме того, критерии настраиваются под роль агента. Например, бот для IT-поддержки и бот для биллинга отвечают на разные наборы вопросов. История оценок привязана к версии агента, так что после правки промпта видно, стало лучше или хуже. Отдельная деталь: система проверяет, что нужное действие реально выполнено в системе — кейс создан, тикет обновлён, — а не полагается только на слова в транскрипте.

Anshuman Rawat, технический директор (CTO) 3CLogic: «Развернуть голосового ИИ-агента относительно легко. Настоящая сложность — понять, действительно ли он решает вопросы клиента или просто уводит его от живого оператора так, что клиент остаётся доволен».

Две честные оговорки. Во-первых, функцию заявили в роадмапе ещё 28 апреля 2026 года, так что корректно говорить «вывела в общий доступ», а не «впервые представила». Во-вторых, 3CLogic — американский вендор контакт-центров для ServiceNow, и в России его продукт не продаётся.

Так что дело не в платформе, а в прецеденте: контроль качества ИИ-агентов оформился в отдельную позицию прайса. Итак, кто-то посчитал, что за это будут платить. И, судя по остальным релизам лета, посчитал не он один.

Почему это не единичный релиз: лето 2026 и российский контекст

Один релиз — это ещё не тренд. Однако за три недели августа контроль качества ИИ-агентов оформили в продукт сразу несколько вендоров, причём и в России тоже.

Август 2026: пять релизов за три недели

10 августа BSS выпустила «Речевую аналитику» 2.15. В релизе — автономный Инсайт-агент: он сам анализирует коллекции записей по расписанию, находит паттерны и аномалии, формирует инсайты и рассылает отчёты. Кроме того, появился RAG-контроль качества, то есть семантическая проверка разговора по корпоративной базе знаний. К тому же в релизе появился Агент-Тренер с многоуровневой системой оценивания и обоснованием результата. Подробности — в материале ComNews про релиз 2.15.

Анна Ивлева, владелец продукта «Речевая Аналитика» департамента голосовых цифровых технологий компании BSS: «В версии 2.15 мы фактически стерли грань между аналитическим инструментом и цифровым сотрудником».

Это лучший диагноз всему тренду. Инструмент, который вчера показывал руководителю графики, сегодня сам ходит по записям и приносит выводы. А если это сотрудник, у него появляется и то, что бывает у сотрудников: качество работы, которое надо мерить.

13 августа AssistRing запустила набор ARIS из четырёх продуктов, где модуль Sage оценивает 100% диалогов по скоркарте заказчика. Причем претензию к отрасли компания сформулировала резче всех.

Arsalan Kamran, CEO and Co-Founder AssistRing (перевод): «Любой BPO в мире скажет вам, что заботится о качестве, а потом покажет отчёт, построенный на двух процентах звонков».

Цифра тут не случайная. По отраслевым оценкам, при ручном контроле качества прослушивают всего 1–3% разговоров, и эту цифру приводят сами поставщики QA-решений. Однако независимого исследования с методологией за ней не стоит, так что относиться к ней стоит как к оценке рынка о самом себе. К теме выборки мы больше не возвращаемся: сегодня разговор не про неё.

MANGO OFFICE и «Гравител»: чем закончилась августовская волна

17 августа MANGO OFFICE расширил «ИИ Тематики» в «Речевой аналитике»: теперь они работают не только со звонками, но и с перепиской. Сценарий задаётся смыслом сказанного, так что вручную собирать словари ключевых слов и синонимов не нужно. 18 августа «Гравител» сообщил, что его речевая аналитика на связке Yandex SpeechSense и YandexGPT научилась помечать разговоры с признаками конфликта: большое число перебиваний, резкое смещение баланса реплик, ключевые слова. В итоге ряд замыкает 3CLogic 25 августа.

Тренд начался раньше: Microsoft свёл контроль качества ИИ-агентов и людей

Ещё в апреле 2026 года Microsoft сделала общедоступным Quality Assurance agent в Dynamics 365 Contact Center. Он оценивает и диалоги ИИ-агента Customer Assist, и разговоры живых операторов: в реальном времени и после разговора, по эмпатии, тону и критериям, которые задаёт сам бизнес. Затем, в конце июня, туда же добавили коучинг в реальном времени.

Обратите внимание на главное в этой конструкции. Microsoft изначально не стала разделять контроль качества ИИ-агентов и контроль качества операторов, то есть один агент смотрит и туда, и туда. По сути, это и есть рамка, к которой рынок постепенно приходит. Кстати, голосовые AI-агенты и раньше ставили перед компаниями вопрос о границе между роботом и человеком — теперь он стал управленческим.

Аналитики зафиксировали направление раньше вендоров. В июне 2025 года Gartner выделил отдельную категорию — guardian agents: ИИ, который следит за надёжностью и безопасностью работы другого ИИ и при необходимости блокирует или перенаправляет его действия. По прогнозу аналитиков, к 2030 году на эти технологии придётся 10–15% рынка агентного ИИ.

Российский спрос: подключения речевой аналитики растут

Спрос в России движется туда же. По данным провайдера «Телфин», по итогам первого полугодия 2026 года число подключений сервисов анализа речи среди его клиентов выросло на 52%. Это быстрее, чем у любой другой категории его сервисов: виртуальные номера +46%, АТС «Телфин.Офис» +44%, интеграция с CRM +21%. Пока рынок за одно лето собрал скоркарты для роботов, полезно проверить, как выглядит скоркарта для обычного звонка.

Бесплатный инструмент
Посмотрите, как устроен чек-лист оценки звонка

20 критериев и система баллов — примерно те же вопросы, которые вендоры сейчас зашивают в скоркарты. Заполните на своём разговоре за 5 минут.

Открыть чек-лист →

Главная подмена: «звонок завершён» — это не «вопрос решён»

Но прежде чем строить контроль качества ИИ-агентов у себя, стоит разобраться, почему привычные метрики из кабинета вендора на нужные вопросы не отвечают. Откройте дашборд любого голосового бота: доля автоматизации, deflection rate, containment rate, средняя длительность диалога. На самом деле все четыре показателя измеряют одно — насколько робот разгрузил живых людей.

Метрики голосового ИИ-агента в дашборде вендора и реальный результат в воронке продаж

Однако ни один из них не говорит, продвинулся ли клиент к сделке. Это не злой умысел, а встроенная в продукт оптика: вендор продаёт экономию на операторах и меряет ровно её. Странно ждать от счётчика экономии ответа про выручку.

Отсюда главная подмена. Формулировка «диалог закрыт без эскалации» одинаково описывает и «вопрос решён», и «клиент бросил трубку от бессилия». По дашборду эти два события неразличимы, хотя для воронки они противоположны.

Как это выглядит в продажах: бот прозвонил базу, поставил в карточке «клиенту не интересно» и закрыл лид. Однако в расшифровке того же разговора клиент говорит: «Сейчас неудобно, перезвоните после 15-го». Формально диалог завершён без эскалации, метрика зелёная. Фактически из воронки выпал живой лид, и заметить это некому.

Дальше работает закон Гудхарта: как только метрика становится целью, она перестаёт быть хорошей метрикой. Если робота «премируют» за долю закрытых без эскалации диалогов, вы награждаете его за умение не отдавать клиента человеку.

Цена вопроса: по прогнозу Gartner от июня 2025 года, более 40% проектов агентного ИИ будут свёрнуты до конца 2027 года. Среди причин аналитики называют не только издержки и неясную бизнес-ценность, но и недостаточный контроль рисков. Так что августовские релизы закрывают как раз эту дыру.

Там же Gartner описывает «agent washing»: из тысяч вендоров, заявляющих агентный ИИ, настоящие агентные продукты, по его оценке, есть примерно у 130. Это второй аргумент в пользу собственных критериев. Если вы не умеете проверять результат сами, вы покупаете обещание вместе с ярлыком. Впрочем, риски ИИ-агентов — тема отдельного разговора.

«Сказал» не равно «сделал»: почему транскрипта недостаточно

Вернёмся к самой недооценённой функции AI Agent Evaluator. Система отдельно проверяет, что требуемое действие реально выполнено в системе — кейс создан, тикет обновлён, — а не опирается только на слова в транскрипте.

Для робота это критично. Бот может уверенно проговорить «я оформил вашу заявку», хотя заявка не создалась. В результате клиент услышал обещание компании и будет ждать. При этом никакой ошибки в диалоге не видно: текст безупречный.

Теперь честно перенесите это на живых менеджеров. Ровно та же дыра есть в любом отделе продаж, только там её никто не называет проблемой качества. Менеджер сказал «сегодня пришлю коммерческое» — письмо ушло? Сказал «поставил встречу на четверг» — задача в CRM появилась?

Проверка по записи разговора покажет обещание, а проверка по CRM покажет факт. То есть настоящий критерий качества — это совпадение двух проверок, а не каждая из них по отдельности.

Отдельная категория рисков — обещания сверх регламента: скидка, срок или условие, которых в компании нет. У робота это называют галлюцинацией, у менеджера — самодеятельностью. Последствия одинаковые: конфликт с клиентом, возврат, иногда юридический спор.

Отсюда простое правило, на котором держится любой контроль качества ИИ-агентов и людей. Проверить можно только то, после чего остался артефакт: запись, карточка, задача, отправленное письмо.

Мнение эксперта: контроль начинается не с ИИ, а с критериев

Мы спросили эксперта по систематизации бизнеса, с чего начинается контроль качества ИИ-агентов и живых сотрудников, если подходить к обеим линиям одинаково. Ответ оказался заметно менее технологичным, чем августовские пресс-релизы.

Павел Котов
Эксперт по систематизации бизнеса
Задать вопрос
Контроль качества начинается не с инструмента, а с трёх вещей: регламента, чётких критериев и артефактов. Критерии должны быть объективными и не допускать двойного толкования — иначе оценка превращается в спор о вкусах. А без артефактов контроля вообще не существует: «Без артефактов нет никакого контроля качества. Прежде чем контролировать, нужно хорошо продумать артефакты». Разница между роботом и менеджером здесь чисто техническая. Артефакт у обоих один и тот же — след выполненной работы: запись разговора, карточка в CRM, отправленное письмо, созданная задача. Если этого следа нет, проверять нечего, и никакая нейросеть ситуацию не спасёт. И главное, что часто забывают: «ОКК — это не карательный орган. Его функция — помогать и вам как собственнику, чтобы вы видели ситуацию, и помогать сотрудникам, давая им информацию о том, где у них есть проблемные части». Контроль без обратной связи бессмысленен — и для человека, и для версии бота.

Где именно ломается воронка: стык «бот → менеджер»

В отделе продаж появились два сотрудника разной природы. Робот работает на первой линии: квалифицирует лид, подтверждает заявку, реактивирует базу, напоминает о встрече. Менеджер, в свою очередь, работает на второй линии — там, где деньги.

Передача лида от голосового ИИ-агента менеджеру — главная точка потери в воронке

Однако контроль качества ИИ-агентов и контроль менеджеров живут в разных системах координат: робота меряют техническими метриками вендора, менеджера — чек-листом РОПа, если этот чек-лист вообще существует. Общего знаменателя нет.

Следствие вылезает в первый же плохой месяц. Конверсия упала — и никто не отвечает на элементарный вопрос: сделки теряются на роботе или на человеке? Бот привёл нецелевые лиды или менеджер не дожал хорошие? Без сопоставимых оценок это спор двух мнений.

Между тем точка стыка — самое дорогое место воронки. Бот обязан выяснить и передать четыре вещи: задачу клиента его собственными словами, три-пять квалификационных признаков, договорённость о времени контакта и контактные данные. Менеджер, в свою очередь, обязан этот контекст использовать, а не переспрашивать всё заново.

Типовой сценарий: бот выяснил задачу, договорился о звонке в 15:00 и передал лид. Однако менеджер начинает разговор с «расскажите, что вас интересует», и клиент раздражённо повторяет то, что уже говорил десять минут назад. Формально оба «отработали». Фактически компания потратила два контакта на один и выглядит несобранной.

Масштаб проблемы виден по данным McKinsey. В отчёте The State of AI in 2025 (ноябрь 2025 года, опрос 1 993 респондентов примерно из 105 стран) 62% респондентов говорят, что их организации как минимум экспериментируют с ИИ-агентами, и лишь 23% масштабируют агентные системы где-то внутри компании. Разрыв объясняется просто: пилот можно оценить на глаз, промышленную эксплуатацию — нельзя.

Остаётся организационный вопрос, который почти никто не задаёт вслух. Чей это чек-лист — РОПа, отдела контроля качества или разработчика бота? Когда критерий провален, кто его чинит? Чаще всего никто, потому что зона ответственности не назначена, а контроль качества ИИ-агентов формально не принадлежит ни одному подразделению.

Восемь критериев, по которым можно оценить любой разговор с клиентом

Контроль качества ИИ-агентов и контроль менеджеров действительно расходятся в метриках. А вот вопросы к диалогу — одни и те же. Ниже восемь критериев, которые работают на любом коммерческом разговоре, потому что описывают не технологию, а движение клиента к сделке.

Критерии 1–4: контакт, потребность, квалификация, возражения

КритерийЧто проверяемКак выглядит провалПочему это стоит денег
1. Цель звонка — в первую минутуПоздоровался, представился, назвал компанию и повод обращенияКлиент 40 секунд гадает, кто звонит и зачемДальше весь разговор идёт как торг за внимание
2. Потребность выясняем, а не предполагаемЗадал вопросы про задачу и ситуацию клиента, ответы записалСразу зачитал оффер по шаблонуПредложение не попадает в реальную задачу — отказ «дорого» вместо разговора
3. Квалификация — по вашим критериямСобрал 3–5 признаков, по которым лид считается целевымВ карточке «вроде интересно» без данныхМенеджер тратит час на нецелевого, целевой ждёт
4. Возражение отрабатывают, а не глушатВозражение прозвучало, на него ответили по существу«Я вас понял» и смена темыКлиент уходит с невыясненным сомнением

Критерии 5–8: условия, следующий шаг, факт и передача

КритерийЧто проверяемКак выглядит провалПочему это стоит денег
5. Условия называют честноПроговорил цену или вилку, сроки и ограничения; ничего не пообещал сверх регламентаПообещал скидку или срок, которых нетУ робота это галлюцинация, у человека — самодеятельность; итог один: конфликт и возврат
6. Следующий шаг — с датой и временемНазвал дату, время, формат и того, кто инициирует контакт«Мы с вами свяжемся»Лид повисает в воронке без даты и умирает
7. Обещание превращается в действиеКП ушло, задача в CRM есть — проверка по системе, а не по словамВ разговоре обещал, в CRM пустоКлиент ждёт, компания в его глазах не держит слово
8. Контекст доходит до следующего в цепочкеЗаписал выясненное так, что следующему не нужно переспрашиватьМенеджер начинает разговор с нуля после ботаКлиент повторяет всё заново — самая частая точка отвала на стыке

Как пользоваться таблицей и чем оценивать разговоры

Шкала — либо «да / частично / нет», либо 0–10, как у 3CLogic. Принципиально одно: шкала должна быть одна и та же для всех участников линии обработки лида.

Три правила формулировки критерия: во-первых, каждый критерий подтверждается артефактом — записью, карточкой в CRM, отправленным письмом. Во-вторых, формулировка не должна допускать двух толкований: не «менеджер был вежлив», а «поздоровался и представился». В-третьих, считать имеет смысл серию разговоров, потому что один диалог ничего не доказывает ни про менеджера, ни про версию бота.

И про инструменты, потому что здесь возникает путаница. Критерии универсальны, инструменты — нет. Контроль качества ИИ-агентов ведут средствами того вендора, который этого бота поставил: об этом ровно и были августовские релизы.

Записи разговоров живых менеджеров, в свою очередь, разбирают сервисы речевой аналитики. Например, Rechka расшифровывает записи звонков и проверяет каждую по чек-листу, который компания формулирует сама, — до 20+ параметров в одном отчёте, с фильтрами по длительности, направлению и полям CRM. В итоге один набор вопросов и разные инструменты под разные типы диалогов делают результаты сопоставимыми.

Список критериев, впрочем, ничего не стоит, пока он не приложен к реальным разговорам.

Проверьте свои звонки по этим критериям

Загрузите 30 минут записей разговоров менеджеров — ИИ разберёт их по вашим параметрам и покажет, где именно разваливается сделка.

Получить бесплатный анализ → Бесплатно · 30 минут анализа · Результат за 24 часа

Шкала зрелости: на каком уровне контроль качества в вашем отделе

А чтобы понять, с чего начинать именно вам, полезно честно определить текущий уровень контроля. Уровней четыре, и складывались они задолго до появления ИИ-агентов.

Шкала зрелости контроля качества звонков: от разбора после жалобы до единого чек-листа
  1. Слушаем, когда что-то пошло не так. Записи есть, но разбирают их после жалобы клиента или провального месяца. Оценка — впечатление руководителя.
  2. Чек-лист есть, проверка ручная и выборочная. Критерии сформулированы, только до записей руки доходят по остаточному принципу. По отраслевым оценкам поставщиков QA-решений, при ручном контроле слушают 1–3% разговоров.
  3. Разбор автоматический и сплошной. Записи расшифровывает и проверяет по чек-листу система, а руководитель работает с результатами, а не с аудио.
  4. Один чек-лист на робота и человека. Диалоги бота и разговоры менеджеров проходят по одним и тем же вопросам и по одной шкале, так что видно, на каком участке линии теряется сделка.

Здесь и обнаруживается неудобная асимметрия. Компании готовы покупать отдельный продукт, чтобы проверять робота на 100% диалогов, и одновременно слушают живых менеджеров выборочно, когда дойдут руки. Кстати, рынок уже сдвинулся: контроль работы менеджеров постепенно уходит от тренингов к разбору записей.

То есть робота контролируют строже, чем человека, который закрывает сделку. Стоит спокойно спросить себя, на каком уровне находится ваш отдел. И не строится ли продвинутый контроль качества ИИ-агентов поверх отсутствующего контроля качества людей.

Частые вопросы про контроль качества ИИ-агентов

Пять вопросов про контроль качества ИИ-агентов, которые чаще всего возникают у руководителей после первых недель работы бота на первой линии.

Контроль качества ИИ-агентов: что это и по каким метрикам оценивать бота

Что такое контроль качества ИИ-агентов и чем он отличается от контроля операторов?
По каким метрикам оценивать голосового ИИ-агента в продажах?

Deflection rate и единый чек-лист для робота и человека

Что такое deflection rate и почему на него нельзя ориентироваться?
Можно ли использовать один чек-лист для робота и живого менеджера?

Где теряется лид: на боте или на менеджере

Как понять, где теряется лид — на боте или на менеджере?

Что делать на этой неделе

Летом 2026 года рынок публично признал очевидное: ИИ-агент — это сотрудник, а не программа. Так что контроль качества ИИ-агентов строится теми же средствами, что и контроль людей: чек-лист, единая шкала, аудируемая оценка с обоснованием, назначенный владелец критериев.

Отрезвляющая часть: контроль роботов не отменяет контроля людей. В B2B сделку по-прежнему закрывает человек. И если у него нет чек-листа, покупка QA-движка для бота ничего не изменит — это сигнализация на дом без стен.

  • Выпишите восемь критериев из таблицы и отметьте, какие из них у вас реально проверяются, а какие существуют только на словах.
  • Идите к вендору бота с конкретным запросом: не deflection rate, а доля диалогов, где выявлена потребность и назначен следующий шаг с датой.
  • Назначьте владельца чек-листа — конкретного человека, который чинит критерий, когда его проваливают. Отдельно для линии робота, отдельно для линии менеджеров.
  • Сверьте обещания из разговоров с фактами в CRM за последнюю неделю: сколько «отправлю КП» превратились в отправленные КП.

Пока рынок спорит, как правильно оценивать роботов, у большинства отделов продаж не выстроен даже базовый контроль живых менеджеров. Сервисы речевой аналитики вроде Rechka закрывают именно эту, более прозаичную часть задачи: расшифровывают записи звонков и проверяют их по чек-листу, который компания задаёт сама, — на всём массиве записей, а не на выборке.

Итак, начинать разумнее с неё. Робот на первой линии станет измеримым ровно в тот момент, когда у вас появятся критерии. А критерии проще всего собрать там, где записи уже лежат и разговоры уже идут.

Блог Речки