Менеджер не согласен с оценкой ИИ: что делать РОПу
Как разбирать спор менеджера с оценкой ИИ через цитату-доказательство и когда дело не в ИИ, а в размытом критерии регламента.
Менеджер заходит с планёрки хмурый и кладёт на стол распечатку разбора звонка: «Тут написано, что я не выявил потребность. Я же весь звонок ей вопросы задавал, послушайте запись». РОП слушает запись, находит момент, где менеджер действительно спрашивал «а что для вас важно при выборе», и понимает — формально вопрос был. Но критерий «выявление потребности» в чек-листе описан размыто, и непонятно, засчитывать это или нет.
Такие споры возникают не потому, что ИИ «глючит». Чаще всего дело в одном из двух: либо система действительно ошиблась в трактовке фразы, либо критерий в регламенте сформулирован так, что под него подходит и хороший вопрос, и формальная отписка. Разбираться нужно по-разному в каждом случае, и от того, как РОП это делает, зависит, будет ли команда доверять оценкам вообще.
Первый шаг — не спорить, а смотреть на цитату
Самая частая ошибка в такой ситуации — начать обсуждение с «ИИ прав» или «ИИ ошибся» вслепую, на основе общего впечатления от звонка. Спор в таком формате быстро превращается в пересказ по памяти: менеджер помнит звонок в свою пользу, РОП — как получится, и решение принимается на эмоциях, а не на фактах.
Правильная точка старта — конкретная цитата с таймкодом, которая стоит за вердиктом. В CANAL под каждой оценкой критерия лежит не голая цифра, а точный фрагмент разговора, на основании которого система сделала вывод — это и есть evidence-разбор, его смысл именно в такой ситуации: перевести спор «прав ли ИИ» в спор «правильно ли размечена эта конкретная фраза». Если менеджер оспаривает оценку, первое, что стоит сделать — открыть демо-разбор или живую карточку звонка и вместе с ним перемотать ровно на ту цитату, которая привела к вердикту.
Дальше есть три возможных исхода:
- цитата подтверждает вердикт — вопрос закрыт, менеджеру нечего возразить, потому что он слышит свою же фразу;
- цитата вырвана из контекста — например, вопрос был, но пятью репликами раньше, и модель не связала его с текущим блоком разговора;
- цитата в принципе не по адресу — модель зацепилась не за то предложение.
Второй и третий случаи — это повод разобраться в самой формулировке критерия, а не просто исправить один звонок вручную.
Когда дело в критерии, а не в модели
Регламент продаж чаще всего пишется человеком, который хорошо понимает свой процесс, но не задумывается, что фраза вроде «менеджер выявляет потребность клиента» допускает десяток трактовок. Для одного РОПа это значит «задал хотя бы один открытый вопрос», для другого — «выяснил бюджет, сроки и критерии выбора», для третьего — «подвёл клиента к формулировке проблемы своими словами». LLM строит чек-лист именно из того текста регламента, который загружен, и если формулировка размыта, модель будет колебаться между строгой и мягкой трактовкой от звонка к звонку — то есть вести себя непоследовательно с точки зрения менеджеров, хотя внутри своей логики она последовательна.
Признак того, что проблема в критерии, а не в конкретной оценке — если один и тот же спор с разными менеджерами повторяется по одному и тому же пункту чек-листа. Один разбор с «ИИ придирается» можно списать на нюанс звонка. Три-четыре похожих спора за месяц по одному критерию — это сигнал переписать формулировку в регламенте: сделать её конкретнее, добавить пример «что считается выполнением», развести «минимально достаточно» и «сделано хорошо». После правки регламента чек-лист критериев в системе перестраивается заново, и трактовка становится стабильнее для всех звонков сразу, а не только для одного оспоренного случая.
Как проводить разбор с менеджером, чтобы не терять доверие
Три вещи, которые стоит держать в разборе:
- Начинать с цитаты, а не с итоговой оценки. Показать менеджеру не «у тебя 2 из 5 баллов», а именно фразу, из-за которой критерий не засчитан. Это меняет тон разговора: вместо «система тебя обвинила» — «вот конкретное место, давай посмотрим вместе».
- Признавать ошибки модели вслух, когда они есть. Если цитата действительно не по адресу — так и сказать: «здесь модель зацепилась не за то место, оценку по этому пункту пересматриваем». Замалчивание очевидных промахов разрушает доверие к системе быстрее, чем сами промахи.
- Не менять оценку конкретного звонка вручную как единственную реакцию. Точечная правка снимает симптом на один разговор, но если причина в критерии, тот же спор всплывёт со следующим менеджером через неделю. Разбор одного звонка должен заканчиваться либо подтверждением вердикта, либо решением поправить регламент.
Отдельно стоит сказать про базовую претензию «а зачем вообще ИИ, если он ошибается, живой контролёр бы так не сделал». Здесь честный ответ — ИИ ошибается на отдельных фразах, но проверяет 100% звонков, тогда как ручной ОКК физически может прослушать только выборку. Точечная ошибка в одном разборе — это цена того, что вообще есть данные по каждому звонку каждого менеджера, а не только по тем пяти, что выбрал контролёр. Задача РОПа — не требовать безошибочности, а выстроить процесс, при котором ошибки быстро всплывают и исправляются на уровне критерия.
Что делать, если спор идёт по регулярному, «пограничному» сценарию
Есть категория звонков, где спор возникает не из-за брака в критерии, а из-за реальной пограничности ситуации: клиент сам оборвал разговор, менеджер и не должен был успеть закрыть все пункты скрипта, но формально чек-лист это фиксирует как невыполнение. Здесь решение — не переписывать критерий под каждое исключение, а договориться с командой, что часть баллов идёт «по контексту звонка», и на планёрке разбирать именно категорию таких звонков, а не единичный случай.
Полезно вести короткий журнал спорных разборов: дата, менеджер, критерий, итог (подтверждено / поправлена цитата / поправлен регламент). Через месяц-два такой журнал сам покажет, какие критерии стабильно вызывают вопросы, и регламент можно поправить пакетно, а не после каждого отдельного скандала. Как в целом устроена оценка и откуда берётся чек-лист, можно посмотреть на странице как это работает — это тот же принцип, что описан выше: правила оценки идут из текста регламента, а не зашиты в модель жёстко.
Частые вопросы
Менеджер уверен, что ИИ его "не понял" — как быстро проверить, прав ли он? Открыть карточку звонка и найти цитату с таймкодом, на которой основан конкретный вердикт. Если фраза действительно не относится к тому, что от неё требовалось, — это техническая ошибка привязки, а не спор о содержании. Если фраза в контексте подтверждает вердикт — спор обычно закрывается сам, потому что менеджер слышит собственные слова.
Стоит ли пересматривать оценку звонка вручную после спора? Да, если ошибка в конкретной цитате — привязка не туда или вырванный контекст. Но если причина спора — размытая формулировка критерия, ручная правка одного звонка не решает проблему: тот же спор повторится с другим менеджером. В этом случае правится текст регламента, а чек-лист критериев перестраивается заново.
Как часто такие споры возникают на практике? Заранее сказать нельзя — зависит от того, насколько конкретно написан регламент. Чем более расплывчато сформулированы критерии («хорошо отработал возражение», «уверенно вёл разговор»), тем чаще будут пограничные случаи. Практический ориентир: если один и тот же критерий вызывает вопросы у нескольких менеджеров подряд, это сигнал переписать формулировку, а не разбирать каждый случай отдельно.
Можно ли доверять оценке ИИ, если он иногда ошибается на пограничных фразах? Ошибка на отдельной фразе — не то же самое, что ошибка в целом по звонку: цитата с таймкодом позволяет проверить и поправить конкретное место за минуту, вместо того чтобы пересматривать всю запись. При этом система разбирает 100% звонков, а не выборку, так что даже с отдельными неточностями суммарная картина по отделу продаж точнее, чем при ручном контроле нескольких случайных разговоров в месяц.
Спор менеджера с оценкой ИИ — это не повод отключать проверку и не повод слепо верить цифре. Это рабочий сигнал: разбирайте его через цитату, а не через память о звонке, и раз в месяц смотрите, какие критерии регламента стоит переформулировать, чтобы таких споров становилось меньше.