← Блог
Технологии25 июня 2026 г.·7 мин чтения·Сергей Полухин, CTO, PapAI Soft

Распознавание речи на русском: что влияет на точность разбора звонков

Акцент, шум, сленг и имена — разбираем, что реально портит расшифровку звонков и почему точность ASR критична для разбора по цитатам.

РОП открывает отчёт по звонку менеджера и видит вердикт: «Не отработал возражение по цене». Логично спросить — а на основании чего вывод? Если под вердиктом нет точной цитаты, приходится либо доверять системе вслепую, либо переслушивать запись целиком, что убивает весь смысл автоматизации. А если цитата есть, но расшифрована с ошибками — «отказ от продукта» вместо «отказ от подукта», спутанные имена, съеденные окончания — доверия к разбору тоже не прибавляется.

Здесь и начинается разговор о точности распознавания речи. Это не абстрактная техническая метрика для инженеров, а то, что напрямую определяет, можно ли верить конкретному вердикту по конкретному звонку. Разберём, что реально влияет на качество расшифровки русской речи в звонках отдела продаж и почему это имеет значение для того, как построен разбор.

Почему русская речь — не самый простой случай для ASR

Системы распознавания речи (ASR, automatic speech recognition) обучаются на огромных массивах аудио с текстовой разметкой. Чем более вариативна речь, тем сложнее модели её распознавать без ошибок. У русского языка с точки зрения телефонных звонков есть несколько особенностей, которые усложняют задачу.

Во-первых, свободный порядок слов и богатая морфология: одно и то же слово может стоять в шести падежах, менять окончание в зависимости от рода и числа. Модели приходится не просто узнавать звук, но и правильно достраивать грамматическую форму — иначе фраза «перезвоните мне в среду» рискует превратиться в «перезвоните мне всреду» или потерять согласование.

Во-вторых, акценты и региональные особенности произношения. Отдел продаж редко состоит из дикторов с идеальной дикцией — звонят менеджеры из разных регионов, с разной скоростью речи, иногда с лёгким акцентом, если менеджер не носитель языка. Модель должна одинаково хорошо справляться и с чётким московским произношением, и с южным «г» фрикативным, и с более смазанной артикуляцией уставшего к вечеру менеджера.

В-третьих, разговорная речь вообще устроена не так, как письменная. В звонках много слов-паразитов, недоговорённых фраз, самоперебивов, наложения реплик друг на друга — клиент и менеджер иногда говорят одновременно. Всё это модель должна расшифровать и корректно развести по говорящим.

Шум, качество связи и особенности телефонии

Даже идеальная языковая модель не поможет, если на входе плохой звук. Телефонные звонки — особенно мобильные и через IP-телефонию с потерей пакетов — почти всегда содержат шум: фоновые разговоры в опенспейсе, звук улицы, если менеджер говорит с мобильного, эхо, сжатие аудио для экономии трафика.

Телефонный канал сам по себе обрезает частотный диапазон — это давняя особенность стандарта передачи голоса по телефонным линиям, из-за которой звук по телефону звучит глуше, чем вживую. Модели распознавания речи, обученные на чистой студийной записи, на таком аудио часто теряют точность именно на границах слов и на тихих участках — там, где клиент, например, называет цифру бюджета вполголоса или чуть отворачивается от микрофона.

Отдельная сложность — одновременная речь двух людей. Когда клиент перебивает менеджера или наоборот, модели нужно не просто распознать звук, а корректно развести его по спикерам (диаризация) и не перепутать, кто что сказал. Ошибка здесь особенно опасна для разбора звонков: если системе кажется, что фразу «это дорого» произнёс менеджер, а не клиент, весь последующий вывод о работе с возражением окажется неверным.

Сленг, профессиональная лексика и имена собственные

Отдельная категория трудностей — слова, которых нет в общеязыковом словаре. В B2B-продажах это названия продуктов и услуг компании, имена клиентов и сотрудников, специфические термины отрасли, аббревиатуры. Универсальная модель распознавания речи, обученная на общих текстах, может не знать, что «Скайформ» — это название продукта заказчика, а не что-то, услышанное с ошибкой, и попытается «исправить» его на похожее по звучанию известное слово.

То же самое происходит с брендами конкурентов, названиями CRM-систем, отраслевым жаргоном («лид», «воронка», «дожим», но также узкоспециализированные термины в строительстве, медицине, юридических услугах). Здесь помогает контекстная адаптация — когда модель получает список ожидаемых терминов и имён для конкретной компании или отрасли и использует его при расшифровке.

Именно поэтому качество разбора звонков зависит не только от общей мощности модели распознавания речи, но и от того, насколько система адаптирована под конкретный бизнес — его продукт, терминологию, отрасль. Разные отраслевые сценарии подробно разобраны в материалах о том, как анализировать звонки в конкретных CRM и телефониях, а общий обзор по отраслям — на странице решений по отраслям.

Почему точность расшифровки критична именно для evidence-подхода

Есть два принципиально разных способа показать РОПу результат анализа звонка. Первый — выдать голую оценку: «критерий выполнен» или «критерий не выполнен», без объяснений. Второй — показать вердикт вместе с точной цитатой из разговора и таймкодом, чтобы можно было в один клик перейти к нужному месту записи и услышать сказанное своими ушами.

CANAL работает по второму принципу — под каждым вердиктом по критерию лежит конкретная цитата с таймкодом, а не абстрактная оценка. Это и называется evidence-разбором: не «поверьте системе», а «вот же место в разговоре, послушайте сами». Разница принципиальна именно потому, что как только точность расшифровки хромает, вся конструкция начинает сыпаться. Если цитата содержит ошибку распознавания — перепутанное слово, неверно приписанную реплику, оборванную фразу — доверие к вердикту падает мгновенно, даже если сама логическая оценка по существу верна.

Поэтому для сервиса, который строит разбор на цитатах, точность ASR — не второстепенный технический параметр, а прямое условие того, что весь продукт вообще имеет смысл использовать. Голая оценка без доказательства можно сделать и с посредственной расшифровкой — никто не проверит. А показать точную цитату и промахнуться — сразу видно.

Посмотреть, как это выглядит на реальном звонке, можно на странице демо-разбора — там видно вердикт вместе с цитатой и таймкодом без необходимости регистрироваться.

Что с этим может сделать РОП на практике

Раз точность расшифровки — не абстракция, а конкретный фактор, влияющий на надёжность каждого отчёта, есть смысл понимать, на что обращать внимание при работе с системой разбора звонков.

Во-первых, проверяйте систему не по общим обещаниям, а на своих реальных звонках — с вашими именами, продуктами и манерой речи менеджеров. Общая точность распознавания на эталонных датасетах мало что говорит о том, как модель справится с конкретным акцентом вашего менеджера из регионального филиала.

Во-вторых, обращайте внимание, показывает ли система цитату и таймкод под каждым выводом, или ограничивается голой оценкой. Это самый быстрый способ проверить, можно ли доверять конкретному вердикту, не переслушивая запись целиком.

В-третьих, если в компании используются специфические названия продуктов, отраслевые термины или регулярно повторяющиеся имена клиентов, стоит уточнить, умеет ли система под них адаптироваться — это напрямую снижает число ошибок в самых важных местах разговора, где называют суммы, сроки и названия.

Как устроен весь процесс — от загрузки регламента до готового отчёта по звонку — подробно описано на странице как это работает. А то, что данные звонков при этом хранятся на серверах в РФ с разграничением доступа и соответствуют требованиям 152-ФЗ, разобрано на странице безопасности.

Частые вопросы

Может ли расшифровка звонка быть с ошибками, а вердикт по критерию — всё равно верным? Да, теоретически возможно, если ошибка распознавания не задела ключевую часть фразы. Но именно поэтому важно видеть саму цитату, а не только итоговую оценку — так менеджер отдела продаж или РОП может сам убедиться, что вывод основан на реально сказанном, а не довериться системе вслепую.

Влияет ли качество телефонии и связи на точность разбора? Да, напрямую. Шум, эхо, потеря пакетов при плохом интернет-соединении и узкий частотный диапазон телефонного канала снижают качество исходного аудио, а значит и точность его расшифровки. Чем чище исходная запись — тем надёжнее итоговый разбор.

Нужно ли что-то настраивать вручную, чтобы улучшить распознавание специфичных терминов компании? Специфика продукта и терминологии учитывается через регламент или скрипт продаж, который загружает пользователь — на основе него система строит чек-лист критериев и получает контекст для более точной интерпретации разговора, включая узнавание характерных для компании названий и терминов.

Проверяются ли все звонки одинаково внимательно, или только часть? В CANAL проверке подлежат 100% звонков автоматически, в отличие от классического ручного ОКК, где обычно прослушивается выборочная часть разговоров. Это значит, что ошибки распознавания не «прячутся» в непроверенных звонках — каждый разбор можно перепроверить по цитате.

Точность распознавания речи — это не техническая деталь под капотом, а то, что напрямую определяет, можно ли доверять конкретному отчёту по конкретному звонку. Если у вас есть возможность посмотреть на цитату и таймкод, а не только на итоговую оценку, — доверие проверяется за секунды, а не часы переслушивания записей. Начать можно с бесплатной регистрации и разбора нескольких своих звонков, а сравнить тарифы — на странице цен.

Проверьте это на своих звонках

Подключите CRM или телефонию сами за 10 минут и получите разбор с цитатой-доказательством. Free — без карты.