Транскрибация звонков на узбекском и русском: смешанная речь в одном разговоре

Мы перебрали десяток моделей распознавания речи и оставили ту, что понимает узбекский точнее всех. Расшифровка идёт на узбекском, русском и на смеси двух языков — так, как реально говорит отдел продаж в Ташкенте.

Транскрибация звонков на узбекском: почему это отдельная задача

Транскрибация звонков — это перевод записи разговора в текст, с которым дальше можно работать: искать по словам, сверять со скриптом, считать. Для отдела продаж в Узбекистане у этой задачи есть особенность, которой нет ни в России, ни в Европе: один и тот же менеджер за смену говорит и на узбекском, и на русском, а чаще всего — на смеси двух языков, иногда в пределах одного предложения. Модель распознавания, обученная в основном на русском и английском, на таком материале начинает не расшифровывать, а домысливать.

Поэтому расшифровка звонков в текст для местного бизнеса — не «включить готовый speech to text», а выбрать модель, которая действительно слышит узбекскую речь: с редукцией окончаний, с городским произношением, с деловой лексикой, где половина терминов пришла из русского. Мы перебрали десяток моделей и оставили ту, что справляется с узбекским точнее остальных.

Смешанная узбекско-русская речь: главный случай, а не исключение

Типичный разговор в ташкентском отделе продаж выглядит так: приветствие и вопрос клиента — на узбекском, названия услуг, сроки, слова «скидка», «предоплата», «договор» — на русском, возражение — снова на узбекском. Для человека это нормальная речь. Для распознавания смешанной узбекско-русской речи это худший сценарий: система должна переключать язык внутри фразы, а не выбирать один на весь файл.

Что ломается, когда модель к этому не готова:

Правильная расшифровка ведёт себя иначе: текст собирается так, как разговор прозвучал, вместе с переключениями языка. Только на таком тексте имеет смысл строить контроль отдела продаж — иначе вы контролируете ошибки распознавания, а не работу людей.

Два дня бесплатно — на ваших звонках

Оставьте заявку: два дня разбираем ваши настоящие звонки бесплатно. Увидите результат — и сами решите, идти дальше или нет.

Номер никому не передаём. Политика конфиденциальности

Почему универсальные STT путают узбекский с другими тюркскими языками

Массовые движки speech to text определяют язык автоматически: по первым секундам аудио модель решает, на каком языке говорят, и дальше расшифровывает в этой раскладке. Узбекский в таких системах представлен слабее, чем турецкий, казахский или азербайджанский, а по фонетике и структуре слова они близки — общий тюркский корень, похожие суффиксы, похожая мелодика фразы.

Отсюда три частые проблемы, которые видно на реальных звонках:

  1. Подмена языка. Разговор помечается как турецкий или казахский, и на выходе получается текст, который читается, но означает не то. Хуже всего, что он выглядит уверенно — ошибку не видно, пока не послушаешь запись.
  2. Плохое качество канала. Телефонная линия — это узкая полоса и сжатие. Короткие узбекские окончания, которые меняют смысл, на такой записи «съедаются» сильнее, чем в чистом студийном аудио, на котором модели обычно тестируют.
  3. Разнобой в письме. Даже правильно услышанное слово можно записать по-разному: qo'ng'iroq, qoʻngʻiroq, кўнғироқ. Если поиск по расшифровкам не учитывает варианты, часть звонков просто не находится.

Проверять это нужно не по описанию на сайте, а на своих записях: взять десяток реальных разговоров и сравнить текст со звуком. Именно для этого мы и делаем демо — два дня разбираем ваши настоящие звонки бесплатно.

Диаризация: кто именно это сказал

Расшифровка без разделения по говорящим — это сплошная простыня текста, по которой невозможно понять, кто задал вопрос, а кто ушёл от ответа. Диаризация — это как раз разбиение записи на реплики и привязка каждой реплики к участнику: менеджер или клиент.

Что она даёт на практике:

Оценка попадает по адресу

Претензия «не назвал срок акции» имеет смысл только тогда, когда точно известно, что этого не сказал менеджер, а не клиент. Без разделения реплик любая проверка по скрипту превращается в угадывание.

Видно, кто вёл разговор

Соотношение реплик показывает, слушал менеджер или говорил один. Это самая простая и самая честная метрика разговора, и она доступна сразу после расшифровки.

Цитата вместо пересказа

В отчёте вы получаете ту самую фразу, из-за которой снижена оценка. Спорить с цитатой невозможно — это меняет сам разговор руководителя с менеджером.

Разговор на троих

Перевод на коллегу, подключение старшего, громкая связь в машине — всё это ломает простой перевод аудио в текст, если реплики не разделены между участниками.

Таймкоды: зачем отметки времени в расшифровке

Таймкод — это метка, на какой секунде записи прозвучала реплика. Он превращает текст в навигацию по звонку: руководитель не переслушивает семь минут, чтобы найти момент, где менеджер назвал цену, а открывает запись на нужной секунде и слушает двадцать секунд. На дистанции это и есть разница между «мы разбираем звонки» и «мы собирались разобрать звонки».

Отметки времени решают и вторую задачу — измеримость. Длинные паузы, момент первого вопроса о бюджете, секунда, на которой прозвучало возражение, — всё это видно только тогда, когда у текста есть привязка ко времени.

Что мы делаем с расшифровкой дальше

Транскрибация на узбекском языке — не результат, а сырьё. Leadlar AI слушает 100 % звонков и читает переписки отдела продаж, а дальше по тексту разговора:

Роли разделены: владелец видит всё, руководитель отдела — свой отдел, менеджер — только свои разговоры и свою оценку с объяснением. Данные видны только в вашем кабинете, серверы защищены.

Как подключиться и сколько стоит

Отдельную программу ставить не нужно. Если ваша АТС уже пишет записи в amoCRM или Bitrix24, мы берём файлы оттуда — телефония остаётся прежней. Как это устроено технически, разобрано на странице про интеграцию телефонии с amoCRM.

Демо — 2 дня бесплатно на ваших реальных звонках. Запуск — 750 долларов один раз: подключение CRM и телефонии, правила проверки, отчёт в Telegram, обучение команды. Абонентской платы нет. AI-анализ — 25–30 сум за минуту, первые 3 месяца бесплатно, без нашей наценки; подробный расчёт — на странице цен. Запуск занимает 1–3 дня после выдачи доступов, первый отчёт приходит на следующий день.

Самый честный способ проверить качество распознавания узбекской речи — посмотреть расшифровку собственных звонков, а не чужие примеры. Оставьте заявку, и через два дня вы прочитаете свои разговоры текстом. Ещё больше о продукте — на главной странице Leadlar AI.

Частые вопросы

Понимает ли система узбекский язык?
Да. Переводит в текст узбекскую, русскую и смешанную речь. Мы перебрали десяток моделей распознавания и оставили ту, что понимает узбекский точнее всех.
Что будет, если менеджер в одном предложении переходит с узбекского на русский?
Это обычный случай для Ташкента, и расшифровка рассчитана именно на него. Разговор не делится на «узбекскую» и «русскую» части заранее — текст собирается так, как он прозвучал, вместе со вставками на втором языке.
Нужно ли ставить отдельную программу для транскрибации?
Нет. Если телефония уже подключена к amoCRM или Bitrix24 и записи разговоров складываются в CRM, мы берём их оттуда. Менять АТС не нужно.
Сколько стоит расшифровка минуты разговора?
25–30 сум за минуту AI-анализа, первые 3 месяца — бесплатно. Это счёт за ИИ без нашей наценки. Запуск — 750 долларов один раз, ежемесячной абонплаты нет.
Переписки тоже разбираются или только звонки?
И то и другое. Чаты внутри CRM и Instagram Direct оцениваются по тем же правилам, что и звонки: сколько ждали ответа, ответили ли на вопрос, предложили ли следующий шаг.
За сколько дней можно увидеть расшифровки своих звонков?
Демо длится 2 дня и идёт на ваших настоящих звонках — бесплатно. Полный запуск занимает 1–3 дня после выдачи доступов, первый отчёт приходит на следующий день.

Два дня бесплатно — на ваших звонках

Оставьте заявку: два дня разбираем ваши настоящие звонки бесплатно. Увидите результат — и сами решите, идти дальше или нет.

Номер никому не передаём. Политика конфиденциальности

Оставить заявку