Транскрибация звонков на узбекском и русском: смешанная речь в одном разговоре
Мы перебрали десяток моделей распознавания речи и оставили ту, что понимает узбекский точнее всех. Расшифровка идёт на узбекском, русском и на смеси двух языков — так, как реально говорит отдел продаж в Ташкенте.
Транскрибация звонков на узбекском: почему это отдельная задача
Транскрибация звонков — это перевод записи разговора в текст, с которым дальше можно работать: искать по словам, сверять со скриптом, считать. Для отдела продаж в Узбекистане у этой задачи есть особенность, которой нет ни в России, ни в Европе: один и тот же менеджер за смену говорит и на узбекском, и на русском, а чаще всего — на смеси двух языков, иногда в пределах одного предложения. Модель распознавания, обученная в основном на русском и английском, на таком материале начинает не расшифровывать, а домысливать.
Поэтому расшифровка звонков в текст для местного бизнеса — не «включить готовый speech to text», а выбрать модель, которая действительно слышит узбекскую речь: с редукцией окончаний, с городским произношением, с деловой лексикой, где половина терминов пришла из русского. Мы перебрали десяток моделей и оставили ту, что справляется с узбекским точнее остальных.
Смешанная узбекско-русская речь: главный случай, а не исключение
Типичный разговор в ташкентском отделе продаж выглядит так: приветствие и вопрос клиента — на узбекском, названия услуг, сроки, слова «скидка», «предоплата», «договор» — на русском, возражение — снова на узбекском. Для человека это нормальная речь. Для распознавания смешанной узбекско-русской речи это худший сценарий: система должна переключать язык внутри фразы, а не выбирать один на весь файл.
Что ломается, когда модель к этому не готова:
- звонок целиком «переводится» в один язык, и половина смысла превращается в набор похожих по звучанию слов;
- русские термины внутри узбекской фразы записываются на слух и теряются при поиске — вы не найдёте по слову «предоплата» те звонки, где она звучала;
- проверка по скрипту даёт ложные ошибки: менеджер назвал срок акции по-русски, а в тексте его нет, значит, формально пункт не выполнен.
Правильная расшифровка ведёт себя иначе: текст собирается так, как разговор прозвучал, вместе с переключениями языка. Только на таком тексте имеет смысл строить контроль отдела продаж — иначе вы контролируете ошибки распознавания, а не работу людей.
Два дня бесплатно — на ваших звонках
Оставьте заявку: два дня разбираем ваши настоящие звонки бесплатно. Увидите результат — и сами решите, идти дальше или нет.
Номер никому не передаём. Политика конфиденциальности
Заявка не ушла. Напишите напрямую в Telegram-бот. Написать в Telegram-бот
Почему универсальные STT путают узбекский с другими тюркскими языками
Массовые движки speech to text определяют язык автоматически: по первым секундам аудио модель решает, на каком языке говорят, и дальше расшифровывает в этой раскладке. Узбекский в таких системах представлен слабее, чем турецкий, казахский или азербайджанский, а по фонетике и структуре слова они близки — общий тюркский корень, похожие суффиксы, похожая мелодика фразы.
Отсюда три частые проблемы, которые видно на реальных звонках:
- Подмена языка. Разговор помечается как турецкий или казахский, и на выходе получается текст, который читается, но означает не то. Хуже всего, что он выглядит уверенно — ошибку не видно, пока не послушаешь запись.
- Плохое качество канала. Телефонная линия — это узкая полоса и сжатие. Короткие узбекские окончания, которые меняют смысл, на такой записи «съедаются» сильнее, чем в чистом студийном аудио, на котором модели обычно тестируют.
- Разнобой в письме. Даже правильно услышанное слово можно записать по-разному: qo'ng'iroq, qoʻngʻiroq, кўнғироқ. Если поиск по расшифровкам не учитывает варианты, часть звонков просто не находится.
Проверять это нужно не по описанию на сайте, а на своих записях: взять десяток реальных разговоров и сравнить текст со звуком. Именно для этого мы и делаем демо — два дня разбираем ваши настоящие звонки бесплатно.
Диаризация: кто именно это сказал
Расшифровка без разделения по говорящим — это сплошная простыня текста, по которой невозможно понять, кто задал вопрос, а кто ушёл от ответа. Диаризация — это как раз разбиение записи на реплики и привязка каждой реплики к участнику: менеджер или клиент.
Что она даёт на практике:
Оценка попадает по адресу
Претензия «не назвал срок акции» имеет смысл только тогда, когда точно известно, что этого не сказал менеджер, а не клиент. Без разделения реплик любая проверка по скрипту превращается в угадывание.
Видно, кто вёл разговор
Соотношение реплик показывает, слушал менеджер или говорил один. Это самая простая и самая честная метрика разговора, и она доступна сразу после расшифровки.
Цитата вместо пересказа
В отчёте вы получаете ту самую фразу, из-за которой снижена оценка. Спорить с цитатой невозможно — это меняет сам разговор руководителя с менеджером.
Разговор на троих
Перевод на коллегу, подключение старшего, громкая связь в машине — всё это ломает простой перевод аудио в текст, если реплики не разделены между участниками.
Таймкоды: зачем отметки времени в расшифровке
Таймкод — это метка, на какой секунде записи прозвучала реплика. Он превращает текст в навигацию по звонку: руководитель не переслушивает семь минут, чтобы найти момент, где менеджер назвал цену, а открывает запись на нужной секунде и слушает двадцать секунд. На дистанции это и есть разница между «мы разбираем звонки» и «мы собирались разобрать звонки».
Отметки времени решают и вторую задачу — измеримость. Длинные паузы, момент первого вопроса о бюджете, секунда, на которой прозвучало возражение, — всё это видно только тогда, когда у текста есть привязка ко времени.
Что мы делаем с расшифровкой дальше
Транскрибация на узбекском языке — не результат, а сырьё. Leadlar AI слушает 100 % звонков и читает переписки отдела продаж, а дальше по тексту разговора:
- оценивает менеджера по вашему скрипту и показывает ошибку цитатой, а не общими словами;
- ставит «температуру» лида от 0 до 100, чтобы было видно, за кем возвращаться в первую очередь;
- создаёт задачу в CRM по итогу разговора;
- вечером присылает руководителю короткий отчёт в Telegram.
Роли разделены: владелец видит всё, руководитель отдела — свой отдел, менеджер — только свои разговоры и свою оценку с объяснением. Данные видны только в вашем кабинете, серверы защищены.
Как подключиться и сколько стоит
Отдельную программу ставить не нужно. Если ваша АТС уже пишет записи в amoCRM или Bitrix24, мы берём файлы оттуда — телефония остаётся прежней. Как это устроено технически, разобрано на странице про интеграцию телефонии с amoCRM.
Демо — 2 дня бесплатно на ваших реальных звонках. Запуск — 750 долларов один раз: подключение CRM и телефонии, правила проверки, отчёт в Telegram, обучение команды. Абонентской платы нет. AI-анализ — 25–30 сум за минуту, первые 3 месяца бесплатно, без нашей наценки; подробный расчёт — на странице цен. Запуск занимает 1–3 дня после выдачи доступов, первый отчёт приходит на следующий день.
Самый честный способ проверить качество распознавания узбекской речи — посмотреть расшифровку собственных звонков, а не чужие примеры. Оставьте заявку, и через два дня вы прочитаете свои разговоры текстом. Ещё больше о продукте — на главной странице Leadlar AI.
Частые вопросы
Понимает ли система узбекский язык?
Что будет, если менеджер в одном предложении переходит с узбекского на русский?
Нужно ли ставить отдельную программу для транскрибации?
Сколько стоит расшифровка минуты разговора?
Переписки тоже разбираются или только звонки?
За сколько дней можно увидеть расшифровки своих звонков?
Два дня бесплатно — на ваших звонках
Оставьте заявку: два дня разбираем ваши настоящие звонки бесплатно. Увидите результат — и сами решите, идти дальше или нет.
Номер никому не передаём. Политика конфиденциальности
Заявка не ушла. Напишите напрямую в Telegram-бот. Написать в Telegram-бот