Сегодня я провел исследование как наш слоняра ИИ от Yandex работает с турецким языком. Задача — перевод турецкой речи (аудиозаписи) в текст. Сейчас и ранее мы для этого использовали 11labs, но по моим предыдущим исследованиям 11labs проиграл в точности распознавания речи Yandex SpeechKit в русском. Потому, что у Yandex сильно больше данных с русской речью чем у 11labs для обучения своих моделек. (которые кстати Герман Греф считает китайскими, но под шильдиком Yandex 😀 — сам Яндекс это отрицает). Поэтому я провел исследование и сравнение в турецком языке.
У нас в Турции ИИ-ОКК слушает 100% звонков менеджеров — как я его несколько месяцев доводил до ума, писал тут. Работает это только пока запись правильно переведена в текст. Распознали криво — и оценщик штрафует менеджера за слова, которых не было.
Когда я сравнивал две модели на русских звонках — Yandex SpeechKit против американского 11labs — Яндекс выиграл: 250 побед против 91 на 358 звонках, писал об этом здесь. Логично было взять этот вывод и просто перенести на турецкий проект. Но нет.
Как я считал
Взял 300 наших реальных звонков — почти 13 часов турецкой речи. Прогнал через обе нейронки. Тексты обезличил и перемешал в пары A/B, чтобы судья не знал, где какая модель. Отдал на слепую сверку. Смотрели связность диалога, бессмыслицу, повторы, искажение имён и названий, и отдельно числа.
Результат: 279:0 в пользу 11labs. Двадцать одна ничья — это почти всегда звонки, где речи вообще нет: гудки и автоответчик. Даже я от такого был мягко говоря удивлен 😨
Как именно ломается Яндекс на турецком
Он не просто ошибается в словах. Он сваливается в узбекскую фонетику (если что Узбекский и Турецкий языки в одной языковой группе). Похоже, тянет к тому тюркскому языку, которого было больше в обучении.
Сильные косяки были в числах:
— комиссия 3% превратилась в 103
— скидка 8% — в 800
— баланс 602 лиры — в «602200»
А теперь, про что вообще эти разговоры. Водитель такси спорит о комиссии, диктует свои реквизиты, уточняет сумму выплаты и свой рейтинг. Если цифры едут, оценивать такой разговор нет смысла.
Судья не знал, кого сравнивает
Перед сверкой я убрал из текстов всё, по чему модель можно опознать: заглавные буквы, пунктуацию, служебные пометки. Потом на каждом звонке бросил монетку — кто будет вариантом A, кто B. Ключ отложил и не заглядывал.
Судья отработал 300 пар и выдал свой итог: вариант A победил в 133 случаях, вариант B — в 146. И дописал вывод: разница в пределах погрешности, ни одна сторона не лучше другой.
А потом я раскрыл ключ. Оказалось, что 133 и 146 — это один и тот же ИИ, просто в половине пар он стоял слева, а в половине справа. Судья ни разу не догадался, кто перед ним, и при этом внутри каждой пары стабильно тыкал в одного и того же. Совпадением это не объяснить.
Вывод
Далеко не всегда ИИ-модель распознавания голоса (и не только) бывает «лучше» вообще. Она бывает лучше на конкретном языке, на конкретном типе записи, на конкретной задаче — телефонная линия это не студийный микрофон. Один и тот же Яндекс на русских звонках ощутимо лучше американцев, а на турецких сильно проигрывает. Обзоры «лучших ИИ» тут не помогут: пока не прогнал свои записи или задачи, ты не знаешь ничего.
Жду ещё доступ от турецкой модели Sestek, чтобы сравнить их с 11labs. Но они не спешат отвечать 🤷☕️
Спасибо, что дочитали 