Главная Журнал Сравнение российских и американских ИИ-моделей. Кто победил?

Заметка

Сравнение российских и американских ИИ-моделей. Кто победил?

В прошлом посте (советую прочитать) я обещал проверить на нашем таксопарке в РФ: правда ли Yandex SpeechKit слышит русскую речь лучше американского 11labs, который мы используем. Оценивал на 358 звонках, замер по качеству распознавания и по цене за час аудио.

Что у меня получилось.

Чтобы посчитать долю неверно распознанных слов, нужен эталон — расшифровка, про которую точно известно, что она верная. Делает её человек, ушами, вручную. Для 358 звонков это несколько дней работы. И не факт, что он верно оценит. Я пошёл другим путём. Каждый звонок я расшифровал дважды — сначала 11labs, потом Yandex SpeechKit. Получились пары: один и тот же разговор, два разных текста.

Эти пары я отдал на суд другим нейросетям — Codex, Gemini и Claude. Я не сказал им, где чей текст. Просто «вариант А» и «вариант Б», и порядок каждый раз менял. Иначе модель начнёт подыгрывать знакомому бренду вместо того, чтобы читать, что перед ней. Да, Claude два раза подсовывал мне фейковые данные: сначала подсуживал себе в анализе диалогов (об этом тут), а потом — 11labs. Именно поэтому оценку проводили три разные модели.

Какой результат.

Yandex — 250 побед. 11labs — 91. Ничьих — 16.

То есть Yandex уверенно вышел вперёд ⚡️ Но это предпочтение судей, а не доля ошибок.

А теперь то, ради чего всё затевалось.

Наш ИИ проверяет, выполняет ли менеджер этапы скрипта: представился ли, назвал ли компанию и тд.
Смотрим, как ИИ справляются с названием нашего таксопарка «Полёт». Тут судьи не нужны — я и так знаю, какое слово должно быть в тексте:

— 11labs теряет или коверкает его в 97 звонках из 358
— Яндекс — в 21 из 358

Коверкает примерно так: «Компания Аполлон», «Компания АПА», «Аэрополёт», «Компания Пиль», «Компания Полез». А один раз наш «Полёт» превратился в «Аня Полетная» 🤷

Я полез в базу и посчитал, во что это обходится: в 13% расшифровок слова «Полёт» нет вообще. ИИ 43 раза вменил менеджерам «не представился». В 15 случаях из этих 43 менеджер представился — просто ИИ не расслышал.

Каждая третья такая претензия — вина не менеджера, а распознавалки. Это не абстрактное «качество транскрибации», это несправедливые оценки менеджерам.

Ещё момент. В РФ мы сдаём в аренду автомобили такси — и Yandex лучше слышит названия китайских марок и таксишные термины. При оценке менеджера это тоже меньше ошибок.

Что по деньгам?

Claude посчитал, что 11labs дороже Яндекса в пять раз, и красиво расписал экономию в 40 тысяч рублей в год 🤦 Я сразу же понял, что это какой-то бред, и пересчитал.

Разумеется, такой экономии нет. Наоборот.

Яндекс на нашем объёме — 40 ₽ за час, 11labs — $0,40, это примерно 31 ₽ по текущему курсу. То есть переходим на ИИ, который дороже процентов на двадцать пять. Иду на это осознанно: девять рублей разницы дешевле, чем разбирать с менеджером незаслуженный минус.

Claude выдаёт неверную цифру ровно тем же уверенным тоном, что и верную. Если бы я не усомнился, я бы сейчас писал вам про экономию, которой нет.

Вывод, к которому я пришёл.

Русский ИИ выиграл у американского в русской речи — но не потому, что у него круче технологии. По объёму распознанного текста они равны, а по цене Яндекс даже дороже. А потому, что его данных с русской речью, собранных по всей России, на которых он обучался намного больше.

Из интересного. 11labs ломает названия компании, марки машин и профессиональные словечки — ровно то, по чему мы оцениваем менеджеров. И иногда просто выдумывает текст. Яндекс путает случайные слова в середине фраз — на оценку менеджера это не влияет.

Так что если выбираете инструмент для ИИ-автоматизаций — не выбирайте по тому, кто ошибается реже. Смотрите, как он ошибается, когда ошибается. И не верьте выборке в полсотни примеров, даже если результат выглядит убедительно.

Переходим на Yandex. Дальше сравню турецкий Sestek и всё тот же 11labs. Об этом тоже напишу пост со сравнением турецких и американских моделей.