Главная Журнал Как обучаются LLM и почему разделение ИИ по странам может повысить его качество?

Заметка

Как обучаются LLM и почему разделение ИИ по странам может повысить его качество?

У нас есть проект оценки звонков менеджеров с клиентами через ИИ, работает в Турции и РФ.

Сначала на пальцах - как вообще учат такие модели.

1. Претрейн. В модель заливают гигантский массив данных и она учится предсказывать. У LLM - следующее слово в тексте, у распознавалки речи - какие звуки в какие слова складываются. Вручную её никто не учит, она миллиарды раз угадывает и запоминает где ошиблась. Тут закладывается почти всё, что модель умеет.

2. Дообучение. Дальше узкие размеченные данные под задачу. В нашем случае это тысячи часов телефонных разговоров - вот аудио, вот как оно должно выглядеть текстом.

3. Донастройка по людям. Живые оценщики показывают модели, что считать хорошим ответом, а что плохим. Тот же принцип, что у нас в оценке звонков, только там нейронка ставит оценку менеджеру, а здесь человек - нейронке.

Модель не умнее своих данных. Если в претрейне русской речи было 2%, а английской 60% - она и будет слышать русский как иностранец. Хоть ты её на десяти тысячах видеокарт обучай.

В прошлом посте я как раз показывал тесты переезда с Claude на китайский DeepSeek писал тут. А сегодня наткнулся на то, что Yandex SpeechKit переводит русскую речь в текст точнее, чем американский 11labs, который мы используем. Для меня 11labs долго был эталоном работы с голосом и речью.

Почему так вышло? Потому, что у Яндекса есть то, чего у 11labs нет - годы живой русской речи из Алисы, навигатора, собственных колл-центров. Состава их датасетов я не знаю, никто его не публикует, так что это моё субъективное видение, а не истина в первой инстанции. Но модель Yandex не умнее. У неё просто другие данные.

Это как Google maps и Яндекс навигатор - сравнение, которое я приводил ещё полтора года назад. Гугл в среднем хорошо работает по всему миру, Яндекс лучше в России и плюс-минус в странах СНГ. Из интересного - в Турции Яндекс навигатор лучше отдаёт данные по пробкам на дорогах в Анталии.

Ещё хороший пример Uber и Яндекс такси. По моим наблюдениям Uber во всех странах старается работать по единым стандартам и не особо подстраивается под особенности страны. Что позволяет ему присутствовать в большом количестве стран и быстро расти. Яндекс наоборот не масштабируется так быстро, при этом более детально вникает в рынок и адаптирует продукт под него. Как это сделано на примере Яндекс такси в Турции писал тут.

А теперь к главному вопросу - почему разделение ИИ по странам может сделать его лучше?

Смотрите как получается. Uber единым стандартом взял больше стран. Яндекс глубже влез в свою нишу, но проиграл в масштабе. С ИИ будет ровно так же. Разделение по странам понижает потолок общих моделей - меньше чипов, денег и исследователей, поэтому YandexGPT и GigaChat топовые модели не догоняют. Но оно же поднимает качество там, где всё решают локальные данные.

Поэтому я не жду, что люди перестанут пользоваться Claude и чат GPT. Я про более узкие и отраслевые решения вроде Yandex SpeechKit - там локальный игрок выигрывает не мощностью, а тем, что данные он копил годами.

Когда выбираете инструмент под свою задачу, посмотрите кто и на чём обучал модель. Общие рейтинги тут мало о чём говорят.

Российскую модель от Yandex я планирую тестировать для таксопарка в РФ на этих выходных. Прогоню около 300 звонков через 11labs и Yandex SpeechKit параллельно, сравню по доле неверно распознанных слов и по цене за час аудио. Результаты приложу сюда как в прошлом посте.