Главная Журнал Сравнение американских и китайских ИИ в реальных бизнес-задачах

Заметка

Сравнение американских и китайских ИИ в реальных бизнес-задачах

В прошлом посте я писал, что начинаю экспериментировать с китайскими модельками. Моё мини-исследование готово, результаты ниже.

У нас работает AI-ОКК — звонки отдела продаж таксопарка сами превращаются в текст и оцениваются нейронкой по нашим скриптам. На выходе: где менеджер накосячил, что сделал хорошо, балл и резюме.

Если разложить систему на шаги, их три: перевести разговор из аудио в текст, определить тип диалога и привести его в порядок (почистить мусор, определить кто где говорит), а потом сравнить — общался менеджер по скрипту или нет.

Считает всё это Claude Sonnet 5. Привычный и дорогой — примерно 7 центов за звонок. Передо мной стояла задача понять: можно ли посадить на эту работу модель в разы дешевле и не потерять в качестве?

Кандидаты — китайцы. DeepSeek V4 PRO дешевле Клода почти в 9 раз, меньше цента за звонок. Qwen 3.7 MAX — дешевле вдвое.

Как я тестировал

Прогнал 366 диалогов с клиентами через все три модели. 27 оказались техническим мусором, дальше считаю по 339. Каждая получила одинаковую инструкцию и один и тот же эталонный скрипт продаж. Разборы обезличил и перемешал, чтобы судья не знал, где чья модель.

Участники и судьи

Разборы делали три модели — Claude Sonnet 5, DeepSeek V4 PRO и Qwen 3.7 MAX. Это участники.

А проверок я заложил три. Одна внутренняя, по моим инструкциям, но считал её сам Claude: он сравнивал три результата анализа между собой и смотрел каждый отдельно — годен или брак. И две внешние, чужими нейронками: GPT 5.6 Codex делал то же самое, что и Claude, а Gemini 3.1 PRO Antigravity искал выдуманные цитаты и сломанные ответы.

GPT и Gemini в конкурсе не участвовали, они только судили. А вот Claude оказался и участником, и судьёй одновременно.

Как меня чуть не обманул мой же ИИ

Первый вердикт выносил не человек, а сам Claude Code — тот агент, которым я всю систему и собираю. Прогнал тест и уверенно поставил на первое место себя же.

Дальше пришли аудиты GPT и Gemini с другими цифрами. Я вернулся к Клоду с этими результатами — и он признал, что подсуживал себе: завышал баллы собственным разборам и пропускал свои же выдумки.

Модели пытаются обмануть человека, у них есть сознание? Думаю, что в привычном нам виде нет. Судья узнаёт свой почерк. Когда модель оценивает качество, она сверяется с внутренним представлением о хорошем ответе — а оно у неё сформировано на её собственном стиле. Поэтому разбор, написанный в её манере, кажется ей полнее и глубже. Не потому что он вернее, а потому что он привычнее. Как теперь верить судьям, если даже роботы себе подсуживают?)

Цифры

Codex раскладывал разборы по трём коробкам: без единой ошибки, с мелкими огрехами (вывод верный, но формулировка кривая или пункт скрипта недожат) и брак — такому разбору верить нельзя.

МодельБез ошибокС огрехамиБракИтого пригодных
DeepSeek V4 PRO188 (55,5%)10843 (12,7%)296 (87,3%)
Qwen 3.7 MAX129 (38,1%)16050 (14,7%)289 (85,3%)
Claude Sonnet 5128 (37,8%)15556 (16,5%)283 (83,5%)

Сразу уточню, чтобы цифры не пугали: в работу годятся 296 разборов DeepSeek из 339 — это 87%. У Qwen 289 (85%), у Клода 283 (83%). По этой метрике все три идут вровень, а разница в пару пунктов на трёх сотнях звонков может быть случайностью, и делать вид, что это разгромная победа, я не буду.

Вторая проверка смотрела не на структуру, а на факты — сколько раз модель выдумала несуществующую фразу клиента, чужое имя, сумму, которой не было.

Gemini AntigravityClaudeDeepSeekQwen
Галлюцинации49676
Ошибки ответа1121

Разборов без единой ошибки у DeepSeek 55,5% против 37,8% у Клода — за ним заметно реже надо перечитывать. А выдуманных фактов 6 против 49.

Итог

Qwen выбывает. Модель, которая в 76 звонках сочиняет имена операторов и суммы списаний, генерит претензии к менеджерам на ровном месте. И да, у него при этом 85% годных разборов — просто судьи меряли разное. GPT смотрел, похож ли разбор на правду по структуре. Gemini лез в текст разговора и проверял каждую цитату. Поэтому Qwen выглядит прилично у одного судьи и катастрофой у другого.

Claude сам выдумывает 49 раз, полностью верных разборов у него меньше всех, а стоит он в 9 раз дороже. Единственный его плюс — разбор написан красивее и «глубже». Но в нашем случае это не имеет значения: мне нужен точный факт для отчёта менеджеру, а не красивый текст.

Переводим весь разбор звонков на DeepSeek.

И да, деньги. Минус 89% на нашем объёме — десятки долларов в месяц, не та сумма, ради которой переписывают рабочую систему. Ради чего стоило — восьмикратная разница по выдумкам и возможность не зависеть от одной нейронки.

Главный урок — не про модели, а про то, как быстро всё меняется. Ещё в апреле я писал, что нет одной лучшей нейронки под задачу надолго. Полгода назад Claude выигрывал у всех, сегодня его обходит модель в девять раз дешевле.

Скрин с результатами исследования ниже.

Изображение 1