В прошлом посте я писал, что начинаю экспериментировать с китайскими модельками. Моё мини-исследование готово, результаты ниже.
У нас работает AI-ОКК — звонки отдела продаж таксопарка сами превращаются в текст и оцениваются нейронкой по нашим скриптам. На выходе: где менеджер накосячил, что сделал хорошо, балл и резюме.
Если разложить систему на шаги, их три: перевести разговор из аудио в текст, определить тип диалога и привести его в порядок (почистить мусор, определить кто где говорит), а потом сравнить — общался менеджер по скрипту или нет.
Считает всё это Claude Sonnet 5. Привычный и дорогой — примерно 7 центов за звонок. Передо мной стояла задача понять: можно ли посадить на эту работу модель в разы дешевле и не потерять в качестве?
Кандидаты — китайцы. DeepSeek V4 PRO дешевле Клода почти в 9 раз, меньше цента за звонок. Qwen 3.7 MAX — дешевле вдвое.
Как я тестировал
Прогнал 366 диалогов с клиентами через все три модели. 27 оказались техническим мусором, дальше считаю по 339. Каждая получила одинаковую инструкцию и один и тот же эталонный скрипт продаж. Разборы обезличил и перемешал, чтобы судья не знал, где чья модель.
Участники и судьи
Разборы делали три модели — Claude Sonnet 5, DeepSeek V4 PRO и Qwen 3.7 MAX. Это участники.
А проверок я заложил три. Одна внутренняя, по моим инструкциям, но считал её сам Claude: он сравнивал три результата анализа между собой и смотрел каждый отдельно — годен или брак. И две внешние, чужими нейронками: GPT 5.6 Codex делал то же самое, что и Claude, а Gemini 3.1 PRO Antigravity искал выдуманные цитаты и сломанные ответы.
GPT и Gemini в конкурсе не участвовали, они только судили. А вот Claude оказался и участником, и судьёй одновременно.
Как меня чуть не обманул мой же ИИ
Первый вердикт выносил не человек, а сам Claude Code — тот агент, которым я всю систему и собираю. Прогнал тест и уверенно поставил на первое место себя же.
Дальше пришли аудиты GPT и Gemini с другими цифрами. Я вернулся к Клоду с этими результатами — и он признал, что подсуживал себе: завышал баллы собственным разборам и пропускал свои же выдумки.
Модели пытаются обмануть человека, у них есть сознание? Думаю, что в привычном нам виде нет. Судья узнаёт свой почерк. Когда модель оценивает качество, она сверяется с внутренним представлением о хорошем ответе — а оно у неё сформировано на её собственном стиле. Поэтому разбор, написанный в её манере, кажется ей полнее и глубже. Не потому что он вернее, а потому что он привычнее. Как теперь верить судьям, если даже роботы себе подсуживают?)
Цифры
Codex раскладывал разборы по трём коробкам: без единой ошибки, с мелкими огрехами (вывод верный, но формулировка кривая или пункт скрипта недожат) и брак — такому разбору верить нельзя.
| Модель | Без ошибок | С огрехами | Брак | Итого пригодных |
|---|---|---|---|---|
| DeepSeek V4 PRO | 188 (55,5%) | 108 | 43 (12,7%) | 296 (87,3%) |
| Qwen 3.7 MAX | 129 (38,1%) | 160 | 50 (14,7%) | 289 (85,3%) |
| Claude Sonnet 5 | 128 (37,8%) | 155 | 56 (16,5%) | 283 (83,5%) |
Сразу уточню, чтобы цифры не пугали: в работу годятся 296 разборов DeepSeek из 339 — это 87%. У Qwen 289 (85%), у Клода 283 (83%). По этой метрике все три идут вровень, а разница в пару пунктов на трёх сотнях звонков может быть случайностью, и делать вид, что это разгромная победа, я не буду.
Вторая проверка смотрела не на структуру, а на факты — сколько раз модель выдумала несуществующую фразу клиента, чужое имя, сумму, которой не было.
| Gemini Antigravity | Claude | DeepSeek | Qwen |
|---|---|---|---|
| Галлюцинации | 49 | 6 | 76 |
| Ошибки ответа | 1 | 12 | 1 |
Разборов без единой ошибки у DeepSeek 55,5% против 37,8% у Клода — за ним заметно реже надо перечитывать. А выдуманных фактов 6 против 49.
Итог
Qwen выбывает. Модель, которая в 76 звонках сочиняет имена операторов и суммы списаний, генерит претензии к менеджерам на ровном месте. И да, у него при этом 85% годных разборов — просто судьи меряли разное. GPT смотрел, похож ли разбор на правду по структуре. Gemini лез в текст разговора и проверял каждую цитату. Поэтому Qwen выглядит прилично у одного судьи и катастрофой у другого.
Claude сам выдумывает 49 раз, полностью верных разборов у него меньше всех, а стоит он в 9 раз дороже. Единственный его плюс — разбор написан красивее и «глубже». Но в нашем случае это не имеет значения: мне нужен точный факт для отчёта менеджеру, а не красивый текст.
Переводим весь разбор звонков на DeepSeek.
И да, деньги. Минус 89% на нашем объёме — десятки долларов в месяц, не та сумма, ради которой переписывают рабочую систему. Ради чего стоило — восьмикратная разница по выдумкам и возможность не зависеть от одной нейронки.
Главный урок — не про модели, а про то, как быстро всё меняется. Ещё в апреле я писал, что нет одной лучшей нейронки под задачу надолго. Полгода назад Claude выигрывал у всех, сегодня его обходит модель в девять раз дешевле.
Скрин с результатами исследования ниже.
