Главная Журнал Как оптимизировать стоимость DeepSeek, когда он подорожал в 4,5 раза?

Заметка

Как оптимизировать стоимость DeepSeek, когда он подорожал в 4,5 раза?

Я ранее писал о том как мы переехали с дорогих токенов Claude на DeepSeek в оценке качества звонков.

По причине того, что DeepSeek в результатах анализа разговоров клиента оказался выше и дешевле примерно на 90%. Долго ждать не пришлось и DeepSeek подорожал примерно в 2,3 раза в дешевые часы и до 4,5 раза в пиковые, если считать по исходящим токенам V4 Pro. Входящие токены выросли с $0.435 до $0.66 в дешевые часы и до $1.32 в пиковые за миллион токенов. Исходящие — с $0.87 до $1.98 и $3.96 соответственно.

У нас через систему проходит около 200 звонков и 100 переписок в день. Это 9 000 диалогов в месяц, каждый из которых читает нейронка. Умножьте подорожание на такой объём и посмотрите на счёт 🤯

Но мы нашли решение. Чтобы контроль звонков менеджеров не стал космически дорогим мы

  1. Сделали оценку тогда, когда DeepSeek дает возможность использовать токены дешевле. Теперь у них 7 дорогих и 17 дешевых часов в сутки. В дешевые часы токены стоят ровно в два раза дешевле, чем в пиковые. По турецкому времени дорогие окна — с 04:00 до 07:00 и с 09:00 до 13:00. Поэтому нам не обязательно анализировать звонок сразу после его завершения. Мы просто складываем их в очередь и отправляем на оценку в дешевые часы.
  2. Использовали методологию повторяющего промта. Большая часть нашего промта для оценки каждого звонка одинаковая: правила, критерии оценки, инструкции и т.д. DeepSeek умеет кэшировать такой повторяющийся кусок. То есть если один и тот же большой промт уже отправлялся раньше, его не нужно каждый раз обрабатывать по полной стоимости. Такой входящий токен в дешевые часы стоит $0.022 за миллион против $0.66 у обычного — разница в 30 раз. А по полной стоимости считается уже в основном новая часть — сам конкретный разговор.

Кэш дешевле даже той цены, по которой мы платили ДО подорожания: $0.022 против $0.435. То есть на входе мы теперь платим в 20 раз меньше, чем когда всё было «дёшево». Выход подорожал, а вход упал.

Тем самым после сильно выросшей стоимости, нам удалось оптимизировать стоимость практически до старых значений.

Чем заплатили. Раньше критичная ошибка менеджера прилетала почти сразу. Теперь — с задержкой, всё уезжает в очередь. Для нас это не критично. Водитель не теряется за 20 минут, цикл сделки у нас дни, а не секунды. Реалтайм в контроле качества удобно, но по факту нам хватает «в течение дня». За реалтайм просто надо доплачивать, и мы решили, что оно того не стоит.

Мой вывод. Модель может подорожать в 4,5 раза за одну ночь, и узнаешь ты об этом из счёта. А вот архитектура — очередь, кэш и готовность отказаться от реалтайма — это то, что ты контролируешь сам. Поэтому чаще стоимость твоего ИИ решения зависит от архитектуры, а не модели.

Спасибо, что дочитали 🙏