Главная Журнал Бесплатные ИИ-модели, которые можно поставить на свой сервер

Заметка

Бесплатные ИИ-модели, которые можно поставить на свой сервер

Бесплатные ИИ-модели, которые можно поставить на свой сервер. Зачем AI - гиганты их раздают?

Меня периодически спрашивают о бесплатных, open-source моделях LLM, которые можно ставить на свой сервак и при желании даже продавать к ним доступ за токены. Как это работает и почему IT гиганты отдают их бесплатно — ниже.

Начнем с того, что список моделей, которые вы можете использовать бесплатно на своём железе достаточно большой, ниже я приведу часть из них:

США: OpenAI (gpt-oss), Meta (Llama, Muse Glimmer), Google (Gemma), Microsoft (Phi), NVIDIA (Nemotron), IBM (Granite), Cohere (Command A+), Allen Institute (OLMo)Китай: Alibaba (Qwen), DeepSeek, Z.ai (GLM), Moonshot (Kimi), MiniMax, Baidu (ERNIE), Tencent (Hunyuan), ByteDance (Seed)Остальные: Mistral AI, TII (Falcon), LG (EXAONE)Не мало, да? Бесплатно - не всегда без условий: у Meta лимит по числу пользователей, у Alibaba — доля с выручки выше $50 млн. Малому бизнесу не грозит, но лицензию читать надо ☝️

Зачем компании раздают свои модели? На это есть несколько причин, основные из них опишу ниже.

  1. Захват стандарта. Если тысячи разработчиков строят продукты на Qwen или Llama — модель становится частью инфраструктуры. Слезть с неё потом сложно.
  2. Продажа облака. Веса бесплатные, но GPU-кластер поднимать никто не хочет. Alibaba раздаёт Qwen — и зарабатывает на Alibaba Cloud.
  3. Давление на конкурентов. Когда сильная модель лежит бесплатно, OpenAI и Anthropic сложнее держать цены.
  4. Бесплатное тестирование и кадры. Миллионы разработчиков находят ошибки, делают оптимизации и датасеты. Лучшие потом идут работать в эту компанию.
  5. Обесценить чужой продукт. Если конкурент зарабатывает на продаже самой модели — сделай модель копеечным товаром и зарабатывай на другом уровне цепочки.

Как запускается модель на своём железе?

На самом деле достаточно просто. Вы сами можете купить или арендовать сервер и поставить на него свою модель. Многие модели не весят миллионы терабайтов как часто думают. Вполне рабочие модели под определенные задачи могут весить несколько гигабайт.

Какое железо подойдет на примере китайской Qwen3-32B: Сама модель весит около 20 ГБ. Нужна видеокарта на 24 ГБ (RTX 3090/4090) впритык, комфортно — 48 ГБ, плюс 32–64 ГБ оперативки. Да, это дороже подписки, но во многих случае дешевле токенов. Для своего последнего проекта железо с почасовой оплатой брал здесь vast.ai.

Что эта Qwen тянет: парсинг и структурирование данных, классификация, вытаскивание контактов из текста, ответы по базе знаний, простой код, тексты на русском, английском и турецком. Не тянет сложные многошаговые рассуждения уровня Claude — там ошибается чаще.

Мой кейс с такими моделями.

На днях я запускал своего ИИ-Агента, который занимается сбором контактов (лидов) для B2B сегмента. По сути по определенному запросу ищет тех, кому бизнес может продавать свои услуги и делает это в отличии от того же GPT даже в режиме поиск или Deep Research в промышленных объёмах. То есть может добывать и сортировать тысячи контактов за короткое время. Для этого агента я изначально использовал DeepSeek, но из-за того, что токены DeepSeek выходил дороговато, я смог поставить и адаптировать бесплатную open-source модель от Qwen. Что кстати не уменьшило качество, зато повысило скорость обработки. Стандартный сбор 1000 контактов вместо часа стал около 40 минут.

По факту я собрал агента с оплатой не за токены, а за железо на котором он находится, что вышло дешевле.

Ну и напоследок

Open-source не значит совсем бесплатно. Платишь не за токены, а за железо, настройку и за то, что за качество отвечаешь ты, а не Alibaba. Это выгодно это на потоке — когда агент делает тысячи запросов в сутки. Для разовых задач и там, где нужны мозги уровня Claude — проще платить за API. Но для бизнеса это как минимум - безопасность, так как данные можно хранить на своем сервере и экономия на больших и объёмных задачах.

Спасибо, что дочитали 🙏