Posted on

Модели с открытыми весами: что можно запустить у себя бесплатно

https://thecode.media/otkrytye-vesa-modeley

Это страница журнала Яндекс Практикума «Код» — статья о моделях с открытыми весами: как их запускать локально, читать лицензии и оценивать требования к железу.

Чем открытые веса отличаются от открытого кода

Открытые веса не равноценны открытому исходному коду. Вместе с весами обычно дают только файлы модели (в форматах safetensors или GGUF), конфиг архитектуры, токенизатор и карточку модели. Полноценный открытый код подразумевает ещё и публикацию кода обучения, скриптов подготовки данных и описания датасета — такое встречается редко. Open Source Initiative (OSI) считает, что модели с открытыми весами не дают всех четырёх свобод, которые нужны для статуса «открытой системы». 12

Какие лицензии бывают и что проверять перед использованием

Самые разрешительные лицензии — Apache 2.0 и MIT: они позволяют коммерческое использование, изменение и распространение моделей с условием сохранения уведомления об авторстве. 3

Есть и вендорские лицензии с условиями:

  • Llama Community License от Meta разрешает коммерческое использование, но при более 700 млн активных пользователей в месяц нужна отдельная лицензия. 4
  • Modified MIT у Kimi K2 требует показывать название модели в интерфейсе при обороте выше 100 млн пользователей в месяц или 20 млн долларов выручки. 5
  • Лицензия MiniMax меняется от версии к версии — например, M2.7 вышла под фактически некоммерческой лицензией.

Перед использованием модели нужно проверить:

  • тип лицензии;
  • ограничения по числу пользователей или выручке;
  • требования к атрибуции;
  • условия дообучения и распространения производных моделей; 6
  • отдельную лицензию на датасет, если он опубликован отдельно.

Как понять, влезет ли модель в железо

Объём нужной видеопамяти примерно равен числу параметров модели, умноженному на количество байт на параметр, плюс 10–20 % на контекст и KV‑кэш. 7

Квантизация сжимает веса модели, уменьшая потребность в памяти ценой небольшой потери качества: FP16 — около 2 байт на параметр (эталонное качество), Q8 — около 1 байта (почти незаметная потеря качества), а также Q4 — 0,5–0,7 байта (заметная, но обычно приемлемая просадка). 8

Ориентировочные требования к видеопамяти для Q4‑квантизации:
7–8 B — 6–8 ГБ, 13–14 B — 8–12 ГБ, 32 B — 20–24 ГБ, а также 70 B — от 40 ГБ.

Особенности: у MoE‑моделей (Mixture‑of‑Experts) память нужна под все параметры сразу, а скорость генерации зависит от активных параметров; если модель не влезает в видеопамять, часть слоёв можно выгрузить в оперативную память (но скорость упадёт); у Mac на Apple Silicon память общая для CPU и GPU — система может использовать почти весь объём без выгрузки. 9

Российские модели и другие примеры

Среди российских моделей с открытыми весами — линейка GigaChat3 и Kandinsky 5.0 от Сбера, T‑Lite и T‑Pro 2.0 от Т‑Банка, модели сообщества Vikhr. 10

Также есть открытые модели для: генерации изображений (например, Stable Diffusion), видео (Kandinsky 5.0 Video Lite и Video Pro), распознавания и синтеза речи (GigaAM‑v3, Whisper), а также работы с кодом (инструктивные версии Qwen и DeepSeek).

Когда локальный запуск выгоднее облачного API

Локальный запуск оправдан: при работе с чувствительными данными, которые нельзя отправлять наружу, для работы офлайн, а также когда важна предсказуемость задержки.

Но для небольшой команды с умеренным трафиком облачное API часто дешевле: локальный сервер окупается только при обработке десятков миллионов токенов ежемесячно. 11

Частые ошибки при выборе модели

Ориентация на общее число параметров вместо активных у MoE, скачивание базовой модели вместо инструктивной (без суффикса -Instruct/-it модель не годится для диалога), выбор максимально возможного размера модели без учёта задачи, игнорирование лицензии до релиза продукта, забывание про KV‑кэш при длинном контексте, оценка модели по бенчмаркам вместо своих задач, а также отсутствие проверки даты релиза и версии модели.