Чек-лист
кодовое словоВеса

Открытые веса: скачать может каждый, запустить почти никто

Первую модель лаборатории бывшего технического директора OpenAI отдали целиком и бесплатно. Только полная версия весит 1,9 ТБ, и по официальной модель-карте ей нужно 16 серверных видеокарт.

Содержание6 глав
  1. 01Открытая модель или подписка
  2. 02Семь вопросов до того, как что-то скачивать
  3. 03Сколько железа реально нужно
  4. 04Три пути, если открытые веса тебе подходят
  5. 05Три ошибки, которые стоят денег
  6. 06Где смотреть первоисточники

Открытая модель или подписка

Модель с открытыми весами можно скачать бесплатно и владеть ей вечно. Вопрос только в том, сможешь ли ты её запустить и нужно ли тебе это вообще. Пройди семь вопросов — и решение станет очевидным.

Семь вопросов до того, как что-то скачивать

01
Твои данные обязаны остаться внутри контура
Медицина, финансы, персональные данные клиентов, коммерческая тайна. Если да — это главный и, по сути, единственный неоспоримый аргумент за открытые веса
02
Тебе нужна модель под одну узкую задачу, а не «умная вообще»
Открытая база выигрывает не сырой мощностью, а тем, что её дообучают под конкретный домен. Если задача широкая — подписка на топовую закрытую модель почти всегда сильнее
03
У тебя есть железо или бюджет на аренду вычислений
Полная точность крупной открытой модели — это стойка серверных видеокарт, а не рабочий ноутбук. Цифры в таблице ниже
04
Есть человек, который будет это обслуживать
Обновления, мониторинг, откаты, замеры качества. У подписки это делает провайдер, у своей модели — ты
05
Ты посчитал стоимость на реальном объёме запросов
На малых объёмах API почти всегда дешевле собственного сервера. Своё железо начинает выигрывать только на постоянной высокой нагрузке
06
Тебе критично, что доступ не отключат и цену не поднимут
Лицензия Apache 2.0 действительно означает «навсегда твоё»: дообучать, менять и использовать коммерчески. Закрытая модель может исчезнуть вместе с решением вендора
07
Ты готов взять на себя безопасность
Вместе с весами ты забираешь и ответственность: фильтрация запросов, ограничение частоты, свои проверки перед запуском
Как читать результат
Отмечено пять пунктов и больше — открытые веса имеют смысл, иди в раздел «Три пути». Отмечено три-четыре — начни с дообучения в облаке, своё железо пока не покупай. Отмечено два и меньше — тебе нужна подписка или API. Открытая модель обойдётся дороже и будет слабее.

Сколько железа реально нужно

01
Полная точность (BF16)
~1,9 ТБ файл, >2 ТБ видеопамяти
8 карт NVIDIA B300 или 16 карт H200 — серверная стойка
02
Квантование NVFP4
от 600 ГБ
4 карты B300 или 8 карт H200
03
4-битный квант
~600 ГБ
Всё ещё несколько серверных карт
04
1-битный квант
~280–295 ГБ
Минимальный рабочий вариант: машина класса Mac Studio Ultra, качество заметно ниже
05
Облегчённая версия модели
кратно меньше
12 млрд активных параметров вместо 41 млрд — реалистичный вход для небольшой команды

Три пути, если открытые веса тебе подходят

01
Скачать веса
Полный контроль и максимальная приватность. Дороже всего по железу и людям. Имеет смысл, когда данные не имеют права покидать периметр
02
Взять ту же модель по API
Together AI, Fireworks, Modal, Databricks, Baseten. Ноль вложений в железо, при этом модель открытая — провайдера можно сменить в любой момент
03
Дообучить в облаке
Обучаешь под свою задачу на чужих мощностях, забираешь готовый чекпоинт. Средний путь: своя модель без своей серверной

Три ошибки, которые стоят денег

01
Считать «открытая» синонимом «лучшая»
Лаборатории прямо пишут, что их открытая модель не сильнейшая на рынке. Ценность в том, что её можно довести под себя, а не в верхней строчке рейтинга
02
Покупать железо до первого замера
Сначала прогони задачу через API той же модели и посчитай реальный объём запросов. Сервер докупишь, когда счёт за API станет больше стоимости стойки
03
Брать самый большой размер «на вырост»
Облегчённые версии на многих прикладных задачах идут вровень со старшими и стоят кратно дешевле в обслуживании

Где смотреть первоисточники

01
thinkingmachines.ai/news/introducing-inkling
Официальный анонс модели: архитектура, на чём обучали, честная оценка от самой лаборатории
02
thinkingmachines.ai/model-card/inkling
Модель-карта: лицензия, требования к видеопамяти, зона ответственности того, кто разворачивает
03
huggingface.co/thinkingmachines/Inkling
Сами веса и форматы файлов
04
unsloth.ai/docs/models/inkling
Таблица квантов и памяти: сколько нужно под каждый вариант сжатия
05
thinkingmachines.ai/tinker
Дообучение в облаке и список поддерживаемых открытых моделей
06
artificialanalysis.ai
Независимые замеры моделей. Оценки обновляются — сверяйся здесь перед решением
07
huggingface.co/moonshotai/Kimi-K3
Крупнейший открытый релиз: 2,8 трлн параметров и та же история с железом