
Чек-лист
кодовое словоЛОКАЛ
whichllm
whichllm сканирует видеокарту и оперативку и ранжирует локальные LLM, которые реально потянет твоё железо, по настоящим бенчмаркам. Можно даже симулировать видеокарту до покупки.
Содержание5 глав
Выбор локальной модели вслепую почти всегда заканчивается либо зависанием железа, либо слабой моделью, которая недогружает GPU. whichllm — консольный инструмент, который сам определяет твоё железо и ранжирует модели с HuggingFace по реальным бенчмаркам, а не по размеру. Ниже — как поставить, какими командами пользоваться и на что не полагаться буквально.
Важно
Формулировка «результат за 5 секунд» — маркетинговое упрощение, на практике это ближе к минуте на первый запуск. Точные флаги команд могут отличаться между версиями — актуальный список смотрите в CLI reference репозитория, а не полагайтесь только на этот список.
1. Что это и почему не «чем больше параметров, тем лучше»
- Логика: модели ранжируются по реальным бенчмаркам (LiveBench, Artificial Analysis, Aider, Chatbot Arena ELO, Open LLM Leaderboard), а не по размеру или числу параметров.
- Пример: модель, которая технически влезает в видеопамять, может занять место ниже более новой и меньшей — потому что её бенчмарки хуже.
- Репозиторий: github.com/Andyyyy64/whichllm, около 4,8 тыс. звёзд на момент проверки.
- Итог: один запуск команды вместо навигации по TUI и запоминания горячих клавиш.
2. Установка
uvx whichllm@latest # разовый запуск без установки
uv tool install whichllm # постоянная установка
pip install whichllm # через pip (подтверждено на pypi.org/project/whichllm)
brew install andyyyy64/whichllm/whichllm # через Homebrew
3. Основные команды
whichllm # определяет GPU/CPU/RAM и показывает топ моделей
whichllm --gpu "RTX 4090" # симуляция GPU: что потянет конкретная видеокарта, до покупки
whichllm plan "llama 3 70b" # обратный подбор: какая видеокарта нужна под модель
whichllm run "qwen 2.5 1.5b gguf" # скачивает и запускает модель без ручной настройки окружения
whichllm snippet "qwen 7b" # печатает Python-код для запуска модели напрямую
Одна команда — конкретный ответ, без TUI и горячих клавиш.
4. Как считается оценка модели
- Ядро оценки: объединённые реальные бенчмарки (LiveBench, Artificial Analysis, Aider, vision-бенчмарки, Arena ELO, Open LLM Leaderboard) с весом по достоверности источника.
- Размер модели: учитывается логарифмически, как индикатор объёма знаний, а не как главный критерий.
- Квантизация и посадка в память: младшие кванты и частичная выгрузка в CPU снижают итоговый балл.
- Маркеры достоверности: ~ — оценка интерполирована по семейству модели, !sr — оценка со слов автора загрузки, не проверена независимо, ? — данных по бенчмаркам нет вообще.
5. Что учитывать перед тем как полагаться на результат
- Список флагов и команд меняется между версиями — перед автоматизацией сверяйтесь с CLI-документацией репозитория, а не с зафиксированным списком команд.
- Модели с маркером !sr или ? ранжируются на основе слабых или отсутствующих данных — относитесь к их месту в рейтинге осторожнее, чем к моделям с прямыми бенчмарками.
- Скорость в токенах в секунду — это плановый диапазон, а не результат живого замера на конкретно вашем железе.
/ материалы


