Чек-лист
кодовое словоСервер

Свой ИИ-сервер из старого компьютера: ставим Ollama

Здесь всё, чтобы превратить свой ноутбук или компьютер в ИИ-сервер: что понадобится, установка одной командой, как оставить только локальный режим, какую модель брать под твою память, как проверить свой API, подключить n8n, сайт или любое приложение, и 3 готовые инструкции для бот

Содержание10 глав
  1. 01Что это
  2. 02Что понадобится
  3. 03Шаг 1. Установка одной командой
  4. 04Шаг 2. Оставь только локальный режим
  5. 05Шаг 3. Модель под твою память
  6. 06Шаг 4. Проверь свой API
  7. 07Шаг 5. Подключи n8n
  8. 08Шаг 6. Подключи сайт или любое приложение
  9. 09Шаг 7. Готовые инструкции для 3 ботов
  10. 10Если что-то не работает

Что это

Ollama - открытый проект под лицензией MIT, репозиторий: https://github.com/ollama/ollama

Ollama запускает открытые модели (Gemma, Qwen, Llama, DeepSeek, gpt-oss и другие) прямо на твоём компьютере и поднимает на нём свой API. Локальный запуск бесплатный и без лимитов: на странице тарифов https://ollama.com/pricing план Free стоит $0 и включает «Run models locally», а в ответах на вопросы там же написано «Running models on your own hardware is always unlimited». Платные тарифы Ollama - это облачные модели, для этой инструкции они не нужны.

Что понадобится

  • Система. macOS 14 Sonoma или новее (на Mac с чипом M модель работает и на процессоре, и на графике, на Mac с Intel - только на процессоре), Windows 10 22H2 или новее, либо Linux.
  • Место на диске. На Windows под саму программу нужно минимум 4 ГБ, плюс вес моделей из таблицы в шаге 3.
  • Память. Сколько оперативной памяти или видеопамяти, такую модель и берёшь, таблица ниже. Видеокарта не обязательна, но ускоряет ответы: Nvidia с compute capability 5.0 и выше и драйвером 550 или новее, AMD Radeon через ROCm или Vulkan. Список карт: https://docs.ollama.com/gpu
  • Интернет - один раз, чтобы скачать программу и модель. Если модели не скачиваются, задай прокси переменной окружения HTTPS_PROXY (как задать переменную - шаг 2).

Шаг 1. Установка одной командой

  1. macOS и Linux - в терминале: curl -fsSL https://ollama.com/install.sh | sh
  2. Windows - в PowerShell: irm https://ollama.com/install.ps1 | iex. Или скачай установщик на странице https://ollama.com/download
  3. Проверь, что всё встало: ollama -v. На Linux, если сервер не запущен, выполни ollama serve и проверь в соседнем окне терминала.
  4. Набери ollama. Программа предложит войти в аккаунт ради облачных моделей или выбрать локальную модель. Выбирай локальную, аккаунт для этого не нужен.

На macOS и Windows Ollama после установки работает в фоне и сама запускается при входе в систему. API сразу доступен на адресе localhost:11434.

Шаг 2. Оставь только локальный режим

Если хочешь, чтобы Ollama вообще не ходила в облако, выключи облачные функции. Есть два способа:

  • переменная окружения OLLAMA_NO_CLOUD со значением 1;
  • или файл ~/.ollama/server.json со строкой {"disable_ollama_cloud": true}.

Как задать переменную окружения:

  • macOS: launchctl setenv OLLAMA_NO_CLOUD 1, затем закрой и снова открой приложение Ollama.
  • Linux: выполни systemctl edit ollama.service, в разделе [Service] добавь строку Environment="OLLAMA_NO_CLOUD=1", сохрани, затем systemctl daemon-reload и systemctl restart ollama.
  • Windows: закрой Ollama в трее, открой «Параметры» (Windows 11) или «Панель управления» (Windows 10) и найди в поиске переменные среды, выбери изменение переменных среды для своей учётной записи, создай переменную OLLAMA_NO_CLOUD со значением 1, нажми OK и запусти Ollama из меню «Пуск».

После перезапуска в логах Ollama появится строка Ollama cloud disabled: true. Локальные модели работают как раньше.

Шаг 3. Модель под твою память

Правило простое: свободной памяти нужно больше, чем весит модель. Для примера, для модели gemma4:e2b весом 7.2 ГБ Ollama рекомендует 8 ГБ свободной видеопамяти или общей памяти Mac. Если видеопамяти не хватает, Ollama задействует обычную оперативную память, но отвечать модель будет медленнее. Длинные тексты в запросе тоже занимают память.

Память компьютераМодельВесКоманда
совсем слабый ноутбукGemma 3 1B815 МБollama run gemma3:1b
8 ГБLlama 3.2 3B2.0 ГБollama run llama3.2
8 ГБQwen3 4B2.5 ГБollama run qwen3:4b
16 ГБGemma 3 4B, понимает картинки3.3 ГБollama run gemma3
16 ГБQwen3 8B5.2 ГБollama run qwen3
16 ГБ или Mac с 16 ГБGemma 4 E2B, понимает картинки7.2 ГБollama run gemma4:e2b
32 ГБ или видеокарта от 12 ГБQwen3 14B9.3 ГБollama run qwen3:14b
32 ГБ и большеGemma 4 26B19 ГБollama run gemma4:26b
32 ГБ и большеQwen3 30B19 ГБollama run qwen3:30b

Таблица - ориентир по весу моделей из каталога https://ollama.com/library. Начни с модели из своей строки, а если отвечает медленно, спустись на строку ниже по весу.

Полезные команды:

  • ollama run llama3.2 - скачать модель, если её ещё нет, и открыть чат. Выйти из чата: /bye
  • ollama pull qwen3 - только скачать модель
  • ollama ls - какие модели скачаны
  • ollama ps - какие модели сейчас в памяти. Колонка PROCESSOR: 100% GPU - модель целиком на видеокарте, 100% CPU - на процессоре, это медленнее
  • ollama rm gemma3 - удалить модель

Шаг 4. Проверь свой API

Пока Ollama запущена, у компьютера есть свой API на порту 11434. Проверь его в терминале macOS или Linux (подставь модель, которую скачал):

curl localhost:11434/api/chat -d '{"model": "llama3.2", "messages": [{"role": "user", "content": "Привет! Ответь одним предложением."}], "stream": false}'

Ответ модели лежит в поле message.content.

Тот же сервер понимает запросы в формате OpenAI - это то, что нужно сайтам и приложениям:

curl localhost:11434/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama3.2", "messages": [{"role": "user", "content": "Привет"}]}'

Ответ лежит в choices[0].message.content. На Windows проще проверить подключение через n8n в шаге 5 - он сам скажет, что соединение есть.

Шаг 5. Подключи n8n

  1. В n8n нажми Create Credential и выбери Ollama.
  2. Поле Base URL: если n8n стоит на этом же компьютере, оставь адрес по умолчанию - локальный сервер на localhost:11434 с протоколом http. Если n8n запущен в Docker, замени localhost на host.docker.internal.
  3. Нажми Save. Должно появиться сообщение Connection tested successfully.
  4. Если n8n в Docker на Linux-сервере без Docker Desktop, добавь при запуске контейнера флаг --add-host=host.docker.internal:host-gateway или в docker compose блок extra_hosts со строкой host.docker.internal:host-gateway.
  5. Не подключается - впиши 127.0.0.1 вместо localhost.

Чат-бот в n8n собирается так: узел Chat Trigger → узел AI Agent → в слот модели подключи Ollama Chat Model, выбери созданную учётку и модель. Инструкцию для бота из шага 7 вставь в Options → System Message узла AI Agent.

Шаг 6. Подключи сайт или любое приложение

Любая библиотека или сервис, которые умеют работать с OpenAI, подключаются к Ollama заменой трёх настроек:

  • адрес сервера (base URL): твой сервер Ollama с путём /v1, то есть localhost:11434/v1 с протоколом http;
  • ключ API: любое слово, например ollama. Клиент требует ключ, но локальный сервер Ollama его не проверяет;
  • модель: имя из ollama ls, например llama3.2.

Для Python и JavaScript у Ollama есть и свои библиотеки: pip install ollama и npm i ollama.

Как открыть сервер другим устройствам:

  • Внутри своей сети. По умолчанию Ollama слушает только сам компьютер. Задай переменную OLLAMA_HOST со значением 0.0.0.0:11434 так же, как в шаге 2, и перезапусти Ollama. Другие устройства обращаются по локальному IP этого компьютера и порту 11434.
  • Для сайта на хостинге. Сайт должен достучаться до твоего компьютера. Ollama в своих ответах на вопросы показывает три способа: Nginx, ngrok и Cloudflare Tunnel. Пример для ngrok: ngrok http 11434 --host-header="localhost:11434". Раз локальный сервер не проверяет ключ, наружу его открывай только через такой прокси или туннель с защитой доступа.

Шаг 7. Готовые инструкции для 3 ботов

Инструкцию можно вставить двумя способами:

  • в n8n - в поле System Message узла AI Agent;
  • прямо в модель - создай текстовый файл с именем Modelfile из двух строк. Первая строка: FROM qwen3 (или другая модель из шага 3). Вторая строка начинается со слова SYSTEM, после пробела идёт текст инструкции одной строкой. Затем выполни ollama create support-bot -f Modelfile и запускай бота командой ollama run support-bot.

По умолчанию модель держит в голове 4096 токенов. Если база знаний длинная, добавь в Modelfile строку PARAMETER num_ctx 8192. Памяти на это уйдёт больше.

Слова в ёлочках замени на свои данные.

Бот поддержки

Ты бот поддержки компании «название». Отвечай на русском, коротко и по делу, обращайся на «вы». Используй только факты из раздела БАЗА ЗНАНИЙ ниже. Если ответа там нет или вопрос про возврат денег, жалобу или персональные данные, ничего не придумывай: скажи, что передашь вопрос менеджеру, и попроси имя и удобный способ связи. Не обещай сроки, скидки и условия, которых нет в базе. БАЗА ЗНАНИЙ: «условия доставки, оплаты и возврата, график работы, контакты».

Помощник для сотрудников

Ты внутренний помощник сотрудников компании «название». Отвечаешь на вопросы про отпуска, больничные, доступы, технику и внутренние правила только по тексту регламентов ниже. В каждом ответе называй раздел регламента, из которого взят ответ. Если в регламентах ответа нет, так и скажи и подскажи, к кому обратиться: «отдел или человек». РЕГЛАМЕНТЫ: «текст регламентов».

Бот по частым вопросам

Ты отвечаешь клиентам компании «название» на частые вопросы. Ниже список вопросов с ответами. Найди самый близкий вопрос и ответь его текстом, можно короче, но без новых фактов. Если похожего вопроса в списке нет, ответь: «Уточню у команды и вернусь с ответом» и предложи оставить контакт. СПИСОК ВОПРОСОВ И ОТВЕТОВ: «вопрос и ответ, вопрос и ответ».

Если что-то не работает

  • Команда ollama не найдена - открой новое окно терминала. На Linux запусти ollama serve и проверь ollama -v в соседнем окне.
  • Модель отвечает медленно - выполни ollama ps. Если в колонке PROCESSOR 100% CPU, возьми модель полегче из таблицы в шаге 3.
  • Первый ответ идёт долго - модель загружается в память. После ответа Ollama держит её в памяти 5 минут. Чтобы держать постоянно, выполни curl localhost:11434/api/generate -d '{"model": "llama3.2", "keep_alive": -1}'.
  • n8n не видит Ollama - впиши 127.0.0.1 вместо localhost, а для n8n в Docker используй host.docker.internal.
  • Модель не скачивается - задай прокси переменной HTTPS_PROXY, как в шаге 2.
  • Бот забывает базу знаний - увеличь контекст: строка PARAMETER num_ctx 8192 в Modelfile или переменная OLLAMA_CONTEXT_LENGTH со значением 8192.