
Свой ИИ-сервер из старого компьютера: ставим Ollama
Здесь всё, чтобы превратить свой ноутбук или компьютер в ИИ-сервер: что понадобится, установка одной командой, как оставить только локальный режим, какую модель брать под твою память, как проверить свой API, подключить n8n, сайт или любое приложение, и 3 готовые инструкции для бот
Содержание10 глав
Что это
Ollama - открытый проект под лицензией MIT, репозиторий: https://github.com/ollama/ollama
Ollama запускает открытые модели (Gemma, Qwen, Llama, DeepSeek, gpt-oss и другие) прямо на твоём компьютере и поднимает на нём свой API. Локальный запуск бесплатный и без лимитов: на странице тарифов https://ollama.com/pricing план Free стоит $0 и включает «Run models locally», а в ответах на вопросы там же написано «Running models on your own hardware is always unlimited». Платные тарифы Ollama - это облачные модели, для этой инструкции они не нужны.
Что понадобится
- Система. macOS 14 Sonoma или новее (на Mac с чипом M модель работает и на процессоре, и на графике, на Mac с Intel - только на процессоре), Windows 10 22H2 или новее, либо Linux.
- Место на диске. На Windows под саму программу нужно минимум 4 ГБ, плюс вес моделей из таблицы в шаге 3.
- Память. Сколько оперативной памяти или видеопамяти, такую модель и берёшь, таблица ниже. Видеокарта не обязательна, но ускоряет ответы: Nvidia с compute capability 5.0 и выше и драйвером 550 или новее, AMD Radeon через ROCm или Vulkan. Список карт: https://docs.ollama.com/gpu
- Интернет - один раз, чтобы скачать программу и модель. Если модели не скачиваются, задай прокси переменной окружения
HTTPS_PROXY(как задать переменную - шаг 2).
Шаг 1. Установка одной командой
- macOS и Linux - в терминале:
curl -fsSL https://ollama.com/install.sh | sh - Windows - в PowerShell:
irm https://ollama.com/install.ps1 | iex. Или скачай установщик на странице https://ollama.com/download - Проверь, что всё встало:
ollama -v. На Linux, если сервер не запущен, выполниollama serveи проверь в соседнем окне терминала. - Набери
ollama. Программа предложит войти в аккаунт ради облачных моделей или выбрать локальную модель. Выбирай локальную, аккаунт для этого не нужен.
На macOS и Windows Ollama после установки работает в фоне и сама запускается при входе в систему. API сразу доступен на адресе localhost:11434.
Шаг 2. Оставь только локальный режим
Если хочешь, чтобы Ollama вообще не ходила в облако, выключи облачные функции. Есть два способа:
- переменная окружения
OLLAMA_NO_CLOUDсо значением1; - или файл
~/.ollama/server.jsonсо строкой{"disable_ollama_cloud": true}.
Как задать переменную окружения:
- macOS:
launchctl setenv OLLAMA_NO_CLOUD 1, затем закрой и снова открой приложение Ollama. - Linux: выполни
systemctl edit ollama.service, в разделе[Service]добавь строкуEnvironment="OLLAMA_NO_CLOUD=1", сохрани, затемsystemctl daemon-reloadиsystemctl restart ollama. - Windows: закрой Ollama в трее, открой «Параметры» (Windows 11) или «Панель управления» (Windows 10) и найди в поиске переменные среды, выбери изменение переменных среды для своей учётной записи, создай переменную
OLLAMA_NO_CLOUDсо значением1, нажми OK и запусти Ollama из меню «Пуск».
После перезапуска в логах Ollama появится строка Ollama cloud disabled: true. Локальные модели работают как раньше.
Шаг 3. Модель под твою память
Правило простое: свободной памяти нужно больше, чем весит модель. Для примера, для модели gemma4:e2b весом 7.2 ГБ Ollama рекомендует 8 ГБ свободной видеопамяти или общей памяти Mac. Если видеопамяти не хватает, Ollama задействует обычную оперативную память, но отвечать модель будет медленнее. Длинные тексты в запросе тоже занимают память.
| Память компьютера | Модель | Вес | Команда |
|---|---|---|---|
| совсем слабый ноутбук | Gemma 3 1B | 815 МБ | ollama run gemma3:1b |
| 8 ГБ | Llama 3.2 3B | 2.0 ГБ | ollama run llama3.2 |
| 8 ГБ | Qwen3 4B | 2.5 ГБ | ollama run qwen3:4b |
| 16 ГБ | Gemma 3 4B, понимает картинки | 3.3 ГБ | ollama run gemma3 |
| 16 ГБ | Qwen3 8B | 5.2 ГБ | ollama run qwen3 |
| 16 ГБ или Mac с 16 ГБ | Gemma 4 E2B, понимает картинки | 7.2 ГБ | ollama run gemma4:e2b |
| 32 ГБ или видеокарта от 12 ГБ | Qwen3 14B | 9.3 ГБ | ollama run qwen3:14b |
| 32 ГБ и больше | Gemma 4 26B | 19 ГБ | ollama run gemma4:26b |
| 32 ГБ и больше | Qwen3 30B | 19 ГБ | ollama run qwen3:30b |
Таблица - ориентир по весу моделей из каталога https://ollama.com/library. Начни с модели из своей строки, а если отвечает медленно, спустись на строку ниже по весу.
Полезные команды:
ollama run llama3.2- скачать модель, если её ещё нет, и открыть чат. Выйти из чата:/byeollama pull qwen3- только скачать модельollama ls- какие модели скачаныollama ps- какие модели сейчас в памяти. Колонка PROCESSOR:100% GPU- модель целиком на видеокарте,100% CPU- на процессоре, это медленнееollama rm gemma3- удалить модель
Шаг 4. Проверь свой API
Пока Ollama запущена, у компьютера есть свой API на порту 11434. Проверь его в терминале macOS или Linux (подставь модель, которую скачал):
curl localhost:11434/api/chat -d '{"model": "llama3.2", "messages": [{"role": "user", "content": "Привет! Ответь одним предложением."}], "stream": false}'
Ответ модели лежит в поле message.content.
Тот же сервер понимает запросы в формате OpenAI - это то, что нужно сайтам и приложениям:
curl localhost:11434/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama3.2", "messages": [{"role": "user", "content": "Привет"}]}'
Ответ лежит в choices[0].message.content. На Windows проще проверить подключение через n8n в шаге 5 - он сам скажет, что соединение есть.
Шаг 5. Подключи n8n
- В n8n нажми Create Credential и выбери Ollama.
- Поле Base URL: если n8n стоит на этом же компьютере, оставь адрес по умолчанию - локальный сервер на
localhost:11434с протоколом http. Если n8n запущен в Docker, замениlocalhostнаhost.docker.internal. - Нажми Save. Должно появиться сообщение Connection tested successfully.
- Если n8n в Docker на Linux-сервере без Docker Desktop, добавь при запуске контейнера флаг
--add-host=host.docker.internal:host-gatewayили в docker compose блокextra_hostsсо строкойhost.docker.internal:host-gateway. - Не подключается - впиши
127.0.0.1вместоlocalhost.
Чат-бот в n8n собирается так: узел Chat Trigger → узел AI Agent → в слот модели подключи Ollama Chat Model, выбери созданную учётку и модель. Инструкцию для бота из шага 7 вставь в Options → System Message узла AI Agent.
Шаг 6. Подключи сайт или любое приложение
Любая библиотека или сервис, которые умеют работать с OpenAI, подключаются к Ollama заменой трёх настроек:
- адрес сервера (base URL): твой сервер Ollama с путём
/v1, то естьlocalhost:11434/v1с протоколом http; - ключ API: любое слово, например
ollama. Клиент требует ключ, но локальный сервер Ollama его не проверяет; - модель: имя из
ollama ls, напримерllama3.2.
Для Python и JavaScript у Ollama есть и свои библиотеки: pip install ollama и npm i ollama.
Как открыть сервер другим устройствам:
- Внутри своей сети. По умолчанию Ollama слушает только сам компьютер. Задай переменную
OLLAMA_HOSTсо значением0.0.0.0:11434так же, как в шаге 2, и перезапусти Ollama. Другие устройства обращаются по локальному IP этого компьютера и порту 11434. - Для сайта на хостинге. Сайт должен достучаться до твоего компьютера. Ollama в своих ответах на вопросы показывает три способа: Nginx, ngrok и Cloudflare Tunnel. Пример для ngrok:
ngrok http 11434 --host-header="localhost:11434". Раз локальный сервер не проверяет ключ, наружу его открывай только через такой прокси или туннель с защитой доступа.
Шаг 7. Готовые инструкции для 3 ботов
Инструкцию можно вставить двумя способами:
- в n8n - в поле System Message узла AI Agent;
- прямо в модель - создай текстовый файл с именем
Modelfileиз двух строк. Первая строка:FROM qwen3(или другая модель из шага 3). Вторая строка начинается со словаSYSTEM, после пробела идёт текст инструкции одной строкой. Затем выполниollama create support-bot -f Modelfileи запускай бота командойollama run support-bot.
По умолчанию модель держит в голове 4096 токенов. Если база знаний длинная, добавь в Modelfile строку PARAMETER num_ctx 8192. Памяти на это уйдёт больше.
Слова в ёлочках замени на свои данные.
Бот поддержки
Ты бот поддержки компании «название». Отвечай на русском, коротко и по делу, обращайся на «вы». Используй только факты из раздела БАЗА ЗНАНИЙ ниже. Если ответа там нет или вопрос про возврат денег, жалобу или персональные данные, ничего не придумывай: скажи, что передашь вопрос менеджеру, и попроси имя и удобный способ связи. Не обещай сроки, скидки и условия, которых нет в базе. БАЗА ЗНАНИЙ: «условия доставки, оплаты и возврата, график работы, контакты».
Помощник для сотрудников
Ты внутренний помощник сотрудников компании «название». Отвечаешь на вопросы про отпуска, больничные, доступы, технику и внутренние правила только по тексту регламентов ниже. В каждом ответе называй раздел регламента, из которого взят ответ. Если в регламентах ответа нет, так и скажи и подскажи, к кому обратиться: «отдел или человек». РЕГЛАМЕНТЫ: «текст регламентов».
Бот по частым вопросам
Ты отвечаешь клиентам компании «название» на частые вопросы. Ниже список вопросов с ответами. Найди самый близкий вопрос и ответь его текстом, можно короче, но без новых фактов. Если похожего вопроса в списке нет, ответь: «Уточню у команды и вернусь с ответом» и предложи оставить контакт. СПИСОК ВОПРОСОВ И ОТВЕТОВ: «вопрос и ответ, вопрос и ответ».
Если что-то не работает
- Команда
ollamaне найдена - открой новое окно терминала. На Linux запустиollama serveи проверьollama -vв соседнем окне. - Модель отвечает медленно - выполни
ollama ps. Если в колонке PROCESSOR100% CPU, возьми модель полегче из таблицы в шаге 3. - Первый ответ идёт долго - модель загружается в память. После ответа Ollama держит её в памяти 5 минут. Чтобы держать постоянно, выполни
curl localhost:11434/api/generate -d '{"model": "llama3.2", "keep_alive": -1}'. - n8n не видит Ollama - впиши
127.0.0.1вместоlocalhost, а для n8n в Docker используйhost.docker.internal. - Модель не скачивается - задай прокси переменной
HTTPS_PROXY, как в шаге 2. - Бот забывает базу знаний - увеличь контекст: строка
PARAMETER num_ctx 8192в Modelfile или переменнаяOLLAMA_CONTEXT_LENGTHсо значением8192.


