# Свой ИИ-сервер из старого компьютера: ставим Ollama

Здесь всё, чтобы превратить свой ноутбук или компьютер в ИИ-сервер: что понадобится, установка одной командой, как оставить только локальный режим, какую модель брать под твою память, как проверить свой API, подключить n8n, сайт или любое приложение, и 3 готовые инструкции для бот

## Что это

**Ollama** - открытый проект под лицензией MIT, репозиторий: https://github.com/ollama/ollama

Ollama запускает открытые модели (Gemma, Qwen, Llama, DeepSeek, gpt-oss и другие) прямо на твоём компьютере и поднимает на нём свой API. Локальный запуск бесплатный и без лимитов: на странице тарифов https://ollama.com/pricing план Free стоит $0 и включает «Run models locally», а в ответах на вопросы там же написано «Running models on your own hardware is always unlimited». Платные тарифы Ollama - это облачные модели, для этой инструкции они не нужны.

## Что понадобится

- **Система.** macOS 14 Sonoma или новее (на Mac с чипом M модель работает и на процессоре, и на графике, на Mac с Intel - только на процессоре), Windows 10 22H2 или новее, либо Linux.
- **Место на диске.** На Windows под саму программу нужно минимум 4 ГБ, плюс вес моделей из таблицы в шаге 3.
- **Память.** Сколько оперативной памяти или видеопамяти, такую модель и берёшь, таблица ниже. Видеокарта не обязательна, но ускоряет ответы: Nvidia с compute capability 5.0 и выше и драйвером 550 или новее, AMD Radeon через ROCm или Vulkan. Список карт: https://docs.ollama.com/gpu
- **Интернет** - один раз, чтобы скачать программу и модель. Если модели не скачиваются, задай прокси переменной окружения `HTTPS_PROXY` (как задать переменную - шаг 2).

## Шаг 1. Установка одной командой

1. **macOS и Linux** - в терминале: `curl -fsSL https://ollama.com/install.sh | sh`
2. **Windows** - в PowerShell: `irm https://ollama.com/install.ps1 | iex`. Или скачай установщик на странице https://ollama.com/download
3. Проверь, что всё встало: `ollama -v`. На Linux, если сервер не запущен, выполни `ollama serve` и проверь в соседнем окне терминала.
4. Набери `ollama`. Программа предложит войти в аккаунт ради облачных моделей или выбрать локальную модель. Выбирай локальную, аккаунт для этого не нужен.

На macOS и Windows Ollama после установки работает в фоне и сама запускается при входе в систему. API сразу доступен на адресе `localhost:11434`.

## Шаг 2. Оставь только локальный режим

Если хочешь, чтобы Ollama вообще не ходила в облако, выключи облачные функции. Есть два способа:

- переменная окружения `OLLAMA_NO_CLOUD` со значением `1`;
- или файл `~/.ollama/server.json` со строкой `{"disable_ollama_cloud": true}`.

Как задать переменную окружения:

- **macOS:** `launchctl setenv OLLAMA_NO_CLOUD 1`, затем закрой и снова открой приложение Ollama.
- **Linux:** выполни `systemctl edit ollama.service`, в разделе `[Service]` добавь строку `Environment="OLLAMA_NO_CLOUD=1"`, сохрани, затем `systemctl daemon-reload` и `systemctl restart ollama`.
- **Windows:** закрой Ollama в трее, открой «Параметры» (Windows 11) или «Панель управления» (Windows 10) и найди в поиске переменные среды, выбери изменение переменных среды для своей учётной записи, создай переменную `OLLAMA_NO_CLOUD` со значением `1`, нажми OK и запусти Ollama из меню «Пуск».

После перезапуска в логах Ollama появится строка `Ollama cloud disabled: true`. Локальные модели работают как раньше.

## Шаг 3. Модель под твою память

Правило простое: свободной памяти нужно больше, чем весит модель. Для примера, для модели gemma4:e2b весом 7.2 ГБ Ollama рекомендует 8 ГБ свободной видеопамяти или общей памяти Mac. Если видеопамяти не хватает, Ollama задействует обычную оперативную память, но отвечать модель будет медленнее. Длинные тексты в запросе тоже занимают память.

| Память компьютера | Модель | Вес | Команда |
|---|---|---|---|
| совсем слабый ноутбук | Gemma 3 1B | 815 МБ | `ollama run gemma3:1b` |
| 8 ГБ | Llama 3.2 3B | 2.0 ГБ | `ollama run llama3.2` |
| 8 ГБ | Qwen3 4B | 2.5 ГБ | `ollama run qwen3:4b` |
| 16 ГБ | Gemma 3 4B, понимает картинки | 3.3 ГБ | `ollama run gemma3` |
| 16 ГБ | Qwen3 8B | 5.2 ГБ | `ollama run qwen3` |
| 16 ГБ или Mac с 16 ГБ | Gemma 4 E2B, понимает картинки | 7.2 ГБ | `ollama run gemma4:e2b` |
| 32 ГБ или видеокарта от 12 ГБ | Qwen3 14B | 9.3 ГБ | `ollama run qwen3:14b` |
| 32 ГБ и больше | Gemma 4 26B | 19 ГБ | `ollama run gemma4:26b` |
| 32 ГБ и больше | Qwen3 30B | 19 ГБ | `ollama run qwen3:30b` |

Таблица - ориентир по весу моделей из каталога https://ollama.com/library. Начни с модели из своей строки, а если отвечает медленно, спустись на строку ниже по весу.

Полезные команды:

- `ollama run llama3.2` - скачать модель, если её ещё нет, и открыть чат. Выйти из чата: `/bye`
- `ollama pull qwen3` - только скачать модель
- `ollama ls` - какие модели скачаны
- `ollama ps` - какие модели сейчас в памяти. Колонка PROCESSOR: `100% GPU` - модель целиком на видеокарте, `100% CPU` - на процессоре, это медленнее
- `ollama rm gemma3` - удалить модель

## Шаг 4. Проверь свой API

Пока Ollama запущена, у компьютера есть свой API на порту 11434. Проверь его в терминале macOS или Linux (подставь модель, которую скачал):

`curl localhost:11434/api/chat -d '{"model": "llama3.2", "messages": [{"role": "user", "content": "Привет! Ответь одним предложением."}], "stream": false}'`

Ответ модели лежит в поле `message.content`.

Тот же сервер понимает запросы в формате OpenAI - это то, что нужно сайтам и приложениям:

`curl localhost:11434/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama3.2", "messages": [{"role": "user", "content": "Привет"}]}'`

Ответ лежит в `choices[0].message.content`. На Windows проще проверить подключение через n8n в шаге 5 - он сам скажет, что соединение есть.

## Шаг 5. Подключи n8n

1. В n8n нажми **Create Credential** и выбери **Ollama**.
2. Поле **Base URL**: если n8n стоит на этом же компьютере, оставь адрес по умолчанию - локальный сервер на `localhost:11434` с протоколом http. Если n8n запущен в Docker, замени `localhost` на `host.docker.internal`.
3. Нажми **Save**. Должно появиться сообщение **Connection tested successfully**.
4. Если n8n в Docker на Linux-сервере без Docker Desktop, добавь при запуске контейнера флаг `--add-host=host.docker.internal:host-gateway` или в docker compose блок `extra_hosts` со строкой `host.docker.internal:host-gateway`.
5. Не подключается - впиши `127.0.0.1` вместо `localhost`.

Чат-бот в n8n собирается так: узел **Chat Trigger** → узел **AI Agent** → в слот модели подключи **Ollama Chat Model**, выбери созданную учётку и модель. Инструкцию для бота из шага 7 вставь в **Options → System Message** узла AI Agent.

## Шаг 6. Подключи сайт или любое приложение

Любая библиотека или сервис, которые умеют работать с OpenAI, подключаются к Ollama заменой трёх настроек:

- **адрес сервера (base URL):** твой сервер Ollama с путём `/v1`, то есть `localhost:11434/v1` с протоколом http;
- **ключ API:** любое слово, например `ollama`. Клиент требует ключ, но локальный сервер Ollama его не проверяет;
- **модель:** имя из `ollama ls`, например `llama3.2`.

Для Python и JavaScript у Ollama есть и свои библиотеки: `pip install ollama` и `npm i ollama`.

Как открыть сервер другим устройствам:

- **Внутри своей сети.** По умолчанию Ollama слушает только сам компьютер. Задай переменную `OLLAMA_HOST` со значением `0.0.0.0:11434` так же, как в шаге 2, и перезапусти Ollama. Другие устройства обращаются по локальному IP этого компьютера и порту 11434.
- **Для сайта на хостинге.** Сайт должен достучаться до твоего компьютера. Ollama в своих ответах на вопросы показывает три способа: Nginx, ngrok и Cloudflare Tunnel. Пример для ngrok: `ngrok http 11434 --host-header="localhost:11434"`. Раз локальный сервер не проверяет ключ, наружу его открывай только через такой прокси или туннель с защитой доступа.

## Шаг 7. Готовые инструкции для 3 ботов

Инструкцию можно вставить двумя способами:

- **в n8n** - в поле System Message узла AI Agent;
- **прямо в модель** - создай текстовый файл с именем `Modelfile` из двух строк. Первая строка: `FROM qwen3` (или другая модель из шага 3). Вторая строка начинается со слова `SYSTEM`, после пробела идёт текст инструкции одной строкой. Затем выполни `ollama create support-bot -f Modelfile` и запускай бота командой `ollama run support-bot`.

По умолчанию модель держит в голове 4096 токенов. Если база знаний длинная, добавь в Modelfile строку `PARAMETER num_ctx 8192`. Памяти на это уйдёт больше.

Слова в ёлочках замени на свои данные.

**Бот поддержки**

Ты бот поддержки компании «название». Отвечай на русском, коротко и по делу, обращайся на «вы». Используй только факты из раздела БАЗА ЗНАНИЙ ниже. Если ответа там нет или вопрос про возврат денег, жалобу или персональные данные, ничего не придумывай: скажи, что передашь вопрос менеджеру, и попроси имя и удобный способ связи. Не обещай сроки, скидки и условия, которых нет в базе. БАЗА ЗНАНИЙ: «условия доставки, оплаты и возврата, график работы, контакты».

**Помощник для сотрудников**

Ты внутренний помощник сотрудников компании «название». Отвечаешь на вопросы про отпуска, больничные, доступы, технику и внутренние правила только по тексту регламентов ниже. В каждом ответе называй раздел регламента, из которого взят ответ. Если в регламентах ответа нет, так и скажи и подскажи, к кому обратиться: «отдел или человек». РЕГЛАМЕНТЫ: «текст регламентов».

**Бот по частым вопросам**

Ты отвечаешь клиентам компании «название» на частые вопросы. Ниже список вопросов с ответами. Найди самый близкий вопрос и ответь его текстом, можно короче, но без новых фактов. Если похожего вопроса в списке нет, ответь: «Уточню у команды и вернусь с ответом» и предложи оставить контакт. СПИСОК ВОПРОСОВ И ОТВЕТОВ: «вопрос и ответ, вопрос и ответ».

## Если что-то не работает

- **Команда `ollama` не найдена** - открой новое окно терминала. На Linux запусти `ollama serve` и проверь `ollama -v` в соседнем окне.
- **Модель отвечает медленно** - выполни `ollama ps`. Если в колонке PROCESSOR `100% CPU`, возьми модель полегче из таблицы в шаге 3.
- **Первый ответ идёт долго** - модель загружается в память. После ответа Ollama держит её в памяти 5 минут. Чтобы держать постоянно, выполни `curl localhost:11434/api/generate -d '{"model": "llama3.2", "keep_alive": -1}'`.
- **n8n не видит Ollama** - впиши `127.0.0.1` вместо `localhost`, а для n8n в Docker используй `host.docker.internal`.
- **Модель не скачивается** - задай прокси переменной `HTTPS_PROXY`, как в шаге 2.
- **Бот забывает базу знаний** - увеличь контекст: строка `PARAMETER num_ctx 8192` в Modelfile или переменная `OLLAMA_CONTEXT_LENGTH` со значением `8192`.

---

Источник: https://localhost:3000/m/svoy-ii-server-iz-starogo-kompyutera-stavim-ollama
