Перейти к основному содержимому

Запуск ИИ-моделей локально с помощью Ollama

Средний

Передовые модели живут в облаке, но существует целый класс моделей с открытыми весами — Llama, Mistral, Qwen, DeepSeek, Gemma — которые можно скачать и запустить на собственном ноутбуке или сервере. Ollama — самый простой способ это сделать: одна установка, одна команда, и модель уже работает локально. Эта страница проведёт вас от нуля до запущенной модели, вызова её из кода и понимания компромиссов, чтобы вы не ожидали от локальной 7B-модели поведения передовой.

What you'll learn
  • Понять, ПОЧЕМУ вам может понадобиться запускать модель локально — и честные компромиссы по сравнению с облачными передовыми моделями
  • Установить Ollama и запустить свою первую модель двумя командами
  • Использовать основной CLI: pull, run, list, ps, rm, stop
  • Вызывать локальную модель из кода через OpenAI-совместимый API Ollama
  • Разобраться в требованиях к RAM, размерах моделей и квантовании — чтобы выбрать модель, которую ваша машина действительно потянет
  • Понять, когда LM Studio (графический интерфейс) — лучшая отправная точка

Зачем запускать модель локально (и когда не стоит)

Запуск модели на собственном железе даёт вам четыре вещи:

  • Приватность — ваши промпты и данные никогда не покидают вашу машину. Именно поэтому команды в регулируемых или чувствительных областях выбирают локальные модели. (См. развилку приватность/self-host в разделе Выбор модели.)
  • Офлайн — нет интернета, нет API, нет зависимости от сбоев. Модель — это файл на вашем диске.
  • Стоимость — нет счёта за токены. После скачивания её запуск «бесплатен» (вы платите электричеством и железом, а не тратами на API). Если расходы на токены — ваше ограничение при масштабировании, локальный вариант может выиграть.
  • Контроль — закрепите точную версию, настройте поведение и интегрируйте без лимитов запросов и сюрпризов в условиях использования.

Честные компромиссы:

  • Разрыв в возможностях. Модель, которую вы можете запустить на ноутбуке (1B–14B параметров), не в той же лиге, что передовая облачная модель, на сложных задачах рассуждения, длинного контекста или агентных задачах. Для многих повседневных задач разрыв невелик; для самых трудных он большой.
  • Железо. Более крупным и способным моделям нужно больше RAM/VRAM, чем есть у типичной машины. Часто вы выбираете самую большую модель, которую тянет ваше железо, а не лучшую из существующих.
  • Вы её эксплуатируете. Нет управляемого масштабирования, нет автоматических обновлений — это цена контроля.

Распространённый, устойчивый паттерн: прототипируйте и выбирайте с помощью крошечной оценки (тот же метод, что и для облачных моделей — см. Выбор модели), используйте локальные модели для приватной/офлайн/дешёвой-при-масштабе работы и обращайтесь к передовому API, когда задача действительно требует дополнительных возможностей.

Установите Ollama и запустите свою первую модель

Guided walkthrough1 of 4
  1. macOS и Windows: скачайте установщик с ollama.com/download и запустите его. Linux: используйте официальный установочный скрипт (ниже). Это установит команду ollama и локальный фоновый сервис.

Установка в Linux (для macOS/Windows используйте вместо этого скачанный установщик):

curl -fsSL https://ollama.com/install.sh | sh

Скачать и запустить небольшую модель (хороший первый выбор)

ollama run llama3.2

Эта единственная команда и скачивает llama3.2 (небольшую модель класса 1B/3B, работающую на скромном железе), и запускает интерактивный чат. Чтобы скачать без запуска чата, используйте вместо этого ollama pull.

Основной CLI

Небольшой набор команд покрывает почти всё. Запустите ollama --help, чтобы увидеть полный список.

# Download a model without starting a chat
ollama pull qwen3

# Start an interactive chat (downloads first if needed)
ollama run qwen3

# One-shot: pass the prompt inline, get the answer, exit
ollama run qwen3 "Summarize the CAP theorem in two sentences."

# List models you've downloaded
ollama list

# Show models currently loaded in memory
ollama ps

# Stop a running/loaded model (frees memory)
ollama stop qwen3

# Delete a downloaded model to reclaim disk
ollama rm qwen3

Внутри интерактивной сессии ollama run введите /bye, чтобы выйти, и /?, чтобы увидеть внутрисессионные команды. Фоновый сервис, который фактически обслуживает модели, запускается командой ollama serve (десктопное приложение запускает его за вас автоматически).

Вызов из кода (OpenAI-совместимый API)

Именно эта часть делает локальные модели по-настоящему полезными в приложениях. Фоновый сервис Ollama предоставляет локальный HTTP API по адресу http://localhost:11434, на порту по умолчанию 11434. У него есть собственные нативные эндпоинты (/api/generate, /api/chat) и OpenAI-совместимый слой на /v1 — так что большинство кода, написанного для OpenAI SDK, работает с вашей локальной моделью после изменения двух строк.

Сырой HTTP через curl (нативный эндпоинт):

curl http://localhost:11434/api/chat -d '{
"model": "llama3.2",
"messages": [
{ "role": "user", "content": "Why is the sky blue?" }
],
"stream": false
}'

Из Python с использованием официального OpenAI SDK — просто укажите base_url на Ollama и передайте любой непустой api_key (Ollama требует это поле, но игнорирует его значение):

from openai import OpenAI

client = OpenAI(
base_url="http://localhost:11434/v1",
api_key="ollama", # required by the SDK, ignored by Ollama
)

response = client.chat.completions.create(
model="llama3.2",
messages=[
{"role": "system", "content": "You are a concise assistant."},
{"role": "user", "content": "Explain gradient descent in two sentences."},
],
)

print(response.choices[0].message.content)

Поскольку это OpenAI-совместимо, те же паттерны, которые вы использовали бы с хостируемым API, переносятся сюда — включая стриминг и использование инструментов / вызов функций, которые работают локально так же, как и в облаке (при условии, что модель действительно хорошо с этим справляется). Слой /v1 в Ollama покрывает /v1/chat/completions, /v1/completions, /v1/models и /v1/embeddings, среди прочих.

Железо, размеры моделей и квантование

Число, которое вы увидите рядом с моделью — 1B, 7B, 8B, 70B — это её количество параметров (в миллиардах). Больше параметров обычно означает более способную и более прожорливую по памяти. Практический предел того, что вы можете запустить, — это RAM (а на GPU — VRAM).

Квантование — ключевой приём, делающий это возможным на обычных машинах. Веса модели изначально хранятся в высокой точности (например, 16 бит), но их можно сжать примерно до 4 бит с небольшой, часто едва заметной потерей качества. Ollama поставляет большинство моделей квантованными по умолчанию — вот почему модель с миллиардами параметров может уместиться в несколько ГБ. Грубое эмпирическое правило (сверяйтесь со страницей конкретной модели):

  • Модели ~1B–3B: комфортно работают на большинстве современных ноутбуков (несколько ГБ RAM).
  • Модели ~7B–8B: золотая середина между способностью и запускаемостью; заложите несколько ГБ свободной RAM.
  • Модели ~13B–14B: нужна довольно хорошо укомплектованная машина.
  • Модели ~70B+: нужна рабочая станция/сервер с большим объёмом RAM или мощным GPU — это не территория типичного ноутбука.

Практический рецепт: начните с небольшой модели (llama3.2), убедитесь, что рабочий процесс работает от начала до конца, а затем масштабируйтесь вверх до самой большой модели, которая всё ещё работает плавно на вашем железе — а не до самой большой из существующих.

Словарь локальных моделей
Нажмите Enter или пробел, чтобы перевернуть карточку. Используйте стрелки влево и вправо для перехода между карточками.Показан термин.
1 / 6

LM Studio: альтернатива с графическим интерфейсом

Если командная строка не для вас, LM Studio — это десктопное приложение (macOS, Windows, Linux), выполняющее ту же работу через графический интерфейс: просматривайте и скачивайте открытые модели, общайтесь с ними во встроенном интерфейсе и — как и Ollama — запускайте локальный OpenAI-совместимый сервер, чтобы ваш код мог с ним общаться. Это более простой вход для не-разработчиков или для всех, кто предпочитает клики терминалу; Ollama обычно выигрывает, когда нужен скриптуемый CLI и лёгкий фоновый сервис. Оба запускают одни и те же виды моделей с открытыми весами, так что концепции с этой страницы переносятся напрямую.

Проверьте себя

0/4
  1. Какой самый большой честный компромисс запуска модели локально по сравнению с передовой облачной моделью?
  2. Какая команда и скачивает модель (если нужно), И запускает общение с ней?
  3. Чтобы вызвать локальную модель из кода на OpenAI SDK, что вы задаёте?
  4. Почему модель с миллиардами параметров может уместиться всего в несколько ГБ RAM?
Key takeaways
  • Локально = приватность + офлайн + отсутствие стоимости за токен + контроль; компромисс — реальный разрыв в возможностях и ограничения железа.
  • Две команды запускают вас: установите Ollama, затем ollama run llama3.2.
  • Основной CLI: pull (скачать), run (чат), list, ps, stop, rm — это большая часть всего.
  • Вызывайте её из кода через OpenAI-совместимый эндпоинт: base_url http://localhost:11434/v1, любой непустой api_key.
  • Количество параметров + квантование решают, сможет ли ваша машина запустить модель — начните с малого, масштабируйтесь до того, что работает плавно.
  • Предпочитаете графический интерфейс? LM Studio выполняет ту же работу кликами и тоже предоставляет локальный OpenAI-совместимый сервер.

Источники и дальнейшее чтение

Далее