Проверено 17 сентября 2026

Ollama на Mac. Установка, выбор модели под память, API и какой Mac нужен

Практический разбор без воды: три команды на установку, таблица «какая модель влезает в сколько памяти» с замеренной скоростью, API для своих скриптов и удалённый доступ. Скорость не с потолка, а из наших замеров на Mac mini M4.

Дисклеймер: страницу написал сервис аренды Mac. Если ваш Mac справляется, ниже так и написано, аренда нужна не всем.

Установка

Три команды и модель отвечает

Ollama ставится либо приложением с ollama.com, либо через Homebrew. Второй путь удобнее для сервера: без окна в доке и с автозапуском как сервис. Дальше одна команда тянет модель и открывает чат в терминале.

Terminal · macOS
# установка через Homebrew и запуск как сервис
brew install ollama
brew services start ollama
# первая модель, 4.7 ГБ, влезает в 16 ГБ памяти
ollama run qwen2.5:7b
>>> Send a message (/? for help)

Модели лежат в ~/.ollama/models, при 256 ГБ на диске за этим стоит следить: три-четыре модели среднего размера это уже 20–30 ГБ. Список установленного показывает ollama list, удаление ollama rm имя.

Модели

Что влезает в память и с какой скоростью

На Mac память общая между процессором и графикой, поэтому единственное ограничение это объём. Правило простое: вес модели в квантовании Q4 плюс 20 процентов на контекст должны помещаться в память с запасом на систему. Ниже замеры на базовом Mac mini M4 с 16 ГБ, Ollama 0.31.2, три прогона на модель, медиана.

Модель (тег Ollama)ПараметровГенерация, ток/сОбработка промпта, ток/с
Llama 3.2 3B llama3.2:3b3B46.71720
Mistral 7B mistral:7b7B22.8645
Qwen 2.5 7B qwen2.5:7b7B22.31130
Llama 3.1 8B llama3.1:8b8B21.2587
DeepSeek R1 8B deepseek-r1:8b8B20.0531
Qwen 2.5 14B qwen2.5:14b14B11.7606

Как это читать. Всё до 8B выдаёт больше 20 токенов в секунду, это быстрее, чем человек читает, и годится для чата и агентов. 14B на 16 ГБ запускается, но 11.7 токена это уже ожидание. 32B и выше в 16 ГБ не помещаются вовсе. Для 32B нужны 24–32 ГБ и желательно M4 Pro, для 70B от 64 ГБ.

Скорость упирается в полосу памяти, а не в процессор: на каждый токен модель читает все свои веса. У M4 полоса 120 ГБ/с, у M4 Pro 273, у M4 Max 546, поэтому та же модель на Pro идёт примерно вдвое быстрее. Полная таблица замеров и прогноз для новой линейки M6 и M5 Pro на странице с бенчмарками.

API

Из скрипта, из другого приложения, с другой машины

Ollama поднимает HTTP-сервер на порту 11434. У него свой API и совместимый с OpenAI эндпоинт, поэтому большинство библиотек и клиентов подключаются без переписывания кода: меняете base_url и ставите любой непустой ключ.

curl · OpenAI-совместимый эндпоинт
curl http://localhost:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model":"qwen2.5:7b","messages":[{"role":"user","content":"Привет"}]}'
→ ответ в формате OpenAI, стриминг через "stream": true

Доступ с другой машины. По умолчанию сервер слушает только localhost. Для доступа по сети запустите его с OLLAMA_HOST=0.0.0.0 (для Homebrew-сервиса переменную задают в launchd-plist или через brew services с окружением). Встроенной авторизации у Ollama нет, поэтому наружу порт открывать нельзя: либо VPN до машины, либо реверс-прокси с ключом.

Параллельные запросы. Ollama обрабатывает запросы по очереди, если не задан OLLAMA_NUM_PARALLEL. Для агентов, которые дёргают модель одновременно, важен не столько процессор, сколько запас полосы памяти и объём под несколько контекстов.

Какой Mac

Когда своего Mac хватает, а когда нет

Хватает. Любой Apple Silicon с 16 ГБ для моделей до 8B. Это чат, автодополнение кода, суммаризация, простые агенты. Покупать или арендовать что-то ради этого не нужно.

Не хватает. Когда нужна модель 32B или 70B для качества ответов, когда модель должна работать круглосуточно как сервер для команды или агентов, и когда Mac нужен на проект, а не навсегда. Тогда вопрос в памяти и полосе: M4 Pro с 48–64 ГБ под 32B, M4 Max со 128 ГБ под 70B.

Мы сдаём такие машины помесячно с Ollama и нужной моделью уже развёрнутыми и с приватным API-эндпоинтом. Что почём у нас и у других сервисов, честно по прайсам, на странице сравнения аренды.

Вопросы

Что спрашивают чаще всего

Работает ли Ollama на Mac с Intel?
Формально да, но без Metal-ускорения на Apple Silicon скорость падает в разы, и модели крупнее 7B на Intel Mac практически непригодны. Всё, что ниже про скорость, относится к Apple Silicon.
Какая модель влезет в 16 ГБ?
Комфортно всё до 8B в квантовании Q4: Llama 3.1 8B, Qwen 2.5 7B, Mistral 7B, DeepSeek R1 8B. Модель 14B запускается, но 11.7 токена в секунду на M4 это уже медленнее чтения. 32B в 16 ГБ не помещается.
Почему на Mac скорость зависит от памяти, а не от процессора?
На каждый токен модель прочитывает все свои веса из памяти. Полоса памяти делится на размер весов, и это потолок скорости. У базового M4 полоса 120 ГБ/с, у M4 Pro 273, у M4 Max 546. Поэтому M4 Pro примерно вдвое быстрее M4 на той же модели.
Можно ли обращаться к Ollama на Mac с другого компьютера?
Да. По умолчанию Ollama слушает только localhost на порту 11434. Чтобы открыть доступ, задайте переменную OLLAMA_HOST=0.0.0.0 перед запуском, а снаружи закройте порт файрволом или реверс-прокси с авторизацией, встроенной авторизации у Ollama нет.
Есть ли у Ollama совместимость с OpenAI API?
Да, эндпоинт /v1/chat/completions принимает запросы в формате OpenAI. Большинство клиентов и библиотек подключаются к Ollama, если указать base_url http://localhost:11434/v1 и любой непустой ключ.

Ollama на Mac mini с нужной моделью за минуты

Выделенный Mac от 16 до 128 ГБ памяти, модель разворачивается в один клик, приватный эндпоинт, оплата USDT за период.

Выбрать машину