Проверено 17 сентября 2026
Ollama на Mac. Установка, выбор модели под память, API и какой Mac нужен
Практический разбор без воды: три команды на установку, таблица «какая модель влезает в сколько памяти» с замеренной скоростью, API для своих скриптов и удалённый доступ. Скорость не с потолка, а из наших замеров на Mac mini M4.
Дисклеймер: страницу написал сервис аренды Mac. Если ваш Mac справляется, ниже так и написано, аренда нужна не всем.
Установка
Три команды и модель отвечает
Ollama ставится либо приложением с ollama.com, либо через Homebrew. Второй путь удобнее для сервера: без окна в доке и с автозапуском как сервис. Дальше одна команда тянет модель и открывает чат в терминале.
Модели лежат в ~/.ollama/models, при 256 ГБ на диске за этим стоит следить: три-четыре модели среднего размера это уже 20–30 ГБ. Список установленного показывает ollama list, удаление ollama rm имя.
Модели
Что влезает в память и с какой скоростью
На Mac память общая между процессором и графикой, поэтому единственное ограничение это объём. Правило простое: вес модели в квантовании Q4 плюс 20 процентов на контекст должны помещаться в память с запасом на систему. Ниже замеры на базовом Mac mini M4 с 16 ГБ, Ollama 0.31.2, три прогона на модель, медиана.
| Модель (тег Ollama) | Параметров | Генерация, ток/с | Обработка промпта, ток/с |
|---|---|---|---|
| Llama 3.2 3B llama3.2:3b | 3B | 46.7 | 1720 |
| Mistral 7B mistral:7b | 7B | 22.8 | 645 |
| Qwen 2.5 7B qwen2.5:7b | 7B | 22.3 | 1130 |
| Llama 3.1 8B llama3.1:8b | 8B | 21.2 | 587 |
| DeepSeek R1 8B deepseek-r1:8b | 8B | 20.0 | 531 |
| Qwen 2.5 14B qwen2.5:14b | 14B | 11.7 | 606 |
Как это читать. Всё до 8B выдаёт больше 20 токенов в секунду, это быстрее, чем человек читает, и годится для чата и агентов. 14B на 16 ГБ запускается, но 11.7 токена это уже ожидание. 32B и выше в 16 ГБ не помещаются вовсе. Для 32B нужны 24–32 ГБ и желательно M4 Pro, для 70B от 64 ГБ.
Скорость упирается в полосу памяти, а не в процессор: на каждый токен модель читает все свои веса. У M4 полоса 120 ГБ/с, у M4 Pro 273, у M4 Max 546, поэтому та же модель на Pro идёт примерно вдвое быстрее. Полная таблица замеров и прогноз для новой линейки M6 и M5 Pro на странице с бенчмарками.
API
Из скрипта, из другого приложения, с другой машины
Ollama поднимает HTTP-сервер на порту 11434. У него свой API и совместимый с OpenAI эндпоинт, поэтому большинство библиотек и клиентов подключаются без переписывания кода: меняете base_url и ставите любой непустой ключ.
Доступ с другой машины. По умолчанию сервер слушает только localhost. Для доступа по сети запустите его с OLLAMA_HOST=0.0.0.0 (для Homebrew-сервиса переменную задают в launchd-plist или через brew services с окружением). Встроенной авторизации у Ollama нет, поэтому наружу порт открывать нельзя: либо VPN до машины, либо реверс-прокси с ключом.
Параллельные запросы. Ollama обрабатывает запросы по очереди, если не задан OLLAMA_NUM_PARALLEL. Для агентов, которые дёргают модель одновременно, важен не столько процессор, сколько запас полосы памяти и объём под несколько контекстов.
Какой Mac
Когда своего Mac хватает, а когда нет
Хватает. Любой Apple Silicon с 16 ГБ для моделей до 8B. Это чат, автодополнение кода, суммаризация, простые агенты. Покупать или арендовать что-то ради этого не нужно.
Не хватает. Когда нужна модель 32B или 70B для качества ответов, когда модель должна работать круглосуточно как сервер для команды или агентов, и когда Mac нужен на проект, а не навсегда. Тогда вопрос в памяти и полосе: M4 Pro с 48–64 ГБ под 32B, M4 Max со 128 ГБ под 70B.
Мы сдаём такие машины помесячно с Ollama и нужной моделью уже развёрнутыми и с приватным API-эндпоинтом. Что почём у нас и у других сервисов, честно по прайсам, на странице сравнения аренды.
Вопросы
Что спрашивают чаще всего
Работает ли Ollama на Mac с Intel?
Какая модель влезет в 16 ГБ?
Почему на Mac скорость зависит от памяти, а не от процессора?
Можно ли обращаться к Ollama на Mac с другого компьютера?
Есть ли у Ollama совместимость с OpenAI API?
Ollama на Mac mini с нужной моделью за минуты
Выделенный Mac от 16 до 128 ГБ памяти, модель разворачивается в один клик, приватный эндпоинт, оплата USDT за период.
Выбрать машину