Локальные модели на Apple Silicon

Сколько токенов в секунду реально выдаёт Mac mini

Замеры на нашем железе, а не оценки по спецификации. Методика открыта, данные под лицензией CC BY, можно перепроверять и цитировать. Ниже два блока, и их важно не путать. Первый измерен. Второй посчитан заранее и будет проверен, когда новые машины приедут.

Измерено

M4 (Mac mini), 16 ГБ, 120 GB/s

Ollama 0.31.2, квантование Q4_K_M, 3 прогона на модель плюс отброшенный прогревочный, разброс 0.1 процента.

МодельПараметровГенерация, ток/сОбработка промпта, ток/с
Llama 3.2 3B3B46.71720
Mistral 7B7B22.8645
Qwen 2.5 7B7B22.31130
Llama 3.1 8B8B21.2587
DeepSeek R1 8B8B20.0531
Qwen 2.5 14B14B11.7606

Что из этого следует практически. Всё до 8B выдаёт больше 20 токенов в секунду, это быстрее, чем читает человек. 14B на 16 ГБ запускается, но 11.7 токена это уже ожидание. Обработка промпта идёт на порядок быстрее генерации, длинный контекст не проблема, проблема сгенерировать ответ на него.

Прогноз, не замер

Новая линейка M6, M5 Pro, M5 Max и M5 Ultra

Apple отгружает эти машины с 22 сентября 2026. Пока их нет ни у кого, цифры ниже посчитаны по правилу, которое мы проверили на собственных замерах M4. Генерация упирается в полосу памяти, поэтому скорость примерно равна полосе, делённой на размер весов, с поправкой 0.83 на накладные расходы. Поправка выведена из четырёх замеренных моделей, а не взята с потолка. Как только машины окажутся у нас, эта таблица заменится замерами, а прогноз останется рядом, чтобы было видно, где он промахнулся.

МодельВес, ГБM4 (замер)M6 16 GB
16 ГБ, 153 GB/s
M6 32 GB
32 ГБ, 170 GB/s
M5 Pro
64 ГБ, 307 GB/s
M5 Max
128 ГБ, 614 GB/s
M5 Ultra
512 ГБ, 1.2 TB/s
Llama 3.2 3B246.7≈64≈71≈127≈255≈498
Llama 3.1 8B4.921.2≈26≈29≈52≈104≈203
Qwen 2.5 14B8.511.7≈15≈17≈30≈60≈117
Qwen 2.5 32B19не влезаетне влезает≈7.4≈13≈27≈52
Llama 3.3 70B40не влезаетне влезаетне влезает≈6.4≈13≈25
Qwen 2.5 72B41не влезаетне влезаетне влезает≈6.2≈12≈24
DeepSeek V3 671B380не влезаетне влезаетне влезаетне влезаетне влезает≈2.6

Токены в секунду на генерации, Q4_K_M. Модель считается влезающей, если её вес с запасом 20 процентов на кэш контекста и систему помещается в память.

Где прогноз почти наверняка ошибётся

Маленькие модели на широкой шине. Сотни токенов в секунду для 3B на M5 Max и Ultra не будет, там узкое место уходит от памяти к вычислениям. Это первое, что мы проверим. Крупные модели на Ultra, у которого два кристалла на мосту, формула считает единой полосой, и как модель между ними разложится, из спецификации не следует. И прогноз только про генерацию, скорость обработки промпта в полосу не упирается вовсе.

Методика

Как мерили и как перепроверить

Ollama REST API, запрос без стриминга, один и тот же промпт для всех моделей, num_predict 512, temperature 0.7. Один прогревочный запрос отбрасывается, затем 3 записанных прогона, публикуется медиана. Скорость генерации это eval_count делить на eval_duration, как их отдаёт сама Ollama. Машина в остальном простаивала, macOS 15.3.1 (Sequoia).

Сырые данные в JSON лежат по адресу macyou.co/benchmarks.json. Если у вас есть другое железо и полчаса, прогоните ту же методику и пришлите цифры, соберём общую таблицу.

Проверить на своей задаче до покупки

Все машины из таблицы можно взять в аренду на месяц, поставить свою модель и померить на своих данных. Дешевле, чем купить и обнаружить, что 16 ГБ не хватило.

Выбрать машину