Локальные модели на Apple Silicon
Сколько токенов в секунду реально выдаёт Mac mini
Замеры на нашем железе, а не оценки по спецификации. Методика открыта, данные под лицензией CC BY, можно перепроверять и цитировать. Ниже два блока, и их важно не путать. Первый измерен. Второй посчитан заранее и будет проверен, когда новые машины приедут.
Измерено
M4 (Mac mini), 16 ГБ, 120 GB/s
Ollama 0.31.2, квантование Q4_K_M, 3 прогона на модель плюс отброшенный прогревочный, разброс 0.1 процента.
| Модель | Параметров | Генерация, ток/с | Обработка промпта, ток/с |
|---|---|---|---|
| Llama 3.2 3B | 3B | 46.7 | 1720 |
| Mistral 7B | 7B | 22.8 | 645 |
| Qwen 2.5 7B | 7B | 22.3 | 1130 |
| Llama 3.1 8B | 8B | 21.2 | 587 |
| DeepSeek R1 8B | 8B | 20.0 | 531 |
| Qwen 2.5 14B | 14B | 11.7 | 606 |
Что из этого следует практически. Всё до 8B выдаёт больше 20 токенов в секунду, это быстрее, чем читает человек. 14B на 16 ГБ запускается, но 11.7 токена это уже ожидание. Обработка промпта идёт на порядок быстрее генерации, длинный контекст не проблема, проблема сгенерировать ответ на него.
Прогноз, не замер
Новая линейка M6, M5 Pro, M5 Max и M5 Ultra
Apple отгружает эти машины с 22 сентября 2026. Пока их нет ни у кого, цифры ниже посчитаны по правилу, которое мы проверили на собственных замерах M4. Генерация упирается в полосу памяти, поэтому скорость примерно равна полосе, делённой на размер весов, с поправкой 0.83 на накладные расходы. Поправка выведена из четырёх замеренных моделей, а не взята с потолка. Как только машины окажутся у нас, эта таблица заменится замерами, а прогноз останется рядом, чтобы было видно, где он промахнулся.
| Модель | Вес, ГБ | M4 (замер) | M6 16 GB 16 ГБ, 153 GB/s | M6 32 GB 32 ГБ, 170 GB/s | M5 Pro 64 ГБ, 307 GB/s | M5 Max 128 ГБ, 614 GB/s | M5 Ultra 512 ГБ, 1.2 TB/s |
|---|---|---|---|---|---|---|---|
| Llama 3.2 3B | 2 | 46.7 | ≈64 | ≈71 | ≈127 | ≈255 | ≈498 |
| Llama 3.1 8B | 4.9 | 21.2 | ≈26 | ≈29 | ≈52 | ≈104 | ≈203 |
| Qwen 2.5 14B | 8.5 | 11.7 | ≈15 | ≈17 | ≈30 | ≈60 | ≈117 |
| Qwen 2.5 32B | 19 | не влезает | не влезает | ≈7.4 | ≈13 | ≈27 | ≈52 |
| Llama 3.3 70B | 40 | не влезает | не влезает | не влезает | ≈6.4 | ≈13 | ≈25 |
| Qwen 2.5 72B | 41 | не влезает | не влезает | не влезает | ≈6.2 | ≈12 | ≈24 |
| DeepSeek V3 671B | 380 | не влезает | не влезает | не влезает | не влезает | не влезает | ≈2.6 |
Токены в секунду на генерации, Q4_K_M. Модель считается влезающей, если её вес с запасом 20 процентов на кэш контекста и систему помещается в память.
Где прогноз почти наверняка ошибётся
Маленькие модели на широкой шине. Сотни токенов в секунду для 3B на M5 Max и Ultra не будет, там узкое место уходит от памяти к вычислениям. Это первое, что мы проверим. Крупные модели на Ultra, у которого два кристалла на мосту, формула считает единой полосой, и как модель между ними разложится, из спецификации не следует. И прогноз только про генерацию, скорость обработки промпта в полосу не упирается вовсе.
Методика
Как мерили и как перепроверить
Ollama REST API, запрос без стриминга, один и тот же промпт для всех моделей, num_predict 512, temperature 0.7. Один прогревочный запрос отбрасывается, затем 3 записанных прогона, публикуется медиана. Скорость генерации это eval_count делить на eval_duration, как их отдаёт сама Ollama. Машина в остальном простаивала, macOS 15.3.1 (Sequoia).
Сырые данные в JSON лежат по адресу macyou.co/benchmarks.json. Если у вас есть другое железо и полчаса, прогоните ту же методику и пришлите цифры, соберём общую таблицу.
Проверить на своей задаче до покупки
Все машины из таблицы можно взять в аренду на месяц, поставить свою модель и померить на своих данных. Дешевле, чем купить и обнаружить, что 16 ГБ не хватило.
Выбрать машину