{"name":"Macyou Apple Silicon LLM Inference Benchmarks","url":"https://macyou.co/benchmarks","license":"CC BY 4.0","meta":{"date":"2026-07-13","ollamaVersion":"0.31.2","macosVersion":"15.3.1 (Sequoia)","prompt":"Write a 300-word explanation of how attention works in transformer models, aimed at a junior developer. Use one concrete analogy.","numPredict":512,"temperature":0.7,"runsPerModel":3,"notes":"Measured on production-identical fleet hardware. One warm-up request per model (discarded). Machine was otherwise idle apart from baseline system daemons."},"chips":[{"id":"m4","label":"M4 (Mac mini)","ramGB":16,"memoryBandwidth":"120 GB/s","status":"measured"},{"id":"m4-pro","label":"M4 Pro (Mac mini)","ramGB":64,"memoryBandwidth":"273 GB/s","status":"coming"},{"id":"m4-max","label":"M4 Max (Mac Studio)","ramGB":128,"memoryBandwidth":"546 GB/s","status":"coming"},{"id":"m3-ultra","label":"M3 Ultra (Mac Studio)","ramGB":256,"memoryBandwidth":"819 GB/s","status":"coming"}],"results":[{"tag":"llama3.2:3b","displayName":"Llama 3.2 3B","paramsLabel":"3B","quant":"Q4_K_M","chipId":"m4","genTokSec":46.7,"promptTokSec":1720,"runs":3,"spread":0.1},{"tag":"mistral:7b","displayName":"Mistral 7B","paramsLabel":"7B","quant":"Q4_K_M","chipId":"m4","genTokSec":22.8,"promptTokSec":645,"runs":3,"spread":0.1},{"tag":"qwen2.5:7b","displayName":"Qwen 2.5 7B","paramsLabel":"7B","quant":"Q4_K_M","chipId":"m4","genTokSec":22.3,"promptTokSec":1130,"runs":3,"spread":0.1},{"tag":"llama3.1:8b","displayName":"Llama 3.1 8B","paramsLabel":"8B","quant":"Q4_K_M","chipId":"m4","genTokSec":21.2,"promptTokSec":587,"runs":3,"spread":0.1,"guideSlug":"llama-3-1-8b"},{"tag":"deepseek-r1:8b","displayName":"DeepSeek R1 8B","paramsLabel":"8B","quant":"Q4_K_M","chipId":"m4","genTokSec":20,"promptTokSec":531,"runs":3,"spread":0.1},{"tag":"qwen2.5:14b","displayName":"Qwen 2.5 14B","paramsLabel":"14B","quant":"Q4_K_M","chipId":"m4","genTokSec":11.7,"promptTokSec":606,"runs":3,"spread":0.1}]}