{"title":"Mac Studio M3 Ultra 512 GB — measured local LLM benchmarks","source":"https://ai-kizai.com/benchmarks/512gb","measured_at":"2026-07-19 – 07-22","environment":{"machine":"Mac Studio / Apple M3 Ultra / 32-core CPU / 80-core GPU / 512 GB unified memory / 4 TB SSD","os":"macOS 26.5.1","runtimes":"MLX 0.32.0 · mlx-lm 0.31.3 · mlx-vlm c9e27b0 · llama.cpp 571d0d5","method":"MLX rows: the same 8,000-byte text as prompt, temperature 0, seed 42, 300 generated tokens. Kimi: llama-bench -p 2048 -n 300. 32K long-context rows: the same 96,638-byte text, 128 generated tokens, 3 runs per model (Qwen3.5 and Gemma 4 served via mlx-vlm). Power: powermetrics CPU+GPU+ANE at 1 s intervals."},"caveats":["Single-run snapshots — not guaranteed or average figures.","Speed measurements only, not a model-quality comparison.","experimental_pr_success rows ran on pinned, unmerged draft mlx-lm pull requests.","The Kimi K2.7 Code row uses llama.cpp with a 2,048-token prompt; its prompt-processing figure is not tokenizer-identical to the MLX rows, and generation-window power could not be isolated (null).","Power values are per-window: p90 during generation and max over the whole run — neither is constant draw."],"rows":[{"tier":1,"model":"DeepSeek R1-0528","backend":"4bit MLX","measuredOn":"2026-07-19/20","artifactGib":351.7,"promptTokens":2777,"loadSeconds":40.2,"promptTps":206.9,"generationTps":20.3,"peakMemoryGb":380.7,"generationPowerP90W":55.6,"runPowerMaxW":160.5,"status":"success"},{"tier":1,"model":"GLM-5.2","backend":"4bit MLX + draft PR #1410","measuredOn":"2026-07-19/20","artifactGib":389.6,"promptTokens":2701,"loadSeconds":40.2,"promptTps":182.6,"generationTps":17.9,"peakMemoryGb":421.4,"generationPowerP90W":53.1,"runPowerMaxW":157.1,"status":"experimental_pr_success"},{"tier":1,"model":"Kimi K2.7 Code","backend":"UD-Q2_K_XL GGUF / llama.cpp","measuredOn":"2026-07-19/20","artifactGib":316.2,"promptTokens":2048,"loadSeconds":116.9,"promptTps":144.8,"generationTps":24.6,"peakMemoryGb":339.8,"generationPowerP90W":null,"runPowerMaxW":160.5,"status":"success","note":"kimi-llama-cpp"},{"tier":1,"model":"Qwen3.5 397B-A17B","backend":"4bit MLX / mlx-vlm","measuredOn":"2026-07-22","artifactGib":208.5,"promptTokens":2872,"loadSeconds":8.3,"promptTps":510.3,"generationTps":38.1,"peakMemoryGb":229.7,"generationPowerP90W":46.6,"runPowerMaxW":155.3,"status":"success","note":"qwen35-warm-load"},{"tier":2,"model":"DeepSeek V4 Flash","backend":"4bit MLX + draft PR #1189","measuredOn":"2026-07-19/20","artifactGib":141.1,"promptTokens":2778,"loadSeconds":21.7,"promptTps":426.5,"generationTps":29.9,"peakMemoryGb":154.2,"generationPowerP90W":41.2,"runPowerMaxW":156.6,"status":"experimental_pr_success"},{"tier":2,"model":"gpt-oss-120B","backend":"MXFP4/BF16 MLX","measuredOn":"2026-07-22","artifactGib":60.8,"promptTokens":2719,"loadSeconds":10.1,"promptTps":1405.9,"generationTps":79.2,"peakMemoryGb":66.2,"generationPowerP90W":45,"runPowerMaxW":129.3,"status":"success"},{"tier":2,"model":"Qwen3.6 35B-A3B","backend":"OptiQ 4bit MLX","measuredOn":"2026-07-19/20","artifactGib":23,"promptTokens":2870,"loadSeconds":4,"promptTps":2892.2,"generationTps":94.6,"peakMemoryGb":24.1,"generationPowerP90W":53.9,"runPowerMaxW":127.2,"status":"success"},{"tier":2,"model":"Gemma 4 31B IT","backend":"4bit MLX / mlx-vlm","measuredOn":"2026-07-22","artifactGib":17.2,"promptTokens":3067,"loadSeconds":3.8,"promptTps":347.8,"generationTps":29.2,"peakMemoryGb":21.3,"generationPowerP90W":62.5,"runPowerMaxW":155.7,"status":"success"},{"tier":2,"model":"Gemma 4 26B-A4B IT","backend":"4bit MLX / mlx-vlm","measuredOn":"2026-07-22","artifactGib":14.3,"promptTokens":3067,"loadSeconds":3.4,"promptTps":2508.5,"generationTps":104.9,"peakMemoryGb":16.6,"generationPowerP90W":41.1,"runPowerMaxW":140.5,"status":"success"},{"tier":3,"model":"Qwen3-Coder-Next","backend":"4bit MLX","measuredOn":"2026-07-19/20","artifactGib":41.8,"promptTokens":2812,"loadSeconds":6.7,"promptTps":2099.8,"generationTps":77.2,"peakMemoryGb":47,"generationPowerP90W":37.9,"runPowerMaxW":106.9,"status":"success"},{"tier":3,"model":"Devstral 2 123B Instruct","backend":"4bit MLX","measuredOn":"2026-07-19/20","artifactGib":65.5,"promptTokens":2889,"loadSeconds":9.9,"promptTps":90.4,"generationTps":8.9,"peakMemoryGb":72,"generationPowerP90W":75.9,"runPowerMaxW":172.7,"status":"success"}],"long_context_32k":{"method":"Same 96,638-byte text (32,006–36,777 tokens depending on tokenizer), 128 generated tokens, 3 runs per model on 2026-07-22. prompt_tps values are medians with p10/p90 spread. All 12 runs exited clean — no OOM, no swap.","rows":[{"model":"Qwen3.5 397B-A17B","promptTokens":34448,"wallSecondsMedian":105,"loadSecondsMedian":8.3,"promptTpsMedian":386.4,"promptTpsP10":359.4,"promptTpsP90":428.1,"generationTpsMedian":33,"peakMemoryGbMedian":234.9,"generationPowerP90WMedian":55.6},{"model":"gpt-oss-120B","promptTokens":32006,"wallSecondsMedian":37,"loadSecondsMedian":2.8,"promptTpsMedian":1077.3,"promptTpsP10":1074.7,"promptTpsP90":1078.3,"generationTpsMedian":62.6,"peakMemoryGbMedian":67.2,"generationPowerP90WMedian":59},{"model":"Gemma 4 31B IT","promptTokens":36777,"wallSecondsMedian":165,"loadSecondsMedian":1.8,"promptTpsMedian":235.1,"promptTpsP10":234.8,"promptTpsP90":236.1,"generationTpsMedian":21.4,"peakMemoryGbMedian":29.7,"generationPowerP90WMedian":69.1},{"model":"Gemma 4 26B-A4B IT","promptTokens":36777,"wallSecondsMedian":27,"loadSecondsMedian":1.6,"promptTpsMedian":1645,"promptTpsP10":1632.3,"promptTpsP90":1645.5,"generationTpsMedian":67.6,"peakMemoryGbMedian":20,"generationPowerP90WMedian":42}]},"agent_soak":{"model":"Qwen3-Coder-Next (4bit MLX)","runtimeSeconds":1909,"iterations":29,"successful":29,"testsPerIteration":"6/6","wallMedianSeconds":56,"wallP90Seconds":102,"powerMedianW":31.1,"powerP90W":69.8}}