Mac Studio M4 Max (128 GB)
Große Modelle mit hohem Tempo.
+4 Modelle flüssig, z. B. Qwen3 32B
Preise bei Amazon ansehen*Macs mit Apple M2 Max und 96 GB gemeinsamem Arbeitsspeicher (MacBook, Mac mini, iMac oder Mac Studio) stellen ca. 72,0 GB für KI-Modelle bereit. Damit laufen 15 von 22 aktuellen Modellen flüssig.
Ein Mac mit M2 Max (96 GB) ist sehr gut für lokale KI geeignet – auch große Modelle laufen flüssig.
ollama run gpt-oss:120bAnnahmen: 8.000 Tokens Kontext, Standard-Quantisierung Q4 (wie bei Ollama), Speicherfreigabe von macOS ohne manuelle Anpassung.
| Modell | Ergebnis | Speicher | Tempo | Details |
|---|---|---|---|---|
| gpt-oss 120B Chat · Logik · Programmieren | Läuft flüssig | 60,8 GB | ca. 89 Tokens/s | MXFP4 (Original) |
| Llama 4 Scout Chat · Bilder | Läuft flüssig | 65,5 GB | ca. 23 Tokens/s | Q4 (Standard) |
| Qwen3 30B-A3B Chat · Logik | Läuft flüssig | 19,1 GB | ca. 120 Tokens/s | Q4 (Standard) |
| Qwen3-Coder 30B-A3B Programmieren | Läuft flüssig | 19,1 GB | ca. 120 Tokens/s | Q4 (Standard) |
| Mistral Small 3.1 24B Chat · Bilder | Läuft flüssig | 15,8 GB | ca. 16 Tokens/s | Q4 (Standard) |
| gpt-oss 20B Chat · Logik · Programmieren | Läuft flüssig | 11,7 GB | ca. 125 Tokens/s | MXFP4 (Original) |
| Qwen3 14B Chat · Logik · Programmieren | Läuft flüssig | 10,5 GB | ca. 27 Tokens/s | Q4 (Standard) |
| Phi-4 14B Chat · Logik | Läuft flüssig | 10,7 GB | ca. 27 Tokens/s | Q4 (Standard) |
| Gemma 3 12B Chat · Bilder | Läuft flüssig | 10,7 GB | ca. 32 Tokens/s | Q4 (Standard) |
| Mistral Nemo 12B Chat | Läuft flüssig | 8,9 GB | ca. 32 Tokens/s | Q4 (Standard) |
| Qwen3 8B Chat · Logik · Programmieren | Läuft flüssig | 6,5 GB | ca. 48 Tokens/s | Q4 (Standard) |
| Llama 3.1 8B Chat | Läuft flüssig | 6,3 GB | ca. 49 Tokens/s | Q4 (Standard) |
| Gemma 3 4B Chat · Bilder | Läuft flüssig | 4,2 GB | ca. 92 Tokens/s | Q4 (Standard) |
| Qwen3 4B Chat · Logik | Läuft flüssig | 4,1 GB | ca. 99 Tokens/s | Q4 (Standard) |
| Llama 3.2 3B Chat | Läuft flüssig | 3,3 GB | ca. 124 Tokens/s | Q4 (Standard) |
| Llama 3.3 70B Chat | Läuft, etwas langsamer | 44,2 GB | ca. 6 Tokens/s | Q4 (Standard) |
| Qwen3 32B Chat · Logik · Programmieren | Läuft, etwas langsamer | 21,7 GB | ca. 12 Tokens/s | Q4 (Standard) |
| Qwen2.5-Coder 32B Programmieren | Läuft, etwas langsamer | 21,7 GB | ca. 12 Tokens/s | Q4 (Standard) |
| DeepSeek-R1 32B (Distill) Logik | Läuft, etwas langsamer | 21,7 GB | ca. 12 Tokens/s | Q4 (Standard) |
| Gemma 3 27B Chat · Bilder | Läuft, etwas langsamer | 20,4 GB | ca. 14 Tokens/s | Q4 (Standard) |
| Qwen3 235B-A22B Chat · Logik · Programmieren | Passt nicht | – | – | braucht ca. 112,0 GB |
| DeepSeek-R1 671B Logik | Passt nicht | – | – | braucht ca. 314,9 GB |
Große Modelle mit hohem Tempo.
+4 Modelle flüssig, z. B. Qwen3 32B
Preise bei Amazon ansehen** Werbelink: Wenn du über diesen Link kaufst, erhalten wir eine kleine Provision. Für dich ändert sich am Preis nichts.
Ein Mac mit M2 Max (96 GB) ist sehr gut für lokale KI geeignet – auch große Modelle laufen flüssig. Von 96 GB Arbeitsspeicher kann macOS standardmäßig ca. 72,0 GB für die KI bereitstellen. Damit laufen 15 von 22 Modellen flüssig.
Unsere Empfehlung ist gpt-oss 120B: Sehr stark und trotz Größe flott. Starten lässt es sich mit „ollama run gpt-oss:120b“.
Ja. Qwen3 32B passt in der Variante Q4 (Standard) komplett in den Speicher (ca. 21,7 GB) und erreicht ca. 12 Tokens/s – nutzbar, aber spürbar langsamer als ein Chat mit ChatGPT.
Ja. Llama 3.3 70B passt in der Variante Q4 (Standard) komplett in den Speicher (ca. 44,2 GB) und erreicht ca. 6 Tokens/s – nutzbar, aber spürbar langsamer als ein Chat mit ChatGPT.
Ja. gpt-oss 120B passt in der Variante MXFP4 (Original) komplett in den Speicher (ca. 60,8 GB) und erreicht ca. 89 Tokens/s – das fühlt sich flüssig an.
Ja. Qwen3 30B-A3B passt in der Variante Q4 (Standard) komplett in den Speicher (ca. 19,1 GB) und erreicht ca. 120 Tokens/s – das fühlt sich flüssig an.