Welche KI läuft auf dem Mac mit M2 Ultra (128 GB)?
Macs mit Apple M2 Ultra und 128 GB gemeinsamem Arbeitsspeicher (MacBook, Mac mini, iMac oder Mac Studio) stellen ca. 96,0 GB für KI-Modelle bereit. Damit laufen 19 von 22 aktuellen Modellen flüssig.
Kurzfazit
Ein Mac mit M2 Ultra (128 GB) ist sehr gut für lokale KI geeignet – auch große Modelle laufen flüssig.
- Empfehlung: gpt-oss 120B – Sehr stark und trotz Größe flott.
ollama run gpt-oss:120b - Größtes lauffähiges Modell: gpt-oss 120B (MXFP4 (Original), ca. 60,8 GB)
- Tempo: Der M2 Ultra hat 800 GB/s Speicherbandbreite – sie bestimmt, wie schnell die KI antwortet.
- Lange Texte: Bei 32.000 Tokens Kontext laufen noch 19 Modelle flüssig.
Alle Modelle auf dem M2 Ultra mit 128 GB
Annahmen: 8.000 Tokens Kontext, Standard-Quantisierung Q4 (wie bei Ollama), Speicherfreigabe von macOS ohne manuelle Anpassung.
| Modell | Ergebnis | Speicher | Tempo | Details |
|---|---|---|---|---|
| gpt-oss 120B Chat · Logik · Programmieren | Läuft flüssig | 60,8 GB | ca. 177 Tokens/s | MXFP4 (Original) |
| Llama 4 Scout Chat · Bilder | Läuft flüssig | 65,5 GB | ca. 47 Tokens/s | Q4 (Standard) |
| Qwen3 32B Chat · Logik · Programmieren | Läuft flüssig | 21,7 GB | ca. 24 Tokens/s | Q4 (Standard) |
| Qwen2.5-Coder 32B Programmieren | Läuft flüssig | 21,7 GB | ca. 24 Tokens/s | Q4 (Standard) |
| DeepSeek-R1 32B (Distill) Logik | Läuft flüssig | 21,7 GB | ca. 24 Tokens/s | Q4 (Standard) |
| Qwen3 30B-A3B Chat · Logik | Läuft flüssig | 19,1 GB | ca. 240 Tokens/s | Q4 (Standard) |
| Qwen3-Coder 30B-A3B Programmieren | Läuft flüssig | 19,1 GB | ca. 240 Tokens/s | Q4 (Standard) |
| Gemma 3 27B Chat · Bilder | Läuft flüssig | 20,4 GB | ca. 29 Tokens/s | Q4 (Standard) |
| Mistral Small 3.1 24B Chat · Bilder | Läuft flüssig | 15,8 GB | ca. 33 Tokens/s | Q4 (Standard) |
| gpt-oss 20B Chat · Logik · Programmieren | Läuft flüssig | 11,7 GB | ca. 251 Tokens/s | MXFP4 (Original) |
| Qwen3 14B Chat · Logik · Programmieren | Läuft flüssig | 10,5 GB | ca. 53 Tokens/s | Q4 (Standard) |
| Phi-4 14B Chat · Logik | Läuft flüssig | 10,7 GB | ca. 54 Tokens/s | Q4 (Standard) |
| Gemma 3 12B Chat · Bilder | Läuft flüssig | 10,7 GB | ca. 65 Tokens/s | Q4 (Standard) |
| Mistral Nemo 12B Chat | Läuft flüssig | 8,9 GB | ca. 65 Tokens/s | Q4 (Standard) |
| Qwen3 8B Chat · Logik · Programmieren | Läuft flüssig | 6,5 GB | ca. 97 Tokens/s | Q4 (Standard) |
| Llama 3.1 8B Chat | Läuft flüssig | 6,3 GB | ca. 99 Tokens/s | Q4 (Standard) |
| Gemma 3 4B Chat · Bilder | Läuft flüssig | 4,2 GB | ca. 184 Tokens/s | Q4 (Standard) |
| Qwen3 4B Chat · Logik | Läuft flüssig | 4,1 GB | ca. 198 Tokens/s | Q4 (Standard) |
| Llama 3.2 3B Chat | Läuft flüssig | 3,3 GB | ca. 247 Tokens/s | Q4 (Standard) |
| Llama 3.3 70B Chat | Läuft, etwas langsamer | 44,2 GB | ca. 11 Tokens/s | Q4 (Standard) |
| Qwen3 235B-A22B Chat · Logik · Programmieren | Passt nicht | – | – | braucht ca. 112,0 GB |
| DeepSeek-R1 671B Logik | Passt nicht | – | – | braucht ca. 314,9 GB |
Mehr KI mit mehr Speicher
Diese Hardware gehört schon zur Spitzenklasse – sinnvolle Upgrades gibt es kaum.
Häufige Fragen
Reicht ein Mac mit M2 Ultra (128 GB) für lokale KI?
Ein Mac mit M2 Ultra (128 GB) ist sehr gut für lokale KI geeignet – auch große Modelle laufen flüssig. Von 128 GB Arbeitsspeicher kann macOS standardmäßig ca. 96,0 GB für die KI bereitstellen. Damit laufen 19 von 22 Modellen flüssig.
Welches KI-Modell ist das beste für den M2 Ultra mit 128 GB?
Unsere Empfehlung ist gpt-oss 120B: Sehr stark und trotz Größe flott. Starten lässt es sich mit „ollama run gpt-oss:120b“.
Läuft Qwen3 32B auf dem M2 Ultra mit 128 GB?
Ja. Qwen3 32B passt in der Variante Q4 (Standard) komplett in den Speicher (ca. 21,7 GB) und erreicht ca. 24 Tokens/s – das fühlt sich flüssig an.
Läuft Llama 3.3 70B auf dem M2 Ultra mit 128 GB?
Ja. Llama 3.3 70B passt in der Variante Q4 (Standard) komplett in den Speicher (ca. 44,2 GB) und erreicht ca. 11 Tokens/s – nutzbar, aber spürbar langsamer als ein Chat mit ChatGPT.
Läuft gpt-oss 120B auf dem M2 Ultra mit 128 GB?
Ja. gpt-oss 120B passt in der Variante MXFP4 (Original) komplett in den Speicher (ca. 60,8 GB) und erreicht ca. 177 Tokens/s – das fühlt sich flüssig an.
Läuft Qwen3 30B-A3B auf dem M2 Ultra mit 128 GB?
Ja. Qwen3 30B-A3B passt in der Variante Q4 (Standard) komplett in den Speicher (ca. 19,1 GB) und erreicht ca. 240 Tokens/s – das fühlt sich flüssig an.
Andere Mac-Konfigurationen
- M1 Ultra (128 GB)19 Modelle flüssig
- M2 Ultra (64 GB)17 Modelle flüssig
- M2 Ultra (192 GB)20 Modelle flüssig
- M3 Max (128 GB)15 Modelle flüssig
- M4 Max (128 GB)19 Modelle flüssig