Welche KI läuft auf dem Mac mit M3 Ultra (256 GB)?

Macs mit Apple M3 Ultra und 256 GB gemeinsamem Arbeitsspeicher (MacBook, Mac mini, iMac oder Mac Studio) stellen ca. 192,0 GB für KI-Modelle bereit. Damit laufen 20 von 22 aktuellen Modellen flüssig.

Kurzfazit

Ein Mac mit M3 Ultra (256 GB) ist sehr gut für lokale KI geeignet – auch große Modelle laufen flüssig.

Im Rechner mit eigenen Einstellungen prüfen

Alle Modelle auf dem M3 Ultra mit 256 GB

Annahmen: 8.000 Tokens Kontext, Standard-Quantisierung Q4 (wie bei Ollama), Speicherfreigabe von macOS ohne manuelle Anpassung.

ModellErgebnisSpeicherTempoDetails
Qwen3 235B-A22B
Chat · Logik · Programmieren
Läuft flüssig138,7 GBca. 37 Tokens/sQ4 (Standard)
gpt-oss 120B
Chat · Logik · Programmieren
Läuft flüssig60,8 GBca. 181 Tokens/sMXFP4 (Original)
Llama 4 Scout
Chat · Bilder
Läuft flüssig65,5 GBca. 48 Tokens/sQ4 (Standard)
Qwen3 32B
Chat · Logik · Programmieren
Läuft flüssig21,7 GBca. 25 Tokens/sQ4 (Standard)
Qwen2.5-Coder 32B
Programmieren
Läuft flüssig21,7 GBca. 25 Tokens/sQ4 (Standard)
DeepSeek-R1 32B (Distill)
Logik
Läuft flüssig21,7 GBca. 25 Tokens/sQ4 (Standard)
Qwen3 30B-A3B
Chat · Logik
Läuft flüssig19,1 GBca. 246 Tokens/sQ4 (Standard)
Qwen3-Coder 30B-A3B
Programmieren
Läuft flüssig19,1 GBca. 246 Tokens/sQ4 (Standard)
Gemma 3 27B
Chat · Bilder
Läuft flüssig20,4 GBca. 30 Tokens/sQ4 (Standard)
Mistral Small 3.1 24B
Chat · Bilder
Läuft flüssig15,8 GBca. 34 Tokens/sQ4 (Standard)
gpt-oss 20B
Chat · Logik · Programmieren
Läuft flüssig11,7 GBca. 257 Tokens/sMXFP4 (Original)
Qwen3 14B
Chat · Logik · Programmieren
Läuft flüssig10,5 GBca. 55 Tokens/sQ4 (Standard)
Phi-4 14B
Chat · Logik
Läuft flüssig10,7 GBca. 55 Tokens/sQ4 (Standard)
Gemma 3 12B
Chat · Bilder
Läuft flüssig10,7 GBca. 66 Tokens/sQ4 (Standard)
Mistral Nemo 12B
Chat
Läuft flüssig8,9 GBca. 66 Tokens/sQ4 (Standard)
Qwen3 8B
Chat · Logik · Programmieren
Läuft flüssig6,5 GBca. 99 Tokens/sQ4 (Standard)
Llama 3.1 8B
Chat
Läuft flüssig6,3 GBca. 101 Tokens/sQ4 (Standard)
Gemma 3 4B
Chat · Bilder
Läuft flüssig4,2 GBca. 189 Tokens/sQ4 (Standard)
Qwen3 4B
Chat · Logik
Läuft flüssig4,1 GBca. 203 Tokens/sQ4 (Standard)
Llama 3.2 3B
Chat
Läuft flüssig3,3 GBca. 253 Tokens/sQ4 (Standard)
Llama 3.3 70B
Chat
Läuft, etwas langsamer44,2 GBca. 11 Tokens/sQ4 (Standard)
DeepSeek-R1 671B
Logik
Passt nicht––braucht ca. 314,9 GB

Mehr KI mit mehr Speicher

Diese Hardware gehört schon zur Spitzenklasse – sinnvolle Upgrades gibt es kaum.

Häufige Fragen

Reicht ein Mac mit M3 Ultra (256 GB) für lokale KI?

Ein Mac mit M3 Ultra (256 GB) ist sehr gut für lokale KI geeignet – auch große Modelle laufen flüssig. Von 256 GB Arbeitsspeicher kann macOS standardmäßig ca. 192,0 GB für die KI bereitstellen. Damit laufen 20 von 22 Modellen flüssig.

Welches KI-Modell ist das beste für den M3 Ultra mit 256 GB?

Unsere Empfehlung ist Qwen3 235B-A22B: Spitzenklasse, braucht sehr viel Speicher. Starten lässt es sich mit „ollama run qwen3:235b“.

Läuft Qwen3 32B auf dem M3 Ultra mit 256 GB?

Ja. Qwen3 32B passt in der Variante Q4 (Standard) komplett in den Speicher (ca. 21,7 GB) und erreicht ca. 25 Tokens/s – das fühlt sich flüssig an.

Läuft Llama 3.3 70B auf dem M3 Ultra mit 256 GB?

Ja. Llama 3.3 70B passt in der Variante Q4 (Standard) komplett in den Speicher (ca. 44,2 GB) und erreicht ca. 11 Tokens/s – nutzbar, aber spürbar langsamer als ein Chat mit ChatGPT.

Läuft gpt-oss 120B auf dem M3 Ultra mit 256 GB?

Ja. gpt-oss 120B passt in der Variante MXFP4 (Original) komplett in den Speicher (ca. 60,8 GB) und erreicht ca. 181 Tokens/s – das fühlt sich flüssig an.

Läuft Qwen3 30B-A3B auf dem M3 Ultra mit 256 GB?

Ja. Qwen3 30B-A3B passt in der Variante Q4 (Standard) komplett in den Speicher (ca. 19,1 GB) und erreicht ca. 246 Tokens/s – das fühlt sich flüssig an.

Andere Mac-Konfigurationen

Alle Mac-Konfigurationen vergleichen →