Welche KI läuft auf der RTX 4080 / 4080 Super (16 GB)?

Die NVIDIA RTX 4080 / 4080 Super hat 16 GB Grafikspeicher und 736 GB/s Speicherbandbreite. Damit laufen 10 von 22 aktuellen KI-Modellen flüssig.

Kurzfazit

Die RTX 4080 / 4080 Super ist gut für lokale KI geeignet – auch die deutlich klügeren 12B- bis 21B-Modelle laufen flüssig.

Im Rechner mit eigenen Einstellungen prüfen RTX 4080 / 4080 Super bei Amazon ansehen*

Alle Modelle auf der RTX 4080 / 4080 Super im Überblick

Annahmen: 8.000 Tokens Kontext, 32 GB DDR5-Arbeitsspeicher für die Auslagerung, Standard-Quantisierung Q4 (wie bei Ollama). Tempo = geschätzte Tokens pro Sekunde beim Antworten.

ModellErgebnisSpeicherTempoDetails
gpt-oss 20B
Chat · Logik · Programmieren
Läuft flüssig11,7 GBca. 231 Tokens/sMXFP4 (Original)
Qwen3 14B
Chat · Logik · Programmieren
Läuft flüssig10,5 GBca. 49 Tokens/sQ4 (Standard)
Phi-4 14B
Chat · Logik
Läuft flüssig10,7 GBca. 50 Tokens/sQ4 (Standard)
Gemma 3 12B
Chat · Bilder
Läuft flüssig10,7 GBca. 60 Tokens/sQ4 (Standard)
Mistral Nemo 12B
Chat
Läuft flüssig8,9 GBca. 60 Tokens/sQ4 (Standard)
Qwen3 8B
Chat · Logik · Programmieren
Läuft flüssig6,5 GBca. 89 Tokens/sQ4 (Standard)
Llama 3.1 8B
Chat
Läuft flüssig6,3 GBca. 91 Tokens/sQ4 (Standard)
Gemma 3 4B
Chat · Bilder
Läuft flüssig4,2 GBca. 169 Tokens/sQ4 (Standard)
Qwen3 4B
Chat · Logik
Läuft flüssig4,1 GBca. 182 Tokens/sQ4 (Standard)
Llama 3.2 3B
Chat
Läuft flüssig3,3 GBca. 228 Tokens/sQ4 (Standard)
Qwen3 30B-A3B
Chat · Logik
Läuft, etwas langsamer19,1 GBca. 37 Tokens/sQ4 (Standard), teilweise ausgelagert
Qwen3-Coder 30B-A3B
Programmieren
Läuft, etwas langsamer19,1 GBca. 37 Tokens/sQ4 (Standard), teilweise ausgelagert
Mistral Small 3.1 24B
Chat · Bilder
Läuft, etwas langsamer13,1 GBca. 38 Tokens/sQ3 (spürbare Einbußen)
Qwen3 32B
Chat · Logik · Programmieren
Nur sehr langsam21,7 GBca. 3 Tokens/sQ4 (Standard), teilweise ausgelagert
Qwen2.5-Coder 32B
Programmieren
Nur sehr langsam21,7 GBca. 3 Tokens/sQ4 (Standard), teilweise ausgelagert
DeepSeek-R1 32B (Distill)
Logik
Nur sehr langsam21,7 GBca. 3 Tokens/sQ4 (Standard), teilweise ausgelagert
Gemma 3 27B
Chat · Bilder
Nur sehr langsam20,4 GBca. 3 Tokens/sQ4 (Standard), teilweise ausgelagert
Llama 3.3 70B
Chat
Passt nicht––braucht ca. 36,1 GB
Llama 4 Scout
Chat · Bilder
Passt nicht––braucht ca. 53,1 GB
gpt-oss 120B
Chat · Logik · Programmieren
Passt nicht––braucht ca. 60,8 GB
Qwen3 235B-A22B
Chat · Logik · Programmieren
Passt nicht––braucht ca. 112,0 GB
DeepSeek-R1 671B
Logik
Passt nicht––braucht ca. 314,9 GB

Mehr KI mit einem Upgrade

Mini-PC mit Ryzen AI Max+ 395 (128 GB)

Riesige Modelle zum Mini-PC-Preis.

+3 Modelle flüssig, z. B. gpt-oss 120B

Preise bei Amazon ansehen*

* Werbelink: Wenn du über diesen Link kaufst, erhalten wir eine kleine Provision. Für dich ändert sich am Preis nichts.

Häufige Fragen

Reicht die RTX 4080 / 4080 Super (16 GB) für lokale KI?

Die RTX 4080 / 4080 Super ist gut für lokale KI geeignet – auch die deutlich klügeren 12B- bis 21B-Modelle laufen flüssig. Mit 16 GB Grafikspeicher laufen 10 von 22 Modellen flüssig, das stärkste davon ist gpt-oss 20B.

Welches KI-Modell ist das beste für die RTX 4080 / 4080 Super?

Unsere Empfehlung ist gpt-oss 20B: Offenes Modell von OpenAI, sehr schnell dank MoE. Starten lässt es sich mit dem Befehl „ollama run gpt-oss:20b“.

Läuft Qwen3 32B auf der RTX 4080 / 4080 Super?

Nur mit Auslagerung in den Arbeitsspeicher: Mit 32 GB RAM läuft Qwen3 32B auf die RTX 4080 / 4080 Super, aber mit ca. 3 Tokens/s sehr langsam.

Läuft Llama 3.3 70B auf der RTX 4080 / 4080 Super?

Nein. Llama 3.3 70B braucht selbst stark komprimiert ca. 36,1 GB – mehr, als die RTX 4080 / 4080 Super bietet.

Läuft gpt-oss 20B auf der RTX 4080 / 4080 Super?

Ja. gpt-oss 20B passt in der Variante MXFP4 (Original) komplett in den Speicher (ca. 11,7 GB) und erreicht ca. 231 Tokens/s – das fühlt sich flüssig an.

Läuft Qwen3 14B auf der RTX 4080 / 4080 Super?

Ja. Qwen3 14B passt in der Variante Q4 (Standard) komplett in den Speicher (ca. 10,5 GB) und erreicht ca. 49 Tokens/s – das fühlt sich flüssig an.

Ähnliche Grafikkarten

Alle Grafikkarten vergleichen →