Welche KI läuft auf der RTX 4070 / 4070 Super (12 GB)?

Die NVIDIA RTX 4070 / 4070 Super hat 12 GB Grafikspeicher und 504 GB/s Speicherbandbreite. Damit laufen 9 von 22 aktuellen KI-Modellen flüssig.

Kurzfazit

Die RTX 4070 / 4070 Super ist gut für lokale KI geeignet – auch die deutlich klügeren 12B- bis 21B-Modelle laufen flüssig.

Im Rechner mit eigenen Einstellungen prüfen RTX 4070 / 4070 Super bei Amazon ansehen*

Alle Modelle auf der RTX 4070 / 4070 Super im Überblick

Annahmen: 8.000 Tokens Kontext, 32 GB DDR5-Arbeitsspeicher für die Auslagerung, Standard-Quantisierung Q4 (wie bei Ollama). Tempo = geschätzte Tokens pro Sekunde beim Antworten.

ModellErgebnisSpeicherTempoDetails
Qwen3 14B
Chat · Logik · Programmieren
Läuft flüssig10,5 GBca. 34 Tokens/sQ4 (Standard)
Phi-4 14B
Chat · Logik
Läuft flüssig10,7 GBca. 34 Tokens/sQ4 (Standard)
Gemma 3 12B
Chat · Bilder
Läuft flüssig10,7 GBca. 41 Tokens/sQ4 (Standard)
Mistral Nemo 12B
Chat
Läuft flüssig8,9 GBca. 41 Tokens/sQ4 (Standard)
Qwen3 8B
Chat · Logik · Programmieren
Läuft flüssig6,5 GBca. 61 Tokens/sQ4 (Standard)
Llama 3.1 8B
Chat
Läuft flüssig6,3 GBca. 62 Tokens/sQ4 (Standard)
Gemma 3 4B
Chat · Bilder
Läuft flüssig4,2 GBca. 116 Tokens/sQ4 (Standard)
Qwen3 4B
Chat · Logik
Läuft flüssig4,1 GBca. 125 Tokens/sQ4 (Standard)
Llama 3.2 3B
Chat
Läuft flüssig3,3 GBca. 156 Tokens/sQ4 (Standard)
Qwen3 30B-A3B
Chat · Logik
Läuft, etwas langsamer19,1 GBca. 20 Tokens/sQ4 (Standard), teilweise ausgelagert
Qwen3-Coder 30B-A3B
Programmieren
Läuft, etwas langsamer19,1 GBca. 20 Tokens/sQ4 (Standard), teilweise ausgelagert
gpt-oss 20B
Chat · Logik · Programmieren
Läuft, etwas langsamer11,7 GBca. 72 Tokens/sMXFP4 (Original), teilweise ausgelagert
Qwen3 32B
Chat · Logik · Programmieren
Nur sehr langsam21,7 GBca. 2 Tokens/sQ4 (Standard), teilweise ausgelagert
Qwen2.5-Coder 32B
Programmieren
Nur sehr langsam21,7 GBca. 2 Tokens/sQ4 (Standard), teilweise ausgelagert
DeepSeek-R1 32B (Distill)
Logik
Nur sehr langsam21,7 GBca. 2 Tokens/sQ4 (Standard), teilweise ausgelagert
Gemma 3 27B
Chat · Bilder
Nur sehr langsam20,4 GBca. 2 Tokens/sQ4 (Standard), teilweise ausgelagert
Mistral Small 3.1 24B
Chat · Bilder
Nur sehr langsam15,8 GBca. 3 Tokens/sQ4 (Standard), teilweise ausgelagert
Llama 3.3 70B
Chat
Passt nicht––braucht ca. 36,1 GB
Llama 4 Scout
Chat · Bilder
Passt nicht––braucht ca. 53,1 GB
gpt-oss 120B
Chat · Logik · Programmieren
Passt nicht––braucht ca. 60,8 GB
Qwen3 235B-A22B
Chat · Logik · Programmieren
Passt nicht––braucht ca. 112,0 GB
DeepSeek-R1 671B
Logik
Passt nicht––braucht ca. 314,9 GB

Mehr KI mit einem Upgrade

* Werbelink: Wenn du über diesen Link kaufst, erhalten wir eine kleine Provision. Für dich ändert sich am Preis nichts.

Häufige Fragen

Reicht die RTX 4070 / 4070 Super (12 GB) für lokale KI?

Die RTX 4070 / 4070 Super ist gut für lokale KI geeignet – auch die deutlich klügeren 12B- bis 21B-Modelle laufen flüssig. Mit 12 GB Grafikspeicher laufen 9 von 22 Modellen flüssig, das stärkste davon ist Qwen3 14B.

Welches KI-Modell ist das beste für die RTX 4070 / 4070 Super?

Unsere Empfehlung ist Qwen3 14B: Deutlich klüger als die 8B-Variante. Starten lässt es sich mit dem Befehl „ollama run qwen3:14b“.

Läuft Qwen3 32B auf der RTX 4070 / 4070 Super?

Nur mit Auslagerung in den Arbeitsspeicher: Mit 32 GB RAM läuft Qwen3 32B auf die RTX 4070 / 4070 Super, aber mit ca. 2 Tokens/s sehr langsam.

Läuft Llama 3.3 70B auf der RTX 4070 / 4070 Super?

Nein. Llama 3.3 70B braucht selbst stark komprimiert ca. 36,1 GB – mehr, als die RTX 4070 / 4070 Super bietet.

Läuft gpt-oss 20B auf der RTX 4070 / 4070 Super?

Nur mit Auslagerung in den Arbeitsspeicher: Mit 32 GB RAM läuft gpt-oss 20B auf die RTX 4070 / 4070 Super, aber mit ca. 72 Tokens/s eher gemächlich.

Läuft Qwen3 14B auf der RTX 4070 / 4070 Super?

Ja. Qwen3 14B passt in der Variante Q4 (Standard) komplett in den Speicher (ca. 10,5 GB) und erreicht ca. 34 Tokens/s – das fühlt sich flüssig an.

Ähnliche Grafikkarten

Alle Grafikkarten vergleichen →