Welche KI läuft auf der RTX 4060 Ti (16 GB)?

Die NVIDIA RTX 4060 Ti hat 16 GB Grafikspeicher und 288 GB/s Speicherbandbreite. Damit laufen 10 von 22 aktuellen KI-Modellen flüssig.

Kurzfazit

Die RTX 4060 Ti ist gut für lokale KI geeignet – auch die deutlich klügeren 12B- bis 21B-Modelle laufen flüssig.

Im Rechner mit eigenen Einstellungen prüfen RTX 4060 Ti bei Amazon ansehen*

Alle Modelle auf der RTX 4060 Ti im Überblick

Annahmen: 8.000 Tokens Kontext, 32 GB DDR5-Arbeitsspeicher für die Auslagerung, Standard-Quantisierung Q4 (wie bei Ollama). Tempo = geschätzte Tokens pro Sekunde beim Antworten.

ModellErgebnisSpeicherTempoDetails
gpt-oss 20B
Chat · Logik · Programmieren
Läuft flüssig11,7 GBca. 90 Tokens/sMXFP4 (Original)
Qwen3 14B
Chat · Logik · Programmieren
Läuft flüssig10,5 GBca. 19 Tokens/sQ4 (Standard)
Phi-4 14B
Chat · Logik
Läuft flüssig10,7 GBca. 19 Tokens/sQ4 (Standard)
Gemma 3 12B
Chat · Bilder
Läuft flüssig10,7 GBca. 23 Tokens/sQ4 (Standard)
Mistral Nemo 12B
Chat
Läuft flüssig8,9 GBca. 23 Tokens/sQ4 (Standard)
Qwen3 8B
Chat · Logik · Programmieren
Läuft flüssig6,5 GBca. 35 Tokens/sQ4 (Standard)
Llama 3.1 8B
Chat
Läuft flüssig6,3 GBca. 36 Tokens/sQ4 (Standard)
Gemma 3 4B
Chat · Bilder
Läuft flüssig4,2 GBca. 66 Tokens/sQ4 (Standard)
Qwen3 4B
Chat · Logik
Läuft flüssig4,1 GBca. 71 Tokens/sQ4 (Standard)
Llama 3.2 3B
Chat
Läuft flüssig3,3 GBca. 89 Tokens/sQ4 (Standard)
Qwen3 30B-A3B
Chat · Logik
Läuft, etwas langsamer19,1 GBca. 26 Tokens/sQ4 (Standard), teilweise ausgelagert
Qwen3-Coder 30B-A3B
Programmieren
Läuft, etwas langsamer19,1 GBca. 26 Tokens/sQ4 (Standard), teilweise ausgelagert
Mistral Small 3.1 24B
Chat · Bilder
Läuft, etwas langsamer13,1 GBca. 15 Tokens/sQ3 (spürbare Einbußen)
Qwen3 32B
Chat · Logik · Programmieren
Nur sehr langsam21,7 GBca. 2 Tokens/sQ4 (Standard), teilweise ausgelagert
Qwen2.5-Coder 32B
Programmieren
Nur sehr langsam21,7 GBca. 2 Tokens/sQ4 (Standard), teilweise ausgelagert
DeepSeek-R1 32B (Distill)
Logik
Nur sehr langsam21,7 GBca. 2 Tokens/sQ4 (Standard), teilweise ausgelagert
Gemma 3 27B
Chat · Bilder
Nur sehr langsam20,4 GBca. 3 Tokens/sQ4 (Standard), teilweise ausgelagert
Llama 3.3 70B
Chat
Passt nicht––braucht ca. 36,1 GB
Llama 4 Scout
Chat · Bilder
Passt nicht––braucht ca. 53,1 GB
gpt-oss 120B
Chat · Logik · Programmieren
Passt nicht––braucht ca. 60,8 GB
Qwen3 235B-A22B
Chat · Logik · Programmieren
Passt nicht––braucht ca. 112,0 GB
DeepSeek-R1 671B
Logik
Passt nicht––braucht ca. 314,9 GB

Mehr KI mit einem Upgrade

Mini-PC mit Ryzen AI Max+ 395 (128 GB)

Riesige Modelle zum Mini-PC-Preis.

+3 Modelle flüssig, z. B. gpt-oss 120B

Preise bei Amazon ansehen*

* Werbelink: Wenn du über diesen Link kaufst, erhalten wir eine kleine Provision. Für dich ändert sich am Preis nichts.

Häufige Fragen

Reicht die RTX 4060 Ti (16 GB) für lokale KI?

Die RTX 4060 Ti ist gut für lokale KI geeignet – auch die deutlich klügeren 12B- bis 21B-Modelle laufen flüssig. Mit 16 GB Grafikspeicher laufen 10 von 22 Modellen flüssig, das stärkste davon ist gpt-oss 20B.

Welches KI-Modell ist das beste für die RTX 4060 Ti?

Unsere Empfehlung ist gpt-oss 20B: Offenes Modell von OpenAI, sehr schnell dank MoE. Starten lässt es sich mit dem Befehl „ollama run gpt-oss:20b“.

Läuft Qwen3 32B auf der RTX 4060 Ti?

Nur mit Auslagerung in den Arbeitsspeicher: Mit 32 GB RAM läuft Qwen3 32B auf die RTX 4060 Ti, aber mit ca. 2 Tokens/s sehr langsam.

Läuft Llama 3.3 70B auf der RTX 4060 Ti?

Nein. Llama 3.3 70B braucht selbst stark komprimiert ca. 36,1 GB – mehr, als die RTX 4060 Ti bietet.

Läuft gpt-oss 20B auf der RTX 4060 Ti?

Ja. gpt-oss 20B passt in der Variante MXFP4 (Original) komplett in den Speicher (ca. 11,7 GB) und erreicht ca. 90 Tokens/s – das fühlt sich flüssig an.

Läuft Qwen3 14B auf der RTX 4060 Ti?

Ja. Qwen3 14B passt in der Variante Q4 (Standard) komplett in den Speicher (ca. 10,5 GB) und erreicht ca. 19 Tokens/s – das fühlt sich flüssig an.

Ähnliche Grafikkarten

Alle Grafikkarten vergleichen →