RTX 5060 Ti 16 GB
Günstigster Einstieg in 16 GB VRAM.
+3 Modelle flüssig, z. B. gpt-oss 20B
Preise bei Amazon ansehen*Die NVIDIA RTX 2080 Ti hat 11 GB Grafikspeicher und 616 GB/s Speicherbandbreite. Damit laufen 7 von 22 aktuellen KI-Modellen flüssig.
Die RTX 2080 Ti ist gut für lokale KI geeignet – auch die deutlich klügeren 12B- bis 21B-Modelle laufen flüssig.
ollama run qwen3:14bIm Rechner mit eigenen Einstellungen prüfen RTX 2080 Ti bei Amazon ansehen*
Annahmen: 8.000 Tokens Kontext, 32 GB DDR5-Arbeitsspeicher für die Auslagerung, Standard-Quantisierung Q4 (wie bei Ollama). Tempo = geschätzte Tokens pro Sekunde beim Antworten.
| Modell | Ergebnis | Speicher | Tempo | Details |
|---|---|---|---|---|
| Qwen3 14B Chat · Logik · Programmieren | Läuft flüssig | 10,5 GB | ca. 41 Tokens/s | Q4 (Standard) |
| Mistral Nemo 12B Chat | Läuft flüssig | 8,9 GB | ca. 50 Tokens/s | Q4 (Standard) |
| Qwen3 8B Chat · Logik · Programmieren | Läuft flüssig | 6,5 GB | ca. 74 Tokens/s | Q4 (Standard) |
| Llama 3.1 8B Chat | Läuft flüssig | 6,3 GB | ca. 76 Tokens/s | Q4 (Standard) |
| Gemma 3 4B Chat · Bilder | Läuft flüssig | 4,2 GB | ca. 142 Tokens/s | Q4 (Standard) |
| Qwen3 4B Chat · Logik | Läuft flüssig | 4,1 GB | ca. 152 Tokens/s | Q4 (Standard) |
| Llama 3.2 3B Chat | Läuft flüssig | 3,3 GB | ca. 191 Tokens/s | Q4 (Standard) |
| Qwen3 30B-A3B Chat · Logik | Läuft, etwas langsamer | 19,1 GB | ca. 19 Tokens/s | Q4 (Standard), teilweise ausgelagert |
| Qwen3-Coder 30B-A3B Programmieren | Läuft, etwas langsamer | 19,1 GB | ca. 19 Tokens/s | Q4 (Standard), teilweise ausgelagert |
| gpt-oss 20B Chat · Logik · Programmieren | Läuft, etwas langsamer | 11,7 GB | ca. 51 Tokens/s | MXFP4 (Original), teilweise ausgelagert |
| Phi-4 14B Chat · Logik | Läuft, etwas langsamer | 9,0 GB | ca. 52 Tokens/s | Q3 (spürbare Einbußen) |
| Gemma 3 12B Chat · Bilder | Läuft, etwas langsamer | 9,3 GB | ca. 62 Tokens/s | Q3 (spürbare Einbußen) |
| Qwen3 32B Chat · Logik · Programmieren | Nur sehr langsam | 21,7 GB | ca. 2 Tokens/s | Q4 (Standard), teilweise ausgelagert |
| Qwen2.5-Coder 32B Programmieren | Nur sehr langsam | 21,7 GB | ca. 2 Tokens/s | Q4 (Standard), teilweise ausgelagert |
| DeepSeek-R1 32B (Distill) Logik | Nur sehr langsam | 21,7 GB | ca. 2 Tokens/s | Q4 (Standard), teilweise ausgelagert |
| Gemma 3 27B Chat · Bilder | Nur sehr langsam | 20,4 GB | ca. 2 Tokens/s | Q4 (Standard), teilweise ausgelagert |
| Mistral Small 3.1 24B Chat · Bilder | Nur sehr langsam | 15,8 GB | ca. 3 Tokens/s | Q4 (Standard), teilweise ausgelagert |
| Llama 3.3 70B Chat | Passt nicht | – | – | braucht ca. 36,1 GB |
| Llama 4 Scout Chat · Bilder | Passt nicht | – | – | braucht ca. 53,1 GB |
| gpt-oss 120B Chat · Logik · Programmieren | Passt nicht | – | – | braucht ca. 60,8 GB |
| Qwen3 235B-A22B Chat · Logik · Programmieren | Passt nicht | – | – | braucht ca. 112,0 GB |
| DeepSeek-R1 671B Logik | Passt nicht | – | – | braucht ca. 314,9 GB |
Günstigster Einstieg in 16 GB VRAM.
+3 Modelle flüssig, z. B. gpt-oss 20B
Preise bei Amazon ansehen*16 GB mit doppeltem Tempo.
+3 Modelle flüssig, z. B. gpt-oss 20B
Preise bei Amazon ansehen*Preis-Leistungs-Tipp für 24 GB.
+10 Modelle flüssig, z. B. Qwen3 32B
Preise bei Amazon ansehen*Das Schnellste für Zuhause.
+10 Modelle flüssig, z. B. Qwen3 32B
Preise bei Amazon ansehen** Werbelink: Wenn du über diesen Link kaufst, erhalten wir eine kleine Provision. Für dich ändert sich am Preis nichts.
Die RTX 2080 Ti ist gut für lokale KI geeignet – auch die deutlich klügeren 12B- bis 21B-Modelle laufen flüssig. Mit 11 GB Grafikspeicher laufen 7 von 22 Modellen flüssig, das stärkste davon ist Qwen3 14B.
Unsere Empfehlung ist Qwen3 14B: Deutlich klüger als die 8B-Variante. Starten lässt es sich mit dem Befehl „ollama run qwen3:14b“.
Nur mit Auslagerung in den Arbeitsspeicher: Mit 32 GB RAM läuft Qwen3 32B auf die RTX 2080 Ti, aber mit ca. 2 Tokens/s sehr langsam.
Nein. Llama 3.3 70B braucht selbst stark komprimiert ca. 36,1 GB – mehr, als die RTX 2080 Ti bietet.
Nur mit Auslagerung in den Arbeitsspeicher: Mit 32 GB RAM läuft gpt-oss 20B auf die RTX 2080 Ti, aber mit ca. 51 Tokens/s eher gemächlich.
Ja. Qwen3 14B passt in der Variante Q4 (Standard) komplett in den Speicher (ca. 10,5 GB) und erreicht ca. 41 Tokens/s – das fühlt sich flüssig an.