Beste Grafikkarte für lokale KI: Die richtige GPU für Ollama & LM Studio
Kurz gesagt: Für lokale KI zählt vor allem der Grafikspeicher (VRAM). 16 GB sind heute der sinnvolle Einstieg, 24 GB der Sweet Spot für ambitionierte Nutzer. Rechenleistung ist zweitrangig – entscheidend sind Speichergröße und Speicherbandbreite.
Unsere Empfehlungen
Der günstige Einstieg
NVIDIA RTX 5060 Ti (16 GB)
- 10 von 22 getesteten Modellen laufen flüssig – stärkstes: gpt-oss 20B
- Plus: 16 GB VRAM zum kleinsten Preis, sparsam und leise.
- Minus: Geringe Speicherbandbreite – große Modelle antworten eher gemächlich.
Die schnelle Mittelklasse
NVIDIA RTX 5070 Ti (16 GB)
- 10 von 22 getesteten Modellen laufen flüssig – stärkstes: gpt-oss 20B
- Plus: Gleicher Speicher wie die 5060 Ti, aber doppelt so hohe Bandbreite – spürbar flottere Antworten.
- Minus: Für 32B-Modelle reichen 16 GB nicht.
Preis-Leistungs-Tipp (gebraucht)
NVIDIA RTX 3090 (24 GB)
- 17 von 22 getesteten Modellen laufen flüssig – stärkstes: Qwen3 32B
- Plus: 24 GB VRAM und hohe Bandbreite – gebraucht oft günstiger als neue 16-GB-Karten.
- Minus: Hoher Stromverbrauch, groß und warm; nur gebraucht erhältlich.
Das Maximum für Zuhause
NVIDIA RTX 5090 (32 GB)
- 17 von 22 getesteten Modellen laufen flüssig – stärkstes: Qwen3 32B
- Plus: 32 GB und die mit Abstand höchste Bandbreite – alles bis 32B läuft sehr schnell, auch mit langen Texten.
- Minus: Sehr teuer und stromhungrig.
Die AMD-Alternative
AMD RX 7900 XTX (24 GB)
- 17 von 22 getesteten Modellen laufen flüssig – stärkstes: Qwen3 32B
- Plus: 24 GB VRAM, oft günstiger als NVIDIA-Karten mit gleichem Speicher.
- Minus: KI-Software ist für NVIDIA (CUDA) besser optimiert – mit Ollama und LM Studio klappt es, bei anderen Tools ist mehr Bastelei nötig.
* Werbelink: Wenn du über diesen Link kaufst, erhalten wir eine kleine Provision. Für dich ändert sich am Preis nichts.
Worauf es wirklich ankommt
1. VRAM: Wie groß darf das Modell sein?
Ein KI-Modell muss komplett in den Grafikspeicher passen, sonst wird es drastisch langsamer. Als Faustregel braucht ein Modell in der üblichen Q4-Variante gut 0,6 GB pro Milliarde Parameter plus 1–2 GB für den Kontext. Mit 8 GB bist du auf Modelle bis etwa 8B beschränkt, 16 GB reichen für die deutlich klügeren 14B-Modelle, 24 GB öffnen die Tür zu 27B- bis 32B-Modellen. Details erklärt unser Ratgeber Wie viel VRAM braucht lokale KI?
2. Speicherbandbreite: Wie schnell antwortet die KI?
Für jedes erzeugte Wort liest die Grafikkarte das komplette Modell einmal aus dem Speicher. Deshalb bestimmt die Bandbreite (in GB/s) das Tempo – nicht die Spiele-Leistung. Ein Beispiel: Qwen3 14B schafft auf der RTX 5060 Ti ca. 30 Tokens pro Sekunde, auf der RTX 5070 Ti mit gleichem Speicher ca. 60.
3. NVIDIA, AMD oder Intel?
NVIDIA ist für lokale KI die unkomplizierteste Wahl, weil fast jede KI-Software zuerst für CUDA entwickelt wird. AMD-Karten funktionieren mit Ollama und LM Studio gut und bieten oft mehr Speicher fürs Geld. Intel Arc ist günstig, erfordert aber noch am meisten Einrichtung.
4. Finger weg von 8-GB-Karten
Karten mit 8 GB sind für lokale KI eine Sackgasse: Schon mittelgroße Modelle passen nicht mehr hinein. Wenn du gezielt für KI kaufst, nimm mindestens 12, besser 16 GB.
Vergleichstabelle
| Grafikkarte | VRAM | Bandbreite | Modelle flüssig | Qwen3 14B |
|---|---|---|---|---|
| RTX 3060 (12 GB) | 12 GB | 360 GB/s | 9 | ca. 24 Tokens/s |
| RTX 5060 (8 GB) | 8 GB | 448 GB/s | 5 | ausgelagert, ca. 5 Tokens/s |
| RTX 4060 Ti (16 GB) | 16 GB | 288 GB/s | 10 | ca. 19 Tokens/s |
| RTX 5060 Ti (16 GB) | 16 GB | 448 GB/s | 10 | ca. 30 Tokens/s |
| RTX 5070 Ti (16 GB) | 16 GB | 896 GB/s | 10 | ca. 60 Tokens/s |
| RX 9070 / 9070 XT (16 GB) | 16 GB | 640 GB/s | 10 | ca. 43 Tokens/s |
| Arc B580 (12 GB) | 12 GB | 456 GB/s | 9 | ca. 30 Tokens/s |
| RTX 3090 (24 GB) | 24 GB | 936 GB/s | 17 | ca. 63 Tokens/s |
| RTX 4090 (24 GB) | 24 GB | 1008 GB/s | 17 | ca. 67 Tokens/s |
| RX 7900 XTX (24 GB) | 24 GB | 960 GB/s | 17 | ca. 64 Tokens/s |
| RTX 5090 (32 GB) | 32 GB | 1792 GB/s | 17 | ca. 120 Tokens/s |
Berechnet für 22 Modelle bei 8.000 Tokens Kontext und 32 GB Arbeitsspeicher. Alle Karten im Detail: Grafikkarten-Vergleich.
Alternativen: Mac und Mini-PC
Wer wirklich große Modelle wie Llama 3.3 70B oder gpt-oss 120B nutzen will, stößt mit einzelnen Grafikkarten an Grenzen. Hier sind Systeme mit großem gemeinsamem Speicher im Vorteil: ein Mac mit viel Arbeitsspeicher oder ein Mini-PC mit AMD Ryzen AI Max+ 395 und 128 GB. Sie sind langsamer als eine RTX 5090, können aber Modelle laden, die auf keine Gaming-Karte passen.