Beste Grafikkarte für lokale KI: Die richtige GPU für Ollama & LM Studio

Kurz gesagt: Für lokale KI zählt vor allem der Grafikspeicher (VRAM). 16 GB sind heute der sinnvolle Einstieg, 24 GB der Sweet Spot für ambitionierte Nutzer. Rechenleistung ist zweitrangig – entscheidend sind Speichergröße und Speicherbandbreite.

Unsere Empfehlungen

Der günstige Einstieg

NVIDIA RTX 5060 Ti (16 GB)

  • 10 von 22 getesteten Modellen laufen flüssig – stärkstes: gpt-oss 20B
  • Plus: 16 GB VRAM zum kleinsten Preis, sparsam und leise.
  • Minus: Geringe Speicherbandbreite – große Modelle antworten eher gemächlich.
Preise bei Amazon ansehen*

Die schnelle Mittelklasse

NVIDIA RTX 5070 Ti (16 GB)

  • 10 von 22 getesteten Modellen laufen flüssig – stärkstes: gpt-oss 20B
  • Plus: Gleicher Speicher wie die 5060 Ti, aber doppelt so hohe Bandbreite – spürbar flottere Antworten.
  • Minus: Für 32B-Modelle reichen 16 GB nicht.
Preise bei Amazon ansehen*

Preis-Leistungs-Tipp (gebraucht)

NVIDIA RTX 3090 (24 GB)

  • 17 von 22 getesteten Modellen laufen flüssig – stärkstes: Qwen3 32B
  • Plus: 24 GB VRAM und hohe Bandbreite – gebraucht oft günstiger als neue 16-GB-Karten.
  • Minus: Hoher Stromverbrauch, groß und warm; nur gebraucht erhältlich.
Preise bei Amazon ansehen*

Das Maximum für Zuhause

NVIDIA RTX 5090 (32 GB)

  • 17 von 22 getesteten Modellen laufen flüssig – stärkstes: Qwen3 32B
  • Plus: 32 GB und die mit Abstand höchste Bandbreite – alles bis 32B läuft sehr schnell, auch mit langen Texten.
  • Minus: Sehr teuer und stromhungrig.
Preise bei Amazon ansehen*

Die AMD-Alternative

AMD RX 7900 XTX (24 GB)

  • 17 von 22 getesteten Modellen laufen flüssig – stärkstes: Qwen3 32B
  • Plus: 24 GB VRAM, oft günstiger als NVIDIA-Karten mit gleichem Speicher.
  • Minus: KI-Software ist für NVIDIA (CUDA) besser optimiert – mit Ollama und LM Studio klappt es, bei anderen Tools ist mehr Bastelei nötig.
Preise bei Amazon ansehen*

* Werbelink: Wenn du über diesen Link kaufst, erhalten wir eine kleine Provision. Für dich ändert sich am Preis nichts.

Worauf es wirklich ankommt

1. VRAM: Wie groß darf das Modell sein?

Ein KI-Modell muss komplett in den Grafikspeicher passen, sonst wird es drastisch langsamer. Als Faustregel braucht ein Modell in der üblichen Q4-Variante gut 0,6 GB pro Milliarde Parameter plus 1–2 GB für den Kontext. Mit 8 GB bist du auf Modelle bis etwa 8B beschränkt, 16 GB reichen für die deutlich klügeren 14B-Modelle, 24 GB öffnen die Tür zu 27B- bis 32B-Modellen. Details erklärt unser Ratgeber Wie viel VRAM braucht lokale KI?

2. Speicherbandbreite: Wie schnell antwortet die KI?

Für jedes erzeugte Wort liest die Grafikkarte das komplette Modell einmal aus dem Speicher. Deshalb bestimmt die Bandbreite (in GB/s) das Tempo – nicht die Spiele-Leistung. Ein Beispiel: Qwen3 14B schafft auf der RTX 5060 Ti ca. 30 Tokens pro Sekunde, auf der RTX 5070 Ti mit gleichem Speicher ca. 60.

3. NVIDIA, AMD oder Intel?

NVIDIA ist für lokale KI die unkomplizierteste Wahl, weil fast jede KI-Software zuerst für CUDA entwickelt wird. AMD-Karten funktionieren mit Ollama und LM Studio gut und bieten oft mehr Speicher fürs Geld. Intel Arc ist günstig, erfordert aber noch am meisten Einrichtung.

4. Finger weg von 8-GB-Karten

Karten mit 8 GB sind für lokale KI eine Sackgasse: Schon mittelgroße Modelle passen nicht mehr hinein. Wenn du gezielt für KI kaufst, nimm mindestens 12, besser 16 GB.

Vergleichstabelle

GrafikkarteVRAMBandbreiteModelle flüssigQwen3 14B
RTX 3060 (12 GB)12 GB360 GB/s9ca. 24 Tokens/s
RTX 5060 (8 GB)8 GB448 GB/s5ausgelagert, ca. 5 Tokens/s
RTX 4060 Ti (16 GB)16 GB288 GB/s10ca. 19 Tokens/s
RTX 5060 Ti (16 GB)16 GB448 GB/s10ca. 30 Tokens/s
RTX 5070 Ti (16 GB)16 GB896 GB/s10ca. 60 Tokens/s
RX 9070 / 9070 XT (16 GB)16 GB640 GB/s10ca. 43 Tokens/s
Arc B580 (12 GB)12 GB456 GB/s9ca. 30 Tokens/s
RTX 3090 (24 GB)24 GB936 GB/s17ca. 63 Tokens/s
RTX 4090 (24 GB)24 GB1008 GB/s17ca. 67 Tokens/s
RX 7900 XTX (24 GB)24 GB960 GB/s17ca. 64 Tokens/s
RTX 5090 (32 GB)32 GB1792 GB/s17ca. 120 Tokens/s

Berechnet für 22 Modelle bei 8.000 Tokens Kontext und 32 GB Arbeitsspeicher. Alle Karten im Detail: Grafikkarten-Vergleich.

Alternativen: Mac und Mini-PC

Wer wirklich große Modelle wie Llama 3.3 70B oder gpt-oss 120B nutzen will, stößt mit einzelnen Grafikkarten an Grenzen. Hier sind Systeme mit großem gemeinsamem Speicher im Vorteil: ein Mac mit viel Arbeitsspeicher oder ein Mini-PC mit AMD Ryzen AI Max+ 395 und 128 GB. Sie sind langsamer als eine RTX 5090, können aber Modelle laden, die auf keine Gaming-Karte passen.

Jetzt deine Hardware im Rechner prüfen

Häufige Fragen

Welche Grafikkarte ist die beste für lokale KI?

Für die meisten Nutzer ist eine Karte mit 16 GB VRAM wie die RTX 5060 Ti oder RTX 5070 Ti der beste Kompromiss. Wer 32B-Modelle nutzen will, braucht 24 GB – zum Beispiel eine gebrauchte RTX 3090 oder eine RTX 4090.

Reichen 8 GB VRAM für lokale KI?

Für kleine Modelle bis etwa 8 Milliarden Parameter ja. Die deutlich leistungsfähigeren 14B-Modelle passen aber nicht mehr komplett hinein. Für einen Neukauf empfehlen wir mindestens 12, besser 16 GB.

Ist AMD für lokale KI geeignet?

Ja, Ollama und LM Studio unterstützen aktuelle AMD-Karten. NVIDIA bleibt wegen CUDA die unkompliziertere Wahl, AMD bietet dafür oft mehr Speicher fürs Geld.