Wie viel VRAM braucht lokale KI? Tabelle für Llama, Qwen, Gemma & Co.

Faustregel: Ein Modell braucht in der üblichen Q4-Variante etwa 0,6 GB VRAM pro Milliarde Parameter – plus 1 bis 2 GB für Kontext und Software. Ein 8B-Modell läuft also ab etwa 6 GB, ein 32B-Modell ab etwa 24 GB.

VRAM-Tabelle für beliebte Modelle

ModellParameterQ4, 8k KontextQ8, 8k KontextQ4, 32k KontextEmpfohlen
Llama 3.2 3B3,2 Mrd.3,3 GB4,7 GB6,0 GB4 GB
Qwen3 8B8,2 Mrd.6,5 GB10,1 GB9,9 GB8 GB
Gemma 3 12B12 Mrd.10,7 GB16,0 GB19,7 GB12 GB
Qwen3 14B15 Mrd.10,5 GB16,9 GB14,2 GB12 GB
gpt-oss 20B21 Mrd. (3,6 aktiv)11,7 GB–12,8 GB16 GB
Mistral Small 3.1 24B24 Mrd.15,8 GB26,3 GB19,6 GB20 GB
Gemma 3 27B27 Mrd.20,4 GB32,4 GB32,0 GB24 GB
Qwen3 30B-A3B31 Mrd. (3,3 aktiv)19,1 GB32,4 GB21,3 GB20 GB
Qwen3 32B33 Mrd.21,7 GB36,0 GB27,7 GB24 GB
Llama 3.3 70B71 Mrd.44,2 GB75,1 GB51,7 GB48 GB
gpt-oss 120B117 Mrd. (5,1 aktiv)60,8 GB–62,5 GB64 GB
Qwen3 235B-A22B235 Mrd. (22,0 aktiv)138,7 GB241,6 GB143,1 GB192 GB

„Empfohlen“ ist die kleinste übliche Speichergröße, in die das Modell in Q4 mit 8.000 Tokens Kontext komplett passt. gpt-oss wird von OpenAI nur in einer komprimierten Variante (MXFP4) ausgeliefert.

Wovon der Speicherbedarf abhängt

Parameter: die Größe des Modells

Die Zahl hinter dem Modellnamen (8B, 14B, 70B) gibt an, aus wie vielen Milliarden Zahlen das Modell besteht. Mehr Parameter bedeuten in der Regel ein klügeres Modell – aber auch mehr Speicherbedarf.

Quantisierung: wie stark komprimiert wird

Im Original speichert ein Modell jede Zahl mit 16 Bit. Quantisierung verkleinert das auf 8, 6, 5 oder 4 Bit. Die Variante Q4 braucht nur rund ein Viertel des Speichers und verliert dabei erstaunlich wenig Qualität – deshalb ist sie Standard bei Ollama. Q8 ist nahezu verlustfrei, braucht aber fast doppelt so viel Platz.

Kontext: wie viel Text die KI gleichzeitig verarbeitet

Für jedes Wort im Gespräch merkt sich das Modell Zwischenergebnisse im sogenannten KV-Cache. Bei Llama 3.1 8B sind das bei 8.000 Tokens ca. 1,0 GB – bei 128.000 Tokens schon ca. 16,0 GB, mehr als das Modell selbst. Wer lange Dokumente verarbeiten will, braucht also deutlich mehr Reserve.

Sonderfall MoE-Modelle

Modelle wie Qwen3 30B-A3B oder gpt-oss nutzen eine „Mixture of Experts“: Sie müssen komplett in den Speicher passen, rechnen pro Wort aber nur mit einem kleinen Teil der Parameter. Deshalb sind sie bei gleichem Speicherbedarf deutlich schneller als normale Modelle.

Was tun, wenn der VRAM nicht reicht?

Welche Modelle genau auf deine Hardware passen, zeigt dir der KI-Hardware-Rechner. Wenn du über eine neue Grafikkarte nachdenkst, hilft unsere Kaufberatung.

Häufige Fragen

Wie viel VRAM brauche ich für ein 8B-Modell?

In der Standard-Quantisierung Q4 braucht ein 8B-Modell mit 8.000 Tokens Kontext etwa 6 bis 7 GB. Eine Grafikkarte mit 8 GB reicht also, mit 12 GB hast du Reserve für längere Texte oder die bessere Q8-Variante.

Wie viel VRAM braucht Llama 3.3 70B?

In Q4 etwa 44 GB. Das passt auf keine einzelne Gaming-Grafikkarte – nötig sind zwei 24-GB-Karten, ein Mac mit mindestens 64 GB oder ein Mini-PC mit großem gemeinsamem Speicher.

Zählt der normale Arbeitsspeicher (RAM) auch?

Nur eingeschränkt: Programme wie Ollama können Teile des Modells in den RAM auslagern, das ist aber deutlich langsamer. Ausnahme sind Macs und Systeme mit gemeinsamem Speicher, bei denen RAM und Grafikspeicher identisch sind.