Wie viel VRAM braucht lokale KI? Tabelle für Llama, Qwen, Gemma & Co.
Faustregel: Ein Modell braucht in der üblichen Q4-Variante etwa 0,6 GB VRAM pro Milliarde Parameter – plus 1 bis 2 GB für Kontext und Software. Ein 8B-Modell läuft also ab etwa 6 GB, ein 32B-Modell ab etwa 24 GB.
VRAM-Tabelle für beliebte Modelle
| Modell | Parameter | Q4, 8k Kontext | Q8, 8k Kontext | Q4, 32k Kontext | Empfohlen |
|---|---|---|---|---|---|
| Llama 3.2 3B | 3,2 Mrd. | 3,3 GB | 4,7 GB | 6,0 GB | 4 GB |
| Qwen3 8B | 8,2 Mrd. | 6,5 GB | 10,1 GB | 9,9 GB | 8 GB |
| Gemma 3 12B | 12 Mrd. | 10,7 GB | 16,0 GB | 19,7 GB | 12 GB |
| Qwen3 14B | 15 Mrd. | 10,5 GB | 16,9 GB | 14,2 GB | 12 GB |
| gpt-oss 20B | 21 Mrd. (3,6 aktiv) | 11,7 GB | – | 12,8 GB | 16 GB |
| Mistral Small 3.1 24B | 24 Mrd. | 15,8 GB | 26,3 GB | 19,6 GB | 20 GB |
| Gemma 3 27B | 27 Mrd. | 20,4 GB | 32,4 GB | 32,0 GB | 24 GB |
| Qwen3 30B-A3B | 31 Mrd. (3,3 aktiv) | 19,1 GB | 32,4 GB | 21,3 GB | 20 GB |
| Qwen3 32B | 33 Mrd. | 21,7 GB | 36,0 GB | 27,7 GB | 24 GB |
| Llama 3.3 70B | 71 Mrd. | 44,2 GB | 75,1 GB | 51,7 GB | 48 GB |
| gpt-oss 120B | 117 Mrd. (5,1 aktiv) | 60,8 GB | – | 62,5 GB | 64 GB |
| Qwen3 235B-A22B | 235 Mrd. (22,0 aktiv) | 138,7 GB | 241,6 GB | 143,1 GB | 192 GB |
„Empfohlen“ ist die kleinste übliche Speichergröße, in die das Modell in Q4 mit 8.000 Tokens Kontext komplett passt. gpt-oss wird von OpenAI nur in einer komprimierten Variante (MXFP4) ausgeliefert.
Wovon der Speicherbedarf abhängt
Parameter: die Größe des Modells
Die Zahl hinter dem Modellnamen (8B, 14B, 70B) gibt an, aus wie vielen Milliarden Zahlen das Modell besteht. Mehr Parameter bedeuten in der Regel ein klügeres Modell – aber auch mehr Speicherbedarf.
Quantisierung: wie stark komprimiert wird
Im Original speichert ein Modell jede Zahl mit 16 Bit. Quantisierung verkleinert das auf 8, 6, 5 oder 4 Bit. Die Variante Q4 braucht nur rund ein Viertel des Speichers und verliert dabei erstaunlich wenig Qualität – deshalb ist sie Standard bei Ollama. Q8 ist nahezu verlustfrei, braucht aber fast doppelt so viel Platz.
Kontext: wie viel Text die KI gleichzeitig verarbeitet
Für jedes Wort im Gespräch merkt sich das Modell Zwischenergebnisse im sogenannten KV-Cache. Bei Llama 3.1 8B sind das bei 8.000 Tokens ca. 1,0 GB – bei 128.000 Tokens schon ca. 16,0 GB, mehr als das Modell selbst. Wer lange Dokumente verarbeiten will, braucht also deutlich mehr Reserve.
Sonderfall MoE-Modelle
Modelle wie Qwen3 30B-A3B oder gpt-oss nutzen eine „Mixture of Experts“: Sie müssen komplett in den Speicher passen, rechnen pro Wort aber nur mit einem kleinen Teil der Parameter. Deshalb sind sie bei gleichem Speicherbedarf deutlich schneller als normale Modelle.
Was tun, wenn der VRAM nicht reicht?
- Kleinere Quantisierung wählen: Q3 statt Q4 spart Speicher, kostet aber spürbar Qualität.
- Kontext begrenzen: Weniger Kontext bedeutet weniger KV-Cache.
- In den Arbeitsspeicher auslagern: Ollama und LM Studio machen das automatisch – das Modell läuft dann, aber oft fünf- bis zehnmal langsamer.
- Ein kleineres oder ein MoE-Modell nehmen: Oft ist ein aktuelles 14B-Modell besser als ein älteres, größeres.
Welche Modelle genau auf deine Hardware passen, zeigt dir der KI-Hardware-Rechner. Wenn du über eine neue Grafikkarte nachdenkst, hilft unsere Kaufberatung.