Ollama installieren: Lokale KI in 5 Minuten starten

Mit Ollama läuft eine ChatGPT-ähnliche KI komplett auf deinem eigenen Rechner – kostenlos, offline und ohne dass deine Daten den PC verlassen. Die Installation dauert nur wenige Minuten.

Vorher: Passt deine Hardware?

Ollama läuft auf fast jedem aktuellen Rechner – wie gut, hängt vom Grafikspeicher ab. Prüfe im KI-Hardware-Rechner, welche Modelle auf deiner Grafikkarte oder deinem Mac flüssig laufen. Plane außerdem ein paar Gigabyte freien Festplattenplatz pro Modell ein.

Installation

Windows

  1. Lade auf ollama.com/download das Windows-Installationsprogramm herunter.
  2. Starte die Datei und folge dem Installer – Administratorrechte sind nicht nötig.
  3. Halte den Grafikkartentreiber aktuell (NVIDIA oder AMD), damit Ollama die GPU nutzen kann.

Mac

  1. Lade die Mac-Version auf ollama.com/download herunter.
  2. Entpacke sie und ziehe Ollama in den Programme-Ordner.
  3. Starte Ollama einmal – das Lama-Symbol erscheint in der Menüleiste.

Linux

Öffne ein Terminal und führe das offizielle Installationsskript aus:

curl -fsSL https://ollama.com/install.sh | sh

Das erste Modell starten

Ollama bringt eine eigene Chat-Oberfläche mit: Öffne die App, wähle ein Modell aus der Liste und schreib los. Alternativ geht es im Terminal (Windows: Eingabeaufforderung oder PowerShell):

ollama run qwen3:8b

Beim ersten Aufruf lädt Ollama das Modell herunter (bei Qwen3 8B gut 5 GB), danach startet direkt ein Chat. Mit /bye beendest du ihn. Welches Modell für deine Hardware am besten passt, zeigt der Rechner – dort kannst du den passenden Befehl direkt kopieren.

Die wichtigsten Befehle

BefehlWas er tut
ollama run MODELLModell herunterladen (falls nötig) und Chat starten
ollama pull MODELLModell nur herunterladen oder aktualisieren
ollama listAlle installierten Modelle anzeigen
ollama psLaufende Modelle anzeigen – inklusive, ob sie auf der GPU oder CPU laufen
ollama rm MODELLModell löschen und Speicherplatz freigeben

Häufige Probleme

Die KI ist extrem langsam

Prüfe mit ollama ps, ob in der Spalte PROCESSOR „100% GPU“ steht. Steht dort ein CPU-Anteil, ist das Modell zu groß für deinen Grafikspeicher und wird ausgelagert. Wähle ein kleineres Modell – der Rechner zeigt dir, welche komplett passen.

Die Grafikkarte wird gar nicht genutzt

Meist hilft ein aktueller Grafikkartentreiber und ein Neustart von Ollama. Sehr alte oder sehr kleine Grafikkarten werden teilweise nicht unterstützt.

Lieber eine grafische Oberfläche?

Neben der eingebauten Chat-App von Ollama sind LM Studio (eigenständige App mit Modell-Browser) und Open WebUI (ChatGPT-ähnliche Oberfläche im Browser) beliebte Alternativen.

Passendes Modell für deine Hardware finden

Häufige Fragen

Ist Ollama kostenlos?

Ja, Ollama ist Open Source und kostenlos. Auch die meisten Modelle wie Llama, Qwen, Gemma oder gpt-oss dürfen privat kostenlos genutzt werden – die jeweilige Lizenz steht auf der Modellseite.

Funktioniert Ollama ohne Internet?

Ja. Internet brauchst du nur zum Herunterladen der Modelle. Danach läuft alles offline auf deinem Rechner.

Wo speichert Ollama die Modelle?

Standardmäßig im Ordner .ollama/models in deinem Benutzerverzeichnis (unter Linux bei der Dienst-Installation unter /usr/share/ollama). Mit der Umgebungsvariable OLLAMA_MODELS lässt sich der Speicherort ändern.