Zum Inhalt springen
Illustration: Illustration: Ein Desktop-Rechner mit leuchtender Grafikkarte steht in einem umrandeten Bereich; das Kabel zu einer Wolke außerhalb ist gekappt und endet vor ihr.
KI

Lokale KI mit Ollama: Datenschutz ohne Cloud

Von · · 6 Min. Lesezeit

Ollama ist ein freies Programm, das offene Sprachmodelle auf dem eigenen Rechner oder Server ausführt. Ein Befehl lädt ein Modell herunter, ein zweiter startet ein Gespräch damit, und eine Schnittstelle auf Port 11434 macht es für andere Programme nutzbar. Für den Datenschutz ist das die einfachste Lösung, die es gibt: Was nicht übertragen wird, muss auch kein Anbieter schützen.

Lokal heißt: Die Daten bleiben beim Rechner, die Verantwortung auch. Den Vertrag mit einem KI-Anbieter sparst du dir. Die Absicherung des Rechners, die Löschung der Daten und die Frage, wer darauf zugreift, übernimmst du dafür selbst.

Was bei Ollama lokal ist und was nicht#

Ollama schreibt in seiner FAQ: „Ollama runs locally. We don't see your prompts or data when you run locally.“ Die Modelle liegen als Dateien auf der Platte, unter Linux in /usr/share/ollama/.ollama/models, unter macOS in ~/.ollama/models, unter Windows im Benutzerordner. Nach außen geht der Download des Modells, sonst nichts.

Die Ausnahme ist neu und leicht zu übersehen: Ollama bietet inzwischen auch Cloud-Modelle an. Sie heißen in der App und auf der Kommandozeile mit dem Zusatz -cloud, etwa gemma4:cloud, werden nicht heruntergeladen und laufen auf den Servern von Ollama (Ollama, Cloud). Ollama schreibt dazu, Eingaben und Antworten würden verarbeitet, aber nicht gespeichert, protokolliert oder zum Training verwendet. Wo diese Server stehen, steht nicht in der Dokumentation. Ein Cloud-Modell ist damit ein Cloud-Dienst wie jeder andere, nur mit derselben Kommandozeile.

Wer das ausschließen will, schaltet die Cloud ab: mit der Umgebungsvariable OLLAMA_NO_CLOUD=1 oder in ~/.ollama/server.json mit "disable_ollama_cloud": true. Das gehört auf jeden Rechner, auf dem Kundendaten verarbeitet werden.

Installieren und starten#

Die Installation dauert unter Linux einen Befehl (Ollama, Linux):

curl -fsSL https://ollama.com/install.sh | sh

Für macOS und Windows gibt es ein Installationspaket auf ollama.com/download. Unter Linux richtet das Skript einen eigenen Systemdienst unter dem Benutzer ollama ein; aktualisiert wird, indem man es erneut ausführt, die Protokolle zeigt journalctl -e -u ollama. Danach lädt und startet ein Befehl das erste Modell:

ollama run gemma4:e2b

Der Befehl öffnet ein Gespräch im Terminal. Gleichzeitig läuft die Schnittstelle unter http://localhost:11434, über die andere Programme das Modell ansprechen, etwa eine Chat-Oberfläche, ein Skript oder ein Automatisierungswerkzeug.

Was die Hardware leisten muss#

Ein Modell muss in den Arbeitsspeicher passen, und für brauchbare Geschwindigkeit in den Grafikspeicher. Für das Einstiegsmodell gemma4:e2b empfiehlt Ollama 8 GB freien Grafikspeicher oder den gemeinsamen Speicher eines Mac. Reicht der Grafikspeicher nicht, weicht Ollama auf den normalen Arbeitsspeicher aus, „though performance may be reduced“, und längere Kontexte brauchen zusätzlich Speicher (Ollama, Quickstart).

Wie schnell das wächst, zeigen die Downloadgrößen aus der Modellbibliothek (Qwen3, Gemma 4, Llama 3.1):

ModellDownload
qwen3:8b5,2 GB
qwen3:14b9,3 GB
gemma4:26b16 bis 19 GB
qwen3:32b20 GB
llama3.1:70b43 GB

Für einen Büro-Laptop heißt das: Modelle bis etwa acht Milliarden Parameter laufen, größere werden langsam oder passen nicht. Für die Klasse um 30 Milliarden Parameter braucht es eine Grafikkarte mit viel Speicher oder einen Mac mit großem gemeinsamem Speicher. Die Modelle der großen Anbieter in der Cloud spielen in einer anderen Liga. Lokal bekommst du kein ChatGPT, sondern ein kleineres Modell, das für klar umrissene Aufgaben reicht: Texte zusammenfassen, Mails vorsortieren, Daten aus Dokumenten ziehen.

Lizenzen: offen heißt nicht immer frei#

Ein offenes Modell kommt mit einer Lizenz, und die ist nicht bei allen gleich. Drei Beispiele aus der Bibliothek:

  • Gemma 4 von Google steht seit der vierten Generation unter Apache 2.0 (Google, Gemma). Gewerbliche Nutzung ist erlaubt, ohne Sonderregeln.
  • Qwen3 von Alibaba steht ebenfalls unter Apache 2.0, laut Modellkarte.
  • Llama 3.1 von Meta steht unter einer eigenen „Llama 3.1 Community License“ (Lizenztext). Sie bindet an eine Nutzungsrichtlinie und verlangt beim Weitergeben den sichtbaren Hinweis „Built with Llama“; ab 700 Millionen monatlichen Nutzern braucht es eine eigene Lizenz von Meta.

Für einen kleinen Betrieb ist die Nutzergrenze egal, die Nutzungsrichtlinie und die Kennzeichnung nicht. Wer ein Modell in ein Produkt für Kunden einbaut, liest die Lizenz vorher.

Illustration: Illustration: Ein Server, dessen Anschluss in einer Schleife zu ihm selbst zurückführt; ein gestricheltes Kabel zu einem Globus endet an einer geschlossenen Schranke.

Port 11434: die Falle, in die alle tappen#

Die lokale Schnittstelle hat keine Anmeldung. Ollama schreibt in der Dokumentation zur Authentifizierung wörtlich: „The local API at http://localhost:11434 does not require authentication.“ Solange sie nur auf dem eigenen Rechner lauscht, ist das kein Problem. Standardmäßig bindet Ollama an 127.0.0.1; mit OLLAMA_HOST lässt sich das ändern, und genau das tun viele, die das Modell vom Laptop aus auf dem Rechner mit der Grafikkarte nutzen wollen.

Mit OLLAMA_HOST=0.0.0.0 hört die Schnittstelle auf allen Netzwerkkarten. Steht der Rechner im Internet, etwa als gemieteter Server, kann jeder das Modell benutzen, eigene Modelle hochladen oder vorhandene löschen. Cisco hat das am 1. September 2025 nachgezählt und mit der Suchmaschine Shodan 1.139 offen erreichbare Ollama-Server gefunden, von denen 214 aktiv Modelle ausgeliefert haben (Cisco, Detecting Exposed LLM Servers). Deutschland lag mit 8,9 % auf Platz drei.

Die zweite Falle ist Docker. Die offizielle Anleitung startet den Container mit -p 11434:11434 (Ollama, Docker), und Docker veröffentlicht einen so freigegebenen Port auf allen Schnittstellen des Hosts: „Publishing container ports is insecure by default“ (Docker, Port publishing). Auf einem Server mit öffentlicher Adresse ist die Schnittstelle damit offen, auch wenn innerhalb des Containers nichts geändert wurde. Die Lösung ist ein Zusatz:

docker run -d -v ollama:/root/.ollama -p 127.0.0.1:11434:11434 --name ollama ollama/ollama

Wer aus dem Netz zugreifen muss, stellt einen Reverse Proxy davor, der eine Anmeldung verlangt; die FAQ von Ollama zeigt dafür ein Beispiel mit Nginx. Noch besser ist ein VPN, über das nur die eigenen Geräte den Server erreichen.

Was nicht hilft#

„Lokal“ als Datenschutz-Freibrief. Die DSGVO gilt für jede Verarbeitung, auch auf dem eigenen Rechner. Zweck, Rechtsgrundlage, Löschfristen und Zugriffsrechte musst du genauso festlegen wie bei einem Cloud-Dienst. Wer Bewerbungen durch ein lokales Modell schickt, braucht dafür denselben Grund wie mit ChatGPT. Die Reihenfolge der Fragen steht in KI DSGVO-konform einsetzen.

Der Mietserver als „lokale“ Lösung. Läuft Ollama auf einem gemieteten Server, fällt der Vertrag mit dem KI-Anbieter weg, der mit dem Hoster nicht. Für ihn brauchst du einen Auftragsverarbeitungsvertrag, wie für jedes andere Hosting.

Ein anderer Port. 11434 auf eine andere Zahl zu legen, hält keinen Scanner auf. Cisco hat die Server über Standardport und Kennung der Antwort gefunden; ein anderer Port verschiebt das Problem, er löst es nicht.

Einmal installieren und vergessen. Ollama ist ein Serverdienst wie jeder andere und bekommt Sicherheitsupdates. Unter Linux heißt Aktualisieren: das Installationsskript erneut ausführen. Das gehört in denselben Rhythmus wie die übrigen Updates des Servers.

Werkzeuge mit Vollzugriff anbinden. Sobald ein lokales Modell über eine Schnittstelle Dateien lesen oder Befehle ausführen darf, gelten dieselben Regeln wie bei jedem Agenten, egal wo das Modell rechnet. Siehe MCP-Server sicher einsetzen.

Der ehrliche Schluss#

Lokale KI lohnt sich, wenn klar umrissene Aufgaben mit sensiblen Daten anfallen und ein Rechner mit genug Speicher da ist: Dokumente auswerten, Mails vorsortieren, interne Texte zusammenfassen. Sie lohnt sich nicht, wenn du die Qualität der großen Modelle erwartest oder niemand den Server pflegt. Dann ist ein Geschäftstarif mit Vertrag und abgeschaltetem Training die sicherere Wahl, weil sich dort jemand anderes um Updates und Absicherung kümmert. Was die drei großen Dienste mit Eingaben machen, steht in ChatGPT, Claude, Copilot: Datenschutz im Vergleich, wie die Verträge aussehen, in Auftragsverarbeitungsvertrag mit KI-Anbietern.

Stand 04.10.2026. Angaben aus der Ollama-Dokumentation, der Modellbibliothek und den verlinkten Lizenztexten vom selben Tag.

Weiterlesen