Ollama im Unternehmen: KI-Modelle auf dem eigenen Server, gemessen ohne Grafikkarte
Ollama holt Sprachmodelle auf den eigenen Rechner, ohne dass ein Prompt die Firma verlässt. Wir haben drei Qwen-Modelle auf einem gewöhnlichen Server ohne Grafikkarte gemessen: wie schnell sie schreiben, wo sie Fehler machen, welche Lizenz gewerblich tatsächlich erlaubt ist und warum die Standardeinstellung beim Netzwerk wichtiger ist als die Modellwahl.
Mit KI erzeugtes Bild. Mehr zur KI-TransparenzDie kurze Antwort zuerst. Ollama ist ein kostenloses Programm, das Sprachmodelle auf dem eigenen Rechner ausführt. Prompts und Antworten bleiben im Haus, solange Sie lokale Modelle verwenden. Es braucht keine Grafikkarte, ist ohne sie aber deutlich langsamer, und die kleinen Modelle, die ohne Grafikkarte flüssig laufen, machen mehr Fehler als ChatGPT oder Claude.
Ob sich das lohnt, hängt an drei Fragen: welche Daten Sie nicht aus der Hand geben wollen, wie schnell eine Antwort da sein muss, und wer im Betrieb den Server pflegt. Für diesen Beitrag haben wir Ollama auf unserem eigenen Server gemessen, einem gewöhnlichen Mietserver ohne Grafikkarte, wie ihn viele Mittelständler ohnehin haben. Die Zahlen unten stammen von dort.
Die Übersicht
| Frage | Kurze Antwort |
|---|---|
| Was kostet Ollama? | Nichts. MIT-Lizenz, der Quelltext liegt offen auf GitHub. |
| Wohin gehen meine Daten? | Nirgendwohin, solange Sie lokale Modelle nutzen. Modelle mit dem Zusatz :cloud laufen bei Ollama. |
| Brauche ich eine Grafikkarte? | Nein. Ohne sie schreibt ein 7B-Modell bei uns rund 20 Token pro Sekunde. |
| Kann ich meine ChatGPT-Anbindung weiterverwenden? | Oft ja. Ollama bietet einen Teil der OpenAI-Schnittstelle unter /v1. |
| Darf ich jedes Modell gewerblich nutzen? | Nein. Die Lizenz hängt am Modell. Qwen2.5 3B etwa ist nur für nichtkommerzielle Zwecke frei. |
| Ist es von außen erreichbar? | In der Standardeinstellung nicht. Wer es öffnet, braucht eine eigene Anmeldung davor. |
Was Ollama ist
Ollama lädt ein Sprachmodell herunter, hält es im Arbeitsspeicher und beantwortet Anfragen über eine Schnittstelle auf Port 11434. Es läuft unter Windows, macOS und Linux, auf Servern meist als Docker-Container. Die Modelle kommen aus einer Bibliothek, darunter Qwen von Alibaba, Llama von Meta, Gemma von Google und die Modelle von Mistral AI, jeweils in mehreren Größen und in vorkomprimierter Form, damit sie in normalen Arbeitsspeicher passen.
Praktisch ist die Brücke zur OpenAI-Welt. Ollama unterstützt laut eigener
Dokumentation „a subset of the OpenAI API“ unter http://localhost:11434/v1/.
Viele Werkzeuge, die für ChatGPT gebaut sind, sprechen damit ohne Umbau mit einem
lokalen Modell. Einen API-Schlüssel verlangt das Programm zwar formal, Ollama
ignoriert ihn aber. Das ist bequem und zugleich der Grund, warum der nächste
Abschnitt über das Netzwerk wichtig ist.
Wir setzen Ollama selbst ein. Unser Gedächtnis-Werkzeug
Cyberbrain prüft damit Widersprüche zwischen Notizen, mit
qwen2.5:7b-instruct über genau diese OpenAI-kompatible Schnittstelle, und ist
so eingestellt, dass es nur mit einem Ollama auf demselben Rechner oder im
eigenen Netz spricht.
Was wir gemessen haben
Der Server ist eine virtuelle Maschine mit 12 Kernen (AMD EPYC Milan, 2,0 GHz), 23 GB Arbeitsspeicher und ohne Grafikkarte. Darauf laufen nebenher noch andere Dienste, er ist also kein leerer Messplatz, sondern ein Arbeitsrechner. Ollama in Version 0.33.3, alle drei Modelle in der üblichen komprimierten Form (Q4_K_M). Die Aufgabe war für alle gleich: eine kurze, sachliche E-Mail an einen Kunden, dessen Liefertermin sich um drei Tage verschiebt, neuer Termin 30. September. Drei Durchläufe je Modell, höchstens 256 Token Antwort.
| Modell | Größe auf der Platte | Schreibtempo (Median) | Dauer für die E-Mail |
|---|---|---|---|
| Qwen2.5 1,5B | 1,0 GB | 80 Token/s | rund 1 Sekunde |
| Qwen2.5 3B | 1,9 GB | 37 Token/s | rund 5 Sekunden |
| Qwen2.5 7B | 4,7 GB | 20 Token/s | rund 10 Sekunden |
Ein Token ist grob eine Silbe oder ein kurzes Wort. Zwanzig Token pro Sekunde sind schneller, als die meisten Menschen lesen. Für eine Antwort im Chat ist das zumutbar, für die Zusammenfassung von hundert Dokumenten am Stück nicht.
Dazu kommt das Einlesen der Anfrage, und das fällt bei langen Texten stärker ins Gewicht als das Schreiben. Wir haben dem 7B-Modell einen unserer eigenen Blogartikel gegeben, knapp 1.900 Wörter oder 3.871 Token, und fünf Sätze Zusammenfassung verlangt. Allein das Einlesen dauerte 82 Sekunden, bis zur fertigen Zusammenfassung vergingen rund 100 Sekunden. Zwei Durchläufe lagen fast gleich. Wer Verträge oder Handbücher in Menge ohne Grafikkarte verarbeiten will, plant besser mit Minuten je Dokument als mit Sekunden.
Was dabei schiefging
Die Zahlen sind die halbe Wahrheit. Die andere Hälfte steht in den E-Mails selbst. Keins der drei Modelle hat die Aufgabe fehlerfrei gelöst, und zwar in keinem der drei Durchläufe. Wir haben mit Temperatur 0 gemessen, jedes Modell schrieb also jedes Mal dieselbe Antwort. Die Fehler sind kein Ausrutscher eines Laufs:
Das 1,5B- und das 7B-Modell schrieben als neuen Termin den „30. September 2023“. Die Jahreszahl stand nirgends in der Aufgabe, beide haben sie erfunden. In einer echten Kundenmail wäre das peinlich, in einem Liefervertrag teuer.
Das 3B-Modell schrieb, man informiere über einen „Terminverschiebungsinformationsbericht“. Das Wort gibt es nicht.
Das 7B-Modell begann mit „Sehr geehrter Herr/Madam“.
Das ist kein Grund, auf lokale Modelle zu verzichten, sondern einer, sie richtig einzusetzen. Sie taugen gut dafür, Texte zu sortieren, zusammenzufassen, Felder aus Formularen zu ziehen oder einen Entwurf vorzuschlagen, den ein Mensch liest. Sie taugen schlecht dafür, ohne Kontrolle Tatsachen zu behaupten. Wie man Halluzinationen eingrenzt, steht in unserem Beitrag LLM-Halluzinationen reduzieren.
Die Lizenz hängt am Modell, nicht an Ollama
Ollama steht unter der MIT-Lizenz und darf in jedem Betrieb laufen. Das sagt aber nichts über die Modelle, die Sie damit ausführen. Jedes bringt seine eigene Lizenz mit, und die Unterschiede sind größer, als man meint.
Ein Beispiel aus unserer Messung: Qwen2.5 in der 7B-Variante steht unter Apache 2.0 und ist gewerblich frei nutzbar. Qwen2.5 in der 3B-Variante steht unter einer eigenen Forschungslizenz. Dort heißt es wörtlich, die Rechte gelten „for non-commercial purposes only“, und wer das Modell gewerblich nutzt, muss bei Alibaba eine Lizenz anfragen. Beide Modelle liegen in Ollama nebeneinander, tragen denselben Familiennamen und laden sich mit demselben Befehl.
Prüfen Sie deshalb vor dem Einsatz die Modellkarte des Anbieters, nicht nur die Ollama-Bibliothek. Wer mehr über die Abwägung zwischen offenen und geschlossenen Modellen lesen will, findet sie in Open Source vs. Closed LLM.
Datenschutz: lokal heißt lokal, :cloud heißt Cloud
Der Hauptgrund für Ollama im Mittelstand ist der Datenschutz. Ollama schreibt dazu in seinen FAQ: „We don’t see your prompts or data when you run locally.“ Personalakten, Angebote, Kundenkorrespondenz können verarbeitet werden, ohne dass ein Modellanbieter sie zu sehen bekommt, weil keiner beteiligt ist. Läuft der Server bei einem Hoster, bleibt der Vertrag mit dem Hoster natürlich nötig.
Seit einiger Zeit bietet Ollama aber auch Cloud-Modelle an. Sie tragen den
Zusatz :cloud im Namen, müssen nicht heruntergeladen werden und laufen auf
Servern von Ollama. Dafür gilt laut Dokumentation: „Ollama processes cloud
prompts and responses to answer your requests.“ Dann verlassen die Daten Ihr
Haus, und die übliche Prüfung mit Auftragsverarbeitung und Drittlandtransfer
beginnt. Im Alltag heißt das: Legen Sie fest, welche Modelle erlaubt sind, und
schließen Sie die :cloud-Varianten aus, wenn der Einsatz lokal bleiben soll.
Wie Sie lokale und Cloud-Modelle grundsätzlich gegeneinander abwägen, steht in On-Premise vs. Cloud-LLM.
Die Einstellung, die wichtiger ist als die Modellwahl
In der Grundeinstellung lauscht Ollama nur auf 127.0.0.1, also nur auf dem
eigenen Rechner. Die FAQ sagen: „Ollama binds 127.0.0.1 port 11434 by default.“
Wer einen zentralen KI-Server für mehrere Arbeitsplätze einrichtet, öffnet das
mit der Einstellung OLLAMA_HOST, zum Beispiel auf 0.0.0.0.
Damit ist der Port für jeden erreichbar, der ihn im Netz findet, und die Schnittstelle fragt nach keinem Passwort. Wie oft das passiert, hat Cisco im September 2025 untersucht: Mit einer Suchmaschine für offene Dienste fanden die Forscher 1.139 öffentlich erreichbare Ollama-Server, über 1.000 davon in den ersten zehn Minuten. Rund 18,8 Prozent antworteten mit geladenen Modellen, 8,9 Prozent standen in Deutschland. Die übrigen hatten gerade kein Modell geladen, waren nach Cisco aber ebenso angreifbar, über fremd hochgeladene Modelle oder eine veränderte Konfiguration. Dazu kommt, dass Fremde auf Ihre Kosten rechnen.
Unser eigener Ollama-Server lauscht deshalb nur auf 127.0.0.1, die Programme,
die ihn nutzen, laufen auf derselben Maschine. Wenn Sie einen gemeinsamen Server
für das Büro brauchen, gehört davor eine Anmeldung, etwa ein Reverse Proxy mit
Passwort oder ein VPN, und der Port bleibt in der Firewall zu.
Wann Ollama passt und wann nicht
Ollama passt gut, wenn
- die Daten das Haus nicht verlassen dürfen, etwa Personal-, Gesundheits- oder Mandantendaten,
- die Aufgabe klar umrissen ist: sortieren, zusammenfassen, Felder auslesen, Entwürfe vorbereiten,
- ein paar Sekunden Wartezeit in Ordnung sind,
- jemand im Betrieb oder beim Dienstleister den Server pflegt.
Es passt schlecht, wenn
- die Antworten ohne Prüfung zu Kunden gehen sollen,
- lange Dokumente in großer Zahl schnell verarbeitet werden müssen und keine Grafikkarte da ist,
- niemand Zeit für Updates, Modellwahl und Absicherung hat.
Dazwischen liegt der häufigste Fall: ein Modell, das vorsortiert und vorbereitet, und ein Mensch, der entscheidet. Wie das mit eigenen Modellen im Betrieb aussieht, zeigen wir auf der Seite zu On-Premise-KI im Mittelstand.
Vier Fragen vor dem Start
- Welche Daten sollen verarbeitet werden, und dürfen sie das Haus verlassen?
Wenn nein: nur lokale Modelle,
:cloudausschließen. - Welches Modell, und steht in seiner Lizenz, dass Sie es gewerblich nutzen dürfen?
- Wer darf auf den Server zugreifen? Wenn mehr als ein Rechner: Anmeldung davor, Port in der Firewall zu.
- Wer prüft die Ergebnisse, bevor sie jemand außerhalb des Betriebs sieht?
Wenn Sie das für Ihren Betrieb nicht allein aufsetzen wollen, bauen wir lokale Modelle als Teil unserer eigenen LLM-Lösungen ein, mit Absicherung und Schulung für die Leute, die damit arbeiten.
Stand: 23. September 2026. Messung am selben Tag auf unserem Server, Ollama 0.33.3, Modelle qwen2.5:1.5b-instruct, qwen2.5:3b-instruct und qwen2.5:7b-instruct in Q4_K_M, je drei Durchläufe; Langtext mit 3.871 Token, zwei Durchläufe. Quellen: Ollama auf GitHub (MIT-Lizenz), Ollama-Dokumentation zu FAQ, Cloud und OpenAI-Kompatibilität; Modellkarten und Lizenzen von Qwen2.5-3B-Instruct und Qwen2.5-7B-Instruct auf Hugging Face; Cisco, „Detecting Exposed LLM Servers: A Shodan Case Study on Ollama“, 1. September 2025.
Häufige Fragen
- Was ist Ollama?
- Ollama ist ein kostenloses Open-Source-Programm unter MIT-Lizenz, das Sprachmodelle wie Qwen, Llama, Mistral oder Gemma auf dem eigenen Rechner oder Server ausführt. Es läuft unter Windows, macOS und Linux oder als Docker-Container und stellt die Modelle über eine Schnittstelle auf Port 11434 bereit. Ein Teil dieser Schnittstelle ist mit der OpenAI-API kompatibel, sodass viele Programme, die für ChatGPT gebaut sind, ohne Umbau mit einem lokalen Modell arbeiten.
- Ist Ollama DSGVO-konform?
- Bei lokalem Betrieb verlassen Prompts und Antworten den eigenen Rechner nicht. Ollama schreibt dazu selbst: „We don't see your prompts or data when you run locally.“ Das gilt nicht für die Cloud-Modelle von Ollama, erkennbar am Zusatz :cloud im Modellnamen. Dort verarbeitet Ollama Prompts und Antworten auf eigenen Servern. Ob Ihr gesamter Einsatz DSGVO-konform ist, hängt außerdem davon ab, welche Daten Sie verarbeiten und wie der Server abgesichert ist.
- Braucht Ollama eine Grafikkarte?
- Nein. Ollama läuft auch nur auf dem Prozessor, dann langsamer. Auf unserem Server mit 12 virtuellen Kernen und ohne Grafikkarte schrieb ein Modell mit 7 Milliarden Parametern rund 20 Token pro Sekunde, eine Kunden-E-Mail von 200 Token dauerte etwa zehn Sekunden. Kleinere Modelle waren zwei- bis viermal schneller, machten aber mehr Fehler.
- Darf ich Modelle aus Ollama gewerblich nutzen?
- Das hängt vom Modell ab, nicht von Ollama. Ollama selbst steht unter MIT-Lizenz, jedes Modell bringt seine eigene Lizenz mit. Qwen2.5 in 7 Milliarden Parametern steht unter Apache 2.0 und ist gewerblich nutzbar. Die Variante mit 3 Milliarden Parametern steht unter einer Forschungslizenz, die nur nichtkommerzielle Nutzung erlaubt; für den gewerblichen Einsatz verlangt Alibaba eine eigene Lizenz. Lesen Sie die Lizenz jedes Modells, bevor es in einen Arbeitsablauf geht.
- Ist Ollama sicher?
- In der Standardeinstellung lauscht Ollama nur auf 127.0.0.1, ist also von außen nicht erreichbar. Die Schnittstelle selbst fragt nach keinem Passwort. Wer sie mit OLLAMA_HOST für das Netzwerk öffnet, macht die Modelle für jeden nutzbar, der den Port erreicht. Cisco fand im September 2025 in wenigen Minuten 1.139 offen erreichbare Ollama-Server, 8,9 Prozent davon in Deutschland. Öffnen Sie den Port nur hinter einer Firewall oder einem Zugang mit Anmeldung.