Whisper im Unternehmen: Spracherkennung auf dem eigenen Server, gemessen ohne Grafikkarte
Whisper schreibt gesprochene Sprache mit, kostenlos und auf dem eigenen Server. Wir haben sechs Modellgrößen an 20 Minuten deutschem Audio mit bekanntem Text gemessen: wie viele Fehler sie machen, wie schnell sie ohne Grafikkarte sind, warum die großen Modelle mit Standardeinstellungen schlechter abschneiden als die mittleren, und weshalb Whisper in 30 Sekunden Stille „Untertitelung des ZDF“ hört.
Mit KI erzeugtes Bild. Mehr zur KI-TransparenzDie kurze Antwort zuerst. Whisper ist ein Spracherkennungsmodell von OpenAI, das Sie kostenlos auf dem eigenen Server betreiben können. Aufnahmen verlassen dann das Haus nicht. Es braucht keine Grafikkarte, ist auf Deutsch sehr genau und hat eine Schwäche, die man kennen muss: In Pausen und Stille erfindet es manchmal Text, und zwar umso eher, je größer das Modell ist.
Für diesen Beitrag haben wir sechs Modellgrößen auf unserem eigenen Server gemessen, einem gewöhnlichen Mietserver ohne Grafikkarte. Als Testmaterial dienten gut 20 Minuten deutscher Sprache, deren Text wir Wort für Wort kennen. Die Zahlen unten stammen von dort.
Die Übersicht
| Frage | Kurze Antwort |
|---|---|
| Was kostet Whisper? | Das offene Modell nichts. Code und Gewichte stehen auf GitHub unter MIT-Lizenz. |
| Wohin gehen die Aufnahmen? | Nirgendwohin, wenn es auf dem eigenen Server läuft. Über die OpenAI-API gehen sie an OpenAI. |
| Wie genau ist es? | Bei uns 2,0 % Wortfehler mit dem besten Modell und passenden Einstellungen. |
| Wie schnell ohne Grafikkarte? | Eine Stunde Audio in rund 15 Minuten mit large-v3-turbo. |
| Welches Modell? | large-v3-turbo, mit Stillefilter und ohne Kontext aus dem vorigen Abschnitt. |
| Worauf achten? | Auf erfundenen Text in Pausen, auf Eigennamen und bei kleinen Modellen auf Zahlen. |
Der Versuch
Wir haben dafür nichts neu aufgenommen, sondern vorhandenes Material genutzt: die Sprecherspuren unserer eigenen Erklärfilme. Sie entstehen mit einem Sprachgenerator aus einem festen Text, und genau das macht sie zum guten Prüfstein. Wir wissen für jede Datei, welcher Text gesprochen wurde. Jede der 147 Tondateien ließ sich über eine Prüfsumme eindeutig ihrem Text zuordnen.
Getestet haben wir zehn Folgen, zusammen 20,4 Minuten und rund 2.300 Wörter: drei längere Filme zu KI-Haftung, zum EU AI Act und zu Prompt Injection sowie sieben kurze KI-Nachrichten. In den Nachrichten stecken viele Zahlen, Firmennamen und Anglizismen, also genau das, woran Spracherkennung gern scheitert.
Gemessen wurde mit faster-whisper, einer Neuimplementierung von Whisper, die laut ihren Entwicklern bei gleicher Genauigkeit bis zu viermal schneller ist. Gezählt haben wir die Wortfehlerrate: der Anteil der Wörter, die falsch, zusätzlich oder gar nicht im Transkript stehen. Groß- und Kleinschreibung, Satzzeichen und die Schreibweise von Zahlen („86 %“ gegen „86 Prozent“) haben wir vorher angeglichen, sonst zählte jede Zahl als Fehler.
Eine Einschränkung vorweg: Unser Material ist sauber gesprochen, von einer einzigen Stimme, ohne Störgeräusche. Echte Aufnahmen aus dem Telefon, aus einer Besprechung oder mit Dialekt schneiden schlechter ab. Die Werte unten sind also eine Untergrenze, kein Praxiswert.
Das Ergebnis
| Modell | Parameter | Standardeinstellung | Mit Stillefilter, ohne Kontext |
|---|---|---|---|
| tiny | 39 Mio. | 12,1 % | 13,6 % |
| base | 74 Mio. | 6,8 % | 7,5 % |
| small | 244 Mio. | 3,9 % | 3,8 % |
| medium | 769 Mio. | 2,7 % | 3,2 % |
| large-v3-turbo | 809 Mio. | 5,9 % | 2,0 % |
| large-v3 | 1.550 Mio. | 7,0 % | 2,2 % |
Wortfehlerrate auf 20,4 Minuten deutschem Audio, weniger ist besser. Parameter laut Whisper-README.
Das Auffällige steht in der dritten Spalte: Mit den Standardeinstellungen schneiden die beiden großen Modelle schlechter ab als medium und small. Das lag nicht daran, dass sie schlechter hören. Ihre Verhörer waren am seltensten. Die Fehler kamen fast vollständig aus Wörtern, die im Audio gar nicht vorkommen, und aus Sätzen, die fehlten.
Zwei Beispiele aus unseren Transkripten. In unserem Film zum AI Act erklärt der Sprecher, dass fast jeder Ratgeber 35 Millionen Euro Bußgeld nennt, oder sieben Prozent vom Jahresumsatz. Im Transkript von large-v3 steht stattdessen „Was kostet ein Verstoß?“, im ganzen Transkript 16-mal, davon nur einmal zu Recht. Genau die Bußgeldzahl fehlt. In einer KI-Nachricht schrieb large-v3-turbo nach dem letzten echten Satz eine Reihe erfundener Prozentzahlen hin, und im selben Transkript fehlte ein ganzer echter Satz.
Die Autoren von Whisper beschreiben genau diese Fehlerarten in ihrem Fachartikel: Wiederholungsschleifen, fehlende erste oder letzte Wörter und Transkripte, die mit dem Audio nichts zu tun haben.
Der wirksamste Hebel ist eine einzige Einstellung
Whisper arbeitet sich in Abschnitten von 30 Sekunden durch eine Aufnahme und gibt
standardmäßig den Text des vorigen Abschnitts als Hinweis in den nächsten mit.
Hat sich das Modell einmal verrannt, schleppt es den Fehler so weiter. Schaltet
man das ab (condition_on_previous_text=False), fiel bei uns die Fehlerrate auf
den fünf problematischsten Folgen bei large-v3-turbo von 8,4 auf 2,1 Prozent und
bei large-v3 von 6,0 auf 1,9 Prozent. Die Dokumentation von faster-whisper
beschreibt diesen Zusammenhang selbst.
Der zweite Hebel ist ein Stillefilter (VAD, Voice Activity Detection), der Abschnitte ohne Sprache vorher herausschneidet. Beides zusammen ergab die Werte in der rechten Spalte.
Was nicht hilft: die Rückfallstufen abzuschalten, mit denen Whisper einen misslungenen Abschnitt neu versucht. Ohne sie blieb large-v3 in seinen Schleifen hängen, und die Fehlerrate stieg auf 25,5 Prozent.
Stille: Whisper hört das Fernsehprogramm
Wir haben den Modellen außerdem 30 Sekunden reine Stille und drei Sorten Rauschen vorgespielt. Ohne Stillefilter und mit fest eingestellter Sprache Deutsch erfanden large-v3-turbo und large-v3 in jeder dieser vier Dateien Text. Wörtlich:
- „Untertitelung des ZDF, 2020“ (large-v3-turbo und large-v3, auf Stille)
- „Untertitel im Auftrag des ZDF für funk, 2017“ (small, auf Stille)
- „Copyright WDR 2021“ (tiny, auf Stille)
- „Das war’s für heute. Bis zum nächsten Mal. Tschüss.“ (medium)
- „Vielen Dank.“ (die großen Modelle, auf Rauschen)
Das klingt nach Abspann und Untertitelzeilen aus Fernsehen und Videoplattformen. Das ist unsere Vermutung, die Quellen sagen dazu nichts. Schon 1,2 Sekunden Stille am Ende einer Datei reichten bei large-v3-turbo für eine Schleife aus „Drei Meldungen. Drei Meldungen. …“. Mit Stillefilter erfand keines der Modelle etwas in unseren Stille- und Rauschdateien.
Der Filter hat allerdings seinen Preis: In einem Test verschluckte er das echte Wort „KI-Agent“ am Anfang einer Aufnahme. Er schneidet also gelegentlich auch Sprache am Rand weg.
Dass das kein Randproblem ist, zeigt eine Studie von 2024 („Careless Whisper“, vorgestellt auf der ACM-Konferenz FAccT). Die Forschenden fanden in etwa einem Prozent der untersuchten Transkripte ganze erfundene Sätze, und 38 Prozent dieser Erfindungen enthielten ausdrücklich schädliche Inhalte, etwa falsche Zusammenhänge oder angemaßte Autorität. Besonders betroffen waren Menschen, die mit längeren Pausen sprechen. Untersucht wurde damals die OpenAI-API in ihrem Stand von 2023, nicht die Modelle, die wir gemessen haben.
Für die Praxis heißt das: Ein Whisper-Transkript ist ein Entwurf. Wo es auf den genauen Wortlaut ankommt, etwa bei einem Protokoll, das jemand unterschreibt, gehört ein Mensch dazwischen, der gegen die Aufnahme prüft.
Wie schnell ohne Grafikkarte
Die Geschwindigkeit haben wir gesondert gemessen, als auf dem Server nichts anderes lief, jeweils dreimal. Angegeben ist, wie lange eine Stunde Audio dauert:
| Modell | Eine Stunde Audio dauert | Arbeitsspeicher |
|---|---|---|
| tiny | 4,3 min | 0,3 GB |
| base | 6,2 min | 0,4 GB |
| small (4 Threads) | 5,9 min | 0,7 GB |
| medium | 29 min | 1,6 GB |
| large-v3-turbo | 15 min | 1,7 GB |
Server mit 12 virtuellen Kernen (AMD EPYC, 2,0 GHz), keine Grafikkarte, faster-whisper 1.2.1, 8-Bit-Quantisierung.
Zwei Dinge haben uns überrascht. Erstens ist large-v3-turbo doppelt so schnell wie medium, obwohl es mehr Parameter hat. Das passt zur Bauweise: Laut Modellkarte ist es large-v3 mit nur 4 statt 32 Decoder-Schichten. Zweitens waren mehr Threads nicht schneller. small brauchte mit 4 Threads weniger als halb so lange wie mit 12. Wer Whisper auf einem Server einrichtet, sollte das an der eigenen Hardware ausprobieren, statt einfach alle Kerne freizugeben. large-v3 haben wir nur einmal und mit der empfohlenen Einstellung gemessen, es lag bei grob 40 Minuten pro Stunde Audio. Das ist ein Richtwert, keine belastbare Messung.
Eigennamen und Zahlen
Unseren Firmennamen „Krynex“ schrieb ohne Hilfe kein Modell zuverlässig richtig,
die besten trafen ihn in 2 von 9 Fällen. Daraus wurde „Crinex“, „Creenix“ oder
„Cryonics“. Whisper kann aber einen kurzen Hinweistext bekommen
(initial_prompt="Krynex Labs"). Damit schrieben small und medium den Namen in 9
von 9 Fällen richtig, large-v3-turbo in 8 von 9. Nur bei large-v3 half der Hinweis
in unserem Test gar nicht. Wer Whisper im Betrieb einsetzt, sollte also die
eigenen Produkt-, Kunden- und Fachbegriffe als Hinweis mitgeben.
Bei Zahlen waren alle Modelle ab base zuverlässig, 56 bis 57 von 57 Zahlen stimmten. Das kleinste Modell tiny dagegen machte aus 86 Prozent 68 Prozent, aus 96 wurde 69 und aus 2026 mehrfach 2020. Das Tückische daran: Das Ergebnis sieht plausibel aus. Für alles mit Zahlen gehört tiny nicht in den Betrieb.
Eigener Server oder OpenAI-API?
OpenAI bietet Transkription auch als Dienst an. Die Preisseite nennt am 23. September 2026 für gpt-transcribe 0,0045 Dollar pro Minute Audio und für gpt-4o-mini-transcribe 0,003 Dollar. Eine Stunde kostet also zwischen 18 und 27 US-Cent. Das ist günstig, aber die Aufnahmen gehen dann an OpenAI.
Wichtig für alle, die schon damit arbeiten: OpenAI hat am 26. August 2026 angekündigt, whisper-1, gpt-4o-transcribe und gpt-4o-mini-transcribe am 26. Februar 2027 aus der API zu entfernen. Wer darauf baut, muss bis dahin umstellen. Das offene Modell auf dem eigenen Server betrifft das nicht, es läuft weiter, solange Sie es betreiben.
Eine Kleinigkeit zur Lizenz: Auf GitHub stehen Code und Gewichte unter der MIT-Lizenz. Die Modellkarte von large-v3 auf Hugging Face nennt in ihren Metadaten dagegen Apache 2.0. Beide erlauben gewerbliche Nutzung. Wer es genau braucht, sollte sich auf die Angabe im GitHub-Repository beziehen.
Unsere Einstellung
Nach der Messung würden wir so starten:
from faster_whisper import WhisperModel
model = WhisperModel("large-v3-turbo", device="cpu", compute_type="int8", cpu_threads=4)
segments, info = model.transcribe(
"aufnahme.wav",
language="de", # Sprache festlegen, sonst kommen in Pausen englische Floskeln
vad_filter=True, # Stille vorher herausschneiden
condition_on_previous_text=False, # Fehler nicht in den nächsten Abschnitt tragen
initial_prompt="Krynex Labs, AgentGuard", # eigene Namen und Fachbegriffe
)
Die Anzahl der Threads sollten Sie auf Ihrer Hardware ausprobieren. Auf unserem Server war 4 bei small deutlich schneller als 12, bei large-v3-turbo waren 12 Threads nur etwas schneller als 4.
Fünf Fragen, bevor Sie Whisper einsetzen
- Wessen Stimmen werden aufgenommen, und wissen die Betroffenen davon?
- Läuft die Transkription im Haus oder bei einem Dienst, und welche Vereinbarung gibt es dazu?
- Wer liest das Transkript gegen, bevor es als Protokoll gilt?
- Welche Eigennamen und Fachbegriffe muss das System kennen?
- Wie sehen Ihre echten Aufnahmen aus: Telefon, Besprechungsraum, mehrere Sprecher, Dialekt? Genau damit sollte der erste Test laufen.
Wie Sie Sprachmodelle generell auf eigener Hardware betreiben, zeigt unser Beitrag zu Ollama. Wenn Sie Spracherkennung mit Ihren eigenen Aufnahmen testen wollen, bevor Sie sich festlegen, tun wir das im KI-Audit.
Stand: 24. September 2026. Messung am 23.09.2026 auf unserem Server (12 vCPU AMD EPYC Milan, 23 GB RAM, keine Grafikkarte), faster-whisper 1.2.1, CTranslate2 4.8.2, 8-Bit-Quantisierung, Beam 5, Sprache fest Deutsch. Testmaterial: 20,4 Minuten synthetische Sprache (ElevenLabs, eine Stimme) mit bekanntem Text; Fehlerrate nach Angleichung von Schreibweise, Satzzeichen und Zahlen. Die Geschwindigkeit ist der Median aus drei Läufen ohne Nebenlast; bei den Fehlerraten lief teilweise ein anderer Prozess mit, was die Genauigkeit nicht beeinflusst. Quellen: openai/whisper, README und LICENSE (GitHub); Radford u. a., „Robust Speech Recognition via Large-Scale Weak Supervision“, arXiv:2212.04356, 2022; Modellkarten whisper-large-v3 und whisper-large-v3-turbo (Hugging Face); SYSTRAN/faster-whisper, README; Koenecke u. a., „Careless Whisper: Speech-to-Text Hallucination Harms“, FAccT 2024, DOI 10.1145/3630106.3658996; OpenAI, API-Preise und Abkündigungen (developers.openai.com), alle abgerufen am 23.09.2026.
Häufige Fragen
- Was ist Whisper?
- Whisper ist ein Spracherkennungsmodell von OpenAI, das gesprochene Sprache in Text umwandelt. Code und Modellgewichte hat OpenAI auf GitHub unter der MIT-Lizenz veröffentlicht, man kann Whisper also kostenlos auf dem eigenen Rechner oder Server betreiben. Trainiert wurde es laut dem zugehörigen Fachartikel mit 680.000 Stunden Audio, davon 117.000 Stunden in 96 weiteren Sprachen neben Englisch.
- Wie genau ist Whisper auf Deutsch?
- In unserem Test mit 20 Minuten deutschem Audio lag das beste Modell, large-v3-turbo, bei 2,0 Prozent Wortfehlerrate, wenn die Einstellungen stimmten. Mit den Standardeinstellungen waren es 5,9 Prozent, weil das Modell Text erfand. Unser Testmaterial war saubere, synthetische Sprache aus einem Sprachgenerator. Bei Telefonaten, Besprechungen oder Dialekt ist mit mehr Fehlern zu rechnen.
- Braucht Whisper eine Grafikkarte?
- Nein. Auf unserem Server mit 12 virtuellen Kernen und ohne Grafikkarte brauchte large-v3-turbo für eine Stunde Audio rund 15 Minuten, das kleinere Modell small mit vier Threads rund 6 Minuten. Für Aufnahmen, die nachträglich verschriftlicht werden, reicht das. Für Mitschrift in Echtzeit bei mehreren Gesprächen gleichzeitig ist eine Grafikkarte sinnvoll.
- Ist Whisper DSGVO-konform?
- Das hängt davon ab, wo es läuft. Betreiben Sie das offene Modell auf dem eigenen Server, verlässt die Aufnahme das Haus nicht. Nutzen Sie die Transkription über die OpenAI-API, gehen die Aufnahmen an OpenAI. Ob Ihr Einsatz insgesamt zulässig ist, hängt außerdem davon ab, wessen Stimmen Sie aufnehmen und ob die Betroffenen informiert sind oder eingewilligt haben.
- Erfindet Whisper Text?
- Ja, das kommt vor. Die Autoren des Whisper-Fachartikels beschreiben selbst Wiederholungsschleifen und komplett erfundene Transkripte. Eine Studie von 2024 fand in etwa einem Prozent der untersuchten Transkripte ganze erfundene Sätze. In unserem Test erfanden die großen Modelle in Stille und Rauschen in jeder Testdatei Text. Mit einem vorgeschalteten Stillefilter und einer bestimmten Einstellung verschwand das fast vollständig.