speech-to-text14 Min. Lesezeit

Spracherkennung ist still und leise Open Weight geworden — und passt in 1,56 GB

Alibabas Qwen3-ASR-Modelle stehen unter Apache 2.0, decken 52 Sprachen und Dialekte ab und sind kleiner als zwei Gigabyte. Ein verständlicher Überblick über die Open-Weight-Transkriptionsschicht: was es gibt, was ein Modell auf dem eigenen Laptop wirklich bringt und wo die geschlossenen APIs weiterhin gewinnen.

T
Telli.sh Team
#speech-to-text#open-weight#qwen3-asr#whisper#parakeet#transcription#self-hosting#ai-models

Auf Hugging Face liegen drei Spracherkennungsmodelle des Qwen-Teams von Alibaba, über die so gut wie niemand geschrieben hat. Qwen3-ASR-0.6B, Qwen3-ASR-1.7B und ein Begleitmodell namens Qwen3-ForcedAligner-0.6B, alle unter der Apache-2.0-Lizenz. Das kleinste ist ein Download von 1,56 GB, es beherrscht 52 Sprachen und Dialekte, und seit dem 26. Juni läuft es mit drei Zeilen Standard-Python. Sie legen es auf eine Maschine, die Sie ohnehin besitzen, und niemand kann Ihnen dafür eine Rechnung schicken.

Das Muster ist schwer zu übersehen, denn wir haben es schon einmal durchlaufen sehen. Große Sprachmodelle waren 2023 und 2024 etwas, das man über eine API mietete, dann kam die Open-Weight-Schicht und wurde zum Standard für alle, denen Kosten, Datenschutz oder Offline-Betrieb wichtig waren. Die Transkription geht denselben Weg, rund zwei Jahre später.

Dieser Artikel ist eine Landkarte dieser Verschiebung für Menschen, die Modellveröffentlichungen nicht beruflich verfolgen: was ein Open-Weight-Sprachmodell ist, welche es gerade gibt und unter welcher Lizenz, was "0.6B auf dem Laptop" praktisch bedeutet — und der Teil, den die meiste Berichterstattung überspringt: wo die geschlossenen, gehosteten APIs weiterhin klar vorn liegen.

TL;DR:

  • Open-Weight-Transkription ist heute einsatzfähig: Qwen3-ASR unter Apache 2.0 mit 52 Sprachen und Dialekten, Whisper unter MIT, NVIDIAs Parakeet und Canary unter CC BY 4.0, Mistrals Voxtral unter Apache 2.0.
  • Selbst hosten bringt Datenschutz, Offline-Betrieb und Kostenkontrolle. Auf dem unabhängigen Board von Artificial Analysis kostet das Hosten eines offenen Modells 1,50 US-Dollar pro 1.000 Minuten, Microsofts MAI-Transcribe-1.5 dagegen 6,00 und Gemini 3.1 Pro Preview 18,15 US-Dollar.
  • Platz eins bei der Genauigkeit hält weiterhin ein geschlossener Preview-Endpunkt. Aber ein offenes Apache-2.0-Modell, Voxtral Small, steht inzwischen auf Platz fünf, rund einen Prozentpunkt Wortfehlerrate dahinter.

Wellenform und Spektrogramm eines gesprochenen Satzes, jedes Wort über dem zugehörigen Audioabschnitt

Bild: Aaron Parecki, Wikimedia Commons, CC BY 2.0. Wellenform und Spektrogramm des Satzes "it rains a lot in Portland", die Buchstaben stehen über dem Audio, zu dem sie gehören — genau dieses Rohmaterial verarbeitet jedes Spracherkennungsmodell.

Was Sie eigentlich herunterladen, wenn Sie ein Transkriptionsmodell herunterladen

Ein ASR-Modell — automatische Spracherkennung, gleichbedeutend mit STT, Speech-to-Text — ist ein Programm, das Audio hineinnimmt und Text herausgibt. Das ist die ganze Aufgabe. Es entscheidet nicht, wer gesprochen hat, es fasst nicht zusammen, es weiß nicht, worum es in Ihrer Besprechung ging. Es hört Wörter und schreibt sie auf.

"Open Weights" heißt, dass das Labor die fertige Modelldatei selbst veröffentlicht hat. Die Gewichte eines Modells sind das riesige Zahlenraster, das es beim Training gelernt hat; sie zu veröffentlichen bedeutet, dass Sie diese Datei herunterladen, auf eigener Hardware betreiben und darauf aufbauen können, ohne jemanden um Erlaubnis zu fragen oder pro Anfrage zu zahlen. Die Alternative ist ein geschlossenes Modell: Die Gewichte bleiben auf den Servern des Anbieters, und Sie mieten den Zugang über eine API — Audio geht hoch, Text kommt zurück, abgerechnet wird nach Minuten.

Die Zahl im Namen ist die Parameterzahl, und bei Sprachmodellen ist sie ungewöhnlich handfest. "0.6B" bedeutet rund 600 Millionen Parameter, was in der Praxis heißt: Qwen3-ASR-0.6B ist eine Datei von 1,56 GB, Qwen3-ASR-1.7B eine von 4,08 GB. Beide klein genug, um unbemerkt auf einer Laptop-SSD zu liegen. Vergleichen Sie das mit den offenen Sprachmodellen aus unserem China-Überblick: Dort war die Schlagzeile 1,56 Terabyte in 96 Shards, und schon zum Laden brauchte es einen Cluster. Sprachmodelle sind rund tausendmal kleiner als Text-Spitzenmodelle, und genau deshalb schlägt diese Verschiebung hier härter durch als dort.

Hier der Begriff, den wir im Rest des Artikels verwenden: die Laptop-Klasse. Gemeint ist die Kategorie von Modellen, bei der sich die Hardwarefrage schlicht auflöst — bei der "Kann ich das betreiben?" keine Budgetdiskussion mehr ist, sondern ein Download. Textmodelle gehören meist nicht dazu. Sprachmodelle fast ausnahmslos.

Eine Zeile sollten Sie noch vor jedem Benchmark lesen: die Lizenz. Apache 2.0 und MIT sind das freizügige Ende — nutzen, verändern, in ein kommerzielles Produkt einbauen, ohne etwas zu schulden. CC BY 4.0, das NVIDIA verwendet, erlaubt ebenfalls kommerzielle Nutzung, verlangt aber Namensnennung.

Qwen hat die Familie im Januar veröffentlicht, im Juni wurde sie einfach

Nun zu der Veröffentlichung, die diesen Artikel ausgelöst hat — mit einer Korrektur an der gängigen Darstellung. Die Qwen3-ASR-Familie ist nicht im Juni erschienen. Die ursprünglichen Repositories gingen am 28. Januar 2026 online, der technische Bericht landete tags darauf auf arXiv. Was am 26. Juni geschah: Qwen veröffentlichte -hf-Versionen aller drei Modelle — Checkpoints, die ab Version 5.13.0 nativ in Hugging Face Transformers laufen.

Das klingt nach einer Fußnote und ist keine. Vorher hieß das Modell zu betreiben: Qwens eigenes Paket qwen-asr oder ein vLLM-Backend installieren und eine Toolchain lernen. Nachher sind es drei Zeilen Standard-Python, die jede Entwicklerin und jeder Entwickler mit Transformers-Erfahrung ohnehin kennt. Die Hürde, an der die meisten offenen Modelle ungenutzt bleiben, ist selten das Modell. Es sind die vierzig Minuten Umgebungsgefummel vor dem ersten Transkript — und genau die hat der 26. Juni gestrichen.

Die technischen Angaben stammen direkt aus den Modellkarten. Beide Größen leisten Sprachidentifikation und Spracherkennung für 30 Sprachen — darunter Englisch, Chinesisch, Koreanisch, Japanisch, Spanisch, Arabisch, Hindi, Thai, Vietnamesisch, Polnisch und zwanzig weitere — plus 22 chinesische Dialekte, woraus sich die Zahl "52 Sprachen und Dialekte" ergibt. Beide beherrschen Streaming und Offline-Inferenz aus einem einzigen Modell heraus, was seltener ist, als es klingt: Viele Transkriptionsmodelle können nur eines von beidem. Beide nehmen lange Audios an, und die Modellkarte führt Gesang sowie Lieder mit Hintergrundmusik als unterstützte Audiotypen auf.

Beim dritten Modell lohnt sich ein Halt. Qwen3-ForcedAligner-0.6B macht Forced Alignment: Gibt man ihm Audio und ein Transkript, markiert es auf die Millisekunde genau, wo jedes Wort beginnt und endet — in 11 Sprachen und für jeweils bis zu fünf Minuten Sprache. Das ist die Mechanik hinter anklickbaren Transkripten, Untertitel-Timing und dem Sprung zu dem Moment, in dem jemand etwas gesagt hat. Genau das zeigt das Bild oben in diesem Artikel. Einen Aligner zusammen mit dem Erkenner zu veröffentlichen, ist ein Signal, für wen diese Veröffentlichung gedacht ist: nicht für Leute, die eine Demo starten, sondern für Leute, die Produkte bauen.

Bei der Qualität sollte man trennen, wer was behauptet. Qwens eigene Karte nennt Werte vom Hugging Face Open ASR Leaderboard mit Stand 26. Juni 2026: eine mittlere Wortfehlerrate von 5,59 % für das 1.7B-Modell und 6,31 % für das 0.6B, im Meeting-Audio-Teil AMI 9,26 % beziehungsweise 10,57 %. Die Wortfehlerrate ist der Anteil falsch erkannter Wörter, niedriger ist also besser, und AMI ist der härteste Wert davon, weil echte Besprechungen unordentlich sind. Qwen nennt die 1.7B-Version außerdem "State of the Art unter den Open-Source-ASR-Modellen" und konkurrenzfähig zu kommerziellen APIs — eine Herstelleraussage, bis jemand außerhalb von Alibaba nachmisst. Und beachten Sie: Das ist ein anderer Benchmark als das unabhängige Board weiter unten, mit anderem Audio. Die beiden Zahlenreihen lassen sich nicht gegeneinander vergleichen.

Whisper hat das angestoßen — und läuft noch immer überall

In dieser Form gäbe es all das ohne OpenAIs Whisper nicht. Das Repository ging am 16. September 2022 unter der MIT-Lizenz online, Code und Gewichte zusammen, zu einer Zeit, in der ernsthafte Spracherkennung einen Vertrag mit einem Cloud-Anbieter bedeutete. Seither hat es 106.679 GitHub-Sterne gesammelt.

Wichtig wurde Whisper weniger durch das Modell als durch das, was die Community binnen Monaten darauf baute. whisper.cpp hat es in schlichtem C und C++ neu implementiert, MIT-lizenziert, 52.591 Sterne, und ließ es ohne Python und ohne GPU auf Laptops und Telefonen laufen. faster-whisper setzte es auf CTranslate2 neu auf, mit deutlichem Gewinn bei Tempo und Speicher, ebenfalls MIT, 24.750 Sterne. Das Modell war der Samen, das Ökosystem der Baum.

Vier Jahre später ist es noch immer das meistgenutzte Sprachmodell der Welt. In den vergangenen 30 Tagen wurde whisper-large-v3-turbo 8,72 Millionen Mal von Hugging Face heruntergeladen und whisper-large-v3 5,50 Millionen Mal — Zahlen, die wir am 5. August 2026 abgerufen haben. Qwen3-ASR-0.6B liegt bei 4,29 Millionen und steigt für ein halbes Jahr altes Modell schnell, doch der Standard, zu dem die Branche ohne Nachdenken greift, bleibt Whisper. Die Genauigkeit ist allerdings gealtert: Auf dem Board von Artificial Analysis erreicht Whisper Large v3 eine AA-WER von 4,07 % gegenüber 1,73 % für den aktuellen Spitzenreiter. Sehr viele ausgelieferte Produkte betreiben es trotzdem.

Zeitleiste offener Spracherkennungsmodelle von Whisper im September 2022 bis Qwen3-ASR 2026

Die offene Sprachschicht kam in zwei Schüben im Abstand von drei Jahren, dazwischen fast nichts. Veröffentlichungsdaten von GitHub und Hugging Face, abgerufen am 5. August 2026.

Die offene Seite ist mehr als ein Labor

Qwen ist nicht allein, und die anderen sind in deutlich unterschiedlichen Dingen gut.

NVIDIAs Parakeet-Reihe setzt auf Tempo. parakeet-tdt-0.6b-v3, im August 2025 unter CC BY 4.0 erschienen, ist ein Modell mit 600 Millionen Parametern für 25 europäische Sprachen, mit automatischer Spracherkennung, Interpunktion, Groß- und Kleinschreibung sowie Zeitstempeln auf Wortebene ab Werk, und es verarbeitet bis zu 24 Minuten Audio in einem Durchgang. NVIDIAs Canary-Familie — canary-1b-v2 und canary-qwen-2.5b, ebenfalls CC BY 4.0 — deckt ähnliches Terrain mit anderen architektonischen Wetten ab. Mistrals Voxtral-Modelle kamen im Juli 2025 unter Apache 2.0 und sind aus einem Grund wichtig, zu dem wir gleich kommen.

Die offene Seite nebeneinander, mit einer gehosteten API in der letzten Zeile als Kontrast.

ModellDownloadLizenzSprachenLäuft aufAm stärksten bei
Whisper Large v33,09 GBMIT99Laptop oder eine GPUDer Standard, den bereits alles unterstützt
Qwen3-ASR-0.6B1,56 GBApache 2.052 mit DialektenLaptopMehrsprachigkeit bei kleinster Größe
Qwen3-ASR-1.7B4,08 GBApache 2.052 mit DialektenLaptop oder eine GPUBeste Genauigkeit der Qwen-Familie
Parakeet TDT 0.6B v32,51 GBCC BY 4.025 europäischeLaptop oder eine GPUTempo und Zeitstempel je Wort
Voxtral SmallApache 2.0Server-GPU, 24 Mrd. ParameterBester offener Wert auf dem unabhängigen Board
Gehostete APINicht herunterladbarProprietärUnterschiedlichCloud des AnbietersDiarisierung, Streaming, Verfügbarkeit

Die Downloadgröße ist der Standard-Checkpoint im jeweiligen Hugging-Face-Repository; „—" steht für einen Wert, den wir nicht aus einer Primärquelle bestätigen konnten. Abgerufen am 5. August 2026.

Dann gibt es die Verpackungsarbeit, die diese Modelle auf echte Geräte bringt — der Punkt, an dem die Laptop-Klasse aufhört, theoretisch zu sein. whisperkit-coreml, also Whisper kompiliert für Apple-Hardware, wurde in den letzten 30 Tagen 8,31 Millionen Mal heruntergeladen. Ein MLX-Build von Parakeet für Apple Silicon kam auf 1,87 Millionen, und zwei GGUF-Konvertierungen — jenes quantisierte Format, mit dem Modelle auf gewöhnlichen CPUs laufen — auf zusammen 2,04 und 1,87 Millionen. Millionen Menschen pro Monat laden Spracherkennung herunter, die eigens dafür verpackt wurde, auf ihrer eigenen Maschine zu laufen. Das ist keine Forschungskuriosität. Das ist ein Vertriebskanal.

Platz eins ist weiterhin ein Preview-Endpunkt, den Sie nicht herunterladen können

Hier beginnt die ehrliche Abrechnung, und sie schneidet in beide Richtungen.

Wir haben das Speech-to-Text-Board von Artificial Analysis am 5. August 2026 abgerufen — ein unabhängiger Benchmark, der offene und geschlossene Modelle auf demselben Audio misst, anders als das Leaderboard von Hugging Face, das eine Angelegenheit offener Modelle ist. Die Spitze des AA-WER-Index:

RangModellAA-WERHerunterladbar?
1Fun-Realtime-ASR-preview1,73 %Nein — Preview-Endpunkt
2Scribe v2, ElevenLabs2,18 %Nein — gehostete API
3MAI-Transcribe-1.5, Microsoft2,38 %Nein — gehostete API
4Smallest AI Pulse Pro2,43 %Nein — gehostete API
5Voxtral Small, Mistral2,77 %Ja — Apache 2.0
6Gemini 3.1 Pro Preview, High2,82 %Nein — gehostete API
11Whisper Large v34,07 %Ja — MIT

Quelle: Speech-to-Text-Leaderboard von Artificial Analysis, AA-WER v2, abgerufen am 5. August 2026. Die Verfügbarkeit zum Download ergibt sich aus der veröffentlichten Lizenz des jeweiligen Modells.

Lesen Sie zuerst die oberen vier Zeilen, denn sie korrigieren jede Erzählung, nach der Open gewonnen hätte. Die bestbewerteten Sprachmodelle der Welt sind Mietsachen, und der Spitzenreiter ist nicht einmal allgemein verfügbar — es ist ein Preview-Endpunkt.

Lesen Sie dann Zeile fünf, denn sie korrigiert die Korrektur. Voxtral Small steht unter Apache 2.0. Sie können es herunterladen, auf eigener Hardware betreiben und kommerziell ausliefern — und es steht mit 2,77 % auf Platz fünf eines unabhängigen Boards, rund einen Prozentpunkt Wortfehlerrate hinter einem geschlossenen Preview-Modell. Auf eine einstündige Besprechung mit 6.300 Wörtern gerechnet, sind das etwa 66 Wörter. Real, aber längst nicht der Abgrund, den die übliche Darstellung nahelegt.

Unsere Einschätzung: Die zutreffende Zusammenfassung lautet nicht "Open STT hinkt weit hinterher". Offene Sprachmodelle haben die Schwelle zum Gutgenug für die meisten Aufgaben längst überschritten, und der verbleibende Vorsprung der geschlossenen Seite besteht aus einem Prozentpunkt Wortfehlerrate plus dem Produkt drumherum. Damit sind wir bei der Abwägung, die tatsächlich entscheidet.

Was Selbstbetrieb bringt und was er kostet

Drei Dinge treiben Teams zum Selbsthosten, und keines davon ist Genauigkeit.

Datenschutz ist das erste und meist ausschlaggebende. Wer ärztliche Gespräche, juristische Interviews oder Personalgespräche transkribiert, für den ist "das Audio verlässt unsere Hardware nicht" keine Vorliebe, sondern eine Beschaffungsvorgabe — und nur ein selbst betriebenes Modell erfüllt sie sauber. Offline-Betrieb ist das zweite: Ein Modell auf dem Gerät funktioniert im Flugzeug, im Keller, in der Werkshalle, an einem Einsatzort ohne Empfang. Genau deshalb haben whisper.cpp und die GGUF-Builds die Downloadzahlen, die sie haben.

Kosten sind das dritte, und hier sind die Zahlen deutlich. Aus derselben Momentaufnahme von Artificial Analysis, Preis je 1.000 Minuten Audio: Whisper Large v3 auf fal.ai kostet 0,50 US-Dollar, NVIDIAs Canary Qwen 2.5B auf Replicate 0,74, Parakeet TDT 0.6B V3 auf Together AI 1,50. Auf der geschlossenen Seite: Deepgrams Nova-3 4,30, MAI-Transcribe-1.5 6,00 und Gemini 3.1 Pro Preview 18,15 US-Dollar. Das ist der Faktor 4 gegenüber Microsoft und der Faktor 12 gegenüber Google — allein dafür, ein offenes Modell auf fremden Servern zu betreiben, bevor man den Eigenbetrieb überhaupt betrachtet, bei dem die Grenzkosten der tausendsten Stunde aus Strom bestehen.

Beim Tempo verläuft der Schnitt genauso, und das war das Detail, das uns am meisten überrascht hat. Das schnellste Modell auf dem gesamten Board ist Parakeet TDT 0.6B V3 auf Together AI mit dem 885-Fachen der Echtzeit — eine Stunde Audio kommt in etwa vier Sekunden zurück. Deepgrams Nova-3 schafft das 512-Fache, Whisper Large v3 auf Together das 478-Fache, MAI-Transcribe-1.5 das 189-Fache. Die schnellste verfügbare Transkriptionsoption ist ein Open-Weight-Modell mit 600 Millionen Parametern, das jede und jeder herunterladen kann.

Zweispaltiger Vergleich von selbst betriebenen offenen Gewichten und einer gehosteten Transkriptions-API

Die Abwägung war nie Genauigkeit gegen Genauigkeit. Sie lautet Kontrolle und Kosten gegen die Funktionen rund um die Erkennung.

Was verkaufen die gehosteten APIs dann noch? Alles, was nicht Erkennung ist. Deepgrams Dokumentation ist eine faire Bestandsaufnahme: Sprecherdiarisierung, Echtzeit-Streaming, Formatierung, eigenes Vokabular, Schwärzung von Entitäten, Spracherkennung — und die betriebliche Zusage, dass der Dienst läuft, während Sie schlafen. Laden Sie Qwen3-ASR herunter, bekommen Sie Wörter und Zeitstempel. Keine Sprecherlabels, kein SLA, und Ihnen gehören die GPU-Rechnung, die Skalierung und der Anruf um drei Uhr nachts.

Das meistgeladene Modell der Kategorie ist gar kein Transkriptionsmodell

Eine Statistik bindet das alles zusammen, und wir hatten sie nicht erwartet.

Sortiert man Hugging Faces gesamte Kategorie für automatische Spracherkennung nach Downloads, steht ganz oben weder Whisper noch Qwen noch Parakeet. Es ist pyannote/speaker-diarization-3.1 mit 8,91 Millionen Downloads in den letzten 30 Tagen, und ein zweites pyannote-Diarisierungsmodell belegt mit 5,26 Millionen Platz fünf. Diarisierung ist die Mechanik, die herausfindet, wer wann gesprochen hat — die Schicht direkt über der Transkription.

Diagramm des Transkriptionsstapels vom Audio bis zur Besprechungsnotiz mit Markierung der Schichten, für die es offene Modelle gibt

Offene Gewichte decken inzwischen die ersten beiden Schichten ab. Die Schichten, die über die Brauchbarkeit einer Notiz entscheiden, liegen darüber.

Das gefragteste Modell der Spracherkennungskategorie erkennt keine Sprache. Es beantwortet eine Frage, die die Erkenner offenlassen — dasselbe Ergebnis, zu dem wir von der geschlossenen Seite des Marktes aus gekommen sind, als das bestbewertete Modell der Welt ohne Sprecherlabels ausgeliefert wurde. Zwei völlig verschiedene Blickwinkel, derselbe Befund: Das Hören der Wörter ist der gelöste Teil.

Das Fazit

Die interessante Frage zu Open-Weight-Spracherkennung war nie, ob sie so gut ist wie die geschlossenen Modelle. Sie liegt rund einen Prozentpunkt Wortfehlerrate dahinter, sie ist schneller, sie ist vier- bis zwölfmal günstiger, und sie passt auf einen Laptop. Die interessante Frage ist, was Sie in den Raum bauen, der sich auftut, wenn Transkription aufhört, ein gemieteter Kostenpunkt zu sein — denn eine 1,56-GB-Datei, die 52 Sprachen hört, ist kein Produkt. Sie ist ein Bauteil, das gerade kostenlos geworden ist.

Für ein Team, das ein Meeting-Notiz-Werkzeug statt eines Modells auswählt, fällt die praktische Lesart kurz aus. Ob ein Produkt ein offenes Modell oder eine geschlossene API betreibt, ist inzwischen weitgehend ein Implementierungsdetail, und zunehmend wird es beides sein: offene Gewichte für die Masse der Arbeit, gehostete APIs dort, wo Diarisierung, Streaming und Skalierung ihren Preis rechtfertigen. Telli.sh betreibt in seiner Zusammenfassungsschicht bereits ein offenes Modell, sodass Fortschritte auf der offenen Seite ohne Preisänderung direkt in Transkription, Übersetzung und Besprechungsnotizen einfließen. Beurteilen Sie das Werkzeug an dem, was am Ende herauskommt: ob die Notiz Ihnen sagt, wer was zugesagt hat.

Live-KI-Notiz starten

Quellen


Zurück zum Blog