speech-to-text14 min czytania

Rozpoznawanie mowy po cichu stało się otwarte — i waży 1,56 GB

Modele Qwen3-ASR od Alibaby są na licencji Apache 2.0, obsługują 52 języki i dialekty i zajmują mniej niż dwa gigabajty. Przystępny przewodnik po warstwie otwartych modeli transkrypcji: co już istnieje, co realnie daje uruchomienie modelu na własnym laptopie i gdzie zamknięte API wciąż wygrywają.

T
Telli.sh Team
#speech-to-text#open-weight#qwen3-asr#whisper#parakeet#transcription#self-hosting#ai-models

Zespół Qwen z Alibaby trzyma na Hugging Face trzy modele rozpoznawania mowy, o których prawie nikt nie napisał. Qwen3-ASR-0.6B, Qwen3-ASR-1.7B oraz towarzyszący im Qwen3-ForcedAligner-0.6B, wszystkie na licencji Apache 2.0. Najmniejszy to pobranie 1,56 GB, radzi sobie z 52 językami i dialektami, a od 26 czerwca uruchamia się w trzech linijkach zwykłego Pythona. Kładziesz go na maszynie, którą już masz, i nikt nie może wystawić ci za to faktury.

Wzorzec trudno przeoczyć, bo już raz widzieliśmy, jak się rozwija. Duże modele językowe przez 2023 i 2024 rok były czymś, co wynajmowało się przez API, a potem pojawiła się warstwa otwartych wag i stała się domyślnym wyborem dla każdego, kto zwracał uwagę na koszt, prywatność albo pracę bez sieci. Transkrypcja robi to samo, z około dwuletnim opóźnieniem.

Ten tekst to mapa tej zmiany dla osób, które nie śledzą premier modeli zawodowo: czym jest otwarty model mowy, jakie istnieją teraz i na jakiej licencji, co w praktyce daje „0.6B na laptopie" i — ta część, którą większość relacji pomija — gdzie zamknięte, hostowane API wciąż mają wyraźną przewagę.

TL;DR:

  • Otwarta transkrypcja jest dziś użyteczna: Qwen3-ASR na Apache 2.0 z 52 językami i dialektami, Whisper na MIT, Parakeet i Canary od NVIDII na CC BY 4.0, Voxtral od Mistrala na Apache 2.0.
  • Własny hosting daje prywatność, pracę bez sieci i kontrolę kosztów. W niezależnym rankingu Artificial Analysis hostowanie otwartego modelu kosztuje 1,50 dolara za 1000 minut, wobec 6,00 za MAI-Transcribe-1.5 od Microsoftu i 18,15 za Gemini 3.1 Pro Preview.
  • Pierwsze miejsce w dokładności nadal zajmuje zamknięty punkt końcowy w wersji zapoznawczej. Ale otwarty model na Apache 2.0, Voxtral Small, jest już piąty — mniej więcej jeden punkt procentowy współczynnika błędu słów za nim.

Przebieg fali i spektrogram wypowiedzianego zdania, każde słowo wyrównane nad odpowiadającym mu fragmentem dźwięku

Zdjęcie: Aaron Parecki, Wikimedia Commons, CC BY 2.0. Przebieg fali i spektrogram zdania „it rains a lot in Portland", z literami ustawionymi nad dźwiękiem, któremu odpowiadają — dokładnie z takim surowcem pracuje każdy model rozpoznawania mowy.

Co właściwie pobierasz, pobierając model transkrypcji

Model ASR — automatyczne rozpoznawanie mowy, używane wymiennie ze STT, mowa na tekst — to program, który przyjmuje dźwięk i zwraca tekst. To całe jego zadanie. Nie ustala, kto mówił, nie streszcza, nie wie, o czym było twoje spotkanie. Słyszy słowa i je zapisuje.

„Otwarte wagi" znaczą, że laboratorium opublikowało sam plik gotowego modelu. Wagi modelu to ogromna siatka liczb wyuczona podczas treningu, a ich publikacja oznacza, że pobierasz ten plik, uruchamiasz na własnym sprzęcie i budujesz na nim, nie pytając nikogo o zgodę i nie płacąc za zapytanie. Alternatywą jest model zamknięty: wagi zostają na serwerach dostawcy, a ty wynajmujesz dostęp przez API — dźwięk idzie w górę, tekst wraca, rozliczenie jest za minuty.

Liczba w nazwie to liczba parametrów i w modelach mowy jest nietypowo konkretna. „0.6B" znaczy około 600 milionów parametrów, co w praktyce czyni Qwen3-ASR-0.6B plikiem o rozmiarze 1,56 GB, a Qwen3-ASR-1.7B — 4,08 GB. Oba dość małe, by leżeć na dysku laptopa niezauważone. Porównaj to z otwartymi modelami językowymi z naszego przeglądu chińskiej fali, gdzie sztandarowa premiera ważyła 1,56 terabajta w 96 fragmentach i wymagała klastra już do samego wczytania. Modele mowy są około tysiąc razy mniejsze od czołowych modeli tekstowych, i właśnie ten jeden fakt sprawia, że tutaj zmiana uderza mocniej niż tam.

Oto termin, którym będziemy się posługiwać w dalszej części tekstu: klasa laptopowa. To kategoria modeli, w której pytanie o sprzęt po prostu znika — w której „czy dam to radę uruchomić?" przestaje być rozmową o budżecie i staje się pobraniem pliku. Modeli tekstowych w większości tu nie ma. Modele mowy są tu niemal wszystkie.

Jeszcze jedna linijka do przeczytania przed jakimkolwiek benchmarkiem: licencja. Apache 2.0 i MIT to koniec liberalny — używaj, zmieniaj, wsadź do produktu komercyjnego, nic nie jesteś winien. CC BY 4.0, którą stosuje NVIDIA, też pozwala na użycie komercyjne, ale wymaga podania autorstwa.

Qwen wydał rodzinę w styczniu; w czerwcu stała się łatwa

Teraz premiera, która sprowokowała ten tekst — z jednym sprostowaniem do tego, jak ją opisywano. Rodzina Qwen3-ASR nie pojawiła się w czerwcu. Pierwotne repozytoria weszły 28 stycznia 2026 roku, a raport techniczny trafił na arXiv dzień później. To, co stało się 26 czerwca, to publikacja wersji -hf wszystkich trzech modeli — punktów kontrolnych działających natywnie w Hugging Face Transformers od wersji 5.13.0.

Brzmi jak przypis, a nim nie jest. Wcześniej uruchomienie modelu wymagało instalacji własnego pakietu qwen-asr albo backendu vLLM i opanowania ich narzędzi. Później to trzy linijki standardowego Pythona, które każdy, kto dotknął Transformers, i tak już zna. Bariera, na której większość otwartych modeli zostaje nieużyta, rzadko jest samym modelem. To czterdzieści minut walki ze środowiskiem przed pierwszą transkrypcją — i to właśnie skasował 26 czerwca.

Specyfikacja wprost z kart modeli. Oba rozmiary wykonują identyfikację języka i rozpoznawanie mowy dla 30 języków — angielskiego, chińskiego, koreańskiego, japońskiego, hiszpańskiego, arabskiego, hindi, tajskiego, wietnamskiego, polskiego i dwudziestu innych — plus 22 dialekty chińskie, i tak wychodzi liczba „52 języki i dialekty". Oba prowadzą wnioskowanie strumieniowe i offline z jednego modelu, co jest rzadsze, niż brzmi: wiele modeli transkrypcji robi jedno albo drugie. Oba przyjmują długie nagrania, a karta wymienia śpiew i utwory z muzyką w tle wśród obsługiwanych typów dźwięku.

Przy trzecim modelu warto się zatrzymać. Qwen3-ForcedAligner-0.6B wykonuje wymuszone dopasowanie: podajesz mu dźwięk i transkrypcję, a on zaznacza, gdzie każde słowo się zaczyna i kończy, z dokładnością do milisekundy, dla 11 języków i do pięciu minut mowy naraz. To mechanizm stojący za klikalnymi transkrypcjami, dopasowaniem napisów i przeskokiem do chwili, w której ktoś coś powiedział. Dokładnie to pokazuje zdjęcie na początku tekstu. Publikacja aligner-a razem z modelem rozpoznającym to sygnał, do kogo ta premiera jest skierowana: nie do ludzi odpalających demo, ale do tych, którzy budują produkty.

Co do jakości, warto rozdzielić, kto co twierdzi. Własna karta Qwena podaje wyniki z Hugging Face Open ASR Leaderboard datowane na 26 czerwca 2026: średni współczynnik błędu słów 5,59 % dla modelu 1.7B i 6,31 % dla 0.6B, a na podzbiorze nagrań ze spotkań AMI odpowiednio 9,26 % i 10,57 %. Współczynnik błędu słów to udział słów, w których model się myli, więc mniej znaczy lepiej, a AMI jest tu najtrudniejszą liczbą, bo prawdziwe spotkania są bałaganiarskie. Qwen nazywa też wersję 1.7B „stanem sztuki wśród modeli ASR o otwartym kodzie" i konkurencyjną wobec komercyjnych API — traktuj to jako twierdzenie dostawcy, dopóki ktoś poza Alibabą nie zmierzy. I uwaga: to inny benchmark niż niezależny ranking poniżej, na innym materiale dźwiękowym, więc obu zestawów liczb nie da się porównywać między sobą.

To Whisper zaczął, i wciąż jego wszyscy uruchamiają

Nic z tego nie istniałoby w tym kształcie bez Whispera od OpenAI. Repozytorium otwarto 16 września 2022 roku na licencji MIT — kod i wagi razem — w momencie, gdy poważne rozpoznawanie mowy oznaczało umowę z dostawcą chmury. Od tego czasu zebrało 106 679 gwiazdek na GitHubie.

Whispera uczyniło ważnym nie tyle sam model, ile to, co społeczność zbudowała na nim w ciągu miesięcy. whisper.cpp przepisał go w czystym C i C++, licencja MIT, 52 591 gwiazdek, i sprawił, że działa na laptopach i telefonach bez Pythona i bez GPU. faster-whisper przebudował go na CTranslate2 z dużym zyskiem na szybkości i pamięci, także MIT, 24 750 gwiazdek. Model był nasieniem; drzewem był ekosystem.

Cztery lata później to nadal najczęściej używany model mowy na świecie. W ostatnich 30 dniach whisper-large-v3-turbo pobrano z Hugging Face 8,72 miliona razy, a whisper-large-v3 5,50 miliona — dane pobraliśmy 5 sierpnia 2026 roku. Qwen3-ASR-0.6B z 4,29 miliona rośnie szybko dla półrocznego modelu, ale domyślnym wyborem, po który branża sięga bez zastanowienia, pozostaje Whisper. Jego dokładność się jednak postarzała: w rankingu Artificial Analysis Whisper Large v3 notuje AA-WER 4,07 % wobec 1,73 % obecnego lidera. A mimo to bardzo wiele wydanych produktów go uruchamia.

Oś czasu otwartych modeli rozpoznawania mowy, od Whispera we wrześniu 2022 do Qwen3-ASR w 2026

Otwarta warstwa mowy przyszła dwiema falami oddzielonymi o trzy lata, a pomiędzy nimi prawie nic. Daty wydania z GitHuba i Hugging Face, pobrane 5 sierpnia 2026.

Otwarta strona to więcej niż jedno laboratorium

Qwen nie jest sam, a pozostali są dobrzy w wyraźnie różnych rzeczach.

Linia Parakeet od NVIDII to zakład o szybkość. parakeet-tdt-0.6b-v3, wydany w sierpniu 2025 na CC BY 4.0, to model o 600 milionach parametrów obsługujący 25 języków europejskich, z automatycznym wykrywaniem języka, interpunkcją, wielkimi literami i znacznikami czasu na poziomie słów w standardzie; w jednym przejściu przyjmuje nagrania do 24 minut. Rodzina Canary od NVIDII — canary-1b-v2 i canary-qwen-2.5b, również CC BY 4.0 — pokrywa podobny obszar innymi zakładami architektonicznymi. Modele Voxtral od Mistrala pojawiły się w lipcu 2025 na Apache 2.0 i są ważne z powodu, do którego zaraz dojdziemy.

Oto otwarta strona zestawiona obok siebie, z hostowanym API w ostatnim wierszu dla kontrastu.

ModelPobranieLicencjaJęzykiDziała naNajlepszy w
Whisper Large v33,09 GBMIT99Laptop lub jedno GPUBycie domyślnym wyborem, który wszystko już obsługuje
Qwen3-ASR-0.6B1,56 GBApache 2.052 z dialektamiLaptopWielojęzyczność w najmniejszym rozmiarze
Qwen3-ASR-1.7B4,08 GBApache 2.052 z dialektamiLaptop lub jedno GPUNajlepsza dokładność w rodzinie Qwen
Parakeet TDT 0.6B v32,51 GBCC BY 4.025 europejskichLaptop lub jedno GPUSzybkość i znaczniki czasu na poziomie słów
Voxtral SmallApache 2.0GPU serwerowe, 24 mld parametrówNajlepszy otwarty wynik w niezależnym rankingu
Hostowane APINie do pobraniaZamkniętaRóżnieChmura dostawcyRozdzielanie mówców, strumieniowanie, dostępność

Rozmiar pobrania to domyślny checkpoint w danym repozytorium Hugging Face; „—" oznacza wartość, której nie udało nam się potwierdzić w źródle pierwotnym. Pobrane 5 sierpnia 2026.

Dalej jest praca nad opakowaniem, która wprowadza te modele na prawdziwe urządzenia — punkt, w którym klasa laptopowa przestaje być teorią. whisperkit-coreml, czyli Whisper skompilowany na sprzęt Apple, pobrano w ostatnich 30 dniach 8,31 miliona razy. Build MLX Parakeeta na Apple Silicon zebrał 1,87 miliona, a dwie konwersje GGUF — kwantyzowany format uruchamiający modele na zwykłych procesorach — 2,04 i 1,87 miliona. Miliony ludzi miesięcznie pobierają rozpoznawanie mowy zapakowane specjalnie po to, by działało na ich własnej maszynie. To nie badawcza ciekawostka. To kanał dystrybucji.

Pierwsze miejsce to nadal punkt końcowy w wersji zapoznawczej, którego nie pobierzesz

Tu zaczyna się uczciwe rozliczenie i cięcie idzie w obie strony.

Ranking mowa-na-tekst Artificial Analysis pobraliśmy 5 sierpnia 2026 roku — to niezależny benchmark mierzący modele otwarte i zamknięte na tym samym materiale, w odróżnieniu od rankingu Hugging Face, który jest sprawą wewnętrzną otwartych modeli. Czoło indeksu AA-WER:

MiejsceModelAA-WERDo pobrania?
1Fun-Realtime-ASR-preview1,73 %Nie — punkt końcowy zapoznawczy
2Scribe v2, ElevenLabs2,18 %Nie — hostowane API
3MAI-Transcribe-1.5, Microsoft2,38 %Nie — hostowane API
4Smallest AI Pulse Pro2,43 %Nie — hostowane API
5Voxtral Small, Mistral2,77 %Tak — Apache 2.0
6Gemini 3.1 Pro Preview, High2,82 %Nie — hostowane API
11Whisper Large v34,07 %Tak — MIT

Źródło: ranking mowa-na-tekst Artificial Analysis, AA-WER v2, pobrany 5 sierpnia 2026 roku. Dostępność do pobrania ocenialiśmy na podstawie opublikowanej licencji każdego modelu.

Przeczytaj najpierw cztery górne wiersze, bo one korygują każdą opowieść o tym, że otwarte wygrało. Najlepiej ocenione modele mowy na świecie to rzeczy, które się wynajmuje, a lider nie jest nawet ogólnie dostępny — to punkt końcowy w wersji zapoznawczej.

Teraz przeczytaj piąty wiersz, bo koryguje samą korektę. Voxtral Small jest na Apache 2.0. Możesz go pobrać, uruchomić na własnym sprzęcie i wydać komercyjnie — a stoi piąty w niezależnym rankingu z wynikiem 2,77 %, mniej więcej jeden punkt procentowy współczynnika błędu słów za zamkniętym modelem zapoznawczym. Przeliczone na godzinne spotkanie liczące 6300 słów daje to około 66 słów różnicy. Realnie istnieje, ale to nie przepaść, którą zwykle się sugeruje.

Nasza ocena: trafne podsumowanie nie brzmi „otwarty STT jest daleko z tyłu". Otwarte modele mowy dawno przekroczyły próg wystarczającej jakości dla większości pracy, a przewaga, która została stronie zamkniętej, to jeden punkt procentowy błędu plus produkt owinięty wokół. Co prowadzi nas do kompromisu, który naprawdę rozstrzyga.

Co daje uruchomienie u siebie i ile to kosztuje

Trzy rzeczy pchają zespoły w stronę własnego hostingu i żadna z nich nie jest dokładnością.

Prywatność jest pierwsza i zwykle rozstrzygająca. Jeśli transkrybujesz konsultacje medyczne, wywiady prawne albo rozmowy kadrowe, „dźwięk nie opuszcza naszego sprzętu" nie jest preferencją, lecz wymogiem zakupowym, a model hostowany przez ciebie to jedyna architektura, która spełnia go czysto. Praca bez sieci jest druga: model na urządzeniu działa w samolocie, w piwnicy, na hali produkcyjnej, w terenie bez zasięgu. Dokładnie dlatego whisper.cpp i buildy GGUF mają takie liczby pobrań, jakie mają.

Koszt jest trzeci, i tu liczby są bezlitosne. Z tego samego zrzutu Artificial Analysis, cena za 1000 minut nagrania: Whisper Large v3 hostowany na fal.ai wychodzi 0,50 dolara, Canary Qwen 2.5B od NVIDII na Replicate 0,74, Parakeet TDT 0.6B V3 na Together AI 1,50. Po stronie zamkniętej Nova-3 od Deepgrama kosztuje 4,30, MAI-Transcribe-1.5 6,00, a Gemini 3.1 Pro Preview 18,15. To czterokrotna różnica wobec Microsoftu i dwunastokrotna wobec Google'a — i to tylko za hostowanie otwartego modelu na cudzych serwerach, przed rozważeniem uruchomienia go na własnych, gdzie koszt krańcowy tysięcznej godziny to prąd.

Szybkość dzieli w tym samym kierunku, i to był szczegół, który zaskoczył nas najbardziej. Najszybszy model w całym rankingu to Parakeet TDT 0.6B V3 serwowany na Together AI, 885 razy szybciej niż czas rzeczywisty — godzina nagrania wraca w około cztery sekundy. Nova-3 od Deepgrama osiąga 512x, Whisper Large v3 na Together 478x, MAI-Transcribe-1.5 189x. Najszybsza dostępna opcja transkrypcji to otwarty model o 600 milionach parametrów, który każdy może pobrać.

Dwukolumnowe porównanie samodzielnie hostowanych otwartych wag z hostowanym API do transkrypcji

Ten wybór nigdy nie był dokładnością przeciwko dokładności. To kontrola i koszt przeciwko funkcjom owiniętym wokół rozpoznawania.

Co wtedy sprzedają hostowane API? Wszystko, co nie jest rozpoznawaniem. Dokumentacja Deepgrama to uczciwy spis: rozdzielanie mówców, strumieniowanie w czasie rzeczywistym, formatowanie, własny słownik, maskowanie danych, wykrywanie języka i operacyjna gwarancja, że usługa stoi, kiedy ty śpisz. Pobierz Qwen3-ASR i dostaniesz słowa oraz znaczniki czasu. Bez etykiet mówców, bez SLA, a rachunek za GPU, skalowanie i telefon o trzeciej w nocy są twoje.

Najczęściej pobierany model w kategorii wcale nie transkrybuje

Jedna statystyka wiąże to wszystko i nie spodziewaliśmy się jej.

Kiedy posortujesz całą kategorię automatycznego rozpoznawania mowy na Hugging Face po pobraniach, na górze nie ma ani Whispera, ani Qwena, ani Parakeeta. Jest pyannote/speaker-diarization-3.1 z 8,91 miliona pobrań w ostatnich 30 dniach, a drugi model rozdzielania mówców od pyannote zajmuje piąte miejsce z 5,26 miliona. Rozdzielanie mówców to mechanizm ustalający, kto mówił i kiedy — warstwa bezpośrednio nad transkrypcją.

Schemat warstw transkrypcji od dźwięku do notatki ze spotkania, z zaznaczeniem warstw pokrytych przez otwarte modele

Otwarte wagi pokrywają już dwie pierwsze warstwy stosu. Te, które decydują o przydatności notatki, leżą wyżej.

Najbardziej pożądany model w kategorii rozpoznawania mowy sam mowy nie rozpoznaje. Odpowiada na pytanie, które modele rozpoznające zostawiają bez odpowiedzi — ten sam wniosek, do którego doszliśmy od zamkniętej strony rynku, kiedy najwyżej oceniany model na świecie wyszedł bez etykiet mówców. Dwa całkowicie różne punkty obserwacyjne, to samo odkrycie: usłyszenie słów to część już rozwiązana.

Wniosek

Ciekawe pytanie o otwarte rozpoznawanie mowy nigdy nie brzmiało „czy jest tak dobre jak modele zamknięte". Jest w granicach jednego punktu procentowego błędu, jest szybsze, jest od czterech do dwunastu razy tańsze i mieści się na laptopie. Ciekawe pytanie brzmi: co zbudujesz w przestrzeni, która się otwiera, kiedy transkrypcja przestaje być wynajmowaną pozycją w kosztach — bo plik 1,56 GB słyszący 52 języki nie jest produktem. To część, która właśnie stała się darmowa.

Dla zespołu, który wybiera narzędzie do notatek ze spotkań, a nie model, praktyczny wniosek jest krótki. Czy produkt uruchamia otwarty model, czy zamknięte API, to dziś w dużej mierze szczegół implementacyjny, i coraz częściej będzie to jedno i drugie: otwarte wagi do pracy masowej, hostowane API tam, gdzie rozdzielanie mówców, strumieniowanie i skala zarabiają na swoją cenę. Telli.sh już używa otwartego modelu w warstwie streszczeń, więc postępy po otwartej stronie płyną prosto do transkrypcji, tłumaczeń i notatek ze spotkań bez zmiany ceny. Oceniaj narzędzie po tym, co wychodzi na końcu: czy notatka mówi, kto się do czego zobowiązał.

Rozpocznij notatkę AI na żywo

Źródła


Wróć do bloga