speech-to-text17 min de lecture

La reconnaissance vocale est passée en open weight sans bruit — et tient dans 1,56 Go

Les modèles Qwen3-ASR d'Alibaba sont sous licence Apache 2.0, couvrent 52 langues et dialectes et pèsent moins de deux gigaoctets. Un guide en langage clair de la couche de transcription open weight : ce qui existe, ce qu'un modèle sur votre propre ordinateur vous apporte réellement, et là où les API fermées gardent l'avantage.

T
Telli.sh Team
#speech-to-text#open-weight#qwen3-asr#whisper#parakeet#transcription#self-hosting#ai-models

L'équipe Qwen d'Alibaba a déposé sur Hugging Face trois modèles de reconnaissance vocale dont presque personne n'a parlé. Qwen3-ASR-0.6B, Qwen3-ASR-1.7B et un compagnon nommé Qwen3-ForcedAligner-0.6B, tous sous licence Apache 2.0. Le plus petit pèse 1,56 Go au téléchargement, gère 52 langues et dialectes, et depuis le 26 juin il tourne en trois lignes de Python standard. Vous le posez sur une machine que vous possédez déjà, et personne ne peut vous envoyer de facture pour cela.

Le schéma est difficile à manquer, car nous l'avons déjà vu se dérouler une fois. Les grands modèles de langage ont passé 2023 et 2024 à être des choses qu'on louait via une API, puis la couche open weight est arrivée et est devenue le choix par défaut pour quiconque se souciait du coût, de la confidentialité ou du fonctionnement hors ligne. La transcription suit le même chemin, avec environ deux ans de retard.

Cet article est une carte de ce basculement pour les personnes qui ne suivent pas les sorties de modèles à plein temps : ce qu'est un modèle vocal open weight, lesquels existent aujourd'hui et sous quelle licence, ce que « 0.6B sur votre portable » donne concrètement, et — la partie que la plupart des articles sautent — là où les API fermées hébergées gardent une nette avance.

TL;DR:

  • La transcription open weight est utilisable dès maintenant : Qwen3-ASR sous Apache 2.0 avec 52 langues et dialectes, Whisper sous MIT, Parakeet et Canary de NVIDIA sous CC BY 4.0, Voxtral de Mistral sous Apache 2.0.
  • L'auto-hébergement apporte confidentialité, fonctionnement hors ligne et maîtrise des coûts. Sur le classement indépendant d'Artificial Analysis, héberger un modèle ouvert revient à 1,50 dollar pour 1 000 minutes, contre 6,00 pour MAI-Transcribe-1.5 de Microsoft et 18,15 pour Gemini 3.1 Pro Preview.
  • La première place en précision reste un point de terminaison fermé en préversion. Mais un modèle ouvert sous Apache 2.0, Voxtral Small, occupe désormais la cinquième place, à environ un point de taux d'erreur de mots derrière.

Forme d'onde et spectrogramme d'une phrase parlée, chaque mot aligné au-dessus du segment audio correspondant

Image : Aaron Parecki, Wikimedia Commons, CC BY 2.0. Forme d'onde et spectrogramme de la phrase « it rains a lot in Portland », les lettres étant placées au-dessus de l'audio auquel elles correspondent — c'est exactement la matière première que traite tout modèle de reconnaissance vocale.

Ce que vous téléchargez vraiment quand vous téléchargez un modèle de transcription

Un modèle ASR — reconnaissance automatique de la parole, synonyme de STT, de la parole vers le texte — est un programme qui prend de l'audio en entrée et produit du texte en sortie. C'est toute sa mission. Il ne décide pas qui a parlé, ne résume pas, ne sait pas de quoi parlait votre réunion. Il entend des mots et les écrit.

« Open weights » signifie que le laboratoire a publié le fichier du modèle fini lui-même. Les poids d'un modèle sont l'immense grille de nombres qu'il a apprise pendant l'entraînement, et les publier signifie que vous téléchargez ce fichier, l'exécutez sur votre propre matériel et construisez dessus sans demander la permission ni payer à la requête. L'alternative est un modèle fermé : les poids restent sur les serveurs du fournisseur et vous louez l'accès via une API — l'audio monte, le texte redescend, et la facturation se fait à la minute.

Le nombre dans le nom est le compte de paramètres, et pour les modèles vocaux il est inhabituellement concret. « 0.6B » veut dire environ 600 millions de paramètres, ce qui donne en pratique un fichier de 1,56 Go pour Qwen3-ASR-0.6B et de 4,08 Go pour Qwen3-ASR-1.7B — tous deux assez petits pour tenir sur le SSD d'un portable sans que personne ne le remarque. Comparez avec les modèles de langage ouverts évoqués dans notre tour d'horizon chinois, où la sortie vedette pesait 1,56 téraoctet réparti sur 96 fragments et exigeait un cluster rien que pour être chargée. Les modèles vocaux sont environ mille fois plus petits que les modèles de texte de pointe, et ce seul fait explique pourquoi ce basculement frappe plus fort ici que là-bas.

Voici le terme que nous emploierons dans la suite de cet article : le palier portable. C'est la catégorie de modèles où la question du matériel disparaît purement et simplement — où « est-ce que je peux faire tourner ça ? » cesse d'être une discussion budgétaire pour devenir un téléchargement. Les modèles de texte n'y sont pour la plupart pas. Les modèles vocaux y sont presque tous.

Une dernière ligne à lire avant tout classement : la licence. Apache 2.0 et MIT sont l'extrémité permissive — utiliser, modifier, intégrer à un produit commercial, sans rien devoir. CC BY 4.0, que NVIDIA emploie, est également utilisable commercialement mais exige l'attribution.

Qwen a publié la famille en janvier ; c'est en juin qu'elle est devenue simple

Venons-en à la sortie qui a motivé cet article, avec une correction sur la façon dont elle a été décrite. La famille Qwen3-ASR n'est pas apparue en juin. Les dépôts d'origine ont été mis en ligne le 28 janvier 2026, et le rapport technique a été déposé sur arXiv le lendemain. Ce qui s'est passé le 26 juin, c'est que Qwen a publié les versions -hf des trois modèles — des points de contrôle qui fonctionnent nativement dans Hugging Face Transformers à partir de la version 5.13.0.

Cela ressemble à une note de bas de page et n'en est pas une. Avant, faire tourner le modèle supposait d'installer le paquet maison qwen-asr ou un back-end vLLM et d'apprendre une chaîne d'outils. Après, ce sont trois lignes de Python standard que tout développeur ayant touché à Transformers connaît déjà. L'obstacle qui laisse la plupart des modèles ouverts inutilisés est rarement le modèle. Ce sont les quarante minutes de bricolage d'environnement avant la première transcription, et c'est précisément ce que le 26 juin a supprimé.

Les caractéristiques viennent directement des fiches de modèle. Les deux tailles assurent l'identification de la langue et la reconnaissance vocale pour 30 langues — anglais, chinois, coréen, japonais, espagnol, arabe, hindi, thaï, vietnamien, polonais et vingt autres — plus 22 dialectes chinois, d'où le chiffre de « 52 langues et dialectes ». Les deux gèrent l'inférence en streaming et hors ligne depuis un modèle unique, ce qui est plus rare qu'il n'y paraît : beaucoup de modèles de transcription font l'un ou l'autre. Les deux acceptent l'audio long, et la fiche mentionne le chant et les chansons avec musique de fond parmi les types audio pris en charge.

Le troisième modèle mérite qu'on s'y arrête. Qwen3-ForcedAligner-0.6B fait de l'alignement forcé : donnez-lui un audio et une transcription, il marque où chaque mot commence et s'arrête, à la milliseconde près, pour 11 langues et jusqu'à cinq minutes de parole à la fois. C'est la mécanique derrière les transcriptions cliquables, le calage des sous-titres et le saut vers l'instant où quelqu'un a dit quelque chose. C'est exactement ce que montre l'image en tête de cet article. Publier un aligneur en même temps que le moteur de reconnaissance est un signal sur le public visé : non pas les gens qui lancent une démo, mais ceux qui construisent des produits.

Sur la qualité, distinguez qui affirme quoi. La fiche de Qwen reprend des chiffres du Hugging Face Open ASR Leaderboard datés du 26 juin 2026 : un taux d'erreur de mots moyen de 5,59 % pour le modèle 1.7B et de 6,31 % pour le 0.6B, avec le sous-ensemble d'audio de réunion AMI à 9,26 % et 10,57 %. Le taux d'erreur de mots est la proportion de mots que le modèle se trompe, donc plus bas vaut mieux, et AMI est le chiffre le plus dur parce que les vraies réunions sont désordonnées. Qwen qualifie aussi la version 1.7B d'« état de l'art parmi les modèles ASR open source » et de concurrente des API commerciales — une affirmation du fournisseur tant que personne hors d'Alibaba n'a mesuré. Notez également qu'il s'agit d'un autre banc d'essai que le classement indépendant ci-dessous, sur un autre audio : les deux séries de chiffres ne se comparent pas entre elles.

C'est Whisper qui a lancé tout cela, et c'est encore lui que tout le monde exécute

Rien de tout cela n'existerait sous cette forme sans Whisper d'OpenAI. Le dépôt est devenu public le 16 septembre 2022 sous licence MIT — code et poids ensemble — à un moment où la reconnaissance vocale sérieuse signifiait un contrat avec un fournisseur cloud. Il a depuis rassemblé 106 679 étoiles sur GitHub.

Ce qui a rendu Whisper important tient moins au modèle qu'à ce que la communauté a bâti dessus en quelques mois. whisper.cpp l'a réimplémenté en C et C++ purs, sous licence MIT, 52 591 étoiles, et l'a fait tourner sur des portables et des téléphones sans Python ni GPU. faster-whisper l'a reconstruit sur CTranslate2 avec un net gain de vitesse et de mémoire, MIT également, 24 750 étoiles. Le modèle était la graine ; l'écosystème était l'arbre.

Quatre ans plus tard, c'est toujours le modèle vocal le plus utilisé au monde. Sur les 30 derniers jours, whisper-large-v3-turbo a été téléchargé 8,72 millions de fois depuis Hugging Face et whisper-large-v3 5,50 millions — chiffres relevés le 5 août 2026. Qwen3-ASR-0.6B, à 4,29 millions, grimpe vite pour un modèle de six mois, mais Whisper reste la valeur par défaut vers laquelle l'industrie tend la main sans réfléchir. Sa précision a toutefois vieilli : sur le classement d'Artificial Analysis, Whisper Large v3 affiche un AA-WER de 4,07 % contre 1,73 % pour le leader actuel. Et quantité de produits en production le font tourner malgré tout.

Chronologie des modèles ouverts de reconnaissance vocale, de Whisper en septembre 2022 à Qwen3-ASR en 2026

La couche vocale ouverte est arrivée en deux vagues séparées de trois ans, avec presque rien entre les deux. Dates de publication issues de GitHub et Hugging Face, relevées le 5 août 2026.

Le camp ouvert ne se limite pas à un laboratoire

Qwen n'est pas seul, et les autres sont bons dans des domaines nettement différents.

La gamme Parakeet de NVIDIA joue la vitesse. parakeet-tdt-0.6b-v3, sorti en août 2025 sous CC BY 4.0, est un modèle de 600 millions de paramètres couvrant 25 langues européennes, avec détection automatique de la langue, ponctuation, majuscules et horodatages au mot intégrés, et il avale jusqu'à 24 minutes d'audio en une seule passe. La famille Canary de NVIDIA — canary-1b-v2 et canary-qwen-2.5b, également CC BY 4.0 — couvre un terrain voisin avec d'autres paris architecturaux. Les modèles Voxtral de Mistral sont arrivés en juillet 2025 sous Apache 2.0, et comptent pour une raison sur laquelle nous revenons dans un instant.

Voici le camp ouvert côte à côte, avec une API hébergée en dernière ligne pour le contraste.

ModèleTéléchargementLicenceLanguesTourne surMeilleur pour
Whisper Large v33,09 GoMIT99Portable ou un GPULe choix par défaut que tout prend déjà en charge
Qwen3-ASR-0.6B1,56 GoApache 2.052 avec dialectesPortableLe multilingue dans la plus petite taille
Qwen3-ASR-1.7B4,08 GoApache 2.052 avec dialectesPortable ou un GPULa meilleure précision de la famille Qwen
Parakeet TDT 0.6B v32,51 GoCC BY 4.025 européennesPortable ou un GPULa vitesse et les horodatages au mot
Voxtral SmallApache 2.0GPU serveur, 24 Md de paramètresLe meilleur score ouvert du classement indépendant
API hébergéeNon téléchargeablePropriétaireVariableLe cloud du fournisseurDiarisation, streaming, disponibilité

La taille de téléchargement correspond au point de contrôle par défaut de chaque dépôt Hugging Face ; « — » signale une valeur que nous n'avons pas pu confirmer auprès d'une source primaire. Relevé le 5 août 2026.

Vient ensuite le travail d'empaquetage qui met ces modèles sur de vrais appareils, le point où le palier portable cesse d'être théorique. whisperkit-coreml — Whisper compilé pour le matériel Apple — a été téléchargé 8,31 millions de fois sur les 30 derniers jours. Une version MLX de Parakeet pour Apple Silicon en a totalisé 1,87 million, et deux conversions GGUF — ce format quantifié qui fait tourner les modèles sur des processeurs ordinaires — 2,04 et 1,87 million. Des millions de personnes par mois téléchargent de la reconnaissance vocale empaquetée spécifiquement pour tourner sur leur propre machine. Ce n'est pas une curiosité de laboratoire. C'est un canal de distribution.

La première place reste un point de terminaison en préversion que vous ne pouvez pas télécharger

C'est ici que commence le décompte honnête, et il coupe des deux côtés.

Nous avons relevé le classement speech-to-text d'Artificial Analysis le 5 août 2026 — un banc d'essai indépendant qui mesure modèles ouverts et fermés sur le même audio, contrairement au classement de Hugging Face, réservé aux modèles ouverts. Le haut de l'indice AA-WER :

RangModèleAA-WERTéléchargeable ?
1Fun-Realtime-ASR-preview1,73 %Non — point de terminaison en préversion
2Scribe v2, ElevenLabs2,18 %Non — API hébergée
3MAI-Transcribe-1.5, Microsoft2,38 %Non — API hébergée
4Smallest AI Pulse Pro2,43 %Non — API hébergée
5Voxtral Small, Mistral2,77 %Oui — Apache 2.0
6Gemini 3.1 Pro Preview, High2,82 %Non — API hébergée
11Whisper Large v34,07 %Oui — MIT

Source : classement speech-to-text d'Artificial Analysis, AA-WER v2, relevé le 5 août 2026. La possibilité de téléchargement est déduite de la licence publiée de chaque modèle.

Lisez d'abord les quatre premières lignes : elles corrigent tout récit selon lequel l'open aurait gagné. Les modèles vocaux les mieux notés au monde sont des choses qu'on loue, et le leader n'est même pas en disponibilité générale — c'est un point de terminaison en préversion.

Lisez ensuite la cinquième ligne, car elle corrige la correction. Voxtral Small est sous Apache 2.0. Vous pouvez le télécharger, l'exécuter sur votre matériel, le commercialiser — et il occupe la cinquième place d'un classement indépendant à 2,77 %, à environ un point de taux d'erreur de mots derrière un modèle fermé en préversion. Rapporté à une réunion d'une heure de 6 300 mots, cet écart représente environ 66 mots. Réel, mais loin du gouffre que la formulation habituelle laisse entendre.

Notre avis : le résumé exact n'est pas « l'ASR ouvert est très en retard ». Les modèles vocaux ouverts ont franchi depuis longtemps le seuil du suffisamment bon pour la plupart des usages, et l'avantage qui reste au camp fermé se résume à un point de taux d'erreur de mots plus le produit qui l'entoure. Ce qui nous amène à l'arbitrage qui tranche vraiment.

Ce que l'exécution en interne vous apporte, et ce qu'elle coûte

Trois choses poussent les équipes vers l'auto-hébergement, et aucune n'est la précision.

La confidentialité est la première et généralement la décisive. Si vous transcrivez des consultations médicales, des entretiens juridiques ou des entretiens RH, « l'audio ne quitte pas notre matériel » n'est pas une préférence mais une exigence d'achat, et seul un modèle que vous hébergez y répond proprement. Le fonctionnement hors ligne est la deuxième : un modèle embarqué marche en avion, dans un sous-sol, dans un atelier, sur un site sans réseau. C'est exactement pourquoi whisper.cpp et les builds GGUF affichent les chiffres de téléchargement qu'ils affichent.

Le coût est la troisième, et les chiffres sont brutaux. Toujours d'après le même relevé d'Artificial Analysis, prix pour 1 000 minutes d'audio : Whisper Large v3 hébergé sur fal.ai revient à 0,50 dollar, Canary Qwen 2.5B de NVIDIA sur Replicate à 0,74, Parakeet TDT 0.6B V3 sur Together AI à 1,50. Côté fermé, Nova-3 de Deepgram est à 4,30, MAI-Transcribe-1.5 à 6,00 et Gemini 3.1 Pro Preview à 18,15. Soit un facteur 4 face à Microsoft et un facteur 12 face à Google, rien que pour héberger un modèle ouvert sur les serveurs d'un tiers — avant même d'envisager de le faire tourner chez vous, où le coût marginal de la millième heure est de l'électricité.

La vitesse tranche dans le même sens, et c'est le détail qui nous a le plus surpris. Le modèle le plus rapide de tout le classement est Parakeet TDT 0.6B V3 servi sur Together AI, à 885 fois le temps réel — une heure d'audio revient en quatre secondes environ. Nova-3 de Deepgram atteint 512x, Whisper Large v3 sur Together 478x, MAI-Transcribe-1.5 189x. L'option de transcription la plus rapide disponible est un modèle open weight de 600 millions de paramètres que n'importe qui peut télécharger.

Comparaison en deux colonnes entre l'auto-hébergement de poids ouverts et une API de transcription hébergée

L'arbitrage n'a jamais été précision contre précision. C'est contrôle et coût contre les fonctions qui entourent la reconnaissance.

Que vendent alors les API hébergées ? Tout ce qui n'est pas de la reconnaissance. La documentation de Deepgram en dresse un inventaire honnête : diarisation des locuteurs, streaming en temps réel, mise en forme, vocabulaire personnalisé, masquage d'entités, détection de la langue, et la garantie que le service tourne pendant que vous dormez. Téléchargez Qwen3-ASR et vous obtenez des mots et des horodatages. Pas d'étiquettes de locuteur, pas de SLA, et à vous la facture GPU, la montée en charge et l'astreinte de trois heures du matin.

Le modèle le plus téléchargé de la catégorie n'est pas un modèle de transcription

Une statistique noue tout cela, et nous ne l'attendions pas.

Quand on trie toute la catégorie reconnaissance automatique de la parole de Hugging Face par téléchargements, le modèle en tête n'est ni Whisper, ni Qwen, ni Parakeet. C'est pyannote/speaker-diarization-3.1, avec 8,91 millions de téléchargements sur les 30 derniers jours, et un second modèle de diarisation pyannote prend la cinquième place avec 5,26 millions. La diarisation est la mécanique qui détermine qui a parlé et quand — la couche située juste au-dessus de la transcription.

Schéma de la pile de transcription, de l'audio à la note de réunion, indiquant les couches couvertes par des modèles ouverts

Les poids ouverts couvrent désormais les deux premières couches de la pile. Celles qui décident si une note est utile se trouvent au-dessus.

Le modèle le plus demandé de la catégorie reconnaissance vocale ne reconnaît pas la parole. Il répond à une question que les moteurs de reconnaissance laissent en suspens, exactement la conclusion à laquelle nous étions arrivés depuis le versant fermé du marché, quand le modèle le mieux noté au monde est sorti sans étiquettes de locuteur. Deux points de vue entièrement différents, le même constat : entendre les mots est la partie résolue.

En résumé

La question intéressante sur la reconnaissance vocale open weight n'a jamais été « est-elle aussi bonne que les modèles fermés ». Elle est à environ un point de taux d'erreur de mots, elle est plus rapide, elle coûte quatre à douze fois moins cher, et elle tient sur un portable. La question intéressante, c'est ce que vous bâtissez dans l'espace qui s'ouvre quand la transcription cesse d'être une ligne de dépense louée — car un fichier de 1,56 Go qui entend 52 langues n'est pas un produit. C'est un composant qui vient de devenir gratuit.

Pour une équipe qui choisit un outil de notes de réunion plutôt qu'un modèle, la lecture pratique est courte. Qu'un produit fasse tourner un modèle ouvert ou une API fermée relève désormais largement du détail d'implémentation, et ce sera de plus en plus les deux : poids ouverts pour le gros du travail, API hébergées là où diarisation, streaming et passage à l'échelle justifient leur prix. Telli.sh exécute déjà un modèle ouvert dans sa couche de synthèse, si bien que les progrès du camp ouvert se répercutent directement sur la transcription, la traduction et les notes de réunion, sans changement de tarif. Jugez l'outil sur ce qui sort à la fin : est-ce que la note vous dit qui s'est engagé à quoi.

Démarrer une note IA en direct

Sources


Retour au blog