O reconhecimento de fala virou open weight em silêncio — e cabe em 1,56 GB
Os modelos Qwen3-ASR da Alibaba são Apache 2.0, cobrem 52 idiomas e dialetos e ocupam menos de dois gigabytes. Um guia em linguagem simples da camada de transcrição open weight: o que existe, o que rodar um modelo no seu próprio notebook realmente entrega e onde as APIs fechadas continuam vencendo.
A equipe Qwen, da Alibaba, tem três modelos de reconhecimento de fala hospedados no Hugging Face sobre os quais quase ninguém escreveu. Qwen3-ASR-0.6B, Qwen3-ASR-1.7B e um companheiro chamado Qwen3-ForcedAligner-0.6B, todos sob licença Apache 2.0. O menor é um download de 1,56 GB, dá conta de 52 idiomas e dialetos e, desde 26 de junho, roda em três linhas de Python padrão. Você o coloca numa máquina que já tem, e ninguém pode lhe mandar uma fatura por isso.
O padrão é difícil de não notar, porque já assistimos a ele uma vez. Os grandes modelos de linguagem passaram 2023 e 2024 como coisas que se alugavam por API, aí chegou a camada open weight e virou o padrão para quem se importava com custo, privacidade ou poder trabalhar offline. A transcrição está fazendo o mesmo, cerca de dois anos depois.
Este texto é um mapa dessa virada para quem não acompanha lançamentos de modelos como ofício: o que é um modelo de fala open weight, quais existem agora e sob qual licença, o que «0.6B no seu notebook» entrega na prática e — a parte que quase toda a cobertura pula — onde as APIs fechadas hospedadas seguem confortavelmente à frente.
TL;DR:
- Transcrição open weight já é utilizável hoje: Qwen3-ASR sob Apache 2.0 com 52 idiomas e dialetos, Whisper sob MIT, Parakeet e Canary da NVIDIA sob CC BY 4.0, Voxtral da Mistral sob Apache 2.0.
- Hospedar por conta própria traz privacidade, operação offline e controle de custo. No ranking independente da Artificial Analysis, hospedar um modelo aberto sai por 1,50 dólar a cada 1.000 minutos, contra 6,00 do MAI-Transcribe-1.5 da Microsoft e 18,15 do Gemini 3.1 Pro Preview.
- O primeiro lugar em precisão ainda é um endpoint fechado em prévia. Mas um modelo aberto sob Apache 2.0, o Voxtral Small, já ocupa o quinto lugar, a cerca de um ponto de taxa de erro de palavra.

Imagem: Aaron Parecki, Wikimedia Commons, CC BY 2.0. Forma de onda e espectrograma da frase «it rains a lot in Portland», com as letras posicionadas sobre o áudio a que correspondem — é exatamente essa a matéria-prima com que todo modelo de reconhecimento de fala trabalha.
O que você baixa de fato quando baixa um transcritor
Um modelo ASR — reconhecimento automático de fala, usado como sinônimo de STT, fala para texto — é um programa que recebe áudio e devolve texto. O trabalho é esse. Ele não decide quem falou, não resume, não sabe do que tratava a sua reunião. Ele ouve palavras e as escreve.
«Open weights» significa que o laboratório publicou o próprio arquivo do modelo pronto. Os pesos de um modelo são a enorme grade de números que ele aprendeu durante o treinamento, e publicá-los significa que você baixa esse arquivo, roda no seu próprio hardware e constrói em cima sem pedir permissão nem pagar por requisição. A alternativa é um modelo fechado: os pesos ficam nos servidores do fornecedor e você aluga o acesso por uma API — o áudio sobe, o texto volta, e a cobrança é por minuto.
O número no nome é a contagem de parâmetros e, em modelos de fala, ele é incomumente concreto. «0.6B» quer dizer cerca de 600 milhões de parâmetros, o que na prática faz do Qwen3-ASR-0.6B um arquivo de 1,56 GB e do Qwen3-ASR-1.7B um de 4,08 GB: ambos pequenos o bastante para viver no SSD de um notebook sem que ninguém perceba. Compare com os modelos de linguagem abertos que cobrimos no nosso apanhado sobre a China, em que o lançamento principal tinha 1,56 terabyte em 96 fragmentos e exigia um cluster só para carregar. Modelos de fala são cerca de mil vezes menores que os modelos de texto de fronteira, e esse único fato explica por que essa virada bate mais forte aqui do que lá.
Eis o termo que usaremos no resto do texto: a faixa notebook. É a classe de modelos em que a pergunta sobre hardware simplesmente desaparece — em que «eu consigo rodar isso?» deixa de ser uma conversa de orçamento e vira um download. Modelos de texto em geral não estão nela. Modelos de fala estão quase todos.
Mais uma linha para ler antes de qualquer benchmark: a licença. Apache 2.0 e MIT são a ponta permissiva — use, modifique, embarque num produto comercial, sem dever nada. CC BY 4.0, que a NVIDIA adota, também permite uso comercial, mas exige atribuição.
A Qwen lançou a família em janeiro; em junho é que ficou fácil
Agora o lançamento que motivou este texto, com uma correção ao modo como ele vem sendo descrito. A família Qwen3-ASR não apareceu em junho. Os repositórios originais foram publicados em 28 de janeiro de 2026, e o relatório técnico chegou ao arXiv no dia seguinte. O que aconteceu em 26 de junho foi a Qwen publicar as versões -hf dos três modelos: checkpoints que rodam nativamente no Hugging Face Transformers a partir da versão 5.13.0.
Parece uma nota de rodapé e não é. Antes, rodar o modelo significava instalar o pacote próprio qwen-asr ou um backend vLLM e aprender uma cadeia de ferramentas. Depois, são três linhas de Python padrão que qualquer pessoa que já mexeu com Transformers conhece. A barreira que deixa a maioria dos modelos abertos sem uso raramente é o modelo: são os quarenta minutos de briga com o ambiente antes da primeira transcrição, e foi exatamente isso que 26 de junho apagou.
As especificações vêm direto dos cartões de modelo. Os dois tamanhos fazem identificação de idioma e reconhecimento de fala em 30 idiomas — inglês, chinês, coreano, japonês, espanhol, árabe, híndi, tailandês, vietnamita, polonês e outros vinte — mais 22 dialetos chineses, e é assim que se chega ao número de «52 idiomas e dialetos». Os dois fazem inferência em streaming e offline a partir de um único modelo, algo mais raro do que parece: muitos modelos de transcrição fazem uma coisa ou outra. Os dois aceitam áudio longo, e o cartão lista canto e músicas com trilha de fundo entre os tipos de áudio suportados.
O terceiro modelo merece uma parada. O Qwen3-ForcedAligner-0.6B faz alinhamento forçado: você dá o áudio e uma transcrição e ele marca onde cada palavra começa e termina, na casa do milissegundo, em 11 idiomas e em até cinco minutos de fala por vez. É a engrenagem por trás de transcrições clicáveis, do ajuste de legendas e do salto para o instante em que alguém disse alguma coisa. É exatamente o que mostra a imagem no topo deste texto. Publicar um alinhador junto com o reconhecedor é um sinal sobre para quem o lançamento é: não para quem roda uma demo, mas para quem constrói produtos.
Sobre qualidade, vale separar quem afirma o quê. O próprio cartão da Qwen traz números do Hugging Face Open ASR Leaderboard datados de 26 de junho de 2026: taxa média de erro de palavra de 5,59 % para o modelo de 1.7B e 6,31 % para o de 0.6B, com o subconjunto de áudio de reunião AMI em 9,26 % e 10,57 %. A taxa de erro de palavra é a fração de palavras que o modelo erra, então menor é melhor, e AMI é o número mais duro porque reuniões reais são bagunçadas. A Qwen também chama a versão 1.7B de «estado da arte entre os modelos ASR de código aberto» e competitiva com APIs comerciais — trate como afirmação do fornecedor até que alguém fora da Alibaba meça. E observe: esse é um benchmark diferente do ranking independente logo abaixo, com áudio diferente, então as duas séries de números não podem ser comparadas entre si.
Foi o Whisper que começou isso, e ainda é o modelo que todo mundo roda
Nada disso existiria nesse formato sem o Whisper, da OpenAI. O repositório foi aberto em 16 de setembro de 2022 sob licença MIT — código e pesos juntos — num momento em que reconhecimento de fala sério significava contrato com um provedor de nuvem. De lá para cá, acumulou 106.679 estrelas no GitHub.
O que tornou o Whisper importante foi menos o modelo do que aquilo que a comunidade construiu em cima dele em poucos meses. O whisper.cpp o reimplementou em C e C++ puros, licença MIT, 52.591 estrelas, e o fez rodar em notebooks e celulares sem Python e sem GPU. O faster-whisper o reconstruiu sobre CTranslate2 com grande ganho de velocidade e memória, MIT também, 24.750 estrelas. O modelo era a semente; o ecossistema, a árvore.
Quatro anos depois, ainda é o modelo de fala mais usado do mundo. Nos últimos 30 dias, o whisper-large-v3-turbo foi baixado 8,72 milhões de vezes do Hugging Face e o whisper-large-v3, 5,50 milhões — números que puxamos em 5 de agosto de 2026. O Qwen3-ASR-0.6B, com 4,29 milhões, sobe rápido para um modelo de seis meses, mas o padrão para o qual o setor estende a mão sem pensar continua sendo o Whisper. A precisão dele, porém, envelheceu: no ranking da Artificial Analysis, o Whisper Large v3 marca AA-WER de 4,07 % contra 1,73 % do líder atual. E ainda assim, muitos produtos em produção o rodam.
A camada de fala aberta chegou em duas ondas separadas por três anos, com quase nada no meio. Datas de lançamento do GitHub e do Hugging Face, consultadas em 5 de agosto de 2026.
O lado aberto é mais do que um laboratório
A Qwen não está sozinha, e os outros são bons em coisas bem diferentes.
A linha Parakeet da NVIDIA aposta em velocidade. O parakeet-tdt-0.6b-v3, lançado em agosto de 2025 sob CC BY 4.0, é um modelo de 600 milhões de parâmetros que cobre 25 idiomas europeus com detecção automática de idioma, pontuação, maiúsculas e marcações de tempo por palavra de fábrica, e engole até 24 minutos de áudio numa passada só. A família Canary da NVIDIA — canary-1b-v2 e canary-qwen-2.5b, também CC BY 4.0 — cobre terreno parecido com outras apostas de arquitetura. Os modelos Voxtral da Mistral chegaram em julho de 2025 sob Apache 2.0 e importam por um motivo a que chegamos já já.
Eis o lado aberto lado a lado, com uma API hospedada na última linha para contraste.
| Modelo | Download | Licença | Idiomas | Roda em | Melhor em |
|---|---|---|---|---|---|
| Whisper Large v3 | 3,09 GB | MIT | 99 | Notebook ou uma GPU | Ser o padrão que tudo já suporta |
| Qwen3-ASR-0.6B | 1,56 GB | Apache 2.0 | 52 com dialetos | Notebook | Multilíngue no menor tamanho |
| Qwen3-ASR-1.7B | 4,08 GB | Apache 2.0 | 52 com dialetos | Notebook ou uma GPU | Melhor precisão da família Qwen |
| Parakeet TDT 0.6B v3 | 2,51 GB | CC BY 4.0 | 25 europeus | Notebook ou uma GPU | Velocidade e marcações de tempo por palavra |
| Voxtral Small | — | Apache 2.0 | — | GPU de servidor, 24 bilhões de parâmetros | Maior pontuação aberta no ranking independente |
| API hospedada | Não baixável | Proprietária | Varia | A nuvem do fornecedor | Diarização, streaming, disponibilidade |
O tamanho do download é o checkpoint padrão de cada repositório no Hugging Face; "—" marca um valor que não conseguimos confirmar em fonte primária. Consultado em 5 de agosto de 2026.
Depois vem o trabalho de empacotamento que leva esses modelos a aparelhos reais, o ponto em que a faixa notebook deixa de ser teórica. O whisperkit-coreml — Whisper compilado para hardware da Apple — foi baixado 8,31 milhões de vezes nos últimos 30 dias. Uma build MLX do Parakeet para Apple Silicon somou 1,87 milhão, e duas conversões GGUF — o formato quantizado que roda modelos em CPUs comuns — 2,04 e 1,87 milhão. Milhões de pessoas por mês baixam reconhecimento de fala empacotado especificamente para rodar na própria máquina. Isso não é curiosidade de pesquisa. É canal de distribuição.
O primeiro lugar ainda é um endpoint em prévia que você não pode baixar
Aqui começa a contabilidade honesta, e ela corta para os dois lados.
Puxamos o ranking de fala para texto da Artificial Analysis em 5 de agosto de 2026 — um benchmark independente que mede modelos abertos e fechados no mesmo áudio, ao contrário do ranking do Hugging Face, que é coisa entre modelos abertos. O topo do índice AA-WER:
| Posição | Modelo | AA-WER | Dá para baixar? |
|---|---|---|---|
| 1 | Fun-Realtime-ASR-preview | 1,73 % | Não — endpoint em prévia |
| 2 | Scribe v2, ElevenLabs | 2,18 % | Não — API hospedada |
| 3 | MAI-Transcribe-1.5, Microsoft | 2,38 % | Não — API hospedada |
| 4 | Smallest AI Pulse Pro | 2,43 % | Não — API hospedada |
| 5 | Voxtral Small, Mistral | 2,77 % | Sim — Apache 2.0 |
| 6 | Gemini 3.1 Pro Preview, High | 2,82 % | Não — API hospedada |
| 11 | Whisper Large v3 | 4,07 % | Sim — MIT |
Fonte: ranking de fala para texto da Artificial Analysis, AA-WER v2, consultado em 5 de agosto de 2026. A possibilidade de download foi avaliada pela licença publicada de cada modelo.
Leia primeiro as quatro linhas de cima, porque elas corrigem qualquer narrativa de que o aberto venceu. Os modelos de fala com melhor pontuação do mundo são coisas que se alugam, e o líder nem sequer está em disponibilidade geral: é um endpoint em prévia.
Agora leia a quinta linha, porque ela corrige a correção. O Voxtral Small é Apache 2.0. Você pode baixar, rodar no seu hardware e distribuir comercialmente — e ele está em quinto num ranking independente com 2,77 %, a cerca de um ponto de taxa de erro de palavra de um modelo fechado em prévia. Levado a uma reunião de uma hora com 6.300 palavras, esse intervalo dá umas 66 palavras. Real, mas longe do abismo que o enquadramento costuma sugerir.
Nossa leitura: o resumo correto não é «o STT aberto está muito atrás». Os modelos de fala abertos passaram há tempos do limiar do suficientemente bom para a maior parte do trabalho, e a vantagem que resta ao lado fechado é um ponto de taxa de erro mais o produto embrulhado em volta. O que nos leva ao trade-off que de fato decide.
O que rodar por conta própria entrega e o que custa
Três coisas empurram equipes para a auto-hospedagem, e nenhuma delas é precisão.
Privacidade é a primeira e costuma ser a decisiva. Se você transcreve consultas médicas, entrevistas jurídicas ou conversas de RH, «o áudio não sai do nosso hardware» não é preferência, é requisito de compra, e um modelo hospedado por você é a única arquitetura que atende isso de forma limpa. Operação offline é a segunda: um modelo no aparelho funciona no avião, no subsolo, no chão de fábrica, num campo sem sinal. É exatamente por isso que o whisper.cpp e as builds GGUF têm os números de download que têm.
Custo é a terceira, e aqui os números são crus. Da mesma fotografia da Artificial Analysis, preço por 1.000 minutos de áudio: Whisper Large v3 hospedado no fal.ai sai por 0,50 dólar, o Canary Qwen 2.5B da NVIDIA no Replicate por 0,74 e o Parakeet TDT 0.6B V3 no Together AI por 1,50. Do lado fechado, o Nova-3 da Deepgram está em 4,30, o MAI-Transcribe-1.5 em 6,00 e o Gemini 3.1 Pro Preview em 18,15. É um fator de 4 contra a Microsoft e de 12 contra o Google só para hospedar um modelo aberto em servidor alheio — antes de considerar rodar no seu, onde o custo marginal da milésima hora é eletricidade.
Velocidade corta na mesma direção, e esse foi o detalhe que mais nos surpreendeu. O modelo mais rápido de todo o ranking é o Parakeet TDT 0.6B V3 servido no Together AI, a 885 vezes o tempo real — uma hora de áudio volta em cerca de quatro segundos. O Nova-3 da Deepgram faz 512x, o Whisper Large v3 no Together 478x e o MAI-Transcribe-1.5 189x. A opção de transcrição mais rápida disponível é um modelo open weight de 600 milhões de parâmetros que qualquer um pode baixar.
A troca nunca foi precisão contra precisão. É controle e custo contra as funções embrulhadas em volta do reconhecimento.
Então o que as APIs hospedadas ainda vendem? Tudo o que não é reconhecimento. A documentação da Deepgram é um inventário justo: diarização de falantes, streaming em tempo real, formatação, vocabulário personalizado, mascaramento de entidades, detecção de idioma e a garantia operacional de que continua de pé enquanto você dorme. Baixe o Qwen3-ASR e você recebe palavras e marcações de tempo. Sem rótulos de falante, sem SLA, e são seus a conta de GPU, o escalonamento e o chamado das três da manhã.
O modelo mais baixado da categoria não é um transcritor
Há uma estatística que amarra tudo, e não a esperávamos.
Quando você ordena por downloads a categoria inteira de reconhecimento automático de fala do Hugging Face, o modelo no topo não é o Whisper, nem a Qwen, nem o Parakeet. É o pyannote/speaker-diarization-3.1, com 8,91 milhões de downloads nos últimos 30 dias, e um segundo modelo de diarização da pyannote fica em quinto com 5,26 milhões. Diarização é a engrenagem que descobre quem falou e quando — a camada logo acima da transcrição.
Os pesos abertos já cobrem as duas primeiras camadas da pilha. As que decidem se uma nota serve ficam acima delas.
O modelo mais procurado da categoria de reconhecimento de fala não reconhece fala. Ele responde a uma pergunta que os reconhecedores deixam em aberto, que é a mesma conclusão a que chegamos pelo lado fechado do mercado, quando o modelo de maior pontuação do mundo saiu sem rótulos de falante. Dois pontos de vista completamente diferentes, a mesma constatação: ouvir as palavras é a parte resolvida.
Conclusão
A pergunta interessante sobre reconhecimento de fala open weight nunca foi «ele é tão bom quanto os modelos fechados». Ele está a cerca de um ponto de taxa de erro de palavra, é mais rápido, custa de quatro a doze vezes menos e cabe num notebook. A pergunta interessante é o que você constrói no espaço que se abre quando a transcrição deixa de ser uma linha de custo alugada — porque um arquivo de 1,56 GB que ouve 52 idiomas não é um produto. É uma peça que acabou de ficar de graça.
Para um time escolhendo uma ferramenta de notas de reunião, e não um modelo, a leitura prática é curta. Se um produto roda um modelo aberto ou uma API fechada hoje é, em grande medida, detalhe de implementação, e cada vez mais será os dois: pesos abertos para o volume, APIs hospedadas onde diarização, streaming e escala justificam o preço. A Telli.sh já roda um modelo aberto na camada de resumo, então os avanços do lado aberto chegam direto à transcrição, à tradução e às notas de reunião sem mudança de preço. Julgue a ferramenta pelo que sai no fim: se a nota diz quem se comprometeu com o quê.
Começar uma nota de IA ao vivo
Fontes
- Cartão do modelo Qwen3-ASR-0.6B-hf (Hugging Face) — licença, lista de idiomas, números de ranking datados de 26 de junho de 2026
- Cartão do modelo Qwen3-ASR-1.7B-hf (Hugging Face)
- Qwen3-ForcedAligner-0.6B (Hugging Face)
- Qwen3-ASR Technical Report, arXiv:2601.21337 (submetido em 29 de janeiro de 2026)
- Repositório OpenAI Whisper (MIT, publicado em 16 de setembro de 2022)
- whisper.cpp e faster-whisper
- Cartão do modelo NVIDIA parakeet-tdt-0.6b-v3 (CC BY 4.0)
- Mistral Voxtral-Small-24B-2507 (Apache 2.0)
- Ranking de fala para texto da Artificial Analysis — AA-WER v2, números de velocidade e preço consultados em 5 de agosto de 2026
- Hugging Face Open ASR Leaderboard
- Documentação da Deepgram sobre diarização
- Página da imagem no Wikimedia Commons