speech-to-text16 min di lettura

Il riconoscimento vocale è diventato open weight in silenzio — e sta in 1,56 GB

I modelli Qwen3-ASR di Alibaba sono sotto licenza Apache 2.0, coprono 52 lingue e dialetti e pesano meno di due gigabyte. Una guida in parole semplici allo strato di trascrizione open weight: cosa esiste, cosa ti dà davvero eseguire un modello sul tuo portatile e dove le API chiuse continuano a vincere.

T
Telli.sh Team
#speech-to-text#open-weight#qwen3-asr#whisper#parakeet#transcription#self-hosting#ai-models

Il team Qwen di Alibaba ha su Hugging Face tre modelli di riconoscimento vocale di cui non ha scritto quasi nessuno. Qwen3-ASR-0.6B, Qwen3-ASR-1.7B e un compagno chiamato Qwen3-ForcedAligner-0.6B, tutti sotto licenza Apache 2.0. Il più piccolo è un download da 1,56 GB, gestisce 52 lingue e dialetti e dal 26 giugno si esegue con tre righe di Python standard. Lo metti su una macchina che già possiedi e nessuno può mandarti una fattura.

Lo schema è difficile da non vedere, perché lo abbiamo già visto svolgersi una volta. I grandi modelli linguistici hanno passato il 2023 e il 2024 come cose che si noleggiavano tramite API, poi è arrivato lo strato open weight ed è diventato la scelta predefinita per chiunque tenesse ai costi, alla riservatezza o alla possibilità di lavorare offline. La trascrizione sta facendo lo stesso, con circa due anni di ritardo.

Questo articolo è una mappa di quel passaggio per chi non segue i rilasci di modelli per mestiere: che cos'è un modello vocale open weight, quali esistono adesso e con quale licenza, cosa dà in pratica «0.6B sul portatile» e — la parte che quasi tutta la copertura salta — dove le API chiuse ospitate restano nettamente avanti.

TL;DR:

  • La trascrizione open weight è già utilizzabile: Qwen3-ASR con Apache 2.0 e 52 lingue e dialetti, Whisper con MIT, Parakeet e Canary di NVIDIA con CC BY 4.0, Voxtral di Mistral con Apache 2.0.
  • L'auto-hosting porta riservatezza, funzionamento offline e controllo dei costi. Sulla classifica indipendente di Artificial Analysis, ospitare un modello aperto costa 1,50 dollari ogni 1.000 minuti, contro i 6,00 di MAI-Transcribe-1.5 di Microsoft e i 18,15 di Gemini 3.1 Pro Preview.
  • Il primo posto per accuratezza resta un endpoint chiuso in anteprima. Ma un modello aperto sotto Apache 2.0, Voxtral Small, è ormai quinto, a circa un punto di tasso di errore sulle parole.

Forma d'onda e spettrogramma di una frase parlata, con ogni parola allineata sopra il tratto audio corrispondente

Immagine: Aaron Parecki, Wikimedia Commons, CC BY 2.0. Forma d'onda e spettrogramma della frase «it rains a lot in Portland», con le lettere posizionate sopra l'audio a cui corrispondono: è esattamente la materia prima su cui lavora ogni modello di riconoscimento vocale.

Cosa scarichi davvero quando scarichi un trascrittore

Un modello ASR — riconoscimento automatico del parlato, usato come sinonimo di STT, da voce a testo — è un programma che riceve audio e produce testo. Il lavoro è tutto qui. Non decide chi ha parlato, non riassume, non sa di cosa trattasse la tua riunione. Sente parole e le scrive.

«Open weights» significa che il laboratorio ha pubblicato il file del modello finito. I pesi di un modello sono l'enorme griglia di numeri che ha imparato durante l'addestramento, e pubblicarli significa che puoi scaricare quel file, eseguirlo sul tuo hardware e costruirci sopra senza chiedere il permesso a nessuno né pagare a richiesta. L'alternativa è un modello chiuso: i pesi restano sui server del fornitore e tu noleggi l'accesso tramite API — l'audio sale, il testo torna indietro e la fatturazione va a minuti.

Il numero nel nome è il conteggio dei parametri e, per i modelli vocali, è insolitamente concreto. «0.6B» vuol dire circa 600 milioni di parametri, il che in pratica rende Qwen3-ASR-0.6B un file da 1,56 GB e Qwen3-ASR-1.7B uno da 4,08 GB: entrambi abbastanza piccoli da stare sull'SSD di un portatile senza che nessuno se ne accorga. Confrontalo con i modelli linguistici aperti di cui abbiamo parlato nella nostra panoramica sulla Cina, dove il rilascio di punta era 1,56 terabyte su 96 frammenti e serviva un cluster solo per caricarlo. I modelli vocali sono circa mille volte più piccoli dei modelli testuali di frontiera, e questo singolo fatto spiega perché qui il cambiamento colpisce più forte che là.

Ecco il termine che useremo per il resto dell'articolo: la fascia da portatile. È la classe di modelli in cui la questione hardware semplicemente scompare, dove «riesco a farlo girare?» smette di essere una conversazione di budget e diventa un download. I modelli testuali per lo più non ci sono. Quelli vocali ci sono quasi tutti.

Un'ultima riga da leggere prima di qualsiasi benchmark: la licenza. Apache 2.0 e MIT sono l'estremo permissivo — usalo, modificalo, mettilo in un prodotto commerciale, senza dovere nulla. CC BY 4.0, che NVIDIA adotta, è anch'essa utilizzabile commercialmente ma richiede l'attribuzione.

Qwen ha rilasciato la famiglia a gennaio; a giugno è diventata facile

Veniamo al rilascio che ha ispirato questo articolo, con una correzione a come è stato raccontato. La famiglia Qwen3-ASR non è comparsa a giugno. I repository originali sono stati pubblicati il 28 gennaio 2026 e il rapporto tecnico è arrivato su arXiv il giorno dopo. Quello che è successo il 26 giugno è che Qwen ha pubblicato le versioni -hf di tutti e tre i modelli: checkpoint che funzionano in modo nativo in Hugging Face Transformers a partire dalla versione 5.13.0.

Sembra una nota a piè di pagina e non lo è. Prima, eseguire il modello significava installare il pacchetto proprietario qwen-asr o un backend vLLM e imparare una catena di strumenti. Dopo, sono tre righe di Python standard che qualunque sviluppatore abbia toccato Transformers già conosce. La barriera che lascia inutilizzati la maggior parte dei modelli aperti raramente è il modello: sono i quaranta minuti di lotta con l'ambiente prima della prima trascrizione, ed è esattamente ciò che il 26 giugno ha cancellato.

Le specifiche vengono direttamente dalle schede modello. Entrambe le taglie fanno identificazione della lingua e riconoscimento vocale per 30 lingue — inglese, cinese, coreano, giapponese, spagnolo, arabo, hindi, thai, vietnamita, polacco e altre venti — più 22 dialetti cinesi, ed è così che si arriva alla cifra di «52 lingue e dialetti». Entrambe fanno inferenza in streaming e offline da un unico modello, cosa più rara di quanto sembri: molti modelli di trascrizione fanno l'una o l'altra. Entrambe accettano audio lunghi, e la scheda elenca il canto e i brani con musica di sottofondo tra i tipi di audio supportati.

Il terzo modello merita una sosta. Qwen3-ForcedAligner-0.6B fa allineamento forzato: gli dai audio e trascrizione e segna dove inizia e finisce ogni parola, al millisecondo, per 11 lingue e fino a cinque minuti di parlato per volta. È il meccanismo dietro le trascrizioni cliccabili, la sincronizzazione dei sottotitoli e il salto al momento in cui qualcuno ha detto una certa cosa. È esattamente ciò che mostra l'immagine in testa a questo articolo. Pubblicare un allineatore insieme al riconoscitore è un segnale su chi sia il destinatario del rilascio: non chi lancia una demo, ma chi costruisce prodotti.

Sulla qualità, conviene distinguere chi afferma cosa. La scheda di Qwen riporta cifre dell'Hugging Face Open ASR Leaderboard datate 26 giugno 2026: un tasso medio di errore sulle parole del 5,59 % per il modello da 1.7B e del 6,31 % per quello da 0.6B, con il sottoinsieme di audio da riunione AMI al 9,26 % e al 10,57 %. Il tasso di errore sulle parole è la quota di parole che il modello sbaglia, quindi più basso è meglio, e AMI è il numero più duro perché le riunioni vere sono disordinate. Qwen definisce inoltre la versione 1.7B «stato dell'arte tra i modelli ASR open source» e competitiva con le API commerciali: trattala come affermazione del fornitore finché qualcuno fuori da Alibaba non misura. E attenzione: questo è un benchmark diverso dalla classifica indipendente qui sotto, su audio diverso, quindi le due serie di numeri non si possono confrontare tra loro.

È stato Whisper a cominciare, ed è ancora il modello che tutti eseguono

Niente di tutto questo esisterebbe in questa forma senza Whisper di OpenAI. Il repository è diventato pubblico il 16 settembre 2022 sotto licenza MIT — codice e pesi insieme — in un momento in cui riconoscimento vocale serio significava un contratto con un fornitore cloud. Da allora ha raccolto 106.679 stelle su GitHub.

Ciò che ha reso importante Whisper è stato meno il modello di quanto la comunità ci ha costruito sopra nel giro di mesi. whisper.cpp lo ha reimplementato in puro C e C++, licenza MIT, 52.591 stelle, facendolo girare su portatili e telefoni senza Python e senza GPU. faster-whisper lo ha ricostruito su CTranslate2 con un grande guadagno in velocità e memoria, sempre MIT, 24.750 stelle. Il modello era il seme; l'ecosistema era l'albero.

Quattro anni dopo è ancora il modello vocale più usato al mondo. Negli ultimi 30 giorni whisper-large-v3-turbo è stato scaricato 8,72 milioni di volte da Hugging Face e whisper-large-v3 5,50 milioni: dati rilevati il 5 agosto 2026. Qwen3-ASR-0.6B, a 4,29 milioni, sale in fretta per un modello di sei mesi, ma il valore predefinito verso cui il settore allunga la mano senza pensarci resta Whisper. La sua accuratezza però è invecchiata: sulla classifica di Artificial Analysis, Whisper Large v3 segna un AA-WER del 4,07 % contro l'1,73 % dell'attuale capolista. E moltissimi prodotti già rilasciati lo eseguono comunque.

Cronologia dei modelli aperti di riconoscimento vocale, da Whisper nel settembre 2022 a Qwen3-ASR nel 2026

Lo strato vocale aperto è arrivato in due ondate a tre anni di distanza, con quasi nulla in mezzo. Date di rilascio da GitHub e Hugging Face, consultate il 5 agosto 2026.

Il fronte aperto non è un laboratorio solo

Qwen non è sola, e le altre sono brave in cose nettamente diverse.

La linea Parakeet di NVIDIA punta sulla velocità. parakeet-tdt-0.6b-v3, uscito ad agosto 2025 sotto CC BY 4.0, è un modello da 600 milioni di parametri che copre 25 lingue europee con rilevamento automatico della lingua, punteggiatura, maiuscole e marcature temporali a livello di parola integrate, e ingoia fino a 24 minuti di audio in un solo passaggio. La famiglia Canary di NVIDIA — canary-1b-v2 e canary-qwen-2.5b, anch'esse CC BY 4.0 — copre un terreno simile con scommesse architetturali diverse. I modelli Voxtral di Mistral sono arrivati a luglio 2025 sotto Apache 2.0 e contano per un motivo a cui arriviamo tra poco.

Ecco il fronte aperto affiancato, con un'API ospitata nell'ultima riga come termine di paragone.

ModelloDownloadLicenzaLingueGira suPiù forte in
Whisper Large v33,09 GBMIT99Portatile o una GPUEssere il default che tutto già supporta
Qwen3-ASR-0.6B1,56 GBApache 2.052 con dialettiPortatileMultilingua nella taglia più piccola
Qwen3-ASR-1.7B4,08 GBApache 2.052 con dialettiPortatile o una GPULa migliore accuratezza della famiglia Qwen
Parakeet TDT 0.6B v32,51 GBCC BY 4.025 europeePortatile o una GPUVelocità e marcature temporali per parola
Voxtral SmallApache 2.0GPU da server, 24 miliardi di parametriIl punteggio aperto più alto sulla classifica indipendente
API ospitataNon scaricabileProprietariaVariabileIl cloud del fornitoreDiarizzazione, streaming, continuità

La dimensione del download è il checkpoint predefinito di ciascun repository Hugging Face; «—» segnala un valore che non abbiamo potuto confermare da una fonte primaria. Consultato il 5 agosto 2026.

Poi c'è il lavoro di confezionamento che porta questi modelli su dispositivi reali, il punto in cui la fascia da portatile smette di essere teorica. whisperkit-coreml — Whisper compilato per l'hardware Apple — è stato scaricato 8,31 milioni di volte negli ultimi 30 giorni. Una build MLX di Parakeet per Apple Silicon ha totalizzato 1,87 milioni e due conversioni GGUF — il formato quantizzato che fa girare i modelli su CPU ordinarie — 2,04 e 1,87 milioni. Milioni di persone al mese scaricano riconoscimento vocale confezionato apposta per girare sulla propria macchina. Non è una curiosità di ricerca. È un canale di distribuzione.

Il primo posto è ancora un endpoint in anteprima che non puoi scaricare

Qui comincia la contabilità onesta, e taglia da entrambe le parti.

Abbiamo consultato la classifica speech-to-text di Artificial Analysis il 5 agosto 2026: un benchmark indipendente che misura modelli aperti e chiusi sullo stesso audio, a differenza della classifica di Hugging Face, che è una faccenda tra modelli aperti. La testa dell'indice AA-WER:

Pos.ModelloAA-WERScaricabile?
1Fun-Realtime-ASR-preview1,73 %No — endpoint in anteprima
2Scribe v2, ElevenLabs2,18 %No — API ospitata
3MAI-Transcribe-1.5, Microsoft2,38 %No — API ospitata
4Smallest AI Pulse Pro2,43 %No — API ospitata
5Voxtral Small, Mistral2,77 %Sì — Apache 2.0
6Gemini 3.1 Pro Preview, High2,82 %No — API ospitata
11Whisper Large v34,07 %Sì — MIT

Fonte: classifica speech-to-text di Artificial Analysis, AA-WER v2, consultata il 5 agosto 2026. La scaricabilità è dedotta dalla licenza pubblicata di ciascun modello.

Leggi prima le quattro righe in alto, perché correggono qualunque racconto secondo cui l'aperto avrebbe vinto. I modelli vocali col punteggio più alto al mondo sono cose che si noleggiano, e il capolista non è nemmeno in disponibilità generale: è un endpoint in anteprima.

Ora leggi la quinta riga, perché corregge la correzione. Voxtral Small è Apache 2.0. Puoi scaricarlo, eseguirlo sul tuo hardware e rilasciarlo commercialmente, e sta al quinto posto di una classifica indipendente con il 2,77 %, a circa un punto di tasso di errore sulle parole da un modello chiuso in anteprima. Riportato a una riunione di un'ora da 6.300 parole, quel divario vale circa 66 parole. Reale, ma ben lontano dall'abisso che la narrazione lascia intendere.

La nostra lettura: il riassunto corretto non è «l'STT aperto è molto indietro». I modelli vocali aperti hanno superato da tempo la soglia del sufficientemente buono per la maggior parte dei lavori, e il vantaggio che resta al fronte chiuso è un punto di tasso di errore più il prodotto che gli sta attorno. Il che ci porta al compromesso che decide davvero.

Cosa ti dà eseguirlo in casa e cosa ti costa

Tre cose spingono i team verso l'auto-hosting, e nessuna è l'accuratezza.

La riservatezza è la prima e di solito quella decisiva. Se trascrivi visite mediche, interviste legali o colloqui HR, «l'audio non esce dal nostro hardware» non è una preferenza ma un requisito d'acquisto, e un modello che ospiti tu è l'unica architettura che lo soddisfa in modo pulito. Il funzionamento offline è la seconda: un modello sul dispositivo funziona in aereo, in un seminterrato, in un capannone, in un sito senza copertura. È esattamente per questo che whisper.cpp e le build GGUF hanno i numeri di download che hanno.

Il costo è la terza, e qui i numeri sono spietati. Dalla stessa istantanea di Artificial Analysis, prezzo per 1.000 minuti di audio: Whisper Large v3 ospitato su fal.ai costa 0,50 dollari, Canary Qwen 2.5B di NVIDIA su Replicate 0,74, Parakeet TDT 0.6B V3 su Together AI 1,50. Sul fronte chiuso, Nova-3 di Deepgram è a 4,30, MAI-Transcribe-1.5 a 6,00 e Gemini 3.1 Pro Preview a 18,15. Un fattore 4 rispetto a Microsoft e 12 rispetto a Google solo per ospitare un modello aperto sui server di qualcun altro, prima ancora di considerare di farlo girare sui tuoi, dove il costo marginale della millesima ora è elettricità.

Anche la velocità taglia nella stessa direzione, ed è il dettaglio che ci ha sorpreso di più. Il modello più veloce dell'intera classifica è Parakeet TDT 0.6B V3 servito su Together AI, a 885 volte il tempo reale: un'ora di audio torna in circa quattro secondi. Nova-3 di Deepgram arriva a 512x, Whisper Large v3 su Together a 478x, MAI-Transcribe-1.5 a 189x. L'opzione di trascrizione più veloce disponibile è un modello open weight da 600 milioni di parametri che chiunque può scaricare.

Confronto su due colonne tra pesi aperti gestiti in proprio e un'API di trascrizione ospitata

Il compromesso non è mai stato accuratezza contro accuratezza. È controllo e costo contro le funzioni avvolte attorno al riconoscimento.

Allora cosa vendono ancora le API ospitate? Tutto ciò che non è riconoscimento. La documentazione di Deepgram è un inventario onesto: diarizzazione dei parlanti, streaming in tempo reale, formattazione, vocabolario personalizzato, oscuramento delle entità, rilevamento della lingua e la garanzia operativa che resti in piedi mentre dormi. Scarica Qwen3-ASR e ottieni parole e marcature temporali. Nessuna etichetta di parlante, nessuno SLA, e tue sono la bolletta della GPU, la scalabilità e la chiamata alle tre di notte.

Il modello più scaricato della categoria non è un trascrittore

C'è una statistica che lega tutto, e non ce l'aspettavamo.

Se ordini per download l'intera categoria riconoscimento automatico del parlato di Hugging Face, il modello in cima non è Whisper, né Qwen, né Parakeet. È pyannote/speaker-diarization-3.1, con 8,91 milioni di download negli ultimi 30 giorni, e un secondo modello di diarizzazione pyannote è quinto con 5,26 milioni. La diarizzazione è il meccanismo che stabilisce chi ha parlato e quando: lo strato immediatamente sopra la trascrizione.

Schema dello stack di trascrizione dall'audio alla nota di riunione, con evidenziati i livelli coperti da modelli aperti

I pesi aperti coprono ormai i primi due livelli dello stack. Quelli che decidono se una nota è utile stanno sopra.

Il modello più richiesto della categoria riconoscimento vocale non riconosce il parlato. Risponde a una domanda che i riconoscitori lasciano aperta, la stessa conclusione a cui eravamo arrivati dal lato chiuso del mercato, quando il modello col punteggio più alto al mondo è uscito senza etichette di parlante. Due punti di osservazione completamente diversi, la stessa scoperta: sentire le parole è la parte risolta.

In conclusione

La domanda interessante sul riconoscimento vocale open weight non è mai stata «è buono quanto i modelli chiusi». È a circa un punto di tasso di errore sulle parole, è più veloce, costa dalle quattro alle dodici volte meno e sta su un portatile. La domanda interessante è cosa costruisci nello spazio che si apre quando la trascrizione smette di essere una voce di spesa noleggiata, perché un file da 1,56 GB che sente 52 lingue non è un prodotto. È un componente che è appena diventato gratuito.

Per un team che sceglie uno strumento per le note di riunione e non un modello, la lettura pratica è breve. Che un prodotto esegua un modello aperto o un'API chiusa è ormai in gran parte un dettaglio implementativo, e sempre più sarà entrambe le cose: pesi aperti per il grosso del lavoro, API ospitate dove diarizzazione, streaming e scala si guadagnano il prezzo. Telli.sh esegue già un modello aperto nel suo strato di sintesi, così i progressi del fronte aperto arrivano diretti a trascrizione, traduzione e note di riunione senza variazioni di prezzo. Giudica lo strumento da ciò che esce alla fine: se la nota ti dice chi si è impegnato a fare cosa.

Avvia una nota IA in diretta

Fonti


Torna al blog