120 minuti gratis che non bastano per una sola intervista: cosa dà davvero la trascrizione AI gratuita in indonesiano
Il piano gratuito di Notta concede 120 minuti di trascrizione al mese e limita ogni singola registrazione a 3 minuti. TurboScribe dà 3 file al giorno con un tetto di 30 minuti. L'API di Google vi consegna 60 minuti gratuiti e nessuna interfaccia. Il 7 agosto 2026 Deepgram ha rilasciato un modello indonesiano migliorato — solo sul percorso batch. Un confronto testato dei piani gratuiti in cui un giornalista, un ricercatore o un selezionatore HR in Indonesia finisce davvero, e i limiti che nessuno di loro pubblicizza.
Avete un'intervista di 47 minuti ferma sul telefono. Una fonte a Surabaya, registrata stamattina, quasi tutta in indonesiano con la solita spruzzata di inglese — deadline, stakeholder, follow up. La trascrizione vi serve oggi, e preferireste decisamente non pagarla.
Così cercate, atterrate su uno strumento che pubblicizza 120 minuti di trascrizione gratuiti al mese e vi registrate. Il vostro file da 47 minuti sta comodamente dentro i 120. Poi il caricamento fallisce, e sepolto nella tabella di confronto dei piani c'è un secondo numero che nessuno mette nel titolo: trascrizione massima per registrazione, 3 minuti.
È la forma di tutta questa categoria. I piani gratuiti si pubblicizzano sul numero che suona più generoso e sono vincolati da un numero diverso, tre righe più in basso. Questo articolo è il confronto che avremmo voluto trovare: cosa dà davvero ogni piano gratuito a un'intervista in lingua indonesiana, cosa rifiuta in silenzio e come testarne uno qualsiasi in cinque minuti prima di impegnarvi.
In breve
- I piani gratuiti hanno tre tetti indipendenti — minuti al mese, minuti per file e file al giorno — e quello che spezza le interviste è quasi sempre il limite per file, non il totale mensile.
- Il riconoscimento del parlato indonesiano è migliorato davvero questo mese: il 7 agosto 2026 Deepgram ha rilasciato un modello indonesiano Nova-3 aggiornato, ma solo sul percorso batch, non in streaming. Caricare una registrazione ne beneficia; sottotitolare dal vivo no.
- Nessuna classifica pubblica misura l'accuratezza sull'indonesiano. La Open ASR Leaderboard ha aggiunto la sua prima lingua del Sud globale il 28 agosto 2026, ed era l'hindi. Finché non cambia, la vostra clip di prova da 5 minuti è l'unico benchmark che descrive il vostro audio.
I piani gratuiti, uno accanto all'altro
Ogni cifra qui sotto viene dal listino o dalla documentazione pubblicati dal fornitore stesso, consultati il 31 agosto 2026. Il lavoro di riferimento è un'intervista di 47 minuti a due voci, perché è il file che le persone hanno davvero.
| Strumento | Piano gratuito | File singolo più lungo, gratis | Indonesiano | Prezzo d'ingresso a pagamento |
|---|---|---|---|---|
| Notta | 120 min/mese, 50 caricamenti/mese, 10 riepiloghi AI/mese, 1 postazione | 3 minuti | Non confermato | Pro 8,17 $/mese con fatturazione annuale — 1.800 min/mese, file da 5 ore |
| TurboScribe | 3 trascrizioni al giorno, priorità in coda più bassa | 30 minuti | Sì | Unlimited 10 $/mese, 120 $ con fatturazione annuale — file da 10 ore |
| Transkriptor | Nessun minuto mensile gratuito pubblicato | — | Sì | Lite 9,99 $/mese — 300 min/mese |
| Maestra | Nessun minuto mensile gratuito pubblicato | — | Sì | Consumo a consumo 12 $ ogni 60 minuti; Lite 23 $/mese — 180 min/mese |
| Google Cloud Speech-to-Text | 60 min/mese, poi 0,016 $/min | Nessun tetto pratico | Sì, id-ID | 0,016 $/min con log dei dati, 0,024 $/min senza |
| API di trascrizione OpenAI | Nessuno | Nessun tetto pratico | Sì | 0,006 $/min (gpt-4o-transcribe), 0,003 $/min (mini) |
| Whisper, self-hosted | Illimitato, licenza MIT | Il vostro hardware | Sì | Software gratuito, il tempo GPU è vostro |
| Telli.sh | 60 min/mese | Fino all'esaurimento del monte minuti | Sì | I piani a pagamento partono da 300 min/mese |
Fonti: la pagina prezzi di ciascun fornitore, consultata il 31 agosto 2026; la documentazione di Google sulle lingue supportate per id-ID; il listino API pubblicato da OpenAI. La pagina prezzi live di TurboScribe blocca il recupero automatico, quindi le sue cifre vengono dallo snapshot dell'Internet Archive di quella pagina e coincidono con il modo in cui il piano è descritto altrove oggi — verificatele prima di farci affidamento. Il 31 agosto 2026 non siamo riusciti a recuperare da Notta un elenco per lingua, quindi il suo supporto all'indonesiano è segnato come non confermato anziché dato per scontato.
Una sola unità su un solo asse: i minuti di un'intervista da 47 minuti accettati in un unico file. I monte minuti mensili sono diversi e sono annotati sotto il grafico.
I 120 minuti di Notta esistono davvero. È il tetto di tre minuti a spezzare l'intervista.
Leggete con attenzione il piano gratuito di Notta e non è affatto tirchio — 120 minuti di trascrizione al mese, 50 caricamenti di file, 10 riepiloghi AI, 1.000 crediti AI, nessuna carta di credito. Per memo vocali e telefonate brevi è un monte davvero utile, ed è più minuti mensili di quanti ne regalino quasi tutti i concorrenti.
Poi leggete una riga più in basso nella stessa tabella di confronto: trascrizione massima per registrazione, 3 minuti nel piano Free, contro 5 ore nel Pro. I vostri 120 minuti sono 40 frammenti separati da tre minuti. Un'intervista di 47 minuti non riesce proprio a entrare nel sistema.
Il punto è questo, e va ben oltre un singolo fornitore: un piano gratuito non è un numero, sono tre tetti, e il marketing cita quello più alto. I minuti al mese sono il titolo. I minuti per file sono ciò che decide se la vostra intervista è trascrivibile. I file al giorno sono ciò che decide se potete lavorare una settimana di ricerca sul campo in una domenica.
TurboScribe ribalta lo stesso scambio. Il suo piano gratuito non pubblicizza alcun monte minuti mensile: tre trascrizioni al giorno, ciascuna fino a 30 minuti, un file alla volta, con priorità in coda più bassa. Tre file da 30 minuti al giorno fanno 90 minuti di audio, ben oltre i 120 mensili di Notta nel giro di due giorni. Ma un'intervista di 47 minuti continua a non entrare, perché il vincolo che morde è di nuovo il limite per file. Dovreste dividere la registrazione, e ogni taglio vi costa la continuità di chi parla attraverso il taglio stesso.
Transkriptor e Maestra sciolgono la tensione in un altro modo: per lo più non hanno un piano gratuito. I piani pubblicati di Transkriptor partono da Lite, 9,99 $ al mese per 300 minuti di trascrizione, e salgono fino a Pro a 19,99 $ per 2.400 minuti (8,33 $ al mese se pagate 99,99 $ per l'anno). Maestra vende crediti a consumo a 12 $ ogni 60 minuti, con Lite a 23 $ al mese per 180 minuti. Entrambi elencano l'indonesiano; la tabella lingue di Maestra segna l'indonesiano come supportato per trascrizione, traduzione, voiceover e tempo reale allo stesso modo. Nessuno dei due pubblica un monte gratuito ricorrente, il che è una forma di onestà a sé.
L'indonesiano è migliorato in modo misurabile il 7 agosto — su un solo percorso
Qualcosa di reale è successo al riconoscimento del parlato indonesiano questo mese, e quasi nessuno di quelli che scrivono di «strumenti di trascrizione AI» l'ha citato.
Il 7 agosto 2026 Deepgram ha rilasciato modelli monolingui Nova-3 migliorati e ha aggiunto l'armeno. Il changelog è specifico in un modo raro per gli annunci dei fornitori. Sotto Batch models: tamil e indonesiano. Sotto Streaming models: tamil e bielorusso.
L'indonesiano compare in un elenco e non nell'altro.
Lo stesso rilascio ha migliorato l'indonesiano in batch e il bielorusso in streaming. «Supporto migliorato per l'indonesiano» non è un fatto solo. Fonte: changelog di Deepgram, 7 agosto 2026.
Quella distinzione cade in pieno sul lavoro di intervista. Batch è il percorso che segue un file caricato: il motore vede l'intera registrazione, può usare il contesto in entrambe le direzioni e non sta rincorrendo un buffer audio dal vivo. Streaming è il percorso dei sottotitoli in diretta. Se registrate un'intervista e la caricate dopo, siete sul percorso batch, che è il percorso su cui l'indonesiano è migliorato questo mese. Se speravate in sottotitoli indonesiani accurati durante l'intervista stessa, quel modello specifico il 7 agosto non è cambiato.
La versione lunga di questo ragionamento l'abbiamo scritta in cosa nasconde davvero la parola «supportata» nella copertura linguistica del riconoscimento vocale, perché lo schema si ripete in tutto il settore: una lingua non è supportata o non supportata, è supportata su un percorso, in una modalità, a un livello di qualità, a una certa data. Per la trascrizione di interviste, in particolare, la buona notizia è che il percorso che vi serve è proprio quello che è migliorato.
Nessuno pubblica un benchmark di accuratezza per l'indonesiano, quindi il benchmark dovete essere voi
Ecco la parte scomoda dello scrivere un confronto onesto: non possiamo darvi una tabella di WER per l'indonesiano, perché non ne esiste una pubblica e credibile.
La Open ASR Leaderboard — la cosa più vicina a un tabellone neutrale che il settore abbia — ha tenuto una scheda multilingue con sole lingue europee fino al 28 agosto 2026, quando Hugging Face e Voice Arena hanno aggiunto l'hindi come sua prima lingua del Sud globale. L'indonesiano, con circa 280 milioni di persone nel suo mercato d'origine, ancora non c'è. I fornitori pubblicano dichiarazioni di accuratezza per l'inglese e tacciono altrove.
La struttura stessa di Whisper suggerisce la medesima asimmetria. Il tokenizer di OpenAI dichiara 100 token di lingua, e l'indonesiano sta alla posizione 17 di quella tabella — rispettabile, ampiamente davanti alla maggior parte dell'elenco, e lontanissimo dal volume di dati che sta dietro a inglese, cinese o spagnolo. Un token dichiarato non è una garanzia di qualità: è la dichiarazione che il modello proverà a gestire quella lingua.
Quindi la conclusione operativa onesta è questa: per l'indonesiano, il benchmark è il vostro audio. Non il file demo del fornitore, non una classifica, non le stelline di un sito di recensioni. Il vostro registratore, la vostra stanza, l'accento regionale del vostro intervistato, il vocabolario del vostro settore. Sembra una scappatoia finché non vi accorgete che farlo per bene richiede una ventina di minuti.
Il test dei 5 minuti: fatelo prima di pagare chiunque
Prendete una fetta di cinque minuti di un'intervista vera — meglio se con due voci, rumore di fondo e almeno tre nomi propri. Passatela a ogni candidato. Poi controllate cinque cose, in quest'ordine.
- Contate gli errori sui nomi propri. Nomi di persone, aziende, luoghi e termini di prodotto. È lì che l'ASR indonesiano fallisce in modo affidabile ed è lì che un errore fa il danno maggiore a valle, perché un nome sbagliato si propaga in silenzio in ogni riepilogo e in ogni citazione che genererete dopo. Cinque errori in cinque minuti sono circa 47 nella vostra intervista.
- Controllate espressamente le righe con lingue miste. Trovate una frase in cui una parola inglese sta dentro una proposizione indonesiana e leggete cosa ha prodotto lo strumento. È il test più predittivo che esista per l'audio professionale in indonesiano, ed è quello che nessuna pagina di fornitore affronta.
- Verificate le etichette di chi parla al minuto cinque, non al minuto uno. La diarizzazione sembra quasi sempre perfetta nei primi secondi. Quello che conta è se il Parlante A è ancora il Parlante A dopo la prima interruzione, sovrapposizione o pausa lunga.
- Cercate timestamp su cui possiate agire. Se un giorno dovrete verificare una citazione contro l'audio, vi servono timestamp riga per riga nell'esportazione, non solo nel player web. Giornalisti e ricercatori qualitativi dovrebbero considerarlo obbligatorio.
- Esportate il file e apritelo altrove. TXT, DOCX, SRT, VTT — quello che serve al vostro flusso di lavoro. È qui che i piani gratuiti si fermano più spesso, e una trascrizione che non riuscite a tirare fuori dallo strumento è una demo, non un documento.
I cinque controlli, nell'ordine in cui una valutazione reale li incontra.
Se vi interessa il flusso di lavoro che viene dopo la scelta dello strumento — rileggere la trascrizione prima di fidarvi del riepilogo, tenere le citazioni legate all'audio di origine — ne abbiamo parlato a parte in trasformare l'audio di un'intervista in una trascrizione e un riepilogo verificabili.
Dove si rompono davvero le interviste in indonesiano: la parola inglese in mezzo alla frase
L'indonesiano professionale non è monolingue. «Nanti kita follow up setelah meeting dengan tim product» non è indonesiano sgrammaticato: è come parla un product manager a Giacarta, e all'incirca come parlano anche un recruiter, un consulente e un fondatore di startup. Qualsiasi trascrizione che storpi i frammenti inglesi ha storpiato esattamente i termini su cui poggiano i vostri appunti.
È la cosa più difficile della categoria, e vale la pena capire perché. La maggior parte dei motori vocali esegue un solo modello monolingue per richiesta. Impostate la lingua su indonesiano e il modello è al meglio sulla fonetica e sul lessico indonesiani — il che significa che una parola inglese che arriva a metà frase viene traslitterata in qualcosa dalla forma indonesiana oppure lasciata cadere. Impostare la lingua su inglese ribalta semplicemente il danno. Esistono modalità multilingua o di code-switching, ma sono più strette degli elenchi monolingui: ad agosto 2026 Nova-3 di Deepgram documenta 58 lingue una alla volta e il code-switching in esattamente 10.
Due mitigazioni pratiche, entrambe a costo zero. Primo: impostate esplicitamente la lingua di partenza su indonesiano invece di lasciare acceso il rilevamento automatico — il rilevamento si impegna su un'ipotesi tratta dai secondi meno contestualizzati dell'intero file, e un'ipotesi sbagliata degrada tutto ciò che viene dopo in un colpo solo. Secondo: se lo strumento offre un vocabolario personalizzato o una lista di parole chiave, metteteci i vostri termini inglesi ricorrenti e i nomi propri prima dell'elaborazione, non dopo.
Chiamatelo il problema gado-gado, dal piatto indonesiano in cui ingredienti diversi arrivano mescolati sotto un'unica salsa: l'audio è misto per progetto, e ogni motore vuole servirvelo come un piatto solo.
Se sapete scrivere codice, trascrivere costa meno di un caffè
Il confronto tra piani gratuiti cambia completamente forma se siete disposti a toccare un'API, e vale la pena conoscere i numeri anche se poi decidete di no.
OpenAI chiede 0,006 $ al minuto per gpt-4o-transcribe e 0,003 $ al minuto per la variante mini. La vostra intervista da 47 minuti costa 28 centesimi, o 14 centesimi con mini. Google Cloud Speech-to-Text regala i primi 60 minuti al mese, poi chiede 0,016 $ al minuto con il log dei dati attivo e 0,024 $ senza, ed elenca id-ID sia sul modello chirp sia su chirp_2 nella regione asia-southeast1. Whisper ha licenza MIT e non costa nulla oltre al vostro hardware.
A questi prezzi il riconoscimento in sé è quasi gratis. Quello che state davvero comprando da un prodotto consumer è tutto il resto: un'interfaccia di caricamento, le etichette di chi parla, i timestamp, un editor, la ricerca tra le vecchie interviste, i riepiloghi, le esportazioni e un posto in cui il documento esiste ancora fra sei mesi.
È questa l'inquadratura onesta della scelta tra costruire e comprare. Se fate tre interviste all'anno e sapete lanciare uno script Python, lanciate lo script. Se ne fate tre a settimana e vi serve ritrovare una citazione di marzo, non state cercando un riconoscitore — state cercando un archivio con un riconoscitore attaccato.
Quello che nessun piano gratuito farà per voi
Onestà per onestà: ecco i limiti che valgono per ogni opzione sul tavolo, la nostra compresa.
I piani gratuiti non vi danno una diarizzazione affidabile di chi parla. È una delle parti più costose della pipeline ed è riservata di routine ai piani a pagamento in tutta la categoria. Se separare due voci è essenziale per il vostro lavoro, mettetelo a budget invece di sperare.
I piani gratuiti non promettono conservazione. Lo storage costa, e lo storage gratuito è una cortesia revocabile con un cambio di policy. Esportate tutto ciò che conta e tenetevi una copia — che è anche la risposta alla domanda sul lock-in del fornitore, quella che nessuno si pone finché non deve andarsene.
I piani gratuiti non alzano il pavimento di accuratezza per i vostri specifici parlanti. Accenti regionali, intervistati anziani, audio da telefono e code-switching pesante degradano tutti l'output, e nessun livello di piano cambia l'esposizione del modello sottostante al vostro audio. Pagare di più vi compra minuti e funzioni, non un riconoscitore diverso.
E nessuno strumento, gratuito o a pagamento, elimina il passaggio di revisione. Un riepilogo AI costruito su una trascrizione non riletta eredita ogni errore che c'è dentro, con sicurezza e senza farsi vedere.
In sostanza: il numero da confrontare non sono i minuti, sono le interviste
Ogni piano gratuito di questa categoria pubblicizza una quantità di tempo. Per il lavoro di intervista è l'unità sbagliata, perché il tempo conta solo se arriva in un unico pezzo continuo. Centoventi minuti tagliati in fette da tre minuti valgono per un giornalista meno di trenta minuti ininterrotti, ed entrambi valgono meno di sessanta minuti che reggono un'intera conversazione con le etichette di chi parla intatte.
Quindi, quando confrontate gli strumenti, convertite ogni piano gratuito nell'unica valuta che conta per voi: quante delle mie interviste reali questo strumento trascrive, dall'inizio alla fine, senza dividere il file? Per diversi piani gratuiti molto noti la risposta onesta è zero, e sulla pagina prezzi non ve lo diranno.
Il livello del riconoscimento è una commodity diretta verso un terzo di centesimo al minuto. Ciò che resta scarso per l'indonesiano è un documento che potete consultare, correggere, citare e ritrovare ancora il trimestre prossimo.
Dove si colloca Telli.sh: siamo una delle opzioni qui sopra e su questo saremo precisi. Il piano Free di Telli.sh è di 60 minuti al mese — meno minuti da titolo dei 120 di Notta, e deliberatamente non affettati da un limite di tre minuti per registrazione, così un'intervista intera entra come un unico file. Ottenete la trascrizione in indonesiano, la traduzione in una qualsiasi di 44 lingue di destinazione, un riepilogo AI generato a partire dalla trascrizione e un'interfaccia disponibile in 15 lingue, indonesiano incluso. Oltre i 60 minuti al mese è un prodotto a pagamento, e se il vostro volume è basso e sapete lanciare uno script la via dell'API costa davvero meno. Fate il test dei 5 minuti su di noi esattamente come lo fareste su chiunque altro.
Carica la registrazione di un'intervista
Fonti
- Deepgram, "Nova-3 Adds Armenian, Plus Improved Models for Tamil, Indonesian, and Belarusian", changelog datato 7 agosto 2026 — modelli batch migliorati per tamil e indonesiano, modelli streaming migliorati per tamil e bielorusso, armeno (
hy) aggiunto per entrambi. - Hugging Face e Voice Arena, "The Open ASR Leaderboard Adds Its First Global South Language", 28 agosto 2026 — l'hindi come prima lingua del Sud globale nella classifica.
- Prezzi di Notta, consultati il 31 agosto 2026 — piano Free con 120 minuti/mese, massimo 3 minuti per registrazione, 50 caricamenti di file/mese, 10 riepiloghi AI/mese; Pro a 8,17 $/mese con fatturazione annuale e 1.800 minuti/mese.
- Prezzi di Transkriptor, consultati il 31 agosto 2026 — Lite 9,99 $/mese (300 minuti), Pro 19,99 $/mese (2.400 minuti, 99,99 $/anno con fatturazione annuale), Team 30 $/postazione/mese (3.000 minuti per postazione).
- Prezzi di Maestra e lingue supportate da Maestra, consultati il 31 agosto 2026 — consumo a consumo a 12 $ ogni 60 crediti, Lite a 23 $/mese per 180 minuti; indonesiano elencato per trascrizione, traduzione, voiceover e tempo reale.
- Prezzi di TurboScribe come acquisiti dall'Internet Archive — piano gratuito con 3 trascrizioni al giorno, tetto di 30 minuti per file e caricamento di un file alla volta; Unlimited a 10 $/mese, 120 $ con fatturazione annuale, file da 10 ore. La pagina live restituisce un HTTP 403 al recupero automatico: trattate queste cifre come indicative e confermatele sul sito.
- Prezzi di Google Cloud Speech-to-Text e lingue supportate, consultati il 31 agosto 2026 — primi 60 minuti al mese gratuiti, 0,016 $/min con log dei dati e 0,024 $/min senza;
id-IDsuchirpechirp_2inasia-southeast1. - Prezzi dell'API OpenAI, consultati il 31 agosto 2026 —
gpt-4o-transcribea 0,006 $/minuto,gpt-4o-mini-transcribea 0,003 $/minuto. - OpenAI Whisper, con licenza MIT; la tabella
LANGUAGESdel tokenizer dichiara 100 lingue con l'indonesiano (id) alla posizione 17, consultata il 31 agosto 2026.