Google akan menerjemahkan rapat bahasa Vietnam Anda secara langsung. Tapi tidak akan mencatat sepatah kata pun.
Teks terjemahan Google Meet mencakup 69 bahasa termasuk bahasa Vietnam, dan fitur Live translate di Google Translate mencakup 74. Fitur Transcripts di Meet dan pencatat Gemini miliknya masing-masing hanya mendukung 8 bahasa, dan bahasa Vietnam tidak ada di keduanya. DeepL Voice hanya bisa mentranskripsi ucapan bahasa Vietnam lewat penyedia pihak ketiga yang harus diaktifkan admin dan tidak bisa memakai deteksi otomatis. Kami menelusuri apa yang sebenarnya diberikan terjemahan suara langsung kepada tim Vietnam pada 2026 — dan apa yang tidak pernah diberikannya.
Ketik 'terjemahan suara langsung' dalam bahasa Vietnam di Google, dan Anda akan mendapat jawaban yang benar-benar bagus. Fitur Live translate di Google Translate mendukung 74 bahasa, termasuk bahasa Vietnam, baik di Android maupun iOS. Fitur ini berjalan dengan atau tanpa headphone, tetap bekerja saat layar terkunci, dan menawarkan mode tatap muka yang membagi layar ponsel menjadi dua agar setiap pembicara membaca sisinya masing-masing.
Fiturnya berfungsi. Bukan itu bagian yang menarik.
Bagian yang menarik adalah apa yang terjadi di platform yang sama empat jam kemudian, saat Anda ingin tahu apa sebenarnya yang disepakati. Fitur Transcripts di Google Meet — yang menghasilkan dokumen Google permanen — hanya mendukung delapan bahasa, dan bahasa Vietnam bukan salah satunya. Bahasa Vietnam juga tidak termasuk dalam delapan bahasa yang didukung fitur 'Take notes for me' di Meet, yang halaman bantuannya sendiri menambahkan bahwa fitur ini 'mendukung satu bahasa dalam satu waktu' dan bahwa 'beberapa bahasa yang diucapkan dalam rapat yang sama saat ini belum didukung'.
TL;DR
- Bahasa Vietnam didukung oleh setiap layanan Google yang mendengarkan: Live translate (74 bahasa), teks terjemahan Meet (69 bahasa). Bahasa ini tidak didukung oleh satu pun layanan Google yang menuliskan: Meet Transcripts dan pencatat Gemini di Meet, masing-masing 8 bahasa.
- DeepL Voice bisa menampilkan teks dalam bahasa Vietnam, tetapi tidak bisa mentranskripsi ucapan bahasa Vietnam dengan modelnya sendiri — bahasa Vietnam berada di lapisan pihak ketiga yang harus diaktifkan admin dan tidak bisa memakai deteksi otomatis.
- Artikel ini memetakan persis di mana dukungan bahasa Vietnam berhenti pada setiap platform besar per 31 Agustus 2026, dan memberikan prosedur enam langkah untuk menjalankan rapat Vietnam–Inggris yang meninggalkan rekam jejak.
Kami sudah menyampaikan versi umum dari argumen ini tadi pagi, dengan melihat apa yang terjadi ketika terjemahannya sangat baik tetapi lenyap sebelum makan malam. Yang ini lebih spesifik dan, bagi tim Vietnam, lebih buruk: masalahnya bukan sekadar bahwa alat langsung mudah lupa. Masalahnya, fitur-fitur yang bertugas mengingat justru melewatkan bahasa Vietnam.
Apa yang sebenarnya diberikan 'terjemahan suara langsung' untuk bahasa Vietnam hari ini
Mari mulai dengan perhitungan yang jujur, karena alat gratis Google memang sangat baik dalam pekerjaan yang menjadi tujuan pembuatannya.
Live translate di Google Translate hadir dengan empat mode, menurut halaman bantuan Android-nya yang diakses pada 31 Agustus 2026: Listening (dekatkan ponsel ke telinga atau gunakan headphone untuk mendengar terjemahan lawan bicara secara real-time), Conversation (terjemahan diputar dengan suara keras, pembicara bergantian), Text only (hanya dibaca, tanpa audio), dan Custom settings. Ada pula mode Face to face terpisah, di mana layar terbagi dua dan setiap pembicara melihat transkripsi sekaligus terjemahan bahasanya sendiri di paruh layarnya. Mikrofon otomatis mendeteksi kapan satu bahasa berhenti dan bahasa lain dimulai, jadi tak ada yang perlu menekan tombol di antara kalimat.
Dua detail layak mendapat apresiasi lebih besar daripada yang biasanya diberikan. Pertama, sesinya bertahan saat multitasking: dokumentasi Google menyatakan bahwa terjemahan 'berlanjut mulus saat Anda berpindah aplikasi, meminimalkan aplikasi, atau saat layar terkunci'. Kedua, bahasa Vietnam bisa diunduh untuk penggunaan offline, dan paket yang sudah diunduh dapat ditingkatkan ke versi berkualitas lebih tinggi dari layar yang sama — hal yang penting di negara tempat kunjungan lapangan atau lantai pabrik bukanlah lingkungan dengan konektivitas terjamin.
Satu keterbatasan perlu disebut terang-terangan karena kerap mengejutkan orang: ini adalah fitur ponsel. Halaman bantuan Google untuk versi web menyatakan dalam satu kalimat, 'Anda tidak bisa berbicara dan menerjemahkan secara bersamaan di Google Translate versi web'. Kalau rapat dwibahasa Anda berlangsung di laptop, Live translate tidak hadir di ruangan itu.
Inti persoalannya begini: untuk percakapan — di taksi, saat mengunjungi pemasok, obrolan di lorong dengan klien yang berkunjung — ini nyaris jadi masalah yang sudah tuntas, gratis pula, dan kami akan merekomendasikannya tanpa ragu. Kegagalannya bukan di percakapan. Kegagalannya ada di rapat.
Gemini 3.5 Live Translate membawa Meet dari lima bahasa ke lebih dari tujuh puluh
Gambarannya juga bergerak cepat, dan bergerak ke arah yang menguntungkan penutur bahasa Vietnam.
Pada 9 Juni 2026, Google mengumumkan Gemini 3.5 Live Translate, model terjemahan suara-ke-suara yang mencakup lebih dari 70 bahasa. Seperti dilaporkan Slator pada 16 Juni 2026, model ini digulirkan melalui Gemini Live API dan Google AI Studio dalam pratinjau publik, masuk pratinjau privat di Google Meet untuk pelanggan Workspace tertentu, serta dirilis secara global di dalam aplikasi seluler Google Translate untuk Android dan iOS.
Angka yang penting bagi Meet adalah perbandingan sebelum dan sesudah. Terjemahan ucapan di Meet sebelumnya terbatas pada lima bahasa yang didukung, dengan terjemahan hanya dari dan ke bahasa Inggris. Gemini 3.5 Live Translate memperluasnya menjadi lebih dari 70 bahasa dan lebih dari 2.000 kombinasi pasangan bahasa, dengan ketersediaan yang lebih luas direncanakan menyusul pada 2026. Bagi tim Vietnam, sistem lima bahasa yang berporos pada bahasa Inggris praktis bukan sistem sama sekali; 2.000 pasangan adalah produk yang sama sekali berbeda.
Google memposisikan model ini secara sempit, dan itu justru pertanda baik. Menurut Slator, dokumentasinya mempertentangkan Live Translate dengan kemampuan Gemini Live Agent yang lebih luas: model ini berfungsi sebagai jalur terjemahan real-time, hanya menerima masukan audio, dan sengaja meniadakan function calling, search grounding, tools, serta system instructions. Ia adalah juru bahasa, bukan asisten — pembedaan yang sama yang ditarik OpenAI saat menjelaskan GPT-Realtime-Translate. Google juga menambahkan 'mode mendengarkan' di Android yang mengalirkan audio terjemahan lewat earpiece, sehingga Anda bisa mengikuti terjemahan tanpa terlihat mengenakan headphone dalam rapat.
Jadi lapisan langsung untuk bahasa Vietnam membaik dengan cepat dan dari beberapa arah sekaligus. Sekarang pertanyaan satunya.
Garis rekam: di mana bahasa Vietnam berhenti
Setiap platform punya garisnya. Di satu sisi ada fitur yang membantu Anda memahami ucapan saat ucapan itu terjadi. Di sisi lain ada fitur yang mengubah ucapan menjadi sesuatu yang masih Anda miliki minggu depan. Sebut saja garis rekam — dan bagi bahasa Vietnam, di situlah persis dukungannya lenyap.
Jumlah bahasa berasal dari Google sendiri, dari empat halaman bantuan yang diakses 31 Agustus 2026. Bahasa Vietnam muncul di kedua fitur mendengarkan dan tidak di satu pun fitur menulis.
Berikut informasi yang sama dalam bentuk tabel, karena ketimpangannya lebih mudah diperdebatkan ketika sudah dijajarkan.
| Fitur Google | Bahasa Vietnam didukung? | Bahasa | Meninggalkan artefak setelah rapat? |
|---|---|---|---|
| Google Translate — Live translate | Ya | 74 | Tidak |
| Google Meet — teks terjemahan | Ya | 69 | Hanya di layar; tertanam di rekaman bila Anda memakai Record captions |
| Google Meet — Transcripts | Tidak | 8 | Ya, sebuah dokumen Google |
| Google Meet — 'Take notes for me' | Tidak | 8, satu per satu | Ya, catatan di Google Docs plus ringkasan lewat email |
| Google Meet — Gemini 3.5 Live Translate | Sedang digulirkan | 5 saat ini, 70+ di pratinjau privat | Tidak disebutkan |
Semua baris bersumber dari halaman Bantuan Google dan laporan Slator tertanggal 16 Juni 2026, diakses 31 Agustus 2026.
Delapan bahasa yang dipakai bersama oleh Transcripts dan 'Take notes for me' persis sama: Inggris, Prancis, Jerman, Italia, Jepang, Korea, Portugis, dan Spanyol. Daftar yang sama diulang dua kali, dan itu adalah daftar pasar besar Eropa dan Asia Timur. Bahasa Vietnam — kira-kira 97 juta penutur, menurut hitungan Samsung sendiri dalam tulisannya tahun 2024 — berada di luar daftar itu, bersama bahasa Thai, Indonesia, Hindi, dan Arab.
Ada satu batasan lagi yang secara khusus menghantam tim dwibahasa, dan itu berlaku bahkan untuk tim yang sepenuhnya bekerja dalam bahasa-bahasa yang didukung. Halaman bantuan Google untuk 'Take notes for me' menyatakan bahwa fitur ini mendukung satu bahasa dalam satu waktu dan bahwa beberapa bahasa yang diucapkan dalam rapat yang sama saat ini belum didukung. Panggilan Vietnam–AS yang berganti-ganti antara bahasa Vietnam dan Inggris gugur dua kali: sekali karena bahasa Vietnam, sekali karena perpindahan bahasa.
Adil untuk Google: teks terjemahan memang punya jalur permanen. Jika Anda merekam rapat dan memilih Record captions, teksnya akan tertanam ke dalam rekaman. Anda juga bisa menggulir kembali teks terjemahan selama sesi berlangsung. Tetapi teks yang terbakar ke dalam berkas video bukanlah rekaman yang bisa dicari — Anda tidak bisa mencari di dalam piksel, tidak bisa mengoreksi nama orang, dan tidak bisa membuat ringkasan darinya. Teks terjemahan di Meet juga terbatas pada edisi Workspace berbayar: Business Standard, Business Plus, Enterprise Standard, Enterprise Plus, Enterprise Starter (tersedia hingga 30 Juni 2025), dan Google AI Pro for Education.
DeepL akan menampilkan teks bahasa Vietnam untuk Anda. Mentranskripsi ucapan bahasa Vietnam adalah kelas yang berbeda.
DeepL Voice adalah alternatif Barat yang paling kuat, dan kisah bahasa Vietnamnya adalah yang paling instruktif di sepanjang artikel ini — karena DeepL mendokumentasikan pembedaannya lebih baik daripada siapa pun.
DeepL membagi dukungan bahasa menjadi dua daftar. Bahasa lisan adalah yang diterima oleh mesin pengenal suara. Bahasa terjemahan adalah bahasa yang bisa ditampilkan sebagai teks. Bahasa Vietnam ada di daftar terjemahan, yang berjumlah 41 bahasa. Sekarang lihat sisi lainnya: model milik DeepL sendiri mentranskripsi 18 bahasa lisan — Mandarin, Ceko, Belanda, Inggris, Prancis, Jerman, Indonesia, Italia, Jepang, Korea, Polandia, Portugis, Rumania, Rusia, Spanyol, Swedia, Turki, dan Ukraina. Bahasa Vietnam tidak ada di antaranya.
Bahasa Vietnam tersedia sebagai bahasa lisan, tetapi hanya di lapisan kedua berisi 20 bahasa yang ditranskripsi oleh penyedia pihak ketiga, Speechmatics. Ada tiga syarat yang menyertainya, semuanya terdokumentasi di halaman bantuan DeepL yang diakses 31 Agustus 2026:
- Admin tim harus mengaktifkan pemrosesan pihak ketiga di akun admin organisasi sebelum bahasa-bahasa ini bisa dipakai sama sekali.
- Deteksi otomatis tidak berfungsi. Dalam kata-kata DeepL: 'Bahasa pihak ketiga tidak berfungsi dengan Auto-detect language — bahasa tersebut harus dipilih secara manual sebagai Spoken language'.
- Agar peserta bisa memilih sendiri bahasa lisannya, tuan rumah harus mengaktifkan kode akses saat menghubungkan rapat ke DeepL Voice.
Tidak ada yang tak masuk akal dari semua itu — DeepL mencatat bahwa Speechmatics beroperasi di bawah perjanjian tanpa penyimpanan, sehingga data transkripsi dihapus dari server mereka begitu selesai diproses. Namun tumpuk semua syarat itu dan Anda mendapat hasil praktisnya: seorang penutur bahasa Vietnam yang bergabung ke rapat berbekal DeepL hanya berjarak satu setelan admin yang belum dicentang dari tidak ditranskripsi sama sekali, dan tidak bisa mengandalkan sistem untuk menyadarinya secara otomatis. Sementara itu, sikap terhadap penyimpanan datanya sama persis dengan yang kami tulis pagi ini — FAQ DeepL menyebut data rapat 'diproses sementara di memori dan dihapus begitu panggilan berakhir'.
Samsung adalah contoh tandingan yang layak disebut namanya. Bahasa Vietnam termasuk dalam 16 bahasa pertama yang dirilis Galaxy AI, dan Samsung R&D Institute Vietnam menerbitkan catatan yang luar biasa terus terang pada 23 Mei 2024 tentang mengapa pekerjaan itu sulit. Bahasa Vietnam memiliki enam nada yang berbeda; contoh dalam artikel itu adalah ma, mả, dan má — hantu, kuburan, dan ibu — yang hanya berbeda pada nadanya. Bui Ngoc Tung, kepala tim ASR di institut tersebut, menggambarkan model yang membedakan bingkai audio berdurasi 'sekitar 20 milidetik' untuk memutuskan kata mana yang menjadi induk dari rangkaian bingkai itu. Ketika produsen ponsel Korea berinvestasi dalam pemodelan nada bahasa Vietnam sementara perusahaan terjemahan Eropa mengalihkannya ke subkontraktor, itu memberi tahu Anda sesuatu tentang bagaimana pasar menghargai bahasa ini.
Di sisi pasokan pengenalan suara, gambarannya lebih baik ketimbang sisi pencatatan: Nova-3 dari Deepgram mencantumkan bahasa Vietnam sebagai vi dalam dokumentasi model dan bahasanya, diakses 31 Agustus 2026 — satu dari 58 bahasa yang kami hitung dalam analisis kami tentang apa yang disembunyikan kata 'didukung' dalam cakupan speech-to-text.
Tak ada vendor yang mempublikasikan tingkat kesalahan untuk ucapan rapat berbahasa Vietnam, dan korpusnya menjelaskan alasannya
Kami mencari angka untuk menakar kualitas transkripsi bahasa Vietnam dalam rapat. Angka itu tidak ada, dan alasannya justru lebih berguna daripada angkanya sendiri.
Jam berlabel bukan keseluruhan cerita — ragam bahasanya yang menentukan. FLEURS berisi ucapan yang dibacakan; set pelatihan PhoWhisper mencakup beragam aksen; VietSuperSpeech adalah korpus pertama yang dibangun khusus untuk percakapan santai. Sumber beserta tanggalnya ada di daftar di bawah.
Tolok ukur yang selalu dikutip untuk bahasa Vietnam adalah FLEURS, yang menyediakan sekitar 12 jam ucapan bacaan per bahasa. Ucapan bacaan bukan ucapan rapat. PhoWhisper, yang dipresentasikan di jalur ICLR 2024 Tiny Papers, menyetel Whisper pada dataset bahasa Vietnam berdurasi 844 jam yang dipilih demi keberagaman aksen — sebuah langkah nyata menuju realisme. VietASR, terbit 23 Mei 2025, menempuh jalur berbeda — pra-pelatihan pada 70.000 jam audio tanpa label dan penyetelan hanya pada 50 jam berlabel — dan melaporkan hasil yang mengungguli Whisper Large-v3 serta sistem komersial pada data dunia nyata.
Lalu ada makalah yang mengucapkan bagian yang biasanya didiamkan. VietSuperSpeech, dirilis pada 2026, menghimpun 52.023 pasangan audio–teks dengan total 267,39 jam percakapan santai berbahasa Vietnam, terbagi menjadi 240,67 jam pelatihan dan 26,72 jam evaluasi, mencakup 13,8 juta karakter yang bertanda diakritik lengkap. Motivasi yang dinyatakannya adalah kalimat yang layak dikutip:
'Meskipun korpus seperti VLSP2020, VIET_BUD500, VietSpeech, FLEURS, VietMed, Sub-GigaSpeech2-Vi, viVoice, dan Sub-PhoAudioBook menyediakan cakupan luas untuk ucapan formal dan bacaan, tidak satu pun yang secara khusus menyasar ragam santai dan spontan yang sangat diperlukan bagi aplikasi AI percakapan.'
Delapan korpus bahasa Vietnam yang disebut namanya, dan sampai yang satu ini muncul, tak satu pun dibangun untuk cara orang benar-benar berbicara dalam rapat — memotong pembicaraan, berhati-hati memilih kata, beralih ke bahasa Inggris untuk nama produk, lalu menggantung kalimat. Angka akurasi apa pun yang dikutip vendor untuk bahasa Vietnam hampir pasti diukur pada seseorang yang sedang membaca naskah.
Konsekuensi operasionalnya sederhana dan sama dengan yang selalu kami sampaikan. Jika Anda tidak bisa memeriksa seberapa akurat transkripsi rapat Anda nantinya, satu-satunya pertahanan adalah transkrip yang bisa dibaca dan dikoreksi manusia. Yang mensyaratkan bahwa transkrip itu ada sejak awal.
Cara menjalankan rapat Vietnam–Inggris agar rekamannya bertahan
Enam langkah, sesuai urutan kejadiannya. Masing-masing menjawab satu kegagalan spesifik yang terdokumentasi di atas.
- Putuskan alat mana yang bertugas untuk pemahaman dan alat mana yang bertugas untuk rekaman — dan terimalah bahwa keduanya alat yang berbeda. Inilah seluruh isi artikel ini dalam satu baris. Google Translate atau teks Meet bisa menangani tugas pertama untuk bahasa Vietnam hari ini. Tidak satu pun menangani yang kedua.
- Tetapkan bahasa Vietnam sebagai bahasa lisan secara eksplisit; jangan mengandalkan deteksi otomatis. Di DeepL ini wajib — bahasa pihak ketiga, termasuk bahasa Vietnam, tidak bisa dideteksi otomatis. Di tempat lain pun ini tetap pilihan yang lebih baik, karena deteksi otomatis mengunci tebakannya pada beberapa detik pertama, tepat pada bagian audio yang paling minim konteks di seluruh sesi.
- Periksa daftar bahasa milik fitur perekamnya, bukan daftar milik platformnya. Jebakan yang membuat artikel ini ditulis adalah asumsi bahwa platform yang menerjemahkan bahasa Vietnam juga mentranskripsinya. Di Google Meet, 69 lawan 8 adalah jurang di antara dua asumsi itu.
- Angkat masalah campur kode sebelum rapat dimulai. Jika tim Anda menyelipkan nama produk berbahasa Inggris, ID tiket, dan akronim ke dalam kalimat bahasa Vietnam — dan setiap tim teknik offshore melakukannya — pastikan alat perekam Anda tahan menghadapi dua bahasa dalam satu sesi. Pencatat Meet secara eksplisit tidak tahan.
- Perbaiki nama diri dalam lima menit pertama, secara langsung. Tanda diakritik bahasa Vietnam dan nama sandi produk berbahasa Inggris adalah dua titik yang paling sering membuat transkripsi jebol, sekaligus dua titik di mana satu baris yang salah paling merusak ringkasan apa pun yang dibangun di atasnya. Mengoreksinya saat rapat berlangsung hanya butuh hitungan detik.
- Simpan teks sumber berbahasa Vietnam, terjemahan bahasa Inggris, dan ringkasannya dalam satu rekaman. Bukan tiga berkas di tiga alat. Terjemahan bersifat satu arah: tahun depan Anda bisa menerjemahkan ulang dari teks bahasa Vietnam dengan model yang lebih baik, tetapi Anda tidak akan pernah bisa memulihkan bahasa Vietnam dari bahasa Inggris.
Kalau yang Anda cari adalah panduan produk langkah demi langkah, bukan analisis pasar, panduan kami bulan Juni untuk tim Vietnam membahas secara tuntas cara mengubah rekaman rapat dwibahasa menjadi catatan AI yang siap ditinjau.
Kesimpulannya: bahasa Vietnam sudah menyeberangi jurang pemahaman, tetapi belum jurang rekaman
Sepanjang sebagian besar dekade terakhir, keluhan tentang bahasa Vietnam dalam rapat internasional adalah bahwa teknologinya belum cukup memahaminya. Pada 2026, keluhan itu sebagian besar sudah kedaluwarsa. Dengan 74 bahasa di Live translate, 69 di teks terjemahan Meet, lebih dari 2.000 pasangan bahasa yang segera hadir di Meet lewat Gemini 3.5 Live Translate, bahasa Vietnam di Nova-3, dan Samsung yang sudah merilis penerjemahan bahasa Vietnam langsung di perangkat sejak 2024, urusan pemahaman sudah beres.
Yang tidak bergerak adalah rekamannya. Dua fitur Google yang menghasilkan artefak permanen bersama-sama hanya mendukung delapan bahasa, delapan yang sama, dan bahasa Vietnam tidak ada di keduanya. DeepL akan menampilkan teks dalam bahasa Vietnam tetapi mengalihkan transkripsinya ke subkontraktor di balik satu tombol admin. Pasar telah memutuskan bahwa bahasa Vietnam layak didengarkan, tetapi belum layak dituliskan.
Jadi pertanyaan yang harus diajukan kepada vendor bukanlah apakah mereka mendukung bahasa Vietnam. Hampir semuanya sekarang menjawab ya, dan hampir semuanya memaksudkan separuh yang mendengarkan. Pertanyaannya adalah: fitur mana saja dari produk Anda yang mendukung bahasa Vietnam setelah rapat selesai — dan bisakah Anda menunjukkan daftar bahasa untuk fitur spesifik itu?
Di mana posisi Telli.sh: lapisan rekaman adalah lapisan yang kami bangun. Telli.sh mentranskripsi rapat dalam bahasa yang benar-benar diucapkan, menerjemahkannya ke 44 bahasa target termasuk bahasa Vietnam, dan menyimpan ketiga artefaknya dalam satu catatan — teks sumber berbahasa Vietnam, terjemahan yang sejajar dengannya, dan ringkasan yang dihasilkan di atasnya. Antarmukanya sendiri tersedia dalam 15 bahasa, termasuk bahasa Vietnam, sehingga tim di Da Nang dan klien di Sydney membaca rapat yang sama dalam bahasa masing-masing dan tetap berbagi satu rekaman yang bisa dikoreksi.
Mulai catatan rapat dengan terjemahan langsung
Sumber
- Bantuan Google Translate, "Hear live speech to speech translations with Live translate" (Android), diakses 31 Agustus 2026 — daftar 74 bahasa termasuk bahasa Vietnam, empat mode terjemahan, mode tatap muka, dan kelanjutan di latar belakang.
- Bantuan Google Translate, "Download languages to use offline" (Android), diakses 31 Agustus 2026 — paket offline dan peningkatan ke kualitas lebih tinggi.
- Bantuan Google Meet, "Use translated captions in Google Meet", diakses 31 Agustus 2026 — daftar 69 bahasa termasuk bahasa Vietnam, edisi Workspace berbayar, dan Record captions.
- Bantuan Google Meet, "Use Transcripts with Google Meet", diakses 31 Agustus 2026 — delapan bahasa transkrip yang didukung.
- Bantuan Google Meet, "'Take notes for me' in Google Meet", diakses 31 Agustus 2026 — delapan bahasa yang sama, dan batasan satu bahasa dalam satu waktu.
- Slator, "Google Expands AI Live Speech Translation with Gemini 3.5 Live Translate", 16 Juni 2026 — pengumuman 9 Juni, 70+ bahasa, Meet yang beranjak dari lima bahasa ke 2.000+ pasangan, dan mode mendengarkan.
- Pusat Bantuan DeepL, "DeepL Voice languages", diakses 31 Agustus 2026 — 18 bahasa lisan yang ditranskripsi DeepL, 20 bahasa lisan pihak ketiga termasuk bahasa Vietnam, 41 bahasa terjemahan, batasan deteksi otomatis, dan perjanjian tanpa penyimpanan dengan Speechmatics.
- Samsung Newsroom, "The Learning Curve, Part 3: Taking AI Data From Good to Great", 23 Mei 2024 — bahasa Vietnam di antara 16 bahasa pertama Galaxy AI, enam nada, contoh ma/mả/má, dan penjelasan bingkai ~20 ms.
- Deepgram, Models & Languages Overview, diakses 31 Agustus 2026 — bahasa Vietnam (
vi) dalam daftar bahasa Nova-3. - Le, Nguyen dan Nguyen, "PhoWhisper: Automatic Speech Recognition for Vietnamese", ICLR 2024 Tiny Papers — set penyetelan 844 jam dengan aksen beragam.
- "VietASR: Achieving Industry-level Vietnamese ASR with 50-hour labeled data and Large-Scale Speech Pretraining", 23 Mei 2025 — 70.000 jam tanpa label, 50 jam berlabel.
- "VietSuperSpeech: A Large-Scale Vietnamese Conversational Speech Dataset", 2026 — 52.023 pasangan, 267,39 jam, dan kesenjangan ragam bahasa pada delapan korpus.