ai translation18 min de leitura

O Google vai traduzir sua reunião em vietnamita em tempo real. E não vai registrar uma única palavra.

As legendas traduzidas do Google Meet cobrem 69 idiomas, incluindo o vietnamita, e o Live translate do Google Tradutor cobre 74. O recurso Transcripts do Meet e seu anotador do Gemini suportam exatamente 8 idiomas cada, e o vietnamita não está em nenhum dos dois. O DeepL Voice só consegue transcrever vietnamita falado por meio de um provedor terceirizado que precisa ser habilitado por um administrador e não funciona com detecção automática. Uma análise do que a tradução de voz ao vivo realmente entrega às equipes vietnamitas em 2026 — e do que ela nunca entrega.

K
Ken Jo
#vietnamese#live-translation#google-translate#google-meet#meeting-notes#sea#asr#multilingual-meetings

Pesquise por tradução de voz ao vivo em vietnamita no Google e você chega a uma resposta genuinamente boa. O recurso Live translate do Google Tradutor suporta 74 idiomas, o vietnamita entre eles, tanto no Android quanto no iOS. Funciona com ou sem fones de ouvido, continua ativo quando a tela é bloqueada e oferece um modo cara a cara que divide o celular ao meio para que cada pessoa leia o seu próprio lado.

Funciona. E não é essa a parte interessante.

A parte interessante é o que acontece na mesma plataforma quatro horas depois, quando você quer saber o que de fato ficou acordado. O recurso Transcripts do Google Meet — aquele que gera um Google Doc duradouro — suporta exatamente oito idiomas, e o vietnamita não é um deles. Nem está entre os oito suportados pelo «Take notes for me» do Meet, cuja própria página de ajuda acrescenta que o recurso «suporta um idioma por vez» e que «vários idiomas falados na mesma reunião não são suportados atualmente».

Resumo

  • O vietnamita é suportado por todas as superfícies do Google que escutam: Live translate (74 idiomas), legendas traduzidas do Meet (69 idiomas). E não é suportado por nenhuma das superfícies do Google que escrevem: Transcripts do Meet e o anotador do Gemini no Meet, 8 idiomas cada.
  • O DeepL Voice consegue exibir legendas em vietnamita, mas não consegue transcrever vietnamita falado com seus próprios modelos — o vietnamita fica em uma camada de terceiros que um administrador precisa habilitar e que não funciona com detecção automática.
  • Este texto mapeia exatamente onde o vietnamita para em cada grande plataforma na data de 31 de agosto de 2026, e traz um procedimento de seis passos para conduzir uma reunião vietnamita–inglês que deixe um registro para trás.

Fizemos a versão geral desse argumento mais cedo hoje, olhando para o que acontece quando a tradução é excelente e some antes do jantar. Esta aqui é mais específica e, para equipes vietnamitas, pior: o problema não é só que as ferramentas ao vivo esquecem. É que os recursos que lembram pulam justamente o vietnamita.

O que a «tradução de voz ao vivo» realmente entrega em vietnamita hoje

Vamos começar pela contabilidade honesta, porque as ferramentas gratuitas do Google são muito boas naquilo para que foram construídas.

O Live translate do Google Tradutor traz quatro modos, segundo sua página de ajuda para Android consultada em 31 de agosto de 2026: Listening (encoste o celular no ouvido ou use fones para a tradução em tempo real de outra pessoa), Conversation (as traduções são reproduzidas em voz alta e os falantes se alternam), Text only (leitura, sem áudio) e Custom settings. Há também um modo Face to face separado, no qual a tela se divide e cada falante vê tanto a transcrição quanto a tradução do seu próprio idioma em sua metade. O microfone detecta automaticamente quando um idioma para e o outro começa, então ninguém precisa tocar em um botão entre uma frase e outra.

Dois detalhes merecem mais crédito do que costumam receber. Primeiro, a sessão sobrevive ao multitarefa: a documentação do Google afirma que a tradução «continua sem interrupções quando você troca de aplicativo, minimiza o aplicativo ou quando a tela é bloqueada». Segundo, o vietnamita pode ser baixado para uso offline, e os pacotes baixados podem ser atualizados para uma versão de qualidade superior na mesma tela — o que importa em um país onde uma visita técnica ou o chão de fábrica não são ambientes de conectividade garantida.

Uma limitação vale ser dita com todas as letras, porque surpreende as pessoas: isto é um recurso de celular. A própria página de ajuda do Google para a versão web diz, em uma frase: «Você não pode falar e traduzir ao mesmo tempo no Google Tradutor para a web». Se a sua reunião bilíngue acontece em um notebook, o Live translate não está na sala.

O ponto é este: para uma conversa — um táxi, uma visita a fornecedor, um papo de corredor com um cliente visitante — isso está perto de ser um problema resolvido, não custa nada, e nós recomendaríamos sem hesitar. A falha não está na conversa. Está na reunião.

O Gemini 3.5 Live Translate leva o Meet de cinco idiomas para mais de setenta

O cenário também está se movendo rápido, e a favor de quem fala vietnamita.

Em 9 de junho de 2026, o Google anunciou o Gemini 3.5 Live Translate, um modelo de tradução fala-a-fala que cobre mais de 70 idiomas. Como a Slator informou em 16 de junho de 2026, ele está sendo lançado pela Gemini Live API e pelo Google AI Studio em prévia pública, entrando em prévia privada no Google Meet para clientes Workspace selecionados, e chegando globalmente dentro do aplicativo móvel do Google Tradutor no Android e no iOS.

O número que importa para o Meet é o antes e depois. A tradução de fala no Meet estava limitada a cinco idiomas suportados, com tradução apenas de e para o inglês. O Gemini 3.5 Live Translate expande isso para mais de 70 idiomas e mais de 2.000 combinações de pares de idiomas, com disponibilidade mais ampla prevista para o final de 2026. Para uma equipe vietnamita, um sistema de cinco idiomas com pivô em inglês era, na prática, sistema nenhum; 2.000 pares são outro produto.

O Google está posicionando o modelo de forma restrita, o que é um bom sinal e não um mau sinal. Segundo a Slator, a documentação contrasta o Live Translate com as capacidades mais amplas de Live Agent do Gemini: ele funciona como um pipeline de tradução em tempo real, aceita entrada apenas de áudio e omite deliberadamente chamada de funções, ancoragem em busca, ferramentas e instruções de sistema. É um intérprete, não um assistente — a mesma distinção que a OpenAI fez ao descrever o GPT-Realtime-Translate. O Google também adicionou um «modo de escuta» no Android que envia o áudio traduzido pelo alto-falante do ouvido, para você acompanhar uma tradução sem usar fones visíveis em uma reunião.

Ou seja: a camada ao vivo para o vietnamita está melhorando rápido e por várias frentes ao mesmo tempo. Agora, a outra pergunta.

A linha do registro: onde o vietnamita para

Toda plataforma tem uma linha. De um lado estão os recursos que ajudam você a entender a fala no momento em que ela acontece. Do outro, os recursos que transformam a fala em algo que você ainda terá na semana que vem. Chame isso de a linha do registro — e, para o vietnamita, é exatamente ali que o suporte desaparece.

Diagrama mostrando o vietnamita suportado nos recursos de escuta do Google e ausente dos seus recursos de escrita

As contagens de idiomas são do próprio Google, extraídas de quatro páginas de ajuda consultadas em 31 de agosto de 2026. O vietnamita aparece nos dois recursos de escuta e em nenhum recurso de escrita.

Aqui está a mesma informação em forma de tabela, porque a assimetria fica mais fácil de contestar quando está alinhada.

Recurso do GoogleVietnamita suportado?IdiomasDeixa um artefato depois da chamada?
Google Tradutor — Live translateSim74Não
Google Meet — legendas traduzidasSim69Só na tela; embutidas no vídeo se você usar Record captions
Google Meet — TranscriptsNão8Sim, um Google Doc
Google Meet — «Take notes for me»Não8, um por vezSim, notas no Google Docs mais um resumo por e-mail
Google Meet — Gemini 3.5 Live TranslateEm implantação5 hoje, 70+ em prévia privadaNão informado

Todas as linhas vêm de páginas de Ajuda do Google e do relatório da Slator de 16 de junho de 2026, consultados em 31 de agosto de 2026.

Os oito idiomas compartilhados por Transcripts e «Take notes for me» são idênticos: inglês, francês, alemão, italiano, japonês, coreano, português e espanhol. É a mesma lista duas vezes, e é uma lista de grandes mercados europeus e do Leste Asiático. O vietnamita — cerca de 97 milhões de falantes, pela própria contagem da Samsung em seu relato de 2024 sobre o trabalho — está fora dela, ao lado do tailandês, do indonésio, do hindi e do árabe.

Há mais uma restrição que atinge especificamente equipes bilíngues, e que se aplica mesmo a equipes que trabalham inteiramente em idiomas suportados. A página de ajuda do Google para «Take notes for me» afirma que o recurso suporta um idioma por vez e que vários idiomas falados na mesma reunião não são suportados atualmente. Uma chamada Vietnã–EUA que alterna entre vietnamita e inglês é desqualificada duas vezes: uma por ser vietnamita, outra por alternar.

Para ser justo com o Google: as legendas traduzidas têm, sim, um caminho de persistência. Se você gravar a reunião e selecionar Record captions, as legendas ficam embutidas no vídeo. E é possível rolar de volta pelas legendas traduzidas durante a sessão. Mas legendas queimadas em um arquivo de vídeo não são um registro pesquisável — você não pode fazer grep em um pixel, não pode corrigir um nome e não pode gerar um resumo a partir disso. As legendas traduzidas no Meet também estão restritas às edições pagas do Workspace: Business Standard, Business Plus, Enterprise Standard, Enterprise Plus, Enterprise Starter (disponível até 30 de junho de 2025) e Google AI Pro for Education.

O DeepL vai mostrar legendas em vietnamita. Transcrever vietnamita falado é outra camada.

O DeepL Voice é a alternativa ocidental mais forte, e sua história com o vietnamita é a mais instrutiva de todo este texto — porque o DeepL documenta a distinção melhor do que qualquer outro.

O DeepL divide o suporte a idiomas em duas listas. Idiomas falados são os que o reconhecedor aceita. Idiomas de tradução são aqueles em que as legendas podem ser exibidas. O vietnamita aparece na lista de tradução, que chega a 41 idiomas. Agora olhe para o outro lado: os modelos próprios do DeepL transcrevem 18 idiomas falados — chinês (mandarim), tcheco, holandês, inglês, francês, alemão, indonésio, italiano, japonês, coreano, polonês, português, romeno, russo, espanhol, sueco, turco e ucraniano. O vietnamita não está entre eles.

O vietnamita está disponível como idioma falado, mas apenas em uma segunda camada de 20 idiomas transcritos por um provedor terceirizado, a Speechmatics. Três condições vêm junto, todas documentadas na página de ajuda do DeepL consultada em 31 de agosto de 2026:

  1. Um administrador da equipe precisa habilitar o processamento por terceiros na conta de administrador da organização antes que qualquer um desses idiomas funcione.
  2. A detecção automática não funciona. Nas palavras do DeepL: «Idiomas de terceiros não funcionam com Auto-detect language — eles precisam ser selecionados manualmente como Spoken language».
  3. Para permitir que os participantes escolham seu próprio idioma falado, o anfitrião precisa habilitar um código de acesso ao conectar a reunião ao DeepL Voice.

Nada disso é irracional — o DeepL observa que a Speechmatics opera sob um acordo de retenção zero, então os dados de transcrição são excluídos dos servidores deles assim que processados. Mas empilhe os requisitos e você chega ao resultado prático: uma pessoa que fala vietnamita entrando em uma reunião equipada com DeepL está a uma configuração de administrador desmarcada de não ser transcrita, e não pode contar com o sistema para notá-la automaticamente. Enquanto isso, a postura de retenção é a mesma sobre a qual escrevemos esta manhã — o FAQ do DeepL diz que os dados da reunião são «processados temporariamente na memória e excluídos quando a chamada termina».

A Samsung é o contraexemplo que vale nomear. O vietnamita esteve entre os 16 primeiros idiomas lançados pela Galaxy AI, e o Samsung R&D Institute Vietnam publicou em 23 de maio de 2024 um relato incomumente franco sobre por que aquilo foi difícil. O vietnamita tem seis tons distintos; o exemplo do artigo é que ma, mả e — fantasma, túmulo e mãe — diferem apenas pelo tom. Bui Ngoc Tung, líder de ASR do instituto, descreveu um modelo que diferencia quadros de áudio de «cerca de 20 milissegundos» para decidir a qual palavra pertence uma sequência de quadros. Quando uma fabricante coreana de celulares investe em modelagem tonal do vietnamita e uma empresa europeia de tradução repassa o idioma a um subcontratado, isso diz algo sobre como o mercado precifica essa língua.

Do lado da oferta de reconhecimento de fala, o quadro é melhor do que o das anotações: o Nova-3 da Deepgram lista o vietnamita como vi em sua documentação de modelos e idiomas, consultada em 31 de agosto de 2026 — um dos 58 idiomas que contamos em nossa análise do que a palavra «suportado» esconde na cobertura de fala para texto.

Nenhum fornecedor publica uma taxa de erro para fala vietnamita em reuniões, e os corpora explicam por quê

Fomos atrás de um número para colocar na qualidade da transcrição de vietnamita em reuniões. Ele não existe, e a razão é mais útil do que o número teria sido.

Gráfico de barras com a contagem de horas rotuladas de três corpora de fala vietnamita, anotado por registro de fala

As horas rotuladas não são a história toda — o registro é. O FLEURS é fala lida; o conjunto de treinamento do PhoWhisper abrange sotaques; o VietSuperSpeech é o primeiro corpus construído especificamente para conversa informal. Fontes datadas na lista abaixo.

O benchmark que todo mundo cita para o vietnamita é o FLEURS, que fornece cerca de 12 horas de fala lida em voz alta por idioma. Fala lida não é fala de reunião. O PhoWhisper, apresentado na trilha Tiny Papers da ICLR 2024, fez fine-tuning do Whisper em um conjunto de dados vietnamita de 844 horas escolhido pela diversidade de sotaques, o que é um passo real em direção ao realismo. O VietASR, publicado em 23 de maio de 2025, seguiu outro caminho — pré-treinamento em 70.000 horas de áudio não rotulado e fine-tuning em apenas 50 horas rotuladas — e relata superar o Whisper Large-v3 e sistemas comerciais em dados do mundo real.

E então há o artigo que diz em voz alta o que ninguém diz. O VietSuperSpeech, lançado em 2026, reúne 52.023 pares de áudio e texto totalizando 267,39 horas de vietnamita conversacional informal, divididas em 240,67 horas de treinamento e 26,72 horas de avaliação, compreendendo 13,8 milhões de caracteres integralmente marcados com diacríticos. Sua motivação declarada é a frase que merece ser citada:

«Embora corpora como VLSP2020, VIET_BUD500, VietSpeech, FLEURS, VietMed, Sub-GigaSpeech2-Vi, viVoice e Sub-PhoAudioBook ofereçam ampla cobertura de fala formal e lida, nenhum deles se dirige especificamente ao registro casual e espontâneo indispensável para aplicações de IA conversacional.»

Oito corpora vietnamitas nomeados e, até este, nenhum construído para o jeito como as pessoas de fato falam em uma reunião — interrompendo, hesitando, trocando para o inglês no nome do produto, deixando a frase morrer. Qualquer número de precisão que um fornecedor cite para o vietnamita quase certamente foi medido com alguém lendo um roteiro.

A consequência operacional é simples e é a mesma à qual sempre chegamos. Se você não consegue consultar quão precisa será a transcrição da sua reunião, a única defesa é uma transcrição que um humano possa ler e corrigir. O que exige que uma transcrição exista, para começo de conversa.

Como conduzir uma reunião vietnamita–inglês para que o registro sobreviva

Seis passos, na ordem em que acontecem. Cada um deles trata de uma falha específica documentada acima.

  1. Decida qual ferramenta cuida da compreensão e qual cuida do registro — e aceite que são ferramentas diferentes. Este é o texto inteiro em uma linha. O Google Tradutor ou as legendas do Meet dão conta da primeira tarefa em vietnamita hoje. Nenhum dos dois dá conta da segunda.
  2. Defina o vietnamita explicitamente como idioma falado; não dependa da detecção automática. No DeepL isso é obrigatório — idiomas de terceiros, vietnamita incluído, não podem ser detectados automaticamente. Em todo o resto continua sendo a melhor escolha, porque a detecção automática se compromete com um palpite nos primeiros segundos, no áudio menos contextual de toda a sessão.
  3. Confira a lista de idiomas do recurso de registro, não a da plataforma. A armadilha que este texto existe para descrever é supor que uma plataforma que traduz vietnamita também o transcreve. No Google Meet, 69 contra 8 é a distância entre essas duas suposições.
  4. Nomeie o problema da alternância de idiomas antes da chamada. Se sua equipe joga nomes de produtos, IDs de tíquete e siglas em inglês dentro de frases em vietnamita — e toda equipe de engenharia offshore faz isso —, verifique se sua ferramenta de registro tolera dois idiomas em uma mesma sessão. O anotador do Meet explicitamente não tolera.
  5. Corrija os nomes próprios nos primeiros cinco minutos, ao vivo. Os diacríticos do vietnamita e os codinomes de produtos em inglês são os dois pontos em que a transcrição quebra de forma confiável, e também os dois pontos em que uma linha errada causa mais estrago a qualquer resumo construído sobre ela. Corrigir durante a reunião custa segundos.
  6. Mantenha o texto original em vietnamita, a tradução para o inglês e o resumo em um único registro. Não três arquivos em três ferramentas. A tradução é de mão única: você pode retraduzir a partir do vietnamita no ano que vem com um modelo melhor, mas nunca vai recuperar o vietnamita a partir do inglês.

Se o que você quer é o passo a passo do produto em vez da análise de mercado, nosso guia de junho para equipes vietnamitas cobre como transformar a gravação de uma reunião bilíngue em uma nota de IA revisável de ponta a ponta.

A conclusão: o vietnamita cruzou o abismo da compreensão, e não o do registro

Durante quase toda a última década, a queixa sobre o vietnamita em reuniões internacionais era que a tecnologia não o entendia bem o suficiente. Em 2026, essa queixa em grande parte expirou. Entre os 74 idiomas do Live translate, os 69 das legendas traduzidas do Meet, os mais de 2.000 pares de idiomas chegando ao Meet via Gemini 3.5 Live Translate, o vietnamita no Nova-3 e a Samsung entregando interpretação de vietnamita no próprio aparelho desde 2024, a compreensão está resolvida.

O que não se moveu é o registro. Os dois recursos do Google que produzem um artefato duradouro suportam oito idiomas entre si, os mesmos oito, e o vietnamita não está em nenhum. O DeepL legenda para o vietnamita, mas encaminha a transcrição dele a um subcontratado atrás de um botão de administrador. O mercado decidiu que o vietnamita é uma língua que vale a pena ouvir e ainda não uma língua que vale a pena registrar por escrito.

Então a pergunta a fazer a um fornecedor não é se ele suporta vietnamita. Quase todos hoje dizem que sim, e quase todos querem dizer a metade que escuta. A pergunta é: quais dos seus recursos suportam vietnamita depois que a chamada termina — e você pode me mostrar a lista de idiomas desse recurso específico?


Onde o Telli.sh se encaixa: a camada do registro é a camada que nós construímos. O Telli.sh transcreve a reunião no idioma em que ela foi de fato falada, traduz para 44 idiomas de destino, incluindo o vietnamita, e mantém os três artefatos na mesma nota — o texto original em vietnamita, a tradução alinhada a ele e o resumo gerado em cima. A própria interface está disponível em 15 idiomas, vietnamita incluído, para que uma equipe em Da Nang e um cliente em Sydney leiam a mesma reunião no seu próprio idioma e ainda compartilhem um único registro corrigível.

Comece uma nota de reunião traduzida ao vivo

Fontes


Voltar ao blog