ai translation15 min czytania

Google przetłumaczy twoje wietnamskie spotkanie w czasie rzeczywistym. Ale nie zapisze z niego ani słowa.

Tłumaczone napisy w Google Meet obejmują 69 języków, w tym wietnamski, a funkcja Live translate w Tłumaczu Google — 74. Funkcja Transcripts w Meet oraz notatnik oparty na Gemini obsługują dokładnie po 8 języków i wietnamskiego nie ma w żadnym z nich. DeepL Voice potrafi transkrybować mówiony wietnamski wyłącznie przez dostawcę zewnętrznego, którego musi włączyć administrator i który nie działa z autowykrywaniem. Przyglądamy się temu, co tłumaczenie głosu na żywo naprawdę daje wietnamskim zespołom w 2026 roku — i czego nigdy im nie daje.

K
Ken Jo
#vietnamese#live-translation#google-translate#google-meet#meeting-notes#sea#asr#multilingual-meetings

Wpisz w Google „tłumaczenie głosu na żywo po wietnamsku”, a trafisz na naprawdę dobrą odpowiedź. Funkcja Live translate w Tłumaczu Google obsługuje 74 języki, wietnamski wśród nich, zarówno na Androidzie, jak i na iOS. Działa ze słuchawkami i bez nich, nie przerywa pracy po zablokowaniu ekranu i oferuje tryb twarzą w twarz, który dzieli telefon na pół, tak by każdy rozmówca czytał własną połowę.

To działa. I to wcale nie jest najciekawsze.

Najciekawsze jest to, co dzieje się na tej samej platformie cztery godziny później, kiedy chcesz się dowiedzieć, co właściwie zostało ustalone. Funkcja Transcripts w Google Meet — ta, która tworzy trwały dokument Google — obsługuje dokładnie osiem języków i wietnamskiego wśród nich nie ma. Nie ma go też wśród ośmiu języków obsługiwanych przez funkcję „Take notes for me” w Meet, której strona pomocy dodaje, że funkcja „obsługuje jeden język naraz” i że „wiele języków używanych na tym samym spotkaniu nie jest obecnie obsługiwanych”.

TL;DR

  • Wietnamski jest obsługiwany przez każdą funkcję Google, która słucha: Live translate (74 języki), tłumaczone napisy w Meet (69 języków). Nie jest obsługiwany przez żadną funkcję Google, która zapisuje: Meet Transcripts i notatnik Gemini w Meet mają po 8 języków.
  • DeepL Voice potrafi wyświetlać napisy po wietnamsku, ale nie transkrybuje mówionego wietnamskiego własnymi modelami — wietnamski trafia do warstwy zewnętrznego dostawcy, którą musi włączyć administrator i która nie współpracuje z autowykrywaniem.
  • Ten tekst pokazuje dokładnie, gdzie wietnamski się kończy na każdej większej platformie według stanu na 31 sierpnia 2026 roku, i podaje sześciostopniową procedurę prowadzenia spotkania wietnamsko-angielskiego tak, by został po nim ślad.

Ogólną wersję tego argumentu przedstawiliśmy dziś wcześniej, przyglądając się temu, co się dzieje, gdy tłumaczenie jest znakomite i znika przed kolacją. Ten tekst jest węższy i — dla wietnamskich zespołów — gorszy: problem nie polega tylko na tym, że narzędzia działające na żywo zapominają. Polega na tym, że funkcje odpowiedzialne za pamiętanie celowo pomijają wietnamski.

Co „tłumaczenie głosu na żywo” naprawdę daje dziś w języku wietnamskim

Zacznijmy od uczciwego rozliczenia, bo darmowe narzędzia Google są naprawdę dobre w zadaniu, do którego zostały zbudowane.

Live translate w Tłumaczu Google ma cztery tryby, według strony pomocy dla Androida pobranej 31 sierpnia 2026 roku: Listening (przykładasz telefon do ucha albo używasz słuchawek, by w czasie rzeczywistym słyszeć tłumaczenie drugiej osoby), Conversation (tłumaczenia odtwarzane są na głos, rozmówcy mówią na zmianę), Text only (tylko czytanie, bez dźwięku) i Custom settings. Osobno istnieje tryb Face to face, w którym ekran dzieli się na pół i każdy rozmówca widzi na swojej połowie zarówno transkrypcję, jak i tłumaczenie swojego języka. Mikrofon sam wykrywa, kiedy jeden język się kończy, a zaczyna drugi, więc nikt nie musi naciskać przycisku między zdaniami.

Dwa szczegóły zasługują na więcej uznania, niż zwykle dostają. Po pierwsze, sesja przeżywa wielozadaniowość: dokumentacja Google stwierdza, że tłumaczenie „działa płynnie dalej, gdy przełączysz aplikacje, zminimalizujesz aplikację lub gdy ekran się zablokuje”. Po drugie, wietnamski można pobrać do użytku offline, a pobrane pakiety da się z tego samego ekranu zaktualizować do wersji o wyższej jakości — co ma znaczenie w kraju, w którym wizyta w terenie albo hala fabryczna nie gwarantują łączności.

Jedno ograniczenie warto powiedzieć wprost, bo ludzi zaskakuje: to funkcja telefonu. Strona pomocy Google dla wersji przeglądarkowej mówi w jednym zdaniu: „W Tłumaczu Google w przeglądarce nie można jednocześnie mówić i tłumaczyć”. Jeśli twoje dwujęzyczne spotkanie odbywa się na laptopie, Live translate nie ma w tym pokoju.

I tu jest sedno: do rozmowy — w taksówce, u dostawcy, na korytarzu z odwiedzającym klientem — to jest problem praktycznie rozwiązany, nic nie kosztuje i polecilibyśmy je bez wahania. Porażka nie leży w rozmowie. Leży w spotkaniu.

Gemini 3.5 Live Translate przenosi Meet z pięciu języków do ponad siedemdziesięciu

Obraz zresztą szybko się zmienia — i zmienia się na korzyść osób mówiących po wietnamsku.

9 czerwca 2026 roku Google ogłosiło Gemini 3.5 Live Translate, model tłumaczenia mowy na mowę obejmujący ponad 70 języków. Jak podał Slator 16 czerwca 2026 roku, model udostępniany jest przez Gemini Live API i Google AI Studio w publicznej wersji zapoznawczej, wchodzi do prywatnej wersji zapoznawczej w Google Meet dla wybranych klientów Workspace i trafia globalnie do mobilnej aplikacji Tłumacza Google na Androida i iOS.

Liczba, która ma znaczenie dla Meet, to porównanie „przed i po”. Tłumaczenie mowy w Meet było ograniczone do pięciu obsługiwanych języków, z tłumaczeniem wyłącznie na angielski i z angielskiego. Gemini 3.5 Live Translate rozszerza to do ponad 70 języków i ponad 2000 kombinacji par językowych, a szerszą dostępność zaplanowano na dalszą część 2026 roku. Dla wietnamskiego zespołu pięciojęzyczny system z angielskim jako osią przesiadkową był w praktyce brakiem systemu; 2000 par to zupełnie inny produkt.

Google pozycjonuje ten model wąsko, co jest raczej dobrym niż złym znakiem. Według Slatora dokumentacja przeciwstawia Live Translate szerszym możliwościom Gemini Live Agent: model działa jak potok tłumaczenia w czasie rzeczywistym, przyjmuje wyłącznie sygnał audio i celowo pomija wywoływanie funkcji, osadzanie w wynikach wyszukiwania, narzędzia i instrukcje systemowe. To tłumacz, nie asystent — dokładnie to rozróżnienie zrobiło OpenAI, opisując GPT-Realtime-Translate. Google dodało też na Androidzie „tryb słuchania”, który przesyła przetłumaczony dźwięk przez głośnik przyuszny, więc można śledzić tłumaczenie, nie zakładając na spotkaniu widocznych słuchawek.

Warstwa działająca na żywo poprawia się więc dla wietnamskiego szybko i z kilku stron naraz. Teraz drugie pytanie.

Linia zapisu: gdzie kończy się wietnamski

Każda platforma ma swoją linię. Po jednej stronie są funkcje, które pomagają zrozumieć mowę w chwili, gdy padają słowa. Po drugiej — funkcje, które zamieniają mowę w coś, co masz jeszcze za tydzień. Nazwijmy to linią zapisu — i dla wietnamskiego to dokładnie ten punkt, w którym wsparcie znika.

Diagram pokazujący wietnamski obsługiwany we wszystkich funkcjach słuchających Google i nieobecny w funkcjach zapisujących

Liczby języków pochodzą od samego Google, z czterech stron pomocy pobranych 31 sierpnia 2026 roku. Wietnamski występuje w obu funkcjach słuchających i w żadnej funkcji zapisującej.

Te same informacje w formie tabeli, bo asymetria łatwiej się broni, gdy jest ustawiona w rzędzie.

Funkcja GoogleWietnamski obsługiwany?JęzykiZostawia ślad po rozmowie?
Tłumacz Google — Live translateTak74Nie
Google Meet — tłumaczone napisyTak69Tylko na ekranie; wtopione w nagranie, jeśli włączysz Record captions
Google Meet — TranscriptsNie8Tak, dokument Google
Google Meet — „Take notes for me”Nie8, po jednym narazTak, notatki w Dokumentach Google plus podsumowanie e-mailem
Google Meet — Gemini 3.5 Live TranslateWe wdrożeniu5 dziś, 70+ w prywatnej wersji zapoznawczejBrak informacji

Wszystkie wiersze na podstawie stron pomocy Google oraz raportu Slatora z 16 czerwca 2026 roku, pobranych 31 sierpnia 2026 roku.

Osiem języków wspólnych dla Transcripts i „Take notes for me” jest identycznych: angielski, francuski, niemiecki, włoski, japoński, koreański, portugalski i hiszpański. To dwa razy ta sama lista, a jest to lista dużych rynków europejskich i wschodnioazjatyckich. Wietnamski — mniej więcej 97 milionów mówiących, według własnych wyliczeń Samsunga z opracowania z 2024 roku — jest poza nią, razem z tajskim, indonezyjskim, hindi i arabskim.

Jest jeszcze jedno ograniczenie, które uderza konkretnie w zespoły dwujęzyczne, i dotyczy nawet zespołów pracujących wyłącznie w obsługiwanych językach. Strona pomocy Google dla „Take notes for me” stwierdza, że funkcja obsługuje jeden język naraz i że wiele języków używanych na tym samym spotkaniu nie jest obecnie obsługiwanych. Rozmowa Wietnam–USA, która przeskakuje między wietnamskim a angielskim, jest zdyskwalifikowana podwójnie: raz za wietnamski, raz za przełączanie.

Gwoli sprawiedliwości wobec Google: tłumaczone napisy mają jednak ścieżkę trwałości. Jeśli nagrasz spotkanie i wybierzesz Record captions, napisy zostaną wtopione w nagranie. Możesz też przewijać tłumaczone napisy wstecz w trakcie sesji. Ale wypalone napisy na pliku wideo nie są przeszukiwalnym zapisem — nie zgrepujesz piksela, nie poprawisz nazwiska i nie wygenerujesz z tego podsumowania. Tłumaczone napisy w Meet są dodatkowo ograniczone do płatnych edycji Workspace: Business Standard, Business Plus, Enterprise Standard, Enterprise Plus, Enterprise Starter (dostępna do 30 czerwca 2025 roku) oraz Google AI Pro for Education.

DeepL pokaże ci wietnamskie napisy. Transkrypcja mówionego wietnamskiego to zupełnie inna półka.

DeepL Voice to najmocniejsza zachodnia alternatywa, a jego wietnamska historia jest najbardziej pouczająca w całym tym tekście — bo DeepL dokumentuje to rozróżnienie lepiej niż ktokolwiek inny.

DeepL dzieli obsługę języków na dwie listy. Języki mówione to te, które przyjmuje system rozpoznawania mowy. Języki tłumaczenia to te, w których mogą być wyświetlane napisy. Wietnamski jest na liście tłumaczeń, która liczy 41 języków. A teraz spójrz na drugą stronę: własne modele DeepL transkrybują 18 języków mówionych — chiński (mandaryński), czeski, niderlandzki, angielski, francuski, niemiecki, indonezyjski, włoski, japoński, koreański, polski, portugalski, rumuński, rosyjski, hiszpański, szwedzki, turecki i ukraiński. Wietnamskiego wśród nich nie ma.

Wietnamski jest dostępny jako język mówiony, ale wyłącznie w drugiej warstwie 20 języków transkrybowanych przez zewnętrznego dostawcę, firmę Speechmatics. Wiążą się z tym trzy warunki, wszystkie udokumentowane na stronie pomocy DeepL pobranej 31 sierpnia 2026 roku:

  1. Administrator zespołu musi włączyć przetwarzanie przez podmiot zewnętrzny na koncie administracyjnym organizacji, zanim którykolwiek z tych języków w ogóle zadziała.
  2. Autowykrywanie nie działa. Słowami DeepL: „Języki zewnętrzne nie działają z funkcją Auto-detect language — trzeba je ręcznie wybrać jako Spoken language”.
  3. Aby uczestnicy mogli sami wybrać swój język mówiony, gospodarz musi włączyć kod dostępu przy podłączaniu spotkania do DeepL Voice.

Nic z tego nie jest nierozsądne — DeepL zaznacza, że Speechmatics działa na podstawie umowy o zerowej retencji, więc dane transkrypcji są usuwane z ich serwerów zaraz po przetworzeniu. Ale jeśli spiętrzysz te wymagania, dostaniesz praktyczny wynik: osoba mówiąca po wietnamsku, dołączająca do spotkania obsługiwanego przez DeepL, jest o jedno niezaznaczone ustawienie administratora od tego, by w ogóle nie zostać zapisana, i nie może liczyć na to, że system sam ją zauważy. Tymczasem podejście do retencji jest dokładnie takie, o jakim pisaliśmy dziś rano — FAQ DeepL mówi, że dane spotkania są „przetwarzane tymczasowo w pamięci i usuwane po zakończeniu rozmowy”.

Samsung to kontrprzykład, który warto wymienić z nazwy. Wietnamski był wśród pierwszych 16 języków, z którymi wystartowało Galaxy AI, a Samsung R&D Institute Vietnam opublikował 23 maja 2024 roku nietypowo szczerą relację z tego, dlaczego było to trudne. Wietnamski ma sześć odrębnych tonów; przykład z artykułu to ma, mả i — duch, grób i mama — różniące się wyłącznie tonem. Bui Ngoc Tung, szef zespołu ASR w instytucie, opisał model rozróżniający ramki dźwiękowe o długości „około 20 milisekund”, by rozstrzygnąć, do którego słowa należy dany ciąg ramek. Kiedy koreański producent telefonów inwestuje w modelowanie tonów wietnamskiego, a europejska firma tłumaczeniowa przekazuje to podwykonawcy, mówi to coś o tym, jak rynek wycenia ten język.

Po stronie podaży rozpoznawania mowy obraz jest lepszy niż po stronie notatek: Nova-3 od Deepgram wymienia wietnamski jako vi w dokumentacji modeli i języków, pobranej 31 sierpnia 2026 roku — to jeden z 58 języków, które policzyliśmy w naszej analizie tego, co ukrywa słowo „obsługiwany” w pokryciu językowym systemów zamiany mowy na tekst.

Żaden dostawca nie publikuje wskaźnika błędów dla wietnamskiej mowy na spotkaniach, a korpusy tłumaczą dlaczego

Poszliśmy szukać liczby, którą można by przypiąć do jakości transkrypcji wietnamskiego na spotkaniach. Takiej liczby nie ma, a powód jest bardziej użyteczny, niż byłaby sama liczba.

Wykres słupkowy liczby oznaczonych godzin w trzech wietnamskich korpusach mowy, z adnotacjami dotyczącymi rejestru wypowiedzi

Oznaczone godziny to nie cała historia — rejestr też się liczy. FLEURS to mowa czytana; zbiór treningowy PhoWhisper obejmuje różne akcenty; VietSuperSpeech to pierwszy korpus zbudowany specjalnie pod rozmowę potoczną. Źródła z datami w liście poniżej.

Benchmark, który wszyscy przytaczają dla wietnamskiego, to FLEURS, dostarczający około 12 godzin mowy czytanej na język. Mowa czytana to nie mowa na spotkaniu. PhoWhisper, zaprezentowany w ścieżce ICLR 2024 Tiny Papers, dostroił Whispera na 844-godzinnym zbiorze wietnamskim dobranym pod kątem różnorodności akcentów, co jest realnym krokiem w stronę realizmu. VietASR, opublikowany 23 maja 2025 roku, poszedł inną drogą — wstępne trenowanie na 70 000 godzin nieoznaczonego audio i dostrajanie na zaledwie 50 oznaczonych godzinach — i raportuje wyniki lepsze niż Whisper Large-v3 oraz systemy komercyjne na danych z rzeczywistego świata.

Jest jeszcze praca, która mówi na głos to, co zwykle przemilczane. VietSuperSpeech, wydany w 2026 roku, zbiera 52 023 pary audio–tekst dające łącznie 267,39 godziny potocznego, konwersacyjnego wietnamskiego, podzielone na 240,67 godziny treningowe i 26,72 godziny ewaluacyjne, obejmujące 13,8 miliona w pełni oznaczonych diakrytycznie znaków. Jego deklarowana motywacja to zdanie warte zacytowania:

„Chociaż korpusy takie jak VLSP2020, VIET_BUD500, VietSpeech, FLEURS, VietMed, Sub-GigaSpeech2-Vi, viVoice i Sub-PhoAudioBook zapewniają szerokie pokrycie mowy formalnej i czytanej, żaden z nich nie celuje konkretnie w swobodny, spontaniczny rejestr, niezbędny w konwersacyjnych zastosowaniach sztucznej inteligencji”.

Osiem wymienionych z nazwy wietnamskich korpusów i aż do tego jednego ani jeden zbudowany pod sposób, w jaki ludzie faktycznie mówią na spotkaniu — przerywając, asekurując się, przeskakując na angielski przy nazwie produktu, urywając zdanie. Każda liczba dotycząca dokładności, którą podaje ci dostawca dla wietnamskiego, została prawie na pewno zmierzona na kimś, kto czytał z kartki.

Konsekwencja operacyjna jest prosta i jest to ta sama, do której wciąż dochodzimy. Jeśli nie możesz sprawdzić, jak dokładna będzie transkrypcja twojego spotkania, jedyną obroną jest transkrypcja, którą człowiek może przeczytać i poprawić. Co wymaga, żeby transkrypcja w ogóle istniała.

Jak prowadzić spotkanie wietnamsko-angielskie, żeby zapis przetrwał

Sześć kroków, w kolejności, w jakiej się zdarzają. Każdy z nich odpowiada na konkretną awarię udokumentowaną powyżej.

  1. Zdecyduj, które narzędzie odpowiada za zrozumienie, a które za zapis — i pogódź się z tym, że to dwa różne narzędzia. To cały ten tekst w jednym zdaniu. Tłumacz Google albo napisy w Meet poradzą sobie dziś z pierwszym zadaniem po wietnamsku. Żadne z nich nie poradzi sobie z drugim.
  2. Ustaw wietnamski jako język mówiony jawnie; nie polegaj na autowykrywaniu. W DeepL to obowiązkowe — języków zewnętrznych, w tym wietnamskiego, nie da się wykryć automatycznie. Wszędzie indziej to i tak lepszy wybór, bo autowykrywanie podejmuje decyzję w pierwszych kilku sekundach, na najmniej kontekstowym fragmencie audio z całej sesji.
  3. Sprawdzaj listę języków funkcji zapisu, a nie platformy. Pułapka, dla opisania której powstał ten tekst, polega na założeniu, że platforma, która tłumaczy wietnamski, także go transkrybuje. W Google Meet 69 kontra 8 to właśnie przepaść między tymi dwoma założeniami.
  4. Nazwij problem przełączania kodów przed rozmową. Jeśli twój zespół wrzuca angielskie nazwy produktów, identyfikatory zgłoszeń i skróty w wietnamskie zdania — a robi to każdy zespół inżynieryjny w modelu offshore — sprawdź, czy twoje narzędzie do zapisu toleruje dwa języki w jednej sesji. Notatnik Meet jawnie tego nie robi.
  5. Popraw nazwy własne w pierwszych pięciu minutach, na żywo. Wietnamskie znaki diakrytyczne i angielskie kryptonimy produktów to dwa miejsca, w których transkrypcja regularnie się wykłada, a zarazem dwa miejsca, w których błędna linijka wyrządza największą szkodę każdemu podsumowaniu zbudowanemu na jej podstawie. Poprawienie w trakcie spotkania kosztuje sekundy.
  6. Trzymaj wietnamski tekst źródłowy, angielskie tłumaczenie i podsumowanie w jednym zapisie. Nie trzy pliki w trzech narzędziach. Tłumaczenie jest jednokierunkowe: za rok możesz przetłumaczyć wietnamski ponownie lepszym modelem, ale nigdy nie odzyskasz wietnamskiego z angielskiego.

Jeśli szukasz raczej przewodnika krok po kroku po produkcie niż analizy rynku, nasz czerwcowy poradnik dla wietnamskich zespołów opisuje od początku do końca zamianę nagrania dwujęzycznego spotkania w notatkę AI gotową do przejrzenia.

Konkluzja: wietnamski przekroczył przepaść zrozumienia, ale nie przepaść zapisu

Przez większość ostatniej dekady zarzut wobec wietnamskiego na międzynarodowych spotkaniach brzmiał tak, że technologia nie rozumie go wystarczająco dobrze. W 2026 roku ten zarzut w dużej mierze stracił ważność. Między 74 językami w Live translate, 69 w tłumaczonych napisach Meet, ponad 2000 par językowych nadchodzących do Meet przez Gemini 3.5 Live Translate, wietnamskim w Nova-3 i Samsungiem dostarczającym wietnamskie tłumaczenie na urządzeniu od 2024 roku — zrozumienie jest załatwione.

Nie ruszył się zapis. Dwie funkcje Google, które tworzą trwały artefakt, obsługują we dwie osiem języków, te same osiem, i wietnamskiego nie ma w żadnej z nich. DeepL zrobi napisy po wietnamsku, ale transkrypcję tego języka kieruje do podwykonawcy schowanego za przełącznikiem administratora. Rynek zdecydował, że wietnamski to język wart słuchania, ale jeszcze nie język wart zapisania.

Pytanie do dostawcy nie brzmi więc, czy obsługuje wietnamski. Prawie wszyscy mówią dziś, że tak, i prawie wszyscy mają na myśli połowę „słuchającą”. Pytanie brzmi: które z waszych funkcji obsługują wietnamski po zakończeniu rozmowy — i czy możecie mi pokazać listę języków dla tej konkretnej funkcji?


Gdzie w tym wszystkim jest Telli.sh: warstwa zapisu to warstwa, którą budujemy. Telli.sh transkrybuje spotkanie w języku, w którym faktycznie się odbyło, tłumaczy na 44 języki docelowe, w tym wietnamski, i trzyma wszystkie trzy artefakty w jednej notatce — wietnamski tekst źródłowy, dopasowane do niego tłumaczenie i wygenerowane na tej podstawie podsumowanie. Sam interfejs dostępny jest w 15 językach, wietnamskim włącznie, więc zespół w Da Nang i klient w Sydney czytają to samo spotkanie we własnym języku i wciąż mają jeden wspólny, poprawialny zapis.

Załóż notatkę ze spotkania tłumaczonego na żywo

Źródła


Wróć do bloga