Google übersetzt Ihr vietnamesisches Meeting in Echtzeit. Aufschreiben wird es kein einziges Wort davon.
Die übersetzten Untertitel von Google Meet decken 69 Sprachen ab, darunter Vietnamesisch, Live translate in Google Translate sogar 74. Die Transcripts-Funktion von Meet und der Gemini-Protokollant unterstützen jeweils exakt 8 Sprachen — Vietnamesisch ist in keiner der beiden Listen. DeepL Voice kann gesprochenes Vietnamesisch nur über einen Drittanbieter transkribieren, der von einer Administratorin freigeschaltet werden muss und keine automatische Spracherkennung erlaubt. Eine Bestandsaufnahme, was Live-Sprachübersetzung vietnamesischen Teams 2026 tatsächlich bringt — und was sie ihnen nie bringt.
Wer bei Google nach Live-Sprachübersetzung für Vietnamesisch sucht, landet bei einer wirklich guten Antwort. Die Funktion Live translate in Google Translate unterstützt 74 Sprachen, Vietnamesisch eingeschlossen, sowohl auf Android als auch auf iOS. Sie läuft mit und ohne Kopfhörer, arbeitet bei gesperrtem Bildschirm weiter und bietet einen Face-to-face-Modus, der das Telefon in zwei Hälften teilt, sodass jede sprechende Person ihre eigene Seite liest.
Es funktioniert. Das ist nicht der interessante Teil.
Interessant wird es vier Stunden später auf derselben Plattform, wenn Sie wissen wollen, was eigentlich beschlossen wurde. Die Transcripts-Funktion von Google Meet — jene, die ein dauerhaftes Google Doc erzeugt — unterstützt exakt acht Sprachen, und Vietnamesisch gehört nicht dazu. Auch nicht zu den acht Sprachen von „Take notes for me“ in Meet, dessen Hilfeseite ergänzt, die Funktion unterstütze „jeweils nur eine Sprache“ und „mehrere im selben Meeting gesprochene Sprachen werden derzeit nicht unterstützt“.
TL;DR
- Vietnamesisch wird von jeder Google-Oberfläche unterstützt, die zuhört: Live translate (74 Sprachen), übersetzte Untertitel in Meet (69 Sprachen). Von keiner Google-Oberfläche unterstützt wird es, die schreibt: Meet Transcripts und der Gemini-Protokollant von Meet, jeweils 8 Sprachen.
- DeepL Voice kann Untertitel auf Vietnamesisch anzeigen, gesprochenes Vietnamesisch aber nicht mit eigenen Modellen transkribieren — Vietnamesisch liegt in einer Drittanbieter-Stufe, die eine Administratorin freischalten muss und die keine automatische Spracherkennung zulässt.
- Dieser Beitrag zeigt, wo Vietnamesisch auf jeder großen Plattform mit Stand 31. August 2026 genau endet, und liefert ein sechsstufiges Vorgehen für ein vietnamesisch-englisches Meeting, das eine Aufzeichnung hinterlässt.
Die allgemeine Fassung dieses Arguments haben wir heute früher formuliert, mit Blick darauf, was passiert, wenn die Übersetzung ausgezeichnet und bis zum Abendessen verschwunden ist. Dieser Beitrag ist enger gefasst und für vietnamesische Teams unangenehmer: Das Problem ist nicht nur, dass Live-Werkzeuge vergessen. Es ist, dass die Funktionen zum Erinnern Vietnamesisch gezielt auslassen.
Was „Live-Sprachübersetzung“ auf Vietnamesisch heute tatsächlich leistet
Beginnen wir mit einer ehrlichen Bilanz, denn Googles kostenlose Werkzeuge erledigen die Aufgabe, für die sie gebaut sind, sehr gut.
Live translate in Google Translate bietet laut der am 31. August 2026 abgerufenen Android-Hilfeseite vier Modi: Listening (Telefon ans Ohr halten oder Kopfhörer nutzen, um jemanden in Echtzeit übersetzt zu hören), Conversation (Übersetzungen werden laut abgespielt, die Sprechenden wechseln sich ab), Text only (nur lesen, kein Ton) und Custom settings. Daneben gibt es den Modus Face to face, bei dem sich der Bildschirm teilt und jede sprechende Person auf ihrer Hälfte sowohl die Transkription als auch die Übersetzung der eigenen Sprache sieht. Das Mikrofon erkennt automatisch, wann eine Sprache endet und die andere beginnt — niemand muss also zwischen den Sätzen eine Taste drücken.
Zwei Details verdienen mehr Anerkennung, als sie üblicherweise bekommen. Erstens übersteht die Sitzung Multitasking: Googles Dokumentation hält fest, die Übersetzung laufe „nahtlos weiter, wenn Sie die App wechseln, die Anwendung minimieren oder der Bildschirm gesperrt wird“. Zweitens lässt sich Vietnamesisch für die Offline-Nutzung herunterladen, und heruntergeladene Pakete können auf demselben Bildschirm auf eine höherwertige Version aktualisiert werden — was in einem Land zählt, in dem ein Vor-Ort-Termin oder eine Fabrikhalle keine garantierte Netzabdeckung bedeutet.
Eine Einschränkung sollte man deutlich benennen, weil sie viele überrascht: Das ist eine Smartphone-Funktion. Googles eigene Hilfeseite zur Web-Version sagt in einem Satz: „Sprechen und Übersetzen gleichzeitig ist in Google Translate für das Web nicht möglich.“ Wenn Ihr zweisprachiges Meeting auf einem Laptop stattfindet, ist Live translate nicht im Raum.
Der Punkt ist: Für ein Gespräch — im Taxi, beim Lieferantenbesuch, im Flurgespräch mit einem Kunden zu Besuch — ist das nahezu gelöst, es kostet nichts, und wir würden es ohne Zögern empfehlen. Das Versagen liegt nicht im Gespräch. Es liegt im Meeting.
Gemini 3.5 Live Translate hebt Meet von fünf Sprachen auf über siebzig
Das Bild bewegt sich zudem schnell — und zugunsten vietnamesischer Sprecherinnen und Sprecher.
Am 9. Juni 2026 kündigte Google Gemini 3.5 Live Translate an, ein Speech-to-Speech-Übersetzungsmodell für mehr als 70 Sprachen. Wie Slator am 16. Juni 2026 berichtete, wird es über die Gemini Live API und Google AI Studio als Public Preview ausgerollt, geht für ausgewählte Workspace-Kunden in Google Meet in die Private Preview und erscheint weltweit in der Google-Translate-App für Android und iOS.
Entscheidend für Meet ist der Vorher-Nachher-Vergleich. Sprachübersetzung in Meet war bislang auf fünf unterstützte Sprachen beschränkt, mit Übersetzung ausschließlich von und ins Englische. Gemini 3.5 Live Translate erweitert das auf mehr als 70 Sprachen und über 2.000 Sprachpaar-Kombinationen, mit breiterer Verfügbarkeit später im Jahr 2026. Für ein vietnamesisches Team war ein Fünf-Sprachen-System mit Englisch als Drehscheibe faktisch kein System; 2.000 Paare sind ein anderes Produkt.
Google positioniert das Modell eng, und das ist eher ein gutes als ein schlechtes Zeichen. Laut Slator grenzt die Dokumentation Live Translate von den breiteren Live-Agent-Fähigkeiten von Gemini ab: Es fungiert als Echtzeit-Übersetzungspipeline, nimmt ausschließlich Audio entgegen und verzichtet bewusst auf Function Calling, Search Grounding, Tools und System-Anweisungen. Es ist ein Dolmetscher, kein Assistent — dieselbe Unterscheidung, die OpenAI bei der Beschreibung von GPT-Realtime-Translate traf. Google ergänzte auf Android außerdem einen „Listening-Modus“, der übersetztes Audio über den Hörer ausgibt, sodass Sie einer Übersetzung folgen können, ohne im Meeting sichtbar Kopfhörer zu tragen.
Die Live-Ebene für Vietnamesisch verbessert sich also schnell und gleich aus mehreren Richtungen. Nun zur anderen Frage.
Die Aufzeichnungsgrenze: wo Vietnamesisch endet
Jede Plattform hat eine Grenze. Auf der einen Seite stehen die Funktionen, die Ihnen helfen, Sprache im Moment zu verstehen. Auf der anderen die Funktionen, die Sprache in etwas verwandeln, das Sie nächste Woche noch haben. Nennen wir sie die Aufzeichnungsgrenze — und für Vietnamesisch verläuft sie genau dort, wo die Unterstützung endet.
Die Sprachzahlen stammen von Google selbst, aus vier am 31. August 2026 abgerufenen Hilfeseiten. Vietnamesisch erscheint in beiden zuhörenden Funktionen und in keiner der schreibenden.
Hier dieselbe Information als Tabelle, weil die Asymmetrie leichter zu diskutieren ist, wenn sie nebeneinandersteht.
| Google-Funktion | Vietnamesisch unterstützt? | Sprachen | Hinterlässt nach dem Gespräch ein Artefakt? |
|---|---|---|---|
| Google Translate — Live translate | Ja | 74 | Nein |
| Google Meet — übersetzte Untertitel | Ja | 69 | Nur auf dem Bildschirm; in die Aufnahme eingebrannt, wenn Sie Untertitel mitaufzeichnen |
| Google Meet — Transcripts | Nein | 8 | Ja, ein Google Doc |
| Google Meet — „Take notes for me“ | Nein | 8, jeweils eine | Ja, Notizen in Google Docs plus eine Zusammenfassung per E-Mail |
| Google Meet — Gemini 3.5 Live Translate | Im Rollout | 5 heute, 70+ in der Private Preview | Nicht angegeben |
Alle Zeilen aus Google-Hilfeseiten und dem Slator-Bericht vom 16. Juni 2026, abgerufen am 31. August 2026.
Die acht Sprachen, die sich Transcripts und „Take notes for me“ teilen, sind identisch: Englisch, Französisch, Deutsch, Italienisch, Japanisch, Koreanisch, Portugiesisch und Spanisch. Es ist zweimal dieselbe Liste, und es ist eine Liste großer europäischer und ostasiatischer Märkte. Vietnamesisch — rund 97 Millionen Sprecherinnen und Sprecher, nach Samsungs eigener Zählung im Bericht von 2024 — steht außerhalb, gemeinsam mit Thai, Indonesisch, Hindi und Arabisch.
Es gibt eine weitere Einschränkung, die zweisprachige Teams besonders trifft, und sie gilt selbst für Teams, die ausschließlich in unterstützten Sprachen arbeiten. Googles Hilfeseite zu „Take notes for me“ hält fest, dass die Funktion jeweils nur eine Sprache unterstützt und dass mehrere im selben Meeting gesprochene Sprachen derzeit nicht unterstützt werden. Ein Gespräch zwischen Vietnam und den USA, das zwischen Vietnamesisch und Englisch wechselt, ist doppelt disqualifiziert: einmal wegen Vietnamesisch und einmal wegen des Wechsels.
Fairerweise gegenüber Google: Übersetzte Untertitel haben durchaus einen Weg zur Dauerhaftigkeit. Wenn Sie das Meeting aufzeichnen und Record captions auswählen, werden die Untertitel in die Aufnahme eingebettet. Und Sie können während der Sitzung durch die übersetzten Untertitel zurückscrollen. Aber eingebrannte Untertitel in einer Videodatei sind keine durchsuchbare Aufzeichnung — man kann kein Pixel greppen, keinen Namen korrigieren und daraus keine Zusammenfassung erzeugen. Übersetzte Untertitel in Meet sind zudem auf kostenpflichtige Workspace-Editionen beschränkt: Business Standard, Business Plus, Enterprise Standard, Enterprise Plus, Enterprise Starter (verfügbar bis 30. Juni 2025) und Google AI Pro for Education.
DeepL zeigt Ihnen vietnamesische Untertitel. Gesprochenes Vietnamesisch zu transkribieren ist eine andere Stufe.
DeepL Voice ist die stärkste westliche Alternative, und seine Vietnamesisch-Geschichte ist die lehrreichste dieses ganzen Beitrags — weil DeepL die Unterscheidung besser dokumentiert als alle anderen.
DeepL teilt die Sprachunterstützung in zwei Listen. Gesprochene Sprachen sind das, was die Erkennung akzeptiert. Übersetzungssprachen sind das, worin Untertitel angezeigt werden können. Vietnamesisch erscheint in der Übersetzungsliste, die 41 Sprachen umfasst. Nun die andere Seite: DeepLs eigene Modelle transkribieren 18 gesprochene Sprachen — Chinesisch (Mandarin), Tschechisch, Niederländisch, Englisch, Französisch, Deutsch, Indonesisch, Italienisch, Japanisch, Koreanisch, Polnisch, Portugiesisch, Rumänisch, Russisch, Spanisch, Schwedisch, Türkisch und Ukrainisch. Vietnamesisch ist nicht darunter.
Vietnamesisch ist als gesprochene Sprache verfügbar, aber nur in einer zweiten Stufe von 20 Sprachen, die ein Drittanbieter transkribiert: Speechmatics. Daran hängen drei Bedingungen, alle auf DeepLs am 31. August 2026 abgerufener Hilfeseite dokumentiert:
- Eine Team-Administratorin muss die Verarbeitung durch Dritte aktivieren, im Admin-Konto der Organisation, bevor irgendeine dieser Sprachen überhaupt funktioniert.
- Die automatische Spracherkennung funktioniert nicht. In DeepLs Worten: „Drittanbieter-Sprachen funktionieren nicht mit Auto-detect language — sie müssen manuell als Spoken language ausgewählt werden.“
- Damit Teilnehmende ihre eigene gesprochene Sprache wählen können, muss die gastgebende Person einen Zugangscode aktivieren, wenn sie das Meeting mit DeepL Voice verbindet.
Nichts davon ist unangemessen — DeepL weist darauf hin, dass Speechmatics unter einer Zero-Retention-Vereinbarung arbeitet, Transkriptionsdaten also nach der Verarbeitung von deren Servern gelöscht werden. Aber stapelt man die Anforderungen, ergibt sich das praktische Resultat: Eine vietnamesisch sprechende Person, die einem mit DeepL ausgestatteten Meeting beitritt, ist eine nicht gesetzte Admin-Einstellung davon entfernt, überhaupt nicht transkribiert zu werden — und kann sich nicht darauf verlassen, dass das System sie automatisch bemerkt. Die Aufbewahrungspraxis ist dabei dieselbe, über die wir heute Morgen geschrieben haben: DeepLs FAQ sagt, Meeting-Daten würden „temporär im Arbeitsspeicher verarbeitet und nach Gesprächsende gelöscht“.
Samsung ist das Gegenbeispiel, das man benennen sollte. Vietnamesisch gehörte zu den ersten 16 Sprachen, mit denen Galaxy AI ausgeliefert wurde, und Samsung R&D Institute Vietnam veröffentlichte am 23. Mai 2024 einen ungewöhnlich offenen Bericht darüber, warum das schwierig war. Vietnamesisch hat sechs unterschiedliche Töne; das Beispiel des Artikels lautet, dass ma, mả und má — Geist, Grab und Mutter — sich allein durch den Ton unterscheiden. Bui Ngoc Tung, ASR-Leiter des Instituts, beschrieb ein Modell, das Audioframes von „rund 20 Millisekunden“ unterscheidet, um zu entscheiden, zu welchem Wort eine Folge von Frames gehört. Wenn ein koreanischer Handyhersteller in die Tonmodellierung des Vietnamesischen investiert und ein europäisches Übersetzungsunternehmen sie an einen Subunternehmer weiterreicht, sagt das etwas darüber aus, wie der Markt diese Sprache bepreist.
Auf der Angebotsseite der Spracherkennung sieht es besser aus als bei der Protokollierung: Deepgrams Nova-3 führt Vietnamesisch als vi in seiner Modell- und Sprachdokumentation, abgerufen am 31. August 2026 — eine der 58 Sprachen, die wir in unserer Analyse dessen, was „unterstützt“ bei der Sprache-zu-Text-Abdeckung verbirgt, gezählt haben.
Kein Anbieter veröffentlicht eine Fehlerrate für vietnamesische Meeting-Sprache, und die Korpora erklären, warum
Wir haben nach einer Zahl gesucht, die die Qualität vietnamesischer Transkription in Meetings beziffert. Es gibt keine, und der Grund dafür ist nützlicher als die Zahl gewesen wäre.
Annotierte Stunden sind nicht die ganze Geschichte — das Register ist es. FLEURS ist vorgelesene Sprache; der Trainingsdatensatz von PhoWhisper deckt verschiedene Akzente ab; VietSuperSpeech ist das erste Korpus, das eigens für beiläufige Gespräche gebaut wurde. Quellen mit Datum in der Liste unten.
Der Benchmark, den alle für Vietnamesisch zitieren, ist FLEURS mit rund 12 Stunden vorgelesener Sprache pro Sprache. Vorgelesene Sprache ist keine Meeting-Sprache. PhoWhisper, vorgestellt im Tiny-Papers-Track der ICLR 2024, hat Whisper auf einem 844-Stunden-Datensatz für Vietnamesisch feinabgestimmt, der auf Akzentvielfalt ausgewählt wurde — ein echter Schritt Richtung Realismus. VietASR, veröffentlicht am 23. Mai 2025, ging einen anderen Weg: Vortraining auf 70.000 Stunden unannotiertem Audio und Feinabstimmung auf lediglich 50 annotierten Stunden — und berichtet, Whisper Large-v3 und kommerzielle Systeme auf realen Daten zu übertreffen.
Und dann gibt es die Arbeit, die den unbequemen Teil ausspricht. VietSuperSpeech, 2026 veröffentlicht, versammelt 52.023 Audio-Text-Paare mit insgesamt 267,39 Stunden beiläufig gesprochenem Vietnamesisch, aufgeteilt in 240,67 Trainings- und 26,72 Evaluationsstunden, mit 13,8 Millionen vollständig diakritisch markierten Zeichen. Die erklärte Motivation ist der Satz, den man zitieren muss:
„Während Korpora wie VLSP2020, VIET_BUD500, VietSpeech, FLEURS, VietMed, Sub-GigaSpeech2-Vi, viVoice und Sub-PhoAudioBook eine breite Abdeckung formaler und vorgelesener Sprache bieten, zielt keines gezielt auf das beiläufige, spontane Register, das für konversationelle KI-Anwendungen unverzichtbar ist.“
Acht namentlich genannte vietnamesische Korpora — und bis zu diesem war keines davon dafür gebaut, wie Menschen in einem Meeting tatsächlich sprechen: unterbrechend, relativierend, für den Produktnamen ins Englische wechselnd, Sätze offen lassend. Welche Genauigkeitszahl ein Anbieter Ihnen für Vietnamesisch auch nennt — sie wurde mit ziemlicher Sicherheit an jemandem gemessen, der ein Skript vorliest.
Die operative Konsequenz ist einfach, und es ist dieselbe, bei der wir immer wieder landen. Wenn Sie nicht nachschlagen können, wie genau die Transkription Ihres Meetings sein wird, ist die einzige Absicherung ein Transkript, das ein Mensch lesen und korrigieren kann. Was voraussetzt, dass überhaupt ein Transkript existiert.
So führen Sie ein vietnamesisch-englisches Meeting, dessen Aufzeichnung überlebt
Sechs Schritte, in der Reihenfolge, in der sie anfallen. Jeder adressiert ein oben dokumentiertes Versagen.
- Entscheiden Sie, welches Werkzeug für das Verstehen zuständig ist und welches für die Aufzeichnung — und akzeptieren Sie, dass es zwei verschiedene sind. Das ist der ganze Beitrag in einer Zeile. Google Translate oder Meet-Untertitel erledigen die erste Aufgabe für Vietnamesisch heute. Die zweite erledigt keines von beiden.
- Stellen Sie Vietnamesisch explizit als gesprochene Sprache ein; verlassen Sie sich nicht auf die automatische Erkennung. Bei DeepL ist das verpflichtend — Drittanbieter-Sprachen, Vietnamesisch eingeschlossen, können nicht automatisch erkannt werden. Überall sonst ist es trotzdem die bessere Wahl, denn die automatische Erkennung legt sich in den ersten Sekunden fest, auf dem kontextärmsten Audio der gesamten Sitzung.
- Prüfen Sie die Sprachliste der Aufzeichnungsfunktion, nicht die der Plattform. Die Falle, deretwegen dieser Beitrag existiert, ist die Annahme, dass eine Plattform, die Vietnamesisch übersetzt, es auch transkribiert. In Google Meet ist 69 gegen 8 der Abstand zwischen diesen beiden Annahmen.
- Benennen Sie das Code-Switching-Problem vor dem Gespräch. Wenn Ihr Team englische Produktnamen, Ticket-IDs und Abkürzungen in vietnamesische Sätze einstreut — und jedes Offshore-Engineering-Team tut das —, prüfen Sie, ob Ihr Aufzeichnungswerkzeug zwei Sprachen in einer Sitzung verträgt. Der Protokollant von Meet tut es ausdrücklich nicht.
- Korrigieren Sie Eigennamen in den ersten fünf Minuten, live. Vietnamesische Diakritika und englische Produkt-Codenamen sind die beiden Stellen, an denen Transkription zuverlässig bricht, und zugleich die beiden Stellen, an denen eine falsche Zeile jeder darauf aufbauenden Zusammenfassung den größten Schaden zufügt. Während des Meetings zu korrigieren kostet Sekunden.
- Halten Sie den vietnamesischen Ausgangstext, die englische Übersetzung und die Zusammenfassung in einer Aufzeichnung. Nicht drei Dateien in drei Werkzeugen. Übersetzung ist eine Einbahnstraße: Aus dem Vietnamesischen können Sie nächstes Jahr mit einem besseren Modell neu übersetzen, aber aus dem Englischen bekommen Sie das Vietnamesische nie zurück.
Wenn Sie statt der Marktanalyse die Schritt-für-Schritt-Anleitung im Produkt suchen: Unser Juni-Leitfaden für vietnamesische Teams behandelt die Verwandlung einer zweisprachigen Meeting-Aufnahme in eine überprüfbare KI-Notiz von Anfang bis Ende.
Das Fazit: Vietnamesisch hat die Verständnislücke überwunden, die Aufzeichnungslücke nicht
Fast das gesamte letzte Jahrzehnt lautete die Klage über Vietnamesisch in internationalen Meetings, die Technik verstehe es nicht gut genug. 2026 hat sich diese Klage weitgehend erledigt. Zwischen 74 Sprachen in Live translate, 69 in Meets übersetzten Untertiteln, mehr als 2.000 Sprachpaaren, die über Gemini 3.5 Live Translate nach Meet kommen, Vietnamesisch in Nova-3 und Samsung, das seit 2024 vietnamesische On-Device-Verdolmetschung ausliefert, ist das Verstehen erledigt.
Nicht bewegt hat sich die Aufzeichnung. Die beiden Google-Funktionen, die ein dauerhaftes Artefakt erzeugen, unterstützen zusammen acht Sprachen, dieselben acht, und Vietnamesisch ist in keiner. DeepL untertitelt ins Vietnamesische, leitet dessen Transkription aber hinter einem Admin-Schalter an einen Subunternehmer weiter. Der Markt hat entschieden, dass Vietnamesisch eine Sprache ist, die zu hören sich lohnt, und noch keine, die aufzuschreiben sich lohnt.
Die Frage an einen Anbieter lautet also nicht, ob er Vietnamesisch unterstützt. Fast alle sagen inzwischen ja, und fast alle meinen die zuhörende Hälfte. Die Frage lautet: Welche Ihrer Funktionen unterstützen Vietnamesisch nach Ende des Gesprächs — und können Sie mir die Sprachliste für genau diese Funktion zeigen?
Wo Telli.sh hineinpasst: Die Aufzeichnungsebene ist die Ebene, die wir bauen. Telli.sh transkribiert das Meeting in der Sprache, in der es tatsächlich gesprochen wurde, übersetzt in 44 Zielsprachen einschließlich Vietnamesisch und hält alle drei Artefakte in derselben Notiz — den vietnamesischen Ausgangstext, die daran ausgerichtete Übersetzung und die darauf aufbauende Zusammenfassung. Die Oberfläche selbst gibt es in 15 Sprachen, Vietnamesisch inbegriffen, sodass ein Team in Da Nang und ein Kunde in Sydney dasselbe Meeting in ihrer eigenen Sprache lesen und trotzdem eine korrigierbare Aufzeichnung teilen.
Live übersetzte Meeting-Notiz starten
Quellen
- Google Translate Help, "Hear live speech to speech translations with Live translate" (Android), abgerufen am 31. August 2026 — die Liste mit 74 Sprachen einschließlich Vietnamesisch, die vier Übersetzungsmodi, der Face-to-face-Modus und die Fortsetzung im Hintergrund.
- Google Translate Help, "Download languages to use offline" (Android), abgerufen am 31. August 2026 — Offline-Pakete und Upgrades auf höhere Qualität.
- Google Meet Help, "Use translated captions in Google Meet", abgerufen am 31. August 2026 — die Liste mit 69 Sprachen einschließlich Vietnamesisch, die kostenpflichtigen Workspace-Editionen und Record captions.
- Google Meet Help, "Use Transcripts with Google Meet", abgerufen am 31. August 2026 — die acht unterstützten Transkriptsprachen.
- Google Meet Help, "'Take notes for me' in Google Meet", abgerufen am 31. August 2026 — dieselben acht Sprachen und die Beschränkung auf jeweils eine Sprache.
- Slator, "Google Expands AI Live Speech Translation with Gemini 3.5 Live Translate", 16. Juni 2026 — die Ankündigung vom 9. Juni, 70+ Sprachen, Meets Sprung von fünf Sprachen auf 2.000+ Paare und der Listening-Modus.
- DeepL Help Center, "DeepL Voice languages", abgerufen am 31. August 2026 — die 18 von DeepL transkribierten gesprochenen Sprachen, die 20 gesprochenen Drittanbieter-Sprachen einschließlich Vietnamesisch, die 41 Übersetzungssprachen, die Einschränkung bei der automatischen Erkennung und die Zero-Retention-Vereinbarung mit Speechmatics.
- Samsung Newsroom, "The Learning Curve, Part 3: Taking AI Data From Good to Great", 23. Mai 2024 — Vietnamesisch unter den ersten 16 Sprachen von Galaxy AI, die sechs Töne, das Beispiel ma/mả/má und die Beschreibung der ~20-ms-Frames.
- Deepgram, Models & Languages Overview, abgerufen am 31. August 2026 — Vietnamesisch (
vi) in der Sprachliste von Nova-3. - Le, Nguyen und Nguyen, "PhoWhisper: Automatic Speech Recognition for Vietnamese", ICLR 2024 Tiny Papers — der akzentvielfältige Feinabstimmungsdatensatz mit 844 Stunden.
- "VietASR: Achieving Industry-level Vietnamese ASR with 50-hour labeled data and Large-Scale Speech Pretraining", 23. Mai 2025 — 70.000 unannotierte Stunden, 50 annotierte Stunden.
- "VietSuperSpeech: A Large-Scale Vietnamese Conversational Speech Dataset", 2026 — 52.023 Paare, 267,39 Stunden und die Registerlücke über acht Korpora.