Google 推进实时翻译,OpenAI 开放全双工语音:语言障碍降低之后呢?
继 Google 推出覆盖 70 种语言的实时语音翻译三个月后,GPT-Live-1 以每分钟语音 $0.05 的价格开放 API。本文梳理已公布的价格和基准测试衡量了什么、没有衡量什么,以及为什么对话越容易,会议记录、想法分享和收藏的资料就越重要。
原创概念图。自然交流与有用的记录是相互补充的设计目标,图中内容不代表产品发布阶段或实测结果。
最近的语音 AI 公告带来了一种很日常、也很令人期待的可能:用自己熟悉的语言把想法说完,途中补充或更正,也能自然地参与对话。等待翻译的时间更少,开口前反复组织外语句子的负担也更轻。于是,我们可以把更多注意力放在对方真正想表达的意思上。
Google 于 2026 年 6 月 9 日发布 Gemini 3.5 Live Translate。OpenAI 于 7 月 8 日在 ChatGPT 中推出全双工 GPT-Live 模型,又于 9 月 10 日开放 GPT-Live-1 API。两类产品的用途不同,却都指向更连贯的语音交流。OpenAI 这次扩大的是开发者的使用范围,并非首次发布 GPT-Live。 Google 6 月公告 · OpenAI 7 月介绍 · OpenAI 9 月 API 发布
在我看来,这些进展让日常生活中语言障碍更少的世界又近了一步。与此同时,另一个问题也更值得思考:对话变得容易之后,怎样留下其中真正有价值的部分?整理会议记录、分享想法、保存参考资料,都是答案的一部分。
全双工语音改变了对话中的等待方式
全双工意味着系统可以一边听、一边说。OpenAI 的当前模型文档如此定义 GPT-Live-1,并说明它可以把推理与工具使用交给后端智能体。这描述的是同时交互的能力,并不保证翻译完全准确。 GPT-Live-1 模型文档,查阅于 2026 年 9 月 11 日
假设助手正在介绍计划,你插话说:“客户其实在马德里,不是墨西哥城。”好用的语音界面应该及时理解这次更正,而不是继续沿用错误前提。它还需要分清更正与简短的应和,以及思考时的停顿与真正结束发言。这些细微判断决定了交流是否顺畅。
过去的语音界面常常让人明显感觉到轮次的切换:说话、等待处理、听取回答,然后再开口。处理速度变快有帮助,但系统如果过早认定用户说完了,交流仍会尴尬。全双工设计直接处理听说交叠的时刻,不必把每段语音都当成封闭、完整的消息。
目前已有一个范围有限、但很具体的信号。OpenAI 表示,语言学习服务 Speak 在早期评估中发现,与此前按轮次交互的系统相比,学习者停下来思考时被 AI 打断的情况减少了近 80%。这是厂商转述的合作伙伴结果,不是对所有语言和场景的独立验证。它衡量的是打断行为,不是翻译准确率提高了 80%。 OpenAI API 发布公告,2026 年 9 月 10 日
OpenAI 公布的更多数据也指向同一方向,也有同样的边界。OpenAI 称,在考察停顿、话轮转换、打断和应和反馈的 Full Duplex Bench 上,GPT-Live-1 的得分比 GPT-Realtime-2.1 高 30 个百分点。与中等推理强度的 GPT-6 Astra 搭配时,它在 Tau3 上排名第一;Tau3 以 Pass@1 为语音客服和银行业务任务评分,其中包括 97 项银行知识任务。两项都是 OpenAI 对对话行为和任务完成情况的自家评估,都不是翻译准确率得分。 OpenAI 评估概述,2026 年 9 月 10 日
对使用第二语言的人来说,停下来找词的那一刻,恰恰可能决定他能否继续参与。懂得等待的助手会留出思考空间,能接受中途更正的助手则让尝试表达的负担更小。这些日常收益,比一段流畅的演示更能说明自然语音交互的意义。
仅为概念性的时间示意,条形长度不表示实测延迟。全双工描述同时输入与输出,而如何妥善处理打断,仍取决于模型和应用。
实时通译与对话助手承担不同任务
Google 的 6 月公告介绍了覆盖 70 多种语言的连续语音翻译。模型在听取原话的同时生成译音,在等待更多上下文与及时跟上说话者之间取得平衡。Google 表示译音通常落后几秒,这比期待完全零延迟更实际。当时面向开发者的版本为公开预览。 Google 发布公告,2026 年 6 月 9 日
这份公告中的规模数据相当具体。Google Meet 的语音翻译将从支持 5 种语言扩展到 70 多种,并从只能在英语与其他语言之间互译,变为在一场会议中支持 2,000 多种语言组合。它将先以非公开预览的形式面向部分 Workspace 企业客户推出,2026 年晚些时候再扩大范围。Grab 正在测试把该模型用于司机与旅客之间的接驾沟通,这一场景每月有超过 1000 万通语音通话。公告引用了合作伙伴对质量、准确度和低延迟的好评,但没有公布任何数值评分。 Google 发布公告中的数据,2026 年 6 月 9 日
这里需要保留一个明确区别。Google 的 Live Translation 指南描述的是连续处理音频的通译功能,使用翻译专用设置,不支持工具或通用指令。GPT-Live-1 则是能够与独立智能体协作的对话模型。前者把说话者的意思转成另一种语言,后者参与交流,因此不能把两者当成可以直接互换的服务。 Google Live Translation 指南,查阅于 2026 年 9 月 11 日 · OpenAI 模型文档,同日查阅
| 时间节点 | 公布的内容 | 公告并未保证的事项 |
|---|---|---|
| Google,2026 年 6 月 9 日 | Gemini 3.5 Live Translate;连续语音翻译;开发者公开预览 | 所有语言组合质量一致,或所有 Google 产品立即可用 |
| OpenAI,2026 年 7 月 8 日 | 在 ChatGPT 中推出 GPT-Live,支持同时听说 | 在所有场景中达到专业口译的准确度 |
| OpenAI,2026 年 9 月 10 日 | 开放 GPT-Live-1 API,供开发语音应用 | 自动集成到所有会议或笔记服务 |
发布范围依据上文链接中的三份官方公告整理。这是时间线,不是性能排名。
把这些进展放在一起,方向就清晰了:翻译可以更连续,与助手交流也可以更自然。要把它们组成可靠的多语言会议体验,应用仍需完成许多工作,包括识别正在通译谁的声音、把结果送给谁、怎样处理更正,以及向参与者展示什么。
公开的数字:每分钟 $0.05,没有准确率评分
在 API 中,GPT-Live-1 语音每分钟 $0.05,按秒计费,不会向上取整到整分钟。这个价格只涵盖前端语音层;会话委托的后端模型和工具按各自的正常费率另行计费。 OpenAI 模型文档,查阅于 2026 年 9 月 11 日
这笔账很好算,也很容易看错。一次 30 分钟的会话,语音层费用为 $1.50,一小时为 $3.00,每月 100 小时则是 $300,这还没算后端推理。如果应用为每位与会者单独开启会话,就要把这些数字再乘以会话数量。Google 的 6 月公告没有列出 Gemini 3.5 Live Translate 的价格,因此本文不从成本角度比较二者。
| 指标 | 数值 | 来源与日期 | 衡量的内容 |
|---|---|---|---|
| GPT-Live-1 API 价格 | 每分钟 $0.05,按秒计费 | OpenAI,2026 年 9 月 10 日 | 仅语音层;后端模型和工具另行计费 |
| Full Duplex Bench | 较 GPT-Realtime-2.1 高 30 个百分点 | OpenAI,2026 年 9 月 10 日 | 停顿、话轮转换和打断,不是翻译 |
| Tau3 | 排名第一,搭配 GPT-6 Astra(中等推理强度) | OpenAI,2026 年 9 月 10 日 | 语音任务成功率(Pass@1),含 97 项银行任务 |
| Speak 早期评估 | 思考停顿时的打断减少近 80% | OpenAI(转述合作伙伴),2026 年 9 月 10 日 | 与此前按轮次交互的系统相比的打断行为 |
| ChatGPT 语音使用 | 每周超过 1.5 亿人 | OpenAI,2026 年 7 月 8 日 | 语音和听写功能的使用量,不是质量 |
| Gemini 3.5 Live Translate | 70 多种语言,自动识别 | Google,2026 年 6 月 9 日 | 覆盖范围,不是各语言组合的质量 |
| Google Meet 语音翻译 | 5 → 70+ 种语言;每场会议 2,000 多种组合 | Google,2026 年 6 月 9 日 | 计划中的升级,先以非公开预览推出 |
| 翻译延迟 | “仅落后说话者几秒” | Google,2026 年 6 月 9 日 | 厂商描述,不是实测数据 |
所有数据均由厂商公布,来自本文链接的公告和文档。其中没有任何一项是翻译准确率的数值评分,例如人工评分或针对某一语言组合的自动指标。
对于为多语言会议挑选工具的人来说,这个空白最为关键。交互基准能告诉你系统是否善于等待、倾听和纠偏,却无法告诉你英语里的“Monday”译成韩语后是否仍然是星期一。OpenAI 7 月提到部分语言存在非母语口音,Google 也没有公布各语言组合的评分,两者指向同一条实用原则:在依靠任何一方做决策之前,先用团队实际使用的语言组合测试。
降低语言障碍,从愿意开口开始
设想一场 30 分钟的项目会议,四位参与者最熟悉的语言共有三种。更好的语音翻译带来的收益,不只是每个人听懂更多话,而是能在疑问变成误解前及时追问。尚未成熟的想法,也不必先打磨成完整的外语句子才能说出来。
这让参与讨论需要付出的努力更少。原本安静倾听、却拥有相关经验的人,多了一条加入讨论的途径。主持人不必反复还原被打断的句子。大家还记得刚才的重点时,就能完成必要的澄清。
我期待这种变化能帮助远程团队、课堂讨论、客户交流,以及旅行中的日常沟通。这是在讨论技术可能发挥作用的领域,并非声称所有人已经获得同样的体验。语言组合、口音、词汇、麦克风质量和产品设计,仍共同决定实际效果。
声音听起来很自然,也需要与意思表达得准确区分开来。OpenAI 在 7 月的介绍中明确提到,部分语言可能带有非母语口音,或存在流利程度上的不足。因此,应该用人们实际使用的语言评估,而不是凭一段流畅的英语演示推断所有语言的表现。这是发布时的说明,并非对 9 月所有部署环境的最新评测。 OpenAI GPT-Live 介绍及语言说明,2026 年 7 月 8 日
更合理的目标是让更多人参与,同时保留方便的确认方式。日期、金额、人名和附带条件的承诺,都应当容易核对。即使 AI 语气肯定,参与者也可能需要说:“请把这句话显示成文字。”提供文本,并在参与者同意录音时保留原始材料,才能满足这种核对需求。
会议说得再流畅,也需要留下决策记录
回到那场假设的会议。有人说:“如果安全审查完成,我们可以周五发布。”另一人认为,周一能给支持团队更多准备时间。最终大家选定周一,指定负责人,但仍有一个前置条件没有解决。如果摘要只记住最初提出的周五,就没有记录下会议的真正结果。
对话节奏再顺畅,也不会消除建议、条件和决定之间的区别。说同一种语言的人本来就需要分清这些。跨语言交流中,保留原始发言、译文和最终约定之间的关系,价值会更加明显。
一份实用的会议记录,应该让缺席者快速找到三件事:决定了什么、下一步由谁负责、还有哪些问题未解决。只有真正商定的期限,才能写成已达成的约定。如果原话不清楚,记录也应保留这种不确定性,而不是为了写得简洁就补出一个不存在的结论。
这并不要求把每次对话都变成完整档案。一份简短的决策说明,有时比没有区分重点的长篇转写更有用。关键是让简明结论与依据保持关联:相关原话、获得授权且可用的录音,以及讨论时参考的文档。
有了这种关联,纠错也更容易。参与者可以指出原话,修改错误摘要,再分享更正后的决定。否则,下一位读者可能继续总结已有摘要,让最初的误解逐渐变成看似确定的事实。更好的语音技术方便当下交流,好的记录则让日后核查成为可能。
分享想法,也要保留赋予它意义的来源
有用的想法很少在一次通话中完整地开始并结束。有人读到文章,保存一段内容,从中提出问题,再把问题带到会议。另一个人从视频或论文里补充反例。对话结束后,还能重新连接这些材料,才能继续推进下一步。
这就是为什么语音 AI 再出色,网页收藏仍然重要。保存的 URL 提供返回来源的路径,选中的段落说明重点在哪里,简短的个人备注则解释为什么值得保存。这些信息各有作用,把它们放在一起,比单独转发一段 AI 生成的文字更有助于分享想法。
例如,只说“我们应该改进新用户引导”,很难让下一位同事接着做。“这篇文章让我重新思考最初五分钟的体验;这里有相关段落、我们的讨论,以及决定尝试的实验”,就提供了可审视的依据。这是一个假设例子,但区别很具体:只给结论是在请求信任,给出思路与来源则能继续展开讨论。
同一原则也能避免原始材料与评论混在一起。引用应当让人看得出是引用,翻译是对原文的跨语言表达,会议摘要则是进一步整理的结果。把这些角色说明白,人们就能直接讨论分歧,而不必先费力还原最初是谁说了什么。
原创工作流程建议。保留经过授权的原始材料,让派生文本可以纠正,并在分享时保持来源可见。图示不表示所有关联目前都已实现自动化。
通话结束后,仍要让上下文延续
语音系统也开始把对话与后台执行的工作分开。OpenAI 的任务委派文档说明,实时语音和受委派任务可以独立进行;后台响应完成,不代表用户已经听到答案。这提醒产品设计者注意:一次口头交互和一个持久的工作结果,需要分别验证。 OpenAI 任务委派文档,查阅于 2026 年 9 月 11 日
对日常使用者来说,问题更简单。通话结束后,明天还能找到决定吗?同事能理解为什么这样决定吗?不用翻找聊天记录、浏览器和录音,也能回到那篇改变我们看法的文章吗?即使每句话都被通译得很好,这些问题依然存在。
我们有理由期待语言障碍逐渐减弱,也应该欢迎帮助更多人自在表达的工具。我认为,交流越容易,把所说的话与保存的资料、分享的想法及实际行动连接起来,就越有价值。会议本身不必永远存在,但它产生的有用结果应该在通话结束后继续发挥作用。
Telli.sh 希望走向哪里
对 Telli.sh 而言,值得投入的方向是帮助人们把对话与发现变成能够再次使用的知识。如今,产品把笔记、录音、翻译和 Clip 汇集到一个工作空间。下一步应当加强它们之间的联系,让会议记录、想法和来源不再重新散落。
我们希望工作流程自然衔接:记录获准保存的对话,复核重点,让决定容易理解,再把想法与支撑材料一起分享。如果讨论始于一个网页,Clip 就应帮助保留 URL 和用户选择保存的上下文。如果翻译帮助了理解,原文也应保留,方便比较和纠正。
这是产品方向的说明,并不是宣布 Telli.sh 已经集成 GPT-Live-1 或 Gemini 3.5 Live Translate。未来引入语音技术,应以多语言环境中的实际价值、可靠的记录,以及用户对保存范围的明确控制为标准。我们的目标是让底层模型的进步改善工作空间,同时避免让个人知识依赖某一个模型。
跨语言交流越容易,我们越希望帮助其中的价值长久留存。可以从一场值得记住的会议、一个值得分享的想法,或一份将来还会用到的资料开始。