ai insights阅读约 12 分钟

Google 推进实时翻译,OpenAI 开放全双工语音:语言障碍降低之后呢?

继 Google 推出覆盖 70 种语言的实时语音翻译三个月后,GPT-Live-1 以每分钟语音 $0.05 的价格开放 API。本文梳理已公布的价格和基准测试衡量了什么、没有衡量什么,以及为什么对话越容易,会议记录、想法分享和收藏的资料就越重要。

K
Ken Jo
#full-duplex-voice#gpt-live#gemini-live#speech-translation#meeting-notes#knowledge-management

两路交叠的语音连接到长期保存的对话记录、决策和来源

原创概念图。自然交流与有用的记录是相互补充的设计目标,图中内容不代表产品发布阶段或实测结果。

最近的语音 AI 公告带来了一种很日常、也很令人期待的可能:用自己熟悉的语言把想法说完,途中补充或更正,也能自然地参与对话。等待翻译的时间更少,开口前反复组织外语句子的负担也更轻。于是,我们可以把更多注意力放在对方真正想表达的意思上。

Google 于 2026 年 6 月 9 日发布 Gemini 3.5 Live Translate。OpenAI 于 7 月 8 日在 ChatGPT 中推出全双工 GPT-Live 模型,又于 9 月 10 日开放 GPT-Live-1 API。两类产品的用途不同,却都指向更连贯的语音交流。OpenAI 这次扩大的是开发者的使用范围,并非首次发布 GPT-Live。 Google 6 月公告 · OpenAI 7 月介绍 · OpenAI 9 月 API 发布

在我看来,这些进展让日常生活中语言障碍更少的世界又近了一步。与此同时,另一个问题也更值得思考:对话变得容易之后,怎样留下其中真正有价值的部分?整理会议记录、分享想法、保存参考资料,都是答案的一部分。

全双工语音改变了对话中的等待方式

全双工意味着系统可以一边听、一边说。OpenAI 的当前模型文档如此定义 GPT-Live-1,并说明它可以把推理与工具使用交给后端智能体。这描述的是同时交互的能力,并不保证翻译完全准确。 GPT-Live-1 模型文档,查阅于 2026 年 9 月 11 日

假设助手正在介绍计划,你插话说:“客户其实在马德里,不是墨西哥城。”好用的语音界面应该及时理解这次更正,而不是继续沿用错误前提。它还需要分清更正与简短的应和,以及思考时的停顿与真正结束发言。这些细微判断决定了交流是否顺畅。

过去的语音界面常常让人明显感觉到轮次的切换:说话、等待处理、听取回答,然后再开口。处理速度变快有帮助,但系统如果过早认定用户说完了,交流仍会尴尬。全双工设计直接处理听说交叠的时刻,不必把每段语音都当成封闭、完整的消息。

目前已有一个范围有限、但很具体的信号。OpenAI 表示,语言学习服务 Speak 在早期评估中发现,与此前按轮次交互的系统相比,学习者停下来思考时被 AI 打断的情况减少了近 80%。这是厂商转述的合作伙伴结果,不是对所有语言和场景的独立验证。它衡量的是打断行为,不是翻译准确率提高了 80%。 OpenAI API 发布公告,2026 年 9 月 10 日

OpenAI 公布的更多数据也指向同一方向,也有同样的边界。OpenAI 称,在考察停顿、话轮转换、打断和应和反馈的 Full Duplex Bench 上,GPT-Live-1 的得分比 GPT-Realtime-2.1 高 30 个百分点。与中等推理强度的 GPT-6 Astra 搭配时,它在 Tau3 上排名第一;Tau3 以 Pass@1 为语音客服和银行业务任务评分,其中包括 97 项银行知识任务。两项都是 OpenAI 对对话行为和任务完成情况的自家评估,都不是翻译准确率得分。 OpenAI 评估概述,2026 年 9 月 10 日

对使用第二语言的人来说,停下来找词的那一刻,恰恰可能决定他能否继续参与。懂得等待的助手会留出思考空间,能接受中途更正的助手则让尝试表达的负担更小。这些日常收益,比一段流畅的演示更能说明自然语音交互的意义。

轮流发言与同时听说的简化对比,展示回答过程中接收更正的情况

仅为概念性的时间示意,条形长度不表示实测延迟。全双工描述同时输入与输出,而如何妥善处理打断,仍取决于模型和应用。

实时通译与对话助手承担不同任务

Google 的 6 月公告介绍了覆盖 70 多种语言的连续语音翻译。模型在听取原话的同时生成译音,在等待更多上下文与及时跟上说话者之间取得平衡。Google 表示译音通常落后几秒,这比期待完全零延迟更实际。当时面向开发者的版本为公开预览。 Google 发布公告,2026 年 6 月 9 日

这份公告中的规模数据相当具体。Google Meet 的语音翻译将从支持 5 种语言扩展到 70 多种,并从只能在英语与其他语言之间互译,变为在一场会议中支持 2,000 多种语言组合。它将先以非公开预览的形式面向部分 Workspace 企业客户推出,2026 年晚些时候再扩大范围。Grab 正在测试把该模型用于司机与旅客之间的接驾沟通,这一场景每月有超过 1000 万通语音通话。公告引用了合作伙伴对质量、准确度和低延迟的好评,但没有公布任何数值评分。 Google 发布公告中的数据,2026 年 6 月 9 日

这里需要保留一个明确区别。Google 的 Live Translation 指南描述的是连续处理音频的通译功能,使用翻译专用设置,不支持工具或通用指令。GPT-Live-1 则是能够与独立智能体协作的对话模型。前者把说话者的意思转成另一种语言,后者参与交流,因此不能把两者当成可以直接互换的服务。 Google Live Translation 指南,查阅于 2026 年 9 月 11 日 · OpenAI 模型文档,同日查阅

时间节点公布的内容公告并未保证的事项
Google,2026 年 6 月 9 日Gemini 3.5 Live Translate;连续语音翻译;开发者公开预览所有语言组合质量一致,或所有 Google 产品立即可用
OpenAI,2026 年 7 月 8 日在 ChatGPT 中推出 GPT-Live,支持同时听说在所有场景中达到专业口译的准确度
OpenAI,2026 年 9 月 10 日开放 GPT-Live-1 API,供开发语音应用自动集成到所有会议或笔记服务

发布范围依据上文链接中的三份官方公告整理。这是时间线,不是性能排名。

把这些进展放在一起,方向就清晰了:翻译可以更连续,与助手交流也可以更自然。要把它们组成可靠的多语言会议体验,应用仍需完成许多工作,包括识别正在通译谁的声音、把结果送给谁、怎样处理更正,以及向参与者展示什么。

公开的数字:每分钟 $0.05,没有准确率评分

在 API 中,GPT-Live-1 语音每分钟 $0.05,按秒计费,不会向上取整到整分钟。这个价格只涵盖前端语音层;会话委托的后端模型和工具按各自的正常费率另行计费。 OpenAI 模型文档,查阅于 2026 年 9 月 11 日

这笔账很好算,也很容易看错。一次 30 分钟的会话,语音层费用为 $1.50,一小时为 $3.00,每月 100 小时则是 $300,这还没算后端推理。如果应用为每位与会者单独开启会话,就要把这些数字再乘以会话数量。Google 的 6 月公告没有列出 Gemini 3.5 Live Translate 的价格,因此本文不从成本角度比较二者。

指标数值来源与日期衡量的内容
GPT-Live-1 API 价格每分钟 $0.05,按秒计费OpenAI,2026 年 9 月 10 日仅语音层;后端模型和工具另行计费
Full Duplex Bench较 GPT-Realtime-2.1 高 30 个百分点OpenAI,2026 年 9 月 10 日停顿、话轮转换和打断,不是翻译
Tau3排名第一,搭配 GPT-6 Astra(中等推理强度)OpenAI,2026 年 9 月 10 日语音任务成功率(Pass@1),含 97 项银行任务
Speak 早期评估思考停顿时的打断减少近 80%OpenAI(转述合作伙伴),2026 年 9 月 10 日与此前按轮次交互的系统相比的打断行为
ChatGPT 语音使用每周超过 1.5 亿人OpenAI,2026 年 7 月 8 日语音和听写功能的使用量,不是质量
Gemini 3.5 Live Translate70 多种语言,自动识别Google,2026 年 6 月 9 日覆盖范围,不是各语言组合的质量
Google Meet 语音翻译5 → 70+ 种语言;每场会议 2,000 多种组合Google,2026 年 6 月 9 日计划中的升级,先以非公开预览推出
翻译延迟“仅落后说话者几秒”Google,2026 年 6 月 9 日厂商描述,不是实测数据

所有数据均由厂商公布,来自本文链接的公告和文档。其中没有任何一项是翻译准确率的数值评分,例如人工评分或针对某一语言组合的自动指标。

对于为多语言会议挑选工具的人来说,这个空白最为关键。交互基准能告诉你系统是否善于等待、倾听和纠偏,却无法告诉你英语里的“Monday”译成韩语后是否仍然是星期一。OpenAI 7 月提到部分语言存在非母语口音,Google 也没有公布各语言组合的评分,两者指向同一条实用原则:在依靠任何一方做决策之前,先用团队实际使用的语言组合测试。

降低语言障碍,从愿意开口开始

设想一场 30 分钟的项目会议,四位参与者最熟悉的语言共有三种。更好的语音翻译带来的收益,不只是每个人听懂更多话,而是能在疑问变成误解前及时追问。尚未成熟的想法,也不必先打磨成完整的外语句子才能说出来。

这让参与讨论需要付出的努力更少。原本安静倾听、却拥有相关经验的人,多了一条加入讨论的途径。主持人不必反复还原被打断的句子。大家还记得刚才的重点时,就能完成必要的澄清。

我期待这种变化能帮助远程团队、课堂讨论、客户交流,以及旅行中的日常沟通。这是在讨论技术可能发挥作用的领域,并非声称所有人已经获得同样的体验。语言组合、口音、词汇、麦克风质量和产品设计,仍共同决定实际效果。

声音听起来很自然,也需要与意思表达得准确区分开来。OpenAI 在 7 月的介绍中明确提到,部分语言可能带有非母语口音,或存在流利程度上的不足。因此,应该用人们实际使用的语言评估,而不是凭一段流畅的英语演示推断所有语言的表现。这是发布时的说明,并非对 9 月所有部署环境的最新评测。 OpenAI GPT-Live 介绍及语言说明,2026 年 7 月 8 日

更合理的目标是让更多人参与,同时保留方便的确认方式。日期、金额、人名和附带条件的承诺,都应当容易核对。即使 AI 语气肯定,参与者也可能需要说:“请把这句话显示成文字。”提供文本,并在参与者同意录音时保留原始材料,才能满足这种核对需求。

会议说得再流畅,也需要留下决策记录

回到那场假设的会议。有人说:“如果安全审查完成,我们可以周五发布。”另一人认为,周一能给支持团队更多准备时间。最终大家选定周一,指定负责人,但仍有一个前置条件没有解决。如果摘要只记住最初提出的周五,就没有记录下会议的真正结果。

对话节奏再顺畅,也不会消除建议、条件和决定之间的区别。说同一种语言的人本来就需要分清这些。跨语言交流中,保留原始发言、译文和最终约定之间的关系,价值会更加明显。

一份实用的会议记录,应该让缺席者快速找到三件事:决定了什么、下一步由谁负责、还有哪些问题未解决。只有真正商定的期限,才能写成已达成的约定。如果原话不清楚,记录也应保留这种不确定性,而不是为了写得简洁就补出一个不存在的结论。

这并不要求把每次对话都变成完整档案。一份简短的决策说明,有时比没有区分重点的长篇转写更有用。关键是让简明结论与依据保持关联:相关原话、获得授权且可用的录音,以及讨论时参考的文档。

有了这种关联,纠错也更容易。参与者可以指出原话,修改错误摘要,再分享更正后的决定。否则,下一位读者可能继续总结已有摘要,让最初的误解逐渐变成看似确定的事实。更好的语音技术方便当下交流,好的记录则让日后核查成为可能。

分享想法,也要保留赋予它意义的来源

有用的想法很少在一次通话中完整地开始并结束。有人读到文章,保存一段内容,从中提出问题,再把问题带到会议。另一个人从视频或论文里补充反例。对话结束后,还能重新连接这些材料,才能继续推进下一步。

这就是为什么语音 AI 再出色,网页收藏仍然重要。保存的 URL 提供返回来源的路径,选中的段落说明重点在哪里,简短的个人备注则解释为什么值得保存。这些信息各有作用,把它们放在一起,比单独转发一段 AI 生成的文字更有助于分享想法。

例如,只说“我们应该改进新用户引导”,很难让下一位同事接着做。“这篇文章让我重新思考最初五分钟的体验;这里有相关段落、我们的讨论,以及决定尝试的实验”,就提供了可审视的依据。这是一个假设例子,但区别很具体:只给结论是在请求信任,给出思路与来源则能继续展开讨论。

同一原则也能避免原始材料与评论混在一起。引用应当让人看得出是引用,翻译是对原文的跨语言表达,会议摘要则是进一步整理的结果。把这些角色说明白,人们就能直接讨论分歧,而不必先费力还原最初是谁说了什么。

原始录音或选取的段落,与译文、决策说明和可分享的想法保持关联

原创工作流程建议。保留经过授权的原始材料,让派生文本可以纠正,并在分享时保持来源可见。图示不表示所有关联目前都已实现自动化。

通话结束后,仍要让上下文延续

语音系统也开始把对话与后台执行的工作分开。OpenAI 的任务委派文档说明,实时语音和受委派任务可以独立进行;后台响应完成,不代表用户已经听到答案。这提醒产品设计者注意:一次口头交互和一个持久的工作结果,需要分别验证。 OpenAI 任务委派文档,查阅于 2026 年 9 月 11 日

对日常使用者来说,问题更简单。通话结束后,明天还能找到决定吗?同事能理解为什么这样决定吗?不用翻找聊天记录、浏览器和录音,也能回到那篇改变我们看法的文章吗?即使每句话都被通译得很好,这些问题依然存在。

我们有理由期待语言障碍逐渐减弱,也应该欢迎帮助更多人自在表达的工具。我认为,交流越容易,把所说的话与保存的资料、分享的想法及实际行动连接起来,就越有价值。会议本身不必永远存在,但它产生的有用结果应该在通话结束后继续发挥作用。


Telli.sh 希望走向哪里

对 Telli.sh 而言,值得投入的方向是帮助人们把对话与发现变成能够再次使用的知识。如今,产品把笔记、录音、翻译和 Clip 汇集到一个工作空间。下一步应当加强它们之间的联系,让会议记录、想法和来源不再重新散落。

我们希望工作流程自然衔接:记录获准保存的对话,复核重点,让决定容易理解,再把想法与支撑材料一起分享。如果讨论始于一个网页,Clip 就应帮助保留 URL 和用户选择保存的上下文。如果翻译帮助了理解,原文也应保留,方便比较和纠正。

这是产品方向的说明,并不是宣布 Telli.sh 已经集成 GPT-Live-1 或 Gemini 3.5 Live Translate。未来引入语音技术,应以多语言环境中的实际价值、可靠的记录,以及用户对保存范围的明确控制为标准。我们的目标是让底层模型的进步改善工作空间,同时避免让个人知识依赖某一个模型。

跨语言交流越容易,我们越希望帮助其中的价值长久留存。可以从一场值得记住的会议、一个值得分享的想法,或一份将来还会用到的资料开始。

创建 Telli.sh 工作空间,留下重要内容


返回博客