speech-to-text阅读约 10 分钟

词错误率 2.4%,却依然不知道是谁在说话

微软 MAI-Transcribe-1.5 拿下 2.4% 的词错误率,而它自己的官方文档写着「不支持说话人分离」。本文用大白话讲清楚:WER 到底测的是什么,为什么排行榜已经挤在地板上,以及把转写变成一份能用的会议纪要,真正起作用的是语音识别之上的哪几层。

T
Telli.sh Team
#speech-to-text#word-error-rate#transcription#diarization#meeting-notes#mai-transcribe#ai-notetaker

六月初,微软 AI 超级智能团队发布了 MAI-Transcribe-1.5,在独立基准 Artificial Analysis 的排行榜上拿到 2.4% 的词错误率。单个模型覆盖 43 种语言,面对口音和嘈杂会议室依然稳得住,一小时的音频不到十五秒就能跑完。

然后去看这个模型自己的 Azure 官方文档。在使用注意事项里有这么一行:「不支持说话人分离(diarization)。」

说话人分离,就是告诉你谁在说话的那部分。也就是说,今年最受关注的语音模型造出了一堵几乎无懈可击的文字墙,却完全不知道这些话是从谁嘴里出来的。这不是发布说明里的疏漏,而是对这个行业当前位置的一次精准写照。听清,已经基本被解决了。而听清,从来就不是会议纪要难的那一部分。

这篇文章讲的是:一份准确的转写,和一份你真的敢发给团队的纪要,中间隔着多远。词错误率测量了什么,它在结构上又测量不了什么,以及语音识别之上叠着哪些层、悄悄决定了最终结果。如果你曾经拿到一份技术上完美、实际上毫无用处的转写,这里就是那种感觉的解释。

TL;DR:

  • 词错误率已经挤在地板上。Artificial Analysis 独立排行榜上前九名模型集中在 1.73% 到 3.31% 之间,换一个「更准」的引擎,在一场普通的一小时会议里也就多对几十个词。
  • WER 对每个词一视同仁。决议里漏掉一个「不」,和漏掉一声「呃」,同样都是 0.016%。这个指标分不清错别字和被反转的承诺。
  • 剩下的活儿都在转写之上:说话人归属、切分、精修、摘要。微软自己的模型卡就是证据——顶级准确率,没有说话人分离,也没有流式。

48 轨录音棚调音台占满画面,成排的推子、旋钮和通道表

图片:Steve Knight,Rockfield Studios,Wikimedia Commons,CC BY 2.0。

2.4% 落到读的人眼里,究竟是什么感觉

词错误率是语音识别里最老、也最粗的一个数字。正因为它被引用得太频繁,才值得搞清楚。拿到实际说过的内容,也就是人工制作的参考转写;拿到模型写出来的东西;然后把错的词分三类来数:替换(人家说「部署」,它写成「部长」)、删除(整个词漏掉)、插入(凭空造出一个没人说过的词)。加起来,除以参考转写的总词数,就是 WER。越低越好。

所以 2.4% 的意思是,大约每四十二个词里错一个。

放进一场真实会议里看。一小时的会议,大家真正在说话的时间大概四十五分钟,按正常语速每分钟 140 个词算,大约是 6,300 个词。按 2.4% 的 WER,其中约 150 个是错的。摊到整份转写里,差不多每屏都有那么几个。

接下来是这个指标拒绝回答的问题:错的是 150 个?

WER 给语言里的每一个词都赋予相同权重。虚词「的」和否定词「不」,价值完全一样。设想一份转写把「我们不会在第三季度发布」写成了「我们会在第三季度发布」。这是一次删除,6,300 个词里的一个词,占全文 0.016%,对着 2.4% 的预算连零头都算不上。可这份纪要现在记录的,是会议室实际决定的反面。

同样的不对称还贯穿人名、产品代号和内部缩写——那些每个字承载意义最重、在训练数据里出现却最少的词。一份转写可以把 6,150 个连接性词句全部拿下,同时把会议室里所有专有名词都碾碎,而 WER 看上去依然漂亮。任何回头读过自己团队站会转写的人都懂这种感觉:字都对,会没了。

排行榜已经挤在地板附近

这一段会重新定义整个品类的看法。我们在 2026 年 8 月 4 日拉取了 Artificial Analysis 的语音识别排行榜——这是独立基准,不是厂商自己的成绩单。它的 AA-WER v2 指数,是在三个数据集共约八小时音频上按时长加权平均得出的:AA-AgentTalk 占 50%,VoxPopuli-Cleaned-AA 占 25%,Earnings22-Cleaned-AA 占 25%。榜首部分是这样:

排名模型AA-WER
1Fun-Realtime-ASR-preview1.73%
2Scribe v22.18%
3MAI-Transcribe-1.52.38%
4Smallest AI Pulse Pro2.43%
5Voxtral Small2.77%
6Gemini 3.1 Pro Preview (High)2.82%
7Universal-3.5 Pro3.02%
8Solaria-3 (Gladia)3.23%
9GPT Transcribe3.31%
11Whisper Large v34.07%

来源:Artificial Analysis 语音识别排行榜,2026 年 8 月 4 日获取(AA-WER v2,非流式)。

有两件事跳出来。第一,微软那 2.4% 是真的,而且是独立测出来的——但它是第三,不是第一。至于更强的那句「在全部 43 种语言的 FLEURS 上达到同类最佳准确率」,是微软自己的口径,在有外部机构测量之前,按厂商数字来读比较稳妥。

第二,也远比第一点重要:九个模型被压进了 1.6 个百分点的窄带里。换算回那场 6,300 词的会议:榜首模型错约 109 个词,第九名错约 209 个,而至今仍被大量产品使用的开源基线 Whisper Large v3 错约 256 个。

想想这对采购决策意味着什么。从中档引擎换到榜首引擎,一小时大约少错 100 个词。这不是没有意义,在医疗和法律转写里确实重要。但它离「一份你信得过的纪要」和「一份要从头重写的纪要」之间的差距,还差得远。如今像样的引擎全都过了 96% 的准确率。真正决定你的会议纪要有没有用的变量,在别的地方。

微软的发布说明,是这个品类里最诚实的一份文档

于是回到开篇那一行。微软 Azure Speech 的文档把 MAI-Transcribe 的限制列得很平实:不支持说话人分离,不支持提示词微调,并且目前是通过 LLM Speech API 提供的公开预览版。关于发布的报道还补充了一点:它也没有原生流式 API,所以实时场景受限。

请体会一下这个形状。这家公司在「听清」这件事上投入了巨大的工程量——语言从上一代的 25 种扩到 43 种,新增 18 种而准确率没有回退。然后它在没有说话人标签、没有流式的情况下发布了。而这两样,恰恰是一场进行中的会议最需要的。

我们的看法是:这不是微软产品的缺口,而是关于整个领域分层结构的一句宣告。识别现在是零件,不是产品。它变成了你去采购、去跑分、去替换的东西,而有意思的工作已经搬到了包在它外面的一切上。

速记员的天花板

我们内部反复用一个说法:速记员的天花板。过了这条线,听得更清就不再有帮助了,因为剩下的活儿根本不是听。

一位完美的速记员会给你一份完美的字词记录。但他不会告诉你,那两句「行,可以」出自不同的人,意思也不同。他不会标出某个话题在哪里结束。他也不会告诉你,关于搬办公室的那二十分钟压根就不该进纪要。转写之上有四个层次,每一层都有自己的塌法。

说话人归属,也就是说话人分离。 这套机制把单一音频流切成「说话人 1、说话人 2、说话人 3」,并让这些标签在一小时里保持稳定。它和识别是彻底不同的问题,有自己独特的失效方式:两个人抢话时、有人中途加入时、同一个人用免提和用耳机听起来不一样时。而且它一旦失效就是破坏性的。把一句承诺挂到错的人头上,比谁也不挂更糟,因为读的人会信。而这恰好是那个得分最高的模型没有提供的能力。

切分。 识别的原始输出是一条河。真实的说话不是按句子到达的,它带着重启、拖尾和打断一起到达。模型必须判断句子在哪里断、某个人的发言轮次在哪里结束、对话在哪里换了话题。这里判断错了,你会得到技术上准确但没人会读的段落,因为眼睛找不到落脚处。判断对了,同样这些字就变成可以扫读的文本。而这份改善,在 WER 上一个字符都不会体现。

精修。 原始转写和纪要之间还有一道清理工序:剔掉口头禅和说了一半的话,规范数字和日期,修正声学模型根本无从知晓的专业术语。「第三季度」被规范成「Q3」,一个流出来变成三个像模像样普通词的内部代号被还原回去。这是领域知识进场的一层,也是「读起来像庭审记录」和「读起来像笔记」的分水岭。

摘要。 最后是判断:这一小时里,哪些是决定,哪些是悬而未决的问题,哪些是把工作派给了具体某个人,哪些是停车场那二十分钟。这是绝大多数读者唯一真正会看的一层,却完全依赖前面三层。一个基于没有说话人、没有切分的转写工作的摘要器,其实是在猜谁承诺了什么。给它干净的发言轮次,它就不用猜了。

依赖关系是单向流动的,这正是准确率之争如此容易误导人的原因。把 WER 从 2.4% 降到 1.7%,改善的是一条四步链路的输入,而那四步从来没人测过。

关键词偏置,是行业悄悄承认了这一点

MAI-Transcribe-1.5 的这次发布里,有一个功能等于把底牌亮了出来。而它同时也是这次发布里最有用的东西。

这个模型支持关键词偏置,也叫实体偏置:你把最多 200 个领域词条——参会者姓名、产品名、内部缩写——作为列表交给它,它就会把预测朝这个列表倾斜,而且不是硬套,而是结合上下文判断什么时候该应用这种偏置。微软报告称,启用偏置后在 FLEURS 上 WER 最多下降 30%。他们公布的例子非常具体:不给关键词列表时,三个名字被写成「Sean」「Oif」「Societal」;给了列表,模型把「Shaun」「Aoife」「Xochitl」找了回来。

仔细看这里发生了什么。音频没变。声学条件没有改善。模型之前并不是听得更差,它听得好好的,只是猜错了,因为它不知道会议室里都有谁。把参会名单递过去,将近三分之一的错误就蒸发了。

这就是本文的全部论点,而且是由那个拥有最高分模型的厂商,以产品功能的形式交付出来的。今年最受瞩目的发布里,最有效的准确率提升手段,靠的是注入音频里本来就不存在的信息。这意味着转写剩下的前线不是声学,而是上下文——而上下文,恰恰就是转写之上那几层赖以搭建的材料。

与此同时,所有人都在抢着捕获更多音频

硬件市场得出了相反的结论,这值得一提。INMO 的 GO3 眼镜售价 599 美元,宣称能把 98 种以上语言的实时翻译投到镜片上,并自动录音、转写、摘要你的每一次对话和会议,背后由 ChatGPT 和 Gemini 支撑。以上都是其产品页上厂商自己的说法,野心很明确:随时随地、不用动手、全都录下来。

可捕获从来就不是瓶颈。桌上放一部手机,十年前就足够把会议录清楚了。让捕获变得更加无处不在,只会把更多音频灌进同一条尚未打通的流水线。要说有什么变化,问题反而更尖锐了:一台整天录下你所有对话的设备,只会产出多得多的、亟需「判断什么才重要」的素材。

与其读 WER 数字,不如做这三个测试

如果你正在评估转写或会议纪要工具,公开的准确率数字分不出高下,因为大家都挤在几个百分点之内。真正能分出来的是三个测试。

录一场至少三个人参加、并且确实有一段抢话的会议,然后检查说话人标签从第 5 分钟到第 50 分钟是否始终一致——说话人分离正是在那里悄悄退化的。接着,挑一条用否定形式表述的决定(「这个季度我们做迁移」),到摘要里去找它;会反转或漏掉否定的系统,会在这里露馅。最后,把摘要和你自己对这场会的记忆对照,分开数两件事:它写进去了但其实不重要的,和它漏掉了但其实很重要的。第二个数字没有人会公布,而它决定了三个月后你还会不会在用这个工具。

结论

词错误率回答的是「机器有没有听清这些字」——这个问题,行业现在已经答完了。而没有任何一个排行榜回答过的问题是:「它能告诉我这场会议决定了什么吗?」

这是两个不同的问题,而从一开始重要的只有其中一个。转写是声音的记录,纪要是决定的记录。两者之间的距离不是用百分点衡量的,也不会靠更好的麦克风或更低的 WER 来弥合。弥合它的是你在上面搭建的一切:知道谁在说话,知道一个想法在哪里结束,知道哪些话是噪音,以及知道这一小时里哪三句话才是这场会议召开的理由。

转写从来都不是交付物,它是原材料。

Telli.sh 正是照这个思路做的:语音识别只是一个零件,我们视为产品的工作在它之上——说话人分离、切分、精修,以及把决定和闲聊区分开的摘要,覆盖 15 种语言。如果你想在自己的会议上看看转写和纪要的差别,录一场,几分钟后读结果就知道了。

开始一场实时 AI 笔记

参考来源


返回博客