语音识别悄悄开源了权重 —— 只有 1.56GB
阿里巴巴的 Qwen3-ASR 采用 Apache 2.0 许可,覆盖 52 种语言和方言,下载体积不到两个 GB。这是一份关于开放权重转写层的通俗指南:现在有哪些模型,在自己的笔记本上跑起来到底能得到什么,以及闭源 API 依然占优的地方在哪里。
阿里巴巴 Qwen 团队在 Hugging Face 上放着三个语音识别模型,几乎没人写过它们。Qwen3-ASR-0.6B、Qwen3-ASR-1.7B,还有配套的 Qwen3-ForcedAligner-0.6B,全部采用 Apache 2.0 许可。最小的那个下载体积是 1.56GB,能处理 52 种语言和方言,而且从 6 月 26 日起,三行标准 Python 就能跑起来。你把它放在自己已经有的机器上,没有人能给你开账单。
这个走向不难看懂,因为我们已经完整看过一遍。大语言模型在 2023 年和 2024 年一直是通过 API 租用的东西,然后开放权重的那一层出现了,对在意成本、隐私和离线运行的人来说,它成了默认选择。转写现在正走同一条路,大约晚了两年。
这篇文章是给不以追踪模型发布为生的人准备的地图:开放权重的语音模型到底是什么,眼下有哪些模型、各自什么许可,"在笔记本上跑 0.6B"实际上能带来什么,以及大多数报道会跳过的那部分——闭源托管 API 依然稳稳领先的地方在哪里。
TL;DR:
- 开放权重的转写已经可以真用了:Qwen3-ASR 是 Apache 2.0、52 种语言和方言,Whisper 是 MIT,英伟达的 Parakeet 与 Canary 是 CC BY 4.0,Mistral 的 Voxtral 是 Apache 2.0。
- 自建带来隐私、离线运行和成本控制。在独立基准 Artificial Analysis 上,托管一个开放模型每 1,000 分钟 1.50 美元,微软 MAI-Transcribe-1.5 是 6.00 美元,Gemini 3.1 Pro Preview 是 18.15 美元。
- 准确率第一名仍然是一个无法下载的闭源预览端点。但 Apache 2.0 的开放模型 Voxtral Small 已经排到第五,与第一名的差距约为一个百分点的词错误率。

图片:Aaron Parecki,Wikimedia Commons,CC BY 2.0。这是句子"it rains a lot in Portland"的波形与语谱图,字母摆放在它们对应的音频区段上方。每一个语音识别模型面对的原材料就是它。
下载一个转写模型时,你到底下载了什么
ASR 模型,也就是自动语音识别模型,与 STT、语音转文字是同一件事:输入音频,输出文本。工作就这些。它不判断谁在说话,不做总结,也不知道你的会议在讲什么。它听见词,然后写下来。
"开放权重"意味着实验室把成品模型文件本身公开了。模型的权重是它在训练中学到的那一大片数字网格,公开权重就等于你可以下载这个文件、在自己的硬件上运行、在它之上做产品,不必征得谁的同意,也不必按次付费。另一边是闭源模型:权重留在厂商的服务器上,你通过 API 租用访问权,音频传上去、文本传回来,按分钟计费。
名字里的数字是参数量,而在语音模型上这个数字格外实在。"0.6B"意思是大约六亿参数,落到实处就是 Qwen3-ASR-0.6B 是一个 1.56GB 的文件,Qwen3-ASR-1.7B 是 4.08GB,两个都小到能躺在笔记本固态硬盘里而无人察觉。对比一下我们在中国开放模型综述里写过的语言模型:那边的主角是分成 96 个分片的 1.56 TB,光是加载就需要一个集群。语音模型比前沿文本模型小上千倍,正是这一点让这次的变化比那次更打得着人。
这里定一个本文后面会一直用的说法:笔记本档位。它指的是硬件问题干脆消失的那一类模型——"我能跑得动吗"不再是一场预算讨论,而只是一次下载。文本模型大多不在这一档,语音模型几乎全都在。
在看任何跑分之前,还有一行要读:许可证。Apache 2.0 和 MIT 是最宽松的一端,用它、改它、装进商业产品去卖,都不欠谁什么。英伟达用的 CC BY 4.0 同样可以商用,但要求署名。
Qwen 一月就发了,六月才变简单
现在说这次促成本文的发布,同时纠正一个流传的说法。Qwen3-ASR 系列不是六月出现的。原始仓库在 2026 年 1 月 28 日上线,技术报告第二天挂上 arXiv。6 月 26 日发生的事,是 Qwen 发布了三个模型的 -hf 版本——从 Hugging Face Transformers v5.13.0 起可以原生直接跑的检查点。
这听着像脚注,其实不是。在那之前,跑这个模型要装 Qwen 自己的 qwen-asr 包或者 vLLM 后端,还得学那套工具链。在那之后,是任何碰过 Transformers 的开发者早就熟悉的三行标准 Python。让大多数开放模型无人问津的门槛,很少是模型本身,而是第一段转写出现之前那四十分钟的环境折腾——6 月 26 日抹掉的正是它。
规格直接取自模型卡。两个尺寸都能对 30 种语言做语种识别和语音识别:英语、中文、韩语、日语、西班牙语、阿拉伯语、印地语、泰语、越南语、波兰语,再加上另外二十种;在此之上还有 22 种中文方言,这就是"52 种语言和方言"这个数字的来处。两个模型都用同一个模型同时支持流式和离线推理,这比听上去要少见——很多转写模型只做其中一种。两者都接受长音频,模型卡还把歌唱和带背景音乐的歌曲列为支持的音频类型。
第三个模型值得停一下。Qwen3-ForcedAligner-0.6B 做的是强制对齐:给它音频和一份转写文本,它会标出每个词在哪里开始、在哪里结束,精确到毫秒,覆盖 11 种语言,一次最多处理 5 分钟的语音。可点击跳转的转写稿、字幕计时、直接跳到某人说那句话的瞬间,背后都是这套机制。本文顶部那张图,正是它的样子。把对齐器和识别器一起放出来,是一个关于这次发布面向谁的信号:不是跑 demo 的人,是做产品的人。
关于质量,要分清是谁在说什么。Qwen 自己的模型卡引用了 2026 年 6 月 26 日的 Hugging Face Open ASR Leaderboard 数据:1.7B 的平均词错误率 5.59%,0.6B 是 6.31%,会议音频 AMI 子集分别是 9.26% 和 10.57%。词错误率是模型说错的词所占比例,越低越好;真实会议本来就乱,所以 AMI 是其中最难看的一项。Qwen 还称 1.7B 是"开源 ASR 模型中的最先进水平"、可与商用 API 竞争——在阿里巴巴之外有人测出来之前,这只能当成厂商说法。另外,这与下文那个独立榜单是不同的基准、不同的音频,两组数字不能互相比较。
是 Whisper 起的头,而且大家现在跑的还是它
如果没有 OpenAI 的 Whisper,眼下这个局面不会是这个样子。仓库在 2022 年 9 月 16 日以 MIT 许可公开,代码和权重一起放出——那时候要做像样的语音识别,意味着跟云厂商签合同。此后它攒下了 106,679 颗 GitHub 星。
真正让 Whisper 重要起来的,与其说是模型本身,不如说是社区在几个月内在它之上盖起来的东西。whisper.cpp 用纯 C/C++ 重写了它,不需要 Python 也不需要 GPU 就能在笔记本和手机上跑,MIT 许可,52,591 颗星。faster-whisper 把它重建在 CTranslate2 上,速度和内存都大幅改善,同样是 MIT,24,750 颗星。模型是种子,生态才是树。
四年过去,它仍然是全世界用得最多的语音模型。过去 30 天里,whisper-large-v3-turbo 在 Hugging Face 上被下载 872 万次,whisper-large-v3 是 550 万次——这是我们在 2026 年 8 月 5 日取到的数字。Qwen3-ASR-0.6B 是 429 万次,对一个上线半年的模型来说爬得很快,但行业不假思索伸手去拿的默认项,依然是 Whisper。不过它的准确率确实老了:在 Artificial Analysis 的榜单上,Whisper Large v3 的 AA-WER 是 4.07%,而当前第一名是 1.73%。即便如此,大量已发布的产品仍在跑它。
开放语音这一层分两波抵达,中间隔了三年,几乎空无一物。发布日期来自 GitHub 与 Hugging Face,2026 年 8 月 5 日取得。
开放这一侧不止一家实验室
除了 Qwen,还有别人,而且各自擅长的地方差别很明显。
英伟达的 Parakeet 系列押的是速度。2025 年 8 月以 CC BY 4.0 发布的 parakeet-tdt-0.6b-v3 是六亿参数规模,覆盖 25 种欧洲语言,自带语种自动检测、标点、大小写和词级时间戳,一次可以吃下长达 24 分钟的音频。英伟达的 Canary 系列——canary-1b-v2 和 canary-qwen-2.5b,同样是 CC BY 4.0——用不同的架构押注覆盖相近的地盘。Mistral 的 Voxtral 系列在 2025 年 7 月以 Apache 2.0 出现,它重要的原因我们马上就会讲到。
把开放这一侧并排放一起看,最后一行是用作对照的托管 API。
| 模型 | 下载体积 | 许可证 | 语言 | 跑在哪 | 最擅长 |
|---|---|---|---|---|---|
| Whisper Large v3 | 3.09GB | MIT | 99 种 | 笔记本或单张 GPU | 所有工具都已支持的默认项 |
| Qwen3-ASR-0.6B | 1.56GB | Apache 2.0 | 含方言 52 种 | 笔记本 | 以最小体积做多语种 |
| Qwen3-ASR-1.7B | 4.08GB | Apache 2.0 | 含方言 52 种 | 笔记本或单张 GPU | Qwen 系里最高的准确率 |
| Parakeet TDT 0.6B v3 | 2.51GB | CC BY 4.0 | 欧洲 25 种 | 笔记本或单张 GPU | 速度与词级时间戳 |
| Voxtral Small | — | Apache 2.0 | — | 服务器 GPU,240 亿参数 | 独立榜单上开放模型的最高分 |
| 托管 API | 不可下载 | 闭源 | 各家不同 | 厂商的云 | 说话人分离、流式、可用性 |
下载体积取各 Hugging Face 仓库的默认检查点;"—" 表示我们无法从一手来源确认的值。2026 年 8 月 5 日取得。
再往下,是把这些模型送上真实设备的那层封装工作,也是"笔记本档位"不再停留在嘴上的地方。为苹果硬件编译的 Whisper,也就是 whisperkit-coreml,过去 30 天被下载 831 万次。面向 Apple Silicon 的 Parakeet MLX 构建是 187 万次,两个 GGUF 转换版——那是让模型跑在普通 CPU 上的量化格式——加起来分别是 204 万和 187 万次。每个月有几百万人,专门去下载为在自己机器上运行而打包好的语音识别。这不是研究上的新奇玩意,这是一条分发渠道。
第一名仍然是一个你下载不到的预览端点
诚实的账从这里开始算,而且两边都扎人。
我们在 2026 年 8 月 5 日取了 Artificial Analysis 的语音转文字榜单——这是一个用同一批音频同时测开源和闭源模型的独立基准,和只在开放模型之间比的 Hugging Face 榜单不是一回事。AA-WER 指数的前列是这样:
| 排名 | 模型 | AA-WER | 能否下载 |
|---|---|---|---|
| 1 | Fun-Realtime-ASR-preview | 1.73% | 不能 —— 预览端点 |
| 2 | Scribe v2,ElevenLabs | 2.18% | 不能 —— 托管 API |
| 3 | MAI-Transcribe-1.5,微软 | 2.38% | 不能 —— 托管 API |
| 4 | Smallest AI Pulse Pro | 2.43% | 不能 —— 托管 API |
| 5 | Voxtral Small,Mistral | 2.77% | 能 —— Apache 2.0 |
| 6 | Gemini 3.1 Pro Preview,High | 2.82% | 不能 —— 托管 API |
| 11 | Whisper Large v3 | 4.07% | 能 —— MIT |
来源:Artificial Analysis 语音转文字榜单,AA-WER v2,2026 年 8 月 5 日取得。能否下载依据各模型公开的许可证判断。
先读上面四行,它们是对"开源已经赢了"这种说法的纠正:全世界得分最高的语音模型都是租来的,而第一名甚至还没正式开放,只是一个预览端点。
再读第五行,这一次是对上面那个纠正的纠正。Voxtral Small 是 Apache 2.0,你可以下载、在自己的硬件上运行、装进商业产品出货——它在一个独立榜单上以 2.77% 排在第五,和闭源预览模型之间大约差一个百分点的词错误率。换算到一场 6,300 词的一小时会议,这个差距约等于 66 个词。差距真实存在,但远不是通常渲染的鸿沟。
我们的看法是:准确的总结不是"开源 STT 还差得远"。开放的语音模型在多数场景下早就跨过了够用这条线,闭源那边剩下的优势是一个百分点的词错误率,加上包在它外面的产品。这就把我们带到了真正决定选择的那个取舍。
自己跑能换来什么,又要付出什么
把团队推向自建的理由有三个,其中没有一个是准确率。
第一是隐私,而且通常是决定性的。如果你转写的是问诊、法律访谈或人事谈话,"音频不离开我们自己的硬件"不是偏好,而是采购要求,只有自建的模型能干净地满足它。第二是离线运行:装在设备里的模型在飞机上、地下室里、车间地面上、没有信号的野外都能工作。whisper.cpp 和那些 GGUF 构建的下载量之所以是那个量级,原因正在于此。
第三是成本,这里的数字很不客气。还是同一份 Artificial Analysis 快照,每 1,000 分钟音频的价格:托管在 fal.ai 上的 Whisper Large v3 是 0.50 美元,Replicate 上的英伟达 Canary Qwen 2.5B 是 0.74 美元,Together AI 上的 Parakeet TDT 0.6B V3 是 1.50 美元。闭源这边,Deepgram 的 Nova-3 是 4.30 美元,MAI-Transcribe-1.5 是 6.00 美元,Gemini 3.1 Pro Preview 是 18.15 美元。仅仅是把开放模型托管在别人的服务器上,相对微软就是 4 倍差距,相对谷歌是 12 倍——这还没算你在自己机器上跑的情况,那种情况下第一千个小时的边际成本是电费。
速度也朝同一个方向裂开,而这是最让我们意外的细节。整张榜上最快的模型是跑在 Together AI 上的 Parakeet TDT 0.6B V3,达到实时速度的 885 倍,意味着一小时音频约四秒返回。Deepgram 的 Nova-3 是 512 倍,Together 上的 Whisper Large v3 是 478 倍,MAI-Transcribe-1.5 是 189 倍。眼下最快的转写选项,是一个任何人都能下载的六亿参数开放权重模型。
这场取舍从来不是准确率对准确率,而是控制权与成本,对上包裹在识别外面的那些功能。
那么托管 API 还在卖什么?卖的是识别之外的一切。Deepgram 的文档就是一份诚实的清单:说话人分离、实时流式、格式化、自定义词表、实体脱敏、语种检测,以及你睡觉时它照样在线的保证。下载 Qwen3-ASR,你得到的是词和时间戳。没有说话人标签,没有 SLA,GPU 账单、扩容和凌晨三点的告警都归你。
这个类目下载量最高的模型,根本不是转写模型
有一个统计把所有线索串了起来,我们自己也没料到。
把 Hugging Face 整个自动语音识别类目按下载量排序,排在最上面的既不是 Whisper,也不是 Qwen 或 Parakeet,而是过去 30 天被下载 891 万次的 pyannote/speaker-diarization-3.1;另一个 pyannote 说话人分离模型以 526 万次排第五。说话人分离,就是判断谁在什么时候说话的那套机制,正好是转写紧邻的上一层。
开放权重如今覆盖了这一叠里最下面的两层。决定一份记录有没有用的那几层,在它们之上。
语音识别类目里最被需要的模型,并不识别语音。它回答的是识别器留着没答的那个问题——这和我们从闭源那一侧看过去时得到的结论一样,当时全世界得分最高的模型出货时就没有说话人标签。两个完全不同的观察点,同一个发现:听清词句,已经是解决了的那部分。
结论
关于开放权重语音识别,真正有意思的问题从来不是"它有没有闭源模型好"。它已经追到词错误率一个百分点以内,更快,便宜四到十二倍,而且装得下一台笔记本。有意思的问题是:当转写不再是一项租来的开支,空出来的那块地方你要盖什么——因为一个能听懂 52 种语言的 1.56GB 文件不是产品,它是一个刚刚变免费的零件。
对于在选会议记录工具而不是在选模型的团队来说,要读的东西很短。一个产品用的是开放模型还是闭源 API,如今大体上只是实现细节,而且会越来越是两者兼有:跑量的部分用开放权重,说话人分离、流式和规模值回票价的地方用托管 API。Telli.sh 的摘要层本来就跑着一个开放模型,所以开放这一侧的进步会不涨价地一路流进转写、翻译和会议记录。判断工具,看最后出来的东西:那份记录有没有告诉你,谁答应了做什么。
来源
- Qwen3-ASR-0.6B-hf 模型卡 (Hugging Face) —— 许可证、语言列表、2026 年 6 月 26 日的榜单数据
- Qwen3-ASR-1.7B-hf 模型卡 (Hugging Face)
- Qwen3-ForcedAligner-0.6B (Hugging Face)
- Qwen3-ASR Technical Report, arXiv:2601.21337(2026 年 1 月 29 日提交)
- OpenAI Whisper 仓库(MIT,2022 年 9 月 16 日公开)
- whisper.cpp / faster-whisper
- NVIDIA parakeet-tdt-0.6b-v3 模型卡 (CC BY 4.0)
- Mistral Voxtral-Small-24B-2507 (Apache 2.0)
- Artificial Analysis 语音转文字榜单 —— AA-WER v2,速度与价格数据于 2026 年 8 月 5 日取得
- Hugging Face Open ASR Leaderboard
- Deepgram 说话人分离文档
- Wikimedia Commons 图片页面