Tỷ lệ lỗi từ 2,4%, mà vẫn không biết ai đang nói
MAI-Transcribe-1.5 của Microsoft đạt tỷ lệ lỗi từ 2,4%, trong khi tài liệu chính thức của chính mô hình đó ghi rằng không hỗ trợ phân tách người nói. Giải thích dễ hiểu về việc WER đo cái gì, vì sao bảng xếp hạng đã dồn cục sát đáy, và những lớp nào nằm trên nhận dạng giọng nói mới thực sự quyết định một bản gỡ băng có trở thành biên bản họp dùng được hay không.
Đầu tháng 6, nhóm AI Superintelligence của Microsoft phát hành MAI-Transcribe-1.5, và mô hình này đạt tỷ lệ lỗi từ 2,4% trên bảng xếp hạng độc lập của Artificial Analysis. Một mô hình duy nhất phủ 43 ngôn ngữ, trụ vững trước giọng vùng miền và phòng họp ồn ào, và xử lý một giờ âm thanh trong chưa đầy mười lăm giây.
Rồi hãy mở tài liệu Azure của Microsoft cho đúng mô hình đó. Trong phần lưu ý sử dụng có một dòng: "Không hỗ trợ phân tách người nói (diarization)."
Phân tách người nói chính là phần cho bạn biết ai đang nói. Nghĩa là mô hình giọng nói được bàn tán nhiều nhất năm nay tạo ra một bức tường chữ gần như hoàn hảo mà không hề biết những chữ đó ra từ miệng ai. Đây không phải sơ suất trong ghi chú phát hành. Đây là một tấm ảnh chụp rất chính xác về chỗ đứng thật sự của ngành này. Việc nghe gần như đã được giải quyết. Và nghe chưa bao giờ là phần khó của một biên bản họp.
Bài viết này nói về khoảng cách giữa một bản gỡ băng chính xác và một biên bản mà bạn thật sự dám gửi cho cả nhóm: tỷ lệ lỗi từ đo cái gì, về mặt cấu trúc nó không thể đo cái gì, và những lớp nào chồng lên trên nhận dạng giọng nói rồi lặng lẽ quyết định bản ghi có dùng được hay không. Nếu bạn từng nhận về một bản gỡ băng hoàn hảo về kỹ thuật nhưng vô dụng về thực tế, đây là lời giải thích cho cảm giác đó.
TL;DR:
- Tỷ lệ lỗi từ đã dồn cục sát đáy: chín mô hình dẫn đầu bảng xếp hạng độc lập của Artificial Analysis nằm trong khoảng 1,73% đến 3,31%, nên đổi sang một engine "chính xác hơn" chỉ giúp bạn được vài chục từ trong một cuộc họp một tiếng.
- WER cân mọi từ như nhau. Mất chữ "không" trong một quyết định cũng tốn đúng 0,016% như nuốt mất một tiếng "ừm" — thước đo này không phân biệt được lỗi đánh máy với một cam kết bị đảo ngược.
- Phần việc còn lại nằm phía trên bản gỡ băng: gán người nói, tách đoạn, tinh chỉnh, tóm tắt. Chính thẻ mô hình của Microsoft là bằng chứng: độ chính xác hàng đầu, không phân tách người nói, không streaming.

Ảnh: Steve Knight, Rockfield Studios, Wikimedia Commons, CC BY 2.0.
2,4% thực sự ra sao khi bạn là người phải đọc
Tỷ lệ lỗi từ là con số lâu đời nhất và thô sơ nhất trong nhận dạng giọng nói — và chính vì nó được trích dẫn ở khắp nơi nên đáng để hiểu cho đúng. Lấy nội dung thật sự đã được nói ra: bản gỡ băng tham chiếu do con người làm. Lấy những gì mô hình viết ra. Rồi đếm các từ sai theo ba dạng: thay thế (viết "trì hoãn" trong khi ai đó nói "triển khai"), xóa (mất hẳn một từ) và chèn (bịa ra một từ chưa ai nói). Cộng lại, chia cho số từ trong bản tham chiếu, đó là WER. Càng thấp càng tốt.
Vậy 2,4% có nghĩa là khoảng cứ bốn mươi hai từ thì sai một từ.
Đặt con số đó vào một cuộc họp thật. Một cuộc họp một tiếng mà mọi người thực sự nói khoảng bốn mươi lăm phút, ở tốc độ hội thoại bình thường chừng 140 từ mỗi phút, cho ra khoảng 6.300 từ. Với WER 2,4%, khoảng 150 từ trong số đó là sai. Rải đều trên bản gỡ băng, đó là vài lỗi trên mỗi màn hình.
Và đây là câu hỏi mà thước đo này từ chối trả lời: 150 từ nào?
WER gán trọng số như nhau cho mọi từ trong ngôn ngữ. Chữ "của" và chữ phủ định "không" có giá trị y hệt nhau. Hãy hình dung một bản gỡ băng biến "chúng ta không phát hành trong quý 3" thành "chúng ta phát hành trong quý 3". Đó là một lần xóa. Một từ trên 6.300 — 0,016% bản gỡ băng, một sai số làm tròn so với hạn mức 2,4%. Và biên bản giờ đang ghi lại điều ngược hẳn với những gì căn phòng đã quyết.
Sự bất đối xứng ấy còn chạy xuyên qua tên riêng, mã sản phẩm và từ viết tắt nội bộ — đúng những từ mang nhiều nghĩa nhất trên mỗi ký tự và xuất hiện ít nhất trong dữ liệu huấn luyện. Một bản gỡ băng có thể ăn trọn 6.150 từ mô liên kết rồi băm nát mọi danh từ riêng trong phòng, mà WER của nó vẫn trông xuất sắc. Ai từng đọc lại bản gỡ băng buổi standup của chính đội mình đều biết cảm giác này: chữ thì đúng, còn cuộc họp thì biến mất.
Bảng xếp hạng đã dồn cục sát đáy
Đây là đoạn định khung lại toàn bộ hạng mục. Chúng tôi lấy bảng xếp hạng speech-to-text của Artificial Analysis ngày 4 tháng 8 năm 2026 — một benchmark độc lập, không phải bảng thành tích do nhà cung cấp tự công bố. Chỉ số AA-WER v2 của họ là trung bình có trọng số theo thời lượng âm thanh trên khoảng tám giờ lấy từ ba bộ dữ liệu: AA-AgentTalk (50%), VoxPopuli-Cleaned-AA (25%) và Earnings22-Cleaned-AA (25%). Nhóm dẫn đầu như sau:
| Hạng | Mô hình | AA-WER |
|---|---|---|
| 1 | Fun-Realtime-ASR-preview | 1,73% |
| 2 | Scribe v2 | 2,18% |
| 3 | MAI-Transcribe-1.5 | 2,38% |
| 4 | Smallest AI Pulse Pro | 2,43% |
| 5 | Voxtral Small | 2,77% |
| 6 | Gemini 3.1 Pro Preview (High) | 2,82% |
| 7 | Universal-3.5 Pro | 3,02% |
| 8 | Solaria-3 (Gladia) | 3,23% |
| 9 | GPT Transcribe | 3,31% |
| 11 | Whisper Large v3 | 4,07% |
Nguồn: bảng xếp hạng speech-to-text của Artificial Analysis, truy xuất ngày 4 tháng 8 năm 2026 (AA-WER v2, không streaming).
Hai điều đập vào mắt. Thứ nhất, con số 2,4% của Microsoft là thật và được đo độc lập — nhưng đó là hạng ba, không phải hạng nhất. Tuyên bố mạnh hơn, rằng mô hình đạt độ chính xác tốt nhất phân khúc trên FLEURS ở toàn bộ 43 ngôn ngữ, là do chính Microsoft công bố, nên hãy đọc nó như số liệu của nhà cung cấp cho tới khi có bên ngoài đo lại.
Thứ hai, và quan trọng hơn nhiều: chín mô hình bị nén vào một dải rộng 1,6 điểm. Quy ngược về cuộc họp 6.300 từ của chúng ta. Mô hình đứng đầu sai khoảng 109 từ. Mô hình hạng chín sai khoảng 209. Whisper Large v3 — nền tảng mở mà rất nhiều sản phẩm vẫn đang chạy — sai khoảng 256.
Hãy nghĩ xem điều đó có nghĩa gì với một quyết định mua sắm. Chuyển từ một engine tầm trung lên engine dẫn đầu giúp bạn tiết kiệm khoảng một trăm từ mỗi giờ. Đó không phải là vô nghĩa, và trong gỡ băng y tế hay pháp lý thì nó thực sự quan trọng. Nhưng nó còn xa lắm mới bằng khác biệt giữa một biên bản bạn tin được và một biên bản bạn phải viết lại từ đầu. Mọi engine nghiêm túc giờ đều vượt 96% độ chính xác. Biến số quyết định biên bản họp của bạn có dùng được hay không nằm ở chỗ hoàn toàn khác.
Ghi chú phát hành của Microsoft là tài liệu trung thực nhất trong hạng mục này
Điều đó đưa ta trở lại dòng chữ mở đầu bài. Tài liệu Azure Speech liệt kê thẳng thắn các giới hạn của MAI-Transcribe: không hỗ trợ phân tách người nói, không hỗ trợ tinh chỉnh bằng prompt, và mô hình chạy ở bản xem trước công khai qua LLM Speech API. Các bài đưa tin về đợt ra mắt bổ sung thêm rằng cũng không có API streaming gốc, khiến ứng dụng thời gian thực bị hạn chế.
Hãy ngẫm về hình dạng của tập giới hạn ấy. Công ty này đã đổ một khối lượng kỹ thuật khổng lồ vào bài toán nghe — 43 ngôn ngữ so với 25 ở thế hệ trước, với 18 ngôn ngữ mới được thêm vào mà không làm tụt độ chính xác. Rồi họ phát hành nó mà không có nhãn người nói và không có streaming. Đó đúng là hai thứ mà một cuộc họp đang diễn ra cần đến.
Nhận định của chúng tôi: đây không phải một lỗ hổng trong sản phẩm của Microsoft, mà là một tuyên bố về cách phân tầng của cả lĩnh vực. Nhận dạng giờ là linh kiện, không phải sản phẩm. Nó đã trở thành thứ bạn mua, đo và thay thế — còn phần việc thú vị đã dời sang tất cả những gì bọc quanh nó.
Trần nhà của người tốc ký
Đây là thuật ngữ chúng tôi vẫn dùng nội bộ: trần nhà của người tốc ký. Là điểm mà từ đó trở đi, nghe giỏi hơn không còn giúp được gì nữa, bởi phần việc còn lại không phải là nghe.
Một người tốc ký hoàn hảo cho bạn một bản ghi chữ hoàn hảo. Nhưng anh ta sẽ không nói cho bạn biết rằng hai câu "vâng, được thôi" là của hai người khác nhau và mang hai ý khác nhau. Anh ta không đánh dấu chỗ một chủ đề kết thúc. Anh ta cũng không nhắc rằng hai mươi phút bàn chuyện chuyển văn phòng lẽ ra chẳng nên có mặt trong biên bản. Phía trên bản gỡ băng có bốn lớp riêng biệt, và mỗi lớp hỏng theo cách của nó.
Gán người nói, tức phân tách người nói. Đây là cỗ máy chia một luồng âm thanh duy nhất thành "người nói 1, người nói 2, người nói 3" và giữ những nhãn đó ổn định suốt một tiếng đồng hồ. Đó là bài toán thực sự tách biệt khỏi nhận dạng, với những kiểu hỏng riêng: hai người nói chồng lên nhau, một người vào họp giữa chừng, cùng một người nghe khác hẳn qua loa ngoài so với qua tai nghe. Và khi hỏng, nó hỏng theo kiểu phá hoại. Một bản gỡ băng gán cam kết cho nhầm người còn tệ hơn bản không gán cho ai cả, vì người đọc sẽ tin. Và đây đúng là năng lực mà mô hình điểm cao nhất không cung cấp.
Tách đoạn. Đầu ra thô của nhận dạng là một dòng sông. Lời nói thật không đến theo từng câu: nó đến kèm những lần nói lại từ đầu, những mệnh đề bỏ lửng và những lần cắt ngang. Hệ thống phải quyết định câu ngắt ở đâu, lượt nói của một người kết thúc ở đâu, và cuộc trò chuyện đổi chủ đề ở đâu. Làm sai thì bạn có một đoạn văn chính xác về kỹ thuật mà không ai đọc, vì mắt không có chỗ nghỉ. Làm đúng thì cũng chừng ấy chữ trở thành thứ lướt qua đọc được. Không một ký tự nào của cải thiện đó hiện lên trong WER.
Tinh chỉnh. Giữa bản gỡ băng thô và biên bản có một lượt dọn dẹp: bỏ từ đệm và những câu nói hụt, chuẩn hóa số và ngày tháng, sửa các thuật ngữ chuyên ngành mà mô hình âm học không có cách nào biết. "Quý ba" thành "Q3". Một tên mã nội bộ vốn phát ra thành ba từ thông thường nghe có vẻ hợp lý được trả về đúng chỗ. Đây là lớp mà kiến thức chuyên ngành bước vào, và nó là ranh giới giữa một văn bản đọc như biên bản tòa án với một văn bản đọc như ghi chú.
Tóm tắt. Cuối cùng là phần phán đoán: phần nào của một tiếng đồng hồ là quyết định, phần nào là câu hỏi còn bỏ ngỏ, phần nào là giao việc cho một người cụ thể, và phần nào là hai mươi phút bàn chuyện chỗ đỗ xe. Đây là lớp duy nhất mà phần lớn người đọc thực sự tiêu thụ, và nó hoàn toàn phụ thuộc vào ba lớp trước. Một bộ tóm tắt làm việc trên bản gỡ băng chưa gán người nói và chưa tách đoạn thì đang đoán xem ai cam kết điều gì. Đưa cho nó các lượt nói sạch sẽ, nó sẽ thôi đoán.
Quan hệ phụ thuộc chỉ chạy theo một chiều, và đó là lý do cuộc tranh luận về độ chính xác gây hiểu lầm đến vậy. Cải thiện WER từ 2,4% xuống 1,7% là cải thiện đầu vào của một chuỗi bốn bước mà chưa ai từng đo.
Kỹ thuật thiên lệch từ khóa chính là ngành này lặng lẽ thừa nhận
Trong đợt phát hành MAI-Transcribe-1.5 có một tính năng để lộ toàn bộ ván bài — và cũng là thứ hữu ích nhất của lần ra mắt này.
Mô hình hỗ trợ thiên lệch từ khóa, còn gọi là thiên lệch thực thể: bạn đưa cho nó danh sách tối đa 200 thuật ngữ chuyên ngành — tên người dự họp, tên sản phẩm, từ viết tắt nội bộ — và mô hình nghiêng dự đoán về phía danh sách đó, dựa vào ngữ cảnh xung quanh để quyết định khi nào nên áp dụng thiên lệch thay vì ép khớp một cách mù quáng. Microsoft báo cáo WER trên FLEURS giảm tới 30% khi bật tính năng này. Ví dụ họ công bố rất cụ thể: không có danh sách từ khóa, ba cái tên ra thành "Sean", "Oif" và "Societal". Có danh sách, mô hình khôi phục lại "Shaun", "Aoife" và "Xochitl".
Hãy nhìn kỹ chuyện gì đã xảy ra ở đó. Âm thanh không đổi. Điều kiện âm học không tốt lên. Mô hình trước đó không hề nghe kém hơn — nó nghe rất rõ và đoán sai, vì nó không biết trong phòng có những ai. Đưa cho nó danh sách người dự họp, gần một phần ba số lỗi bốc hơi.
Đó chính là toàn bộ luận điểm của bài viết này, được giao đến dưới dạng một tính năng sản phẩm bởi chính nhà cung cấp có mô hình điểm cao nhất. Biện pháp cải thiện độ chính xác hiệu quả nhất trong bản phát hành đình đám nhất năm hoạt động bằng cách bơm vào thông tin vốn chưa từng có trong âm thanh. Nghĩa là biên giới còn lại của gỡ băng không nằm ở âm học. Nó nằm ở ngữ cảnh — và ngữ cảnh đúng là vật liệu làm nên những lớp phía trên bản gỡ băng.
Trong khi đó, ai cũng đang chạy đua thu thêm âm thanh
Thị trường phần cứng lại rút ra kết luận ngược lại, và điều đó đáng chú ý. Kính GO3 của INMO, giá 599 đô la, hứa hẹn dịch thời gian thực hơn 98 ngôn ngữ chiếu thẳng lên mắt kính, cộng thêm tự động ghi âm, gỡ băng và tóm tắt mọi cuộc trò chuyện và cuộc họp, chạy trên ChatGPT và Gemini. Đó đều là tuyên bố của chính hãng trên trang sản phẩm, và tham vọng thì rõ ràng: thu tất cả, ở mọi nơi, không cần động tay.
Chỉ có điều thu thập chưa bao giờ là nút thắt cổ chai. Một chiếc điện thoại đặt trên bàn đã ghi âm cuộc họp đủ tốt suốt cả thập kỷ nay. Làm cho việc thu thập trở nên bao trùm hơn chỉ khiến khối lượng âm thanh đổ vào đúng cái quy trình chưa được giải quyết ấy tăng lên. Nếu có gì thay đổi thì là vấn đề trở nên gay gắt hơn: một thiết bị ghi lại mọi cuộc trò chuyện suốt cả ngày sẽ tạo ra nhiều tư liệu hơn hẳn cần được áp dụng bước quyết định xem cái gì mới đáng.
Nên kiểm tra gì thay vì đọc con số WER
Nếu bạn đang đánh giá một công cụ gỡ băng hay biên bản họp, con số độ chính xác được công bố sẽ không tách được các ứng viên, vì tất cả đều nằm trong vài điểm. Ba phép thử thì tách được.
Hãy ghi âm một cuộc họp thật với ít nhất ba người và có một đoạn mọi người thực sự nói chồng lên nhau, rồi kiểm tra xem nhãn người nói có giữ nhất quán từ phút thứ năm đến phút thứ năm mươi hay không — đó chính là chỗ phân tách người nói âm thầm xuống cấp. Tiếp theo, chọn một quyết định được phát biểu ở dạng phủ định ("quý này chúng ta không làm migration") rồi tìm nó trong bản tóm tắt; hệ thống nào đảo ngược hoặc đánh rơi phủ định sẽ lộ ra ngay tại đây. Cuối cùng, đối chiếu bản tóm tắt với trí nhớ của chính bạn về cuộc họp và đếm riêng hai thứ: cái nó đưa vào mà không quan trọng, và cái nó bỏ sót mà lại quan trọng. Con số thứ hai không ai công bố cả, và nó chính là thứ quyết định ba tháng nữa bạn còn dùng công cụ đó hay không.
Kết luận
Tỷ lệ lỗi từ trả lời câu hỏi "máy có nghe ra những chữ đó không?" — và ngành này giờ đã trả lời xong. Câu chưa bảng xếp hạng nào từng trả lời là: "cái này có cho tôi biết cuộc họp đã quyết điều gì không?"
Đó là hai câu hỏi khác nhau, và chỉ một trong hai từng là cốt lõi. Bản gỡ băng là bản ghi của âm thanh. Biên bản là bản ghi của một quyết định. Khoảng cách giữa chúng không đo bằng điểm phần trăm, và sẽ không được lấp bằng một micro tốt hơn hay một WER thấp hơn. Nó được lấp bằng tất cả những gì bạn dựng lên phía trên: biết ai đã nói, biết ý nghĩ kết thúc ở đâu, biết chữ nào là tạp âm, và biết ba câu nào trong cả một tiếng đồng hồ mới là lý do cuộc họp đó diễn ra.
Bản gỡ băng chưa bao giờ là sản phẩm bàn giao. Nó là nguyên liệu thô.
Telli.sh được xây đúng theo cách đó: nhận dạng giọng nói chỉ là một linh kiện, còn phần việc chúng tôi coi là sản phẩm nằm ở phía trên nó — tách người nói, tách đoạn, tinh chỉnh, và những bản tóm tắt phân biệt quyết định với chuyện phiếm, bằng 15 ngôn ngữ. Nếu bạn muốn thấy khác biệt giữa bản gỡ băng và biên bản trên chính cuộc họp của mình, hãy ghi một buổi và đọc kết quả sau vài phút.
Nguồn
- MAI-Transcribe in Azure Speech (preview) — Microsoft Learn — danh sách giới hạn, bao gồm "không hỗ trợ phân tách người nói"
- Microsoft AI Introduces MAI-Transcribe-1.5 — MarkTechPost, ngày 8 tháng 6 năm 2026
- Introducing MAI-Transcribe-1.5 — Microsoft AI
- Bảng xếp hạng speech-to-text của Artificial Analysis — số liệu AA-WER v2 truy xuất ngày 4 tháng 8 năm 2026
- Trang sản phẩm INMO GO3 — tuyên bố của hãng về tính năng dịch và gỡ băng
- Trang ảnh trên Wikimedia Commons