Kadar ralat perkataan 2.4%, namun masih tidak tahu siapa yang bercakap
MAI-Transcribe-1.5 daripada Microsoft mencatat kadar ralat perkataan 2.4%, sementara dokumentasi rasmi model yang sama menyatakan bahawa diarisasi tidak disokong. Penjelasan mudah tentang apa yang diukur oleh WER, mengapa papan kedudukan sudah berhimpit di dekat paras terendah, dan lapisan mana di atas pengecaman pertuturan yang sebenarnya menentukan sama ada transkrip menjadi nota mesyuarat yang berguna.
Awal Jun lalu, pasukan AI Superintelligence Microsoft melancarkan MAI-Transcribe-1.5, dan model itu mencatat kadar ralat perkataan 2.4% pada papan kedudukan bebas Artificial Analysis. Satu model merangkumi 43 bahasa, tahan menghadapi loghat dan bilik mesyuarat yang bising, serta memproses satu jam audio dalam masa kurang daripada lima belas saat.
Kemudian bukalah dokumentasi Azure Microsoft untuk model yang sama. Dalam bahagian nota penggunaan terdapat satu baris: "Diarisasi tidak disokong."
Diarisasi ialah bahagian yang memberitahu anda siapa yang sedang bercakap. Maksudnya, model pertuturan paling hangat diperkatakan tahun ini menghasilkan dinding perkataan yang hampir sempurna tanpa tahu langsung dari mulut siapa perkataan itu keluar. Ini bukan kecuaian dalam nota keluaran. Ini gambaran yang sangat tepat tentang di mana industri ini sebenarnya berdiri. Soal mendengar hampir selesai. Dan mendengar tidak pernah menjadi bahagian sukar bagi sesebuah nota mesyuarat.
Tulisan ini tentang jarak antara transkrip yang tepat dengan nota yang benar-benar akan anda hantar kepada pasukan anda: apa yang diukur oleh kadar ralat perkataan, apa yang secara strukturnya tidak mampu diukurnya, dan lapisan apa yang bertindan di atas pengecaman pertuturan lalu senyap-senyap menentukan sama ada sesuatu rakaman menjadi berguna. Jika anda pernah menerima transkrip yang sempurna dari segi teknikal tetapi tidak berguna langsung dalam amalan, inilah penjelasan bagi perasaan itu.
TL;DR:
- Kadar ralat perkataan sudah berhimpit di dekat paras terendah: sembilan model teratas pada papan bebas Artificial Analysis berada antara 1.73% dan 3.31%, jadi bertukar kepada enjin yang "lebih tepat" hanya memberi anda beberapa puluh perkataan dalam mesyuarat satu jam.
- WER memberat setiap perkataan sama rata. Kehilangan perkataan "tidak" dalam sesuatu keputusan menelan 0.016% yang sama dengan menelan satu bunyi "emm" — metrik ini tidak dapat membezakan salah taip daripada komitmen yang terbalik.
- Kerja yang tinggal berada di atas transkrip: pengecaman penutur, segmentasi, penghalusan dan peringkasan. Kad model Microsoft sendiri ialah buktinya: ketepatan barisan hadapan, tiada diarisasi, tiada penstriman.

Gambar: Steve Knight, Rockfield Studios, Wikimedia Commons, CC BY 2.0.
Bagaimana rasanya 2.4% apabila anda yang terpaksa membacanya
Kadar ralat perkataan ialah angka tertua sekaligus paling kasar dalam pengecaman pertuturan — dan justeru kerana ia dipetik di mana-mana, angka ini wajar difahami dengan betul. Ambil apa yang benar-benar diucapkan: transkrip rujukan yang disediakan manusia. Ambil apa yang ditulis oleh model. Kemudian kira perkataan yang salah dalam tiga bentuk: penggantian (menulis "tunda" sedangkan seseorang menyebut "tuntas"), pengguguran (satu perkataan hilang sepenuhnya) dan penyisipan (model mencipta perkataan yang tidak pernah dituturkan). Jumlahkan, bahagikan dengan bilangan perkataan dalam rujukan, dan itulah WER. Semakin rendah semakin baik.
Jadi 2.4% bermakna lebih kurang satu perkataan salah bagi setiap empat puluh dua perkataan.
Terapkan angka itu pada mesyuarat sebenar. Mesyuarat satu jam di mana orang benar-benar bercakap sekitar empat puluh lima minit, pada kelajuan perbualan biasa kira-kira 140 perkataan seminit, menghasilkan lebih kurang 6,300 perkataan. Pada WER 2.4%, kira-kira 150 daripadanya salah. Tersebar di sepanjang transkrip, itu bermakna beberapa ralat pada setiap skrin.
Dan di sinilah muncul soalan yang enggan dijawab oleh metrik ini: 150 perkataan yang mana satu?
WER memberi pemberat yang sama kepada setiap perkataan dalam bahasa. Kata hubung "dan" dan kata nafi "tidak" bernilai betul-betul sama. Bayangkan transkrip yang menukar "kita tidak akan melancarkannya pada suku ketiga" menjadi "kita akan melancarkannya pada suku ketiga". Itu satu pengguguran. Satu perkataan daripada 6,300 — 0.016% daripada transkrip, sekadar ralat pembundaran berbanding peruntukan 2.4%. Dan nota itu kini merekodkan tepat sebaliknya daripada apa yang diputuskan oleh bilik mesyuarat.
Ketaksimetrian yang sama menjalar ke nama orang, kod produk dan singkatan dalaman — iaitu perkataan yang membawa makna paling padat bagi setiap aksara dan paling jarang muncul dalam data latihan. Sesebuah transkrip boleh menepati 6,150 perkataan tisu penghubung sambil memusnahkan setiap kata nama khas di dalam bilik itu, dan WER-nya tetap kelihatan cemerlang. Sesiapa yang pernah membaca semula transkrip stand-up pasukannya sendiri mengenali rasa ini: perkataannya betul, dan mesyuaratnya hilang.
Papan kedudukan sudah berhimpit di dekat paras terendah
Inilah bahagian yang membingkai semula keseluruhan kategori ini. Kami mengambil papan kedudukan speech-to-text Artificial Analysis pada 4 Ogos 2026 — penanda aras bebas, bukan helaian markah keluaran vendor. Indeks AA-WER v2 mereka ialah purata berwajaran tempoh audio merentas kira-kira lapan jam yang diambil daripada tiga set data: AA-AgentTalk (50%), VoxPopuli-Cleaned-AA (25%) dan Earnings22-Cleaned-AA (25%). Kedudukan teratas adalah seperti berikut:
| Kedudukan | Model | AA-WER |
|---|---|---|
| 1 | Fun-Realtime-ASR-preview | 1.73% |
| 2 | Scribe v2 | 2.18% |
| 3 | MAI-Transcribe-1.5 | 2.38% |
| 4 | Smallest AI Pulse Pro | 2.43% |
| 5 | Voxtral Small | 2.77% |
| 6 | Gemini 3.1 Pro Preview (High) | 2.82% |
| 7 | Universal-3.5 Pro | 3.02% |
| 8 | Solaria-3 (Gladia) | 3.23% |
| 9 | GPT Transcribe | 3.31% |
| 11 | Whisper Large v3 | 4.07% |
Sumber: papan kedudukan speech-to-text Artificial Analysis, diambil pada 4 Ogos 2026 (AA-WER v2, bukan penstriman).
Dua perkara terus menarik perhatian. Pertama, angka 2.4% Microsoft itu benar dan diukur secara bebas — tetapi ia kedudukan ketiga, bukan pertama. Dakwaan yang lebih kuat, iaitu ketepatan terbaik dalam kelasnya pada FLEURS merentas kesemua 43 bahasa, datang daripada Microsoft sendiri, jadi bacalah sebagai angka vendor sehingga ada pihak luar mengukurnya.
Kedua, dan ini jauh lebih penting: sembilan model berasak dalam jalur selebar 1.6 mata. Kembalikan kepada mesyuarat 6,300 perkataan kita tadi. Model teratas tersilap kira-kira 109 perkataan. Model kedudukan kesembilan kira-kira 209. Whisper Large v3 — asas terbuka yang masih dijalankan oleh terlalu banyak produk — kira-kira 256.
Fikirkan apa maknanya bagi keputusan pembelian. Berpindah daripada enjin pertengahan kepada peneraju menjimatkan kira-kira seratus perkataan sejam. Itu bukan perkara remeh, dan dalam transkripsi perubatan atau perundangan ia benar-benar penting. Tetapi ia masih jauh daripada perbezaan antara nota yang anda percayai dan nota yang anda tulis semula dari awal. Setiap enjin yang serius kini sudah melepasi ketepatan 96%. Pemboleh ubah yang menentukan sama ada nota mesyuarat anda berguna terletak di tempat yang sama sekali lain.
Nota keluaran Microsoft ialah dokumen paling jujur dalam kategori ini
Yang membawa kita kembali kepada baris pembuka tadi. Dokumentasi Azure Speech menyenaraikan batasan MAI-Transcribe dengan terus terang: diarisasi tidak disokong, penalaan melalui gesaan tidak disokong, dan model itu berjalan dalam pratonton awam menerusi LLM Speech API. Laporan pelancarannya menambah bahawa tiada juga API penstriman asli, sekali gus mengehadkan penggunaan masa nyata.
Perhatikan bentuk senarai itu. Syarikat ini mencurahkan kejuruteraan yang amat besar ke atas masalah mendengar — 43 bahasa berbanding 25 pada generasi sebelumnya, dengan 18 bahasa baharu ditambah tanpa menjejaskan ketepatan. Kemudian ia dikeluarkan tanpa label penutur dan tanpa penstriman. Sedangkan kedua-duanya itulah yang diperlukan oleh mesyuarat yang sedang berlangsung.
Bacaan kami: ini bukan lompang dalam produk Microsoft, sebaliknya satu pengisytiharan tentang cara keseluruhan bidang ini berlapis. Pengecaman kini ialah komponen, bukan produk. Ia telah menjadi sesuatu yang dibeli, diukur dan ditukar ganti — dan kerja yang menarik telah berpindah kepada segala-galanya yang membaluti ia.
Siling jurutrengkas
Inilah istilah yang kami gunakan secara dalaman: siling jurutrengkas. Iaitu titik di mana mendengar dengan lebih baik berhenti membantu, kerana kerja yang tinggal bukan lagi soal mendengar.
Seorang jurutrengkas yang sempurna memberi anda rekod perkataan yang sempurna. Dia tidak akan memberitahu anda bahawa dua ayat "ya, boleh" itu datang daripada orang yang berbeza dan membawa maksud yang berbeza. Dia tidak menandakan di mana sesuatu topik berakhir. Dia juga tidak memberitahu bahawa dua puluh minit tentang perpindahan pejabat itu sememangnya tidak sepatutnya masuk ke dalam nota. Di atas transkrip terdapat empat lapisan yang berasingan, dan setiap satunya gagal dengan caranya sendiri.
Pengecaman penutur, iaitu diarisasi. Inilah jentera yang memecahkan satu aliran audio kepada "penutur 1, penutur 2, penutur 3" dan mengekalkan label itu stabil sepanjang satu jam. Ia masalah yang benar-benar berasingan daripada pengecaman, dengan corak kegagalannya sendiri: dua orang bercakap serentak, seseorang menyertai di pertengahan, peserta yang sama berbunyi berlainan melalui pembesar suara berbanding melalui fon kepala. Dan apabila ia gagal, kegagalannya bersifat memusnahkan. Transkrip yang mengaitkan sesuatu komitmen kepada orang yang salah lebih teruk daripada transkrip yang tidak mengaitkannya kepada sesiapa, kerana pembaca akan mempercayainya. Dan inilah tepatnya keupayaan yang tidak disertakan oleh model dengan markah tertinggi.
Segmentasi. Output mentah pengecaman ialah sebatang sungai. Pertuturan sebenar tidak tiba dalam bentuk ayat; ia tiba dalam bentuk permulaan semula, klausa yang tergantung dan celahan. Sistem perlu memutuskan di mana ayat terputus, di mana giliran bercakap seseorang berakhir, dan di mana perbualan bertukar topik. Salah di sini, anda mendapat perenggan yang tepat dari segi teknikal tetapi tidak akan dibaca sesiapa, kerana mata tiada tempat untuk berehat. Betul di sini, perkataan yang sama menjadi boleh diimbas sekali lalu. Tiada satu aksara pun daripada penambahbaikan itu muncul dalam WER.
Penghalusan. Antara transkrip mentah dan nota terdapat satu pusingan pembersihan: membuang kata pengisi dan permulaan ayat yang gagal, menyeragamkan angka dan tarikh, membetulkan istilah teknikal yang mustahil diketahui oleh model akustik. "Suku ketiga" menjadi "Q3". Nama kod dalaman yang keluar sebagai tiga perkataan biasa yang kedengaran munasabah dikembalikan ke tempatnya. Inilah lapisan tempat pengetahuan domain masuk, dan inilah pembeza antara dokumen yang terbaca seperti rekod perbicaraan dengan dokumen yang terbaca seperti catatan.
Peringkasan. Akhir sekali, pertimbangan: bahagian mana daripada satu jam itu yang merupakan keputusan, mana soalan yang masih terbuka, mana penugasan kerja kepada orang yang disebut namanya, dan mana dua puluh minit tentang tempat letak kereta. Ini satu-satunya lapisan yang benar-benar dibaca oleh kebanyakan pembaca, namun ia bergantung sepenuhnya kepada tiga lapisan sebelumnya. Peringkas yang bekerja di atas transkrip tanpa pengecaman penutur dan tanpa segmentasi sedang meneka siapa berjanji tentang apa. Berikan ia giliran bercakap yang bersih, dan ia berhenti meneka.
Kebergantungan itu mengalir sehala, dan itulah sebabnya perbincangan tentang ketepatan begitu mengelirukan. Menambah baik WER daripada 2.4% kepada 1.7% bermakna menambah baik input bagi rantaian empat langkah yang tidak pernah diukur langsung.
Pemberatan kata kunci ialah pengakuan senyap daripada industri ini
Terdapat satu ciri dalam keluaran MAI-Transcribe-1.5 yang mendedahkan keseluruhan permainan ini — dan ia juga perkara paling berguna dalam pelancaran tersebut.
Model ini menyokong pemberatan kata kunci, juga dipanggil pemberatan entiti: anda menyerahkan senarai sehingga 200 istilah domain — nama peserta, nama produk, singkatan dalaman — dan model mencondongkan ramalannya ke arah senarai itu, menggunakan konteks sekeliling untuk memutuskan bila pemberatan patut dikenakan dan bukannya memaksa padanan secara membuta tuli. Microsoft melaporkan penurunan WER sehingga 30% pada FLEURS apabila ciri ini digunakan. Contoh yang mereka terbitkan sangat konkrit: tanpa senarai kata kunci, tiga nama keluar sebagai "Sean", "Oif" dan "Societal". Dengan senarai itu, model memulihkan "Shaun", "Aoife" dan "Xochitl".
Perhatikan betul-betul apa yang berlaku di situ. Audionya tidak berubah. Akustiknya tidak bertambah baik. Model itu sebelum ini bukan mendengar dengan lebih teruk — ia mendengar dengan sangat jelas tetapi meneka dengan salah, kerana ia tidak tahu siapa yang berada di dalam bilik. Serahkan senarai peserta, dan hampir satu pertiga daripada ralatnya lenyap.
Itulah keseluruhan hujah tulisan ini, disampaikan sebagai ciri produk oleh vendor yang memiliki model bermarkah tertinggi. Kaedah penambahbaikan ketepatan paling berkesan dalam keluaran utama tahun ini berfungsi dengan menyuntik maklumat yang tidak pernah wujud dalam audio. Ini bermakna sempadan yang tinggal dalam transkripsi bukan soal akustik. Ia soal konteks — dan konteks tepat sekali merupakan bahan yang membina lapisan-lapisan di atas transkrip.
Sementara itu, semua orang berlumba menangkap lebih banyak audio
Pasaran perkakasan pula membuat kesimpulan yang bertentangan, dan itu wajar dicatat. Cermin mata GO3 daripada INMO, berharga 599 dolar, menjanjikan terjemahan masa nyata dalam lebih 98 bahasa yang diunjurkan pada kanta, ditambah rakaman, transkripsi dan peringkasan automatik bagi setiap perbualan dan setiap mesyuarat, dikuasakan oleh ChatGPT dan Gemini. Kesemuanya ialah dakwaan pengeluar di halaman produknya sendiri, dan cita-citanya jelas: tangkap segala-galanya, di mana-mana, tanpa menggunakan tangan.
Sedangkan menangkap tidak pernah menjadi halangan utama. Sebuah telefon di atas meja sudah cukup baik merakam mesyuarat sejak sedekad lalu. Menjadikan penangkapan lebih menyeluruh hanya meningkatkan jumlah audio yang mengalir masuk ke dalam talian pemprosesan yang sama dan masih belum selesai. Jika ada apa-apa kesannya, masalahnya menjadi lebih tajam: peranti yang merakam setiap perbualan anda sepanjang hari menghasilkan jauh lebih banyak bahan yang perlu dikenakan keputusan tentang apa yang penting.
Apa yang patut diuji, bukannya membaca angka WER
Jika anda sedang menilai alat transkripsi atau nota mesyuarat, angka ketepatan yang diterbitkan tidak akan memisahkan calon-calon itu, kerana kesemuanya berhimpun dalam jarak beberapa mata sahaja. Tiga ujian ini akan memisahkannya.
Rakam mesyuarat sebenar dengan sekurang-kurangnya tiga orang dan satu bahagian di mana orang benar-benar bercakap serentak, kemudian periksa sama ada label penutur kekal konsisten dari minit kelima hingga minit kelima puluh — di situlah diarisasi merosot secara senyap. Seterusnya, ambil satu keputusan yang dinyatakan dalam bentuk nafi ("suku ini kita tidak melakukan migrasi") lalu cari ia dalam ringkasan; sistem yang membalikkan atau menghilangkan kata nafi akan terdedah di sini. Akhir sekali, bandingkan ringkasan itu dengan ingatan anda sendiri tentang mesyuarat tersebut dan kira dua perkara secara berasingan: apa yang dimasukkan walaupun tidak penting, dan apa yang tercicir walaupun penting. Angka kedua itu tidak diterbitkan oleh sesiapa pun, dan angka itulah yang menentukan sama ada tiga bulan lagi anda masih menggunakan alat berkenaan.
Kesimpulan
Kadar ralat perkataan menjawab soalan "adakah mesin itu mendengar perkataannya?" — dan industri kini sudah menjawabnya. Yang tidak pernah dijawab oleh mana-mana papan kedudukan ialah: "adakah ini memberitahu saya apa yang diputuskan dalam mesyuarat itu?"
Itu dua soalan yang berbeza, dan hanya satu daripadanya yang pernah menjadi intipatinya. Transkrip ialah rakaman bunyi. Nota mesyuarat ialah rakaman sesuatu keputusan. Jurang antara keduanya tidak diukur dalam mata peratusan, dan ia tidak akan dirapatkan oleh mikrofon yang lebih baik mahupun WER yang lebih rendah. Ia dirapatkan oleh segala yang anda bina di atasnya: mengetahui siapa yang bercakap, di mana sesuatu buah fikiran berakhir, perkataan mana yang sekadar hingar, dan tiga ayat mana daripada satu jam itu yang menjadi sebab mesyuarat tersebut diadakan.
Transkrip tidak pernah menjadi hasil akhir. Ia bahan mentah.
Begitulah tepatnya kami membina Telli.sh: pengecaman pertuturan ialah satu komponen, dan kerja yang kami anggap sebagai produk terletak di atasnya — pengasingan penutur, segmentasi, penghalusan dan ringkasan yang memisahkan keputusan daripada perbualan kosong, dalam 15 bahasa. Jika anda ingin melihat perbezaan antara transkrip dan nota pada mesyuarat anda sendiri, rakam satu dan bacalah hasilnya beberapa minit kemudian.
Mulakan nota AI secara langsung
Sumber
- MAI-Transcribe in Azure Speech (preview) — Microsoft Learn — senarai batasan, termasuk "diarisasi tidak disokong"
- Microsoft AI Introduces MAI-Transcribe-1.5 — MarkTechPost, 8 Jun 2026
- Introducing MAI-Transcribe-1.5 — Microsoft AI
- Papan kedudukan speech-to-text Artificial Analysis — nilai AA-WER v2 diambil pada 4 Ogos 2026
- Halaman produk INMO GO3 — dakwaan pengeluar tentang ciri terjemahan dan transkripsi
- Halaman imej di Wikimedia Commons