guide15 minit bacaan

Kadar ralat sama 10,0%, keputusan bertentangan: cara mengukur ketepatan transkripsi mesyuarat

Kadar ralat perkataan memberi wajaran serupa kepada perkataan «bukan» dan kata sandang biasa, lalu dua transkrip boleh sama-sama mendarat pada 10,0% sedangkan hanya satu yang benar-benar boleh dipakai. Inilah tatacara pengukurannya secara penuh: klip ujian 12 minit yang dibina mengikut spesifikasi mesyuarat, transkrip rujukan dengan peraturan penormalan yang dibekukan, arahan cpWER dan DER yang tepat, serta kad markah lima dimensi yang memberi WER mentah 10 mata daripada 100.

K
Ken Jo
#transcription-accuracy#word-error-rate#wer#cpwer#diarization#meeting-notes#speech-to-text#evaluation

Inilah dua transkrip mesin bagi ayat dua puluh perkataan yang sama, dipetik daripada sebuah mesyuarat produk.

A — "Priya said Helios migration slips to Q3 and we should not sign the vendor contract before security review"

B — "Priya said the Helios migration slips to Q2 and we should sign the vendor contract before the security review"

Setiap satu mengandungi tepat dua ralat berbanding apa yang sebenarnya diucapkan. Setiap satu mencatat kadar ralat perkataan sebanyak 10,0%. Transkrip A menggugurkan kata sandang "the" sebanyak dua kali. Transkrip B mengalihkan satu tarikh akhir ke hadapan sebanyak satu suku tahun dan memadamkan perkataan "not" daripada sebuah komitmen.

Sekiranya proses penilaian anda meletakkan dua sistem itu sebagai setara, yang bermasalah ialah prosesnya — bukan modelnya.

Tulisan ini ialah tatacara pengukuran yang bakal kami serahkan kepada sesiapa yang disuruh memilih alat transkripsi menjelang hari Jumaat. Kandungannya: apa sebenarnya yang dikira oleh kadar ralat perkataan; mengapa angka itu mengelirukan khususnya pada audio mesyuarat; dan sebuah protokol lima langkah yang boleh anda jalankan dalam satu petang menggunakan dua pakej sumber terbuka serta sebuah rakaman 12 minit. Secara berasingan kami pernah berhujah bahawa ketepatan transkripsi memang tidak pernah menjadi hasil akhirnya. Ini tulisan pasangannya — bukan hujahnya, tetapi kaedahnya.

Ringkasan:

  • WER ialah (substitutions + deletions + insertions) ÷ reference words, dan setiap perkataan membawa wajaran yang serupa. Penafian «bukan» dan kata sandang biasa berkos sama.
  • Papan pendahulu yang diterbitkan sudah memampat. Pada papan bebas Artificial Analysis, dicapai 31 Ogos 2026, lima model teratas berada antara 1,7% dan 2,6% AA-WER — julat yang terlalu sempit untuk memilih pemenang.
  • Nilaikan lima dimensi sebaliknya, dengan wajaran: istilah penanggung makna (30), pengatributan penutur (25), angka dan jumlah wang (20), segmentasi (15), WER mentah (10). Alat bagi bahagian yang sukar sudah pun wujud — cpWER dan DER terkandung dalam MeetEval, kit yang dibina untuk siri cabaran CHiME.

Dua transkrip bagi ayat yang sama disandingkan, kedua-duanya mencatat kadar ralat perkataan 10,0 peratus, dengan transkrip kedua memaparkan suku tahun yang salah, penafian yang terpadam, dan kadar ralat istilah penanggung sebanyak 50 peratus

Kedua-dua lajur mengandungi dua ralat berbanding rujukan sepanjang 20 perkataan. Hanya satu daripadanya masih merakam keputusan yang benar-benar dibuat di dalam bilik itu.

Apa yang sebenarnya dikira oleh kadar ralat perkataan, ditulis sepenuhnya

WER terhasil daripada satu penjajaran tunggal. Ambil transkrip rujukan — apa yang manusia bersetuju telah diucapkan. Ambil keluaran mesin. Cari urutan suntingan termurah yang menukar satu menjadi satu lagi, menggunakan penjajaran Levenshtein klasik, kemudian labelkan setiap suntingan:

  • penggantian apabila model menulis perkataan yang berlainan ("deploy" terdengar sebagai "delay"),
  • pengguguran apabila sesuatu perkataan rujukan tiada pasangannya dalam keluaran,
  • penyisipan apabila model menghasilkan perkataan yang tidak diucapkan sesiapa pun.

Kemudian:

WER = (substitutions + deletions + insertions) ÷ reference words

Penyebutnya ialah panjang rujukan, bukan panjang hipotesis, dan itulah sebabnya WER boleh melebihi 100% secara sah — model yang berhalusinasi tanpa kekangan mampu mengumpul lebih banyak penyisipan daripada bilangan perkataan yang ada pada mulanya.

Satu contoh terkira, dipetik daripada dokumentasi MeetEval sendiri supaya aritmetiknya boleh disemak berbanding keluaran yang telah diterbitkan. Rujukan: "The quick brown fox jumps over the lazy dog" — sembilan perkataan. Hipotesis: "The kwick brown fox jump over lazy" — tujuh perkataan. Penjajaran itu menemui dua penggantian (quick→kwick, jumps→jump) serta dua pengguguran (the, dog), tanpa penyisipan. Itu bersamaan (2 + 2 + 0) ÷ 9 = 0,4444, iaitu WER sebanyak 44,4%, dan MeetEval mencetak tepat begitu: ErrorRate(error_rate=0.4444…, errors=4, length=9, insertions=0, deletions=2, substitutions=2).

Sembilan kotak perkataan yang dijajarkan memaparkan ayat rujukan dan ayat hipotesis, dengan dua penggantian dan dua pengguguran ditandakan, serta rumus yang berakhir pada 44,4 peratus

Penjajarannya bersifat mekanikal dan boleh diulang. Apa yang tiada padanya ialah wajaran. Sumber: dokumentasi MeetEval, dicapai 31 Ogos 2026.

Dua sifat rumus itu lebih penting daripada apa-apa jua yang tertera pada laman promosi vendor. Pertama, ia rata: metrik ini langsung tidak tahu bahawa sesetengah perkataan menanggung isi mesyuarat manakala yang lain hanya menanggung tatabahasa. Kedua, ia buta penutur: WER piawai mencantumkan segalanya menjadi satu aliran, jadi sistem yang mentranskripsi setiap perkataan dengan sempurna tetapi mengatributkan separuhnya kepada orang yang salah masih boleh memaparkan markah yang bersih.

Mengapa angka terbitan sudah tidak mampu membezakan calon anda

Tarik papan pendahulunya dan masalahnya bertukar menjadi aritmetik. Artificial Analysis, yang menjalankan penilaiannya sendiri dan bukan mencetak semula dakwaan vendor, menyenaraikan lima model teratasnya mengikut AA-WER pada 31 Ogos 2026 sebagai Fun-Realtime-ASR-preview pada 1,7%, ElevenLabs Scribe v2 pada 2,2%, MAI-Transcribe-1.5 milik Microsoft pada 2,4%, Smallest AI Pulse Pro pada 2,4%, dan Gemini 3.5 Transcribe pada 2,6%. Model pemberat terbuka terbaik, Voxtral Small daripada Mistral, berada pada 2,8%.

Keseluruhan puncak pasaran itu muat dalam jalur selebar 1,1 mata. Bagi mesyuarat 45 minit yang mengandungi lebih kurang 6.300 patah perkataan terucap, jurang antara kedudukan pertama dengan kedudukan kelima menyamai kira-kira 57 patah perkataan — kurang daripada satu patah bagi setiap skrin transkrip.

Ada masalah kedua, iaitu audio penanda aras itu bukan audio anda. AA-WER v2 ialah purata berwajaran tempoh audio merentas kira-kira lapan jam rakaman yang diambil daripada tiga sumber: AA-AgentTalk sebanyak 50%, VoxPopuli-Cleaned-AA sebanyak 25%, dan Earnings22-Cleaned-AA sebanyak 25%. Ucapan parlimen dan panggilan laporan pendapatan dirakam dengan baik, dituturkan bergilir-gilir, dan sebahagian besarnya bebas daripada perkara yang justru mentakrifkan mesyuarat dalaman — empat orang mencelah antara satu sama lain tentang projek yang hanya mereka sahaja pernah dengar.

Penyelidikan terhadap audio yang benar-benar bersifat perbualan telah lama memperlakukan hal ini sebagai bidang tersendiri. Cabaran CHiME-6, diterbitkan pada 20 April 2020 oleh Watanabe, Mandel, Barker bersama lapan belas penulis bersama, membina penilaiannya di atas rakaman jamuan makan malam justeru kerana perbualan semula jadi yang bertindih dan mikrofon berjauhan meranapkan sistem yang bermarkah tinggi pada ucapan bacaan. AMI Meeting Corpus, 100 jam rakaman yang dirakam serentak menggunakan set kepala dekat mulut dan mikrofon bilik jarak jauh, wujud atas sebab yang sama.

Inilah intinya, dan kami menyatakannya tanpa berselindung: WER yang diterbitkan hanya memberitahu anda bahawa model sesuatu vendor itu tidak rosak. Ia tidak mampu memberitahu anda vendor mana yang patut dibeli.

Apa yang tertangkap oleh WER dan apa yang secara struktur tidak mungkin ditangkapnya

Mod kegagalanDitangkap WER mentah?Apa kosnya kepada andaApa yang benar-benar mengukurnya
Perkataan biasa tersalah dengar («their»/«there»)Ya, dengan wajaran penuhHampir tiadaWER
Bunyi sisipan dan permulaan tergendala digugurkanYa, dikira sebagai pengguguranTiada — selalunya malah penambahbaikanWER, secara mengelirukan
Kata nama khas rosak («Xochitl» → «Societal»)Ya, tetapi berwajaran 1 perkataanNama orang yang bertanggungjawabKadar ralat istilah penanggung
Angka atau tarikh tersalah («Q3» → «Q2»)Ya, berwajaran 1 perkataanTarikh akhir yang terlepasKetepatan angka, dinilai berasingan
Penafian terpadam («should not» → «should»)Ya, berwajaran 1 perkataanKeputusan yang terbalikKadar ralat istilah penanggung
Perkataan betul, penutur salahTidak — WER buta penuturTiada sesiapa tahu siapa yang berjanjicpWER, DER
Giliran penutur bercantum menjadi satu blokTidakDinding teks yang tidak terbacatcpWER berserta collar, bacaan oleh manusia
Sempadan ayat hilangTidak — tanda baca dinormalkan keluarRingkasan yang meneka-neka strukturnyaMarkah segmentasi, bacaan oleh manusia
Seluruh petikan dihalusinasi ketika senyapSebahagian — sebagai penyisipanKandungan rekaan disajikan sebagai rekodWER berserta kiraan penyisipan yang dibaca berasingan

Separuh bawah jadual itulah yang menentukan sama ada sesebuah transkrip menjelma menjadi minit yang berguna, dan WER piawai langsung tidak melihatnya. Itu bukan kecacatan pada metriknya — WER menjawab soalan yang memang direka untuknya dalam penyelidikan pengimlakan tahun 1990-an. Yang cacat ialah penggunaannya secara bersendirian pada tahun 2026.

Langkah 1: bina klip 12 minit yang berkelakuan seperti mesyuarat sebenar

Jangan menilai menggunakan fail demonstrasi vendor dan jangan pula menilai menggunakan lapan jam arkib anda sendiri. Anda memerlukan satu klip yang cukup pendek untuk ditranskripsi dengan tangan dan cukup padat untuk meranapkan pelbagai perkara.

Sasarkan 12 minit. Pada kelajuan perbualan biasa kira-kira 140 patah perkataan seminit dan ketumpatan pertuturan lebih kurang 75%, itu menghasilkan sekitar 1.260 patah perkataan rujukan — cukup banyak sehingga perbezaan 2% pada kadar ralat bermakna 25 patah perkataan dan bukan hingar statistik, dan cukup sedikit sehingga dua orang boleh mentranskripsikannya dengan teliti dalam satu petang.

Bina klip itu mengikut spesifikasi, bukan mengikut rasa hati. Spesifikasi kami:

  1. Empat penutur atau lebih, termasuk sekurang-kurangnya seorang yang menyertai dari jauh melalui saluran audio termampat, dan sekurang-kurangnya satu loghat bukan penutur jati dalam bahasa kerja.
  2. Sembilan puluh saat atau lebih pertindihan yang tulen — dua orang bercakap serentak, seseorang menghabiskan ayat orang lain, batuk yang menutupi sesuatu keputusan. Pertuturan bersilang ialah tempat diarisasi runtuh secara senyap, dan klip yang tiada padanya tidak mengukur apa-apa.
  3. Dua puluh lima istilah domain atau lebih: nama kod produk, akronim dalaman, nama pelanggan, nama hadirin. Inilah perkataan yang paling tinggi makna bagi setiap aksara di dalam bilik dan paling rendah kekerapannya dalam mana-mana korpus latihan.
  4. Lima belas angka atau lebih: tarikh, suku tahun, jumlah mata wang, nombor versi, peratusan. Sebut sebahagiannya secara taksa dengan sengaja («lima belas» dan «lima puluh» dalam minit yang sama).
  5. Tiga keputusan bernafi atau lebih, dinyatakan secara semula jadi: «kita takkan hantar itu dalam keluaran ini», «kita tangguh dulu kontrak tersebut».
  6. Dua rakaman serentak jika anda mampu menguruskannya — mikrofon komputer riba itu sendiri dan trek set kepala bagi setiap penutur. Itulah reka bentuk korpus AMI, dan ia membolehkan anda mengasingkan «modelnya lemah» daripada «biliknya bising».

Rakam sekali sahaja. Simpan failnya dalam WAV tanpa mampatan pada 16 kHz atau lebih baik. Setiap alat yang anda nilai mulai saat ini menerima fail yang serupa ini, selama-lamanya.

Langkah 2: tulis rujukannya — kemudian bekukan peraturan penormalan sebelum menilai apa-apa

Transkrip rujukan ialah alat pengukur, dan ia mempunyai palang ralatnya sendiri. Artificial Analysis menyelenggara versi «dibersihkan» bagi set penilaian awamnya justeru kerana transkrip rujukan asalnya sendiri mengandungi ralat transkripsi; nota mereka berterus terang mengenainya — versi yang dibersihkan itu «membuang ralat transkripsi daripada teks rujukan, lalu menyediakan kebenaran asas yang lebih tepat untuk penilaian model». Jika pengendali penanda aras pun terpaksa membetulkan kebenaran asas yang telah diterbitkan, transkrip pusingan pertama anda juga bukanlah kitab suci.

Jadi: dua orang mentranskripsi secara berasingan, kemudian menyelaraskan setiap perbezaan. Peruntukkan lima hingga lapan kali masa sebenar bagi pasangan itu, yang meletakkan klip 12 minit pada lebih kurang satu hari bekerja usaha gabungan. Itulah kos tunggal terbesar dalam keseluruhan tatacara ini dan tiada jalan untuk mengelakkannya.

Kemudian catatkan dasar penormalan anda sebelum anda mengira walau satu markah, kerana pilihan-pilihan berikut dengan sendirinya menganjak angka akhir sebanyak beberapa mata:

  • Nombor: adakah «Q3» token yang sama dengan «Q tiga»? Adakah «empat puluh ribu» bersamaan «40.000»?
  • Bentuk singkatan: adakah «we're» sepadan dengan «we are»?
  • Bunyi sisipan: adakah «um», «uh» dan permulaan tergendala hadir di dalam rujukan langsung, dan adakah ia dinilai?
  • Huruf besar dan tanda baca: lazimnya dilucutkan sebelum penilaian — bermakna alat yang meletakkan tanda baca dengan cantik langsung tidak mendapat kredit di sini, dan anda mesti menilainya berasingan dalam langkah 3.

Simpan hasilnya dalam SegLST, format JSON yang digunakan siri cabaran CHiME dan menjadi lalai MeetEval: satu objek bagi setiap segmen dengan session_id, words, speaker, start_time dan end_time. Medan penutur dan pemasaan itulah yang membolehkan metrik peka penutur, dan memasangnya semula kemudian hari amat menyeksakan.

Langkah 3: nilai lima dimensi, dan beri WER mentah sepuluh mata daripada seratus

Pasang alatnya — pip install jiwer meeteval — kemudian nilai setiap dimensi pada klip yang sama. JiWER mengira WER bersama match error rate, word information lost, word information preserved dan character error rate, menggunakan pelaksanaan jarak suntingan minimum RapidFuzz. MeetEval pula mengira metrik yang khusus untuk mesyuarat.

Carta bar mendatar bagi lima dimensi penilaian dengan wajaran 30, 25, 20, 15 dan 10 mata, dengan kadar ralat perkataan mentah paling rendah pada 10

Wajaran yang kami syorkan. Dimensi yang diiklankan setiap vendor ialah dimensi yang bernilai paling sedikit mata.

Istilah penanggung makna — 30 mata. Tandakan setiap kata nama khas, nama kod dan serpihan jargon domain di dalam rujukan. Kemudian kira rumus WER yang sama hanya ke atas token-token itu. Hasilnya kami panggil kadar ralat istilah penanggung, dan itulah angka paling meramal dalam keseluruhan latihan ini. Pada pasangan transkrip di bahagian awal tulisan ini, empat token penanggungnya ialah Priya, Helios, Q3 dan not. Transkrip A tidak merosakkan satu pun: 0,0%. Transkrip B merosakkan dua: 50,0%. WER keseluruhan sama-sama 10,0%, dengan jurang lima puluh mata pada metrik yang benar-benar bermakna.

Pengatributan penutur — 25 mata. Jalankan meeteval-wer cpwer -r ref.stm -h hyp.stm. Concatenated minimum-permutation WER mencari pemetaan terbaik antara penutur rujukan dengan penutur hipotesis, mencantumkan perkataan setiap penutur, lalu menilai hasilnya — sehingga perkataan yang diatributkan kepada orang yang salah menjadi ralat. Kemudian tolak: cpWER ditolak WER biasa ialah jurang pengatributan, iaitu bahagian kerosakan yang berpunca semata-mata daripada tidak diketahuinya siapa yang bercakap. Tambahkan diarization error rate untuk pandangan pemasaan; DER ialah hasil tambah ralat penutur, pertuturan penggera palsu dan pertuturan tercicir sebagai peratusan daripada masa yang dinilai, ditakrifkan dalam seksyen 6.1 pelan penilaian NIST RT-09 dan dilaksanakan dalam dscore, yang dibalut oleh MeetEval dan yang membaca fail RTTM. Sekiranya calon anda menyokong cap masa, gunakan tcpwer --collar 5 menggantikan cpwer supaya perkataan yang betul tetapi terlekat pada saat yang salah tidak diampunkan secara senyap.

Angka, tarikh dan jumlah wang — 20 mata. Cungkil setiap token berangka daripada rujukan lalu nilai ketepatan padanan tepatnya berbanding hipotesis, selepas menerapkan dasar penormalan bertulis anda. Laporkannya sebagai pecahan biasa — «13 daripada 15 betul» — dan bukan sebagai peratusan, kerana bilangannya kecil dan peratusan menyiratkan kejituan yang anda sebenarnya tidak miliki.

Segmentasi dan kebolehbacaan — 15 mata. Yang satu ini bergantung pada manusia. Minta dua pembaca yang tidak menghadiri mesyuarat itu membaca keluaran mentahnya lalu menandakan, bagi setiap minit: sempadan ayat yang tersalah letak, giliran penutur yang bercantum menjadi satu blok, dan perenggan yang menuntut bacaan berulang. Tanda baca sudah dinormalkan keluar daripada pengiraan WER anda, jadi di sinilah satu-satunya tempat ia dinilai langsung.

Kadar ralat perkataan mentah — 10 mata. Jalankan jiwer lalu catat angkanya. Ia benar-benar berguna sebagai semakan lantai: apa-apa yang melebihi kira-kira 12% pada audio dekat mulut yang bersih menandakan masalah akustik sebenar yang berbaloi disiasat. Melepasi lantai itu, ia hampir tidak membezakan apa-apa, dan itulah tepatnya sebab ia bernilai sepuluh mata dan bukan lapan puluh.

Nilai setiap dimensi pada julat 0–100, darabkan dengan wajarannya, kemudian jumlahkan. Hasilnya boleh dibandingkan merentas alat dan merentas masa, dan itulah keseluruhan tujuannya.

Langkah 4: jalankan setiap calon pada fail yang serupa, dan catatkan apa maksud «serupa» itu

Inilah langkah yang dilangkau pasukan, dan ia membatalkan segala-galanya di hulunya.

WAV yang sama, kadar pensampelan yang sama, tanpa pengekodan semula antara calon. Rujukan yang sama, dasar penormalan yang sama dikenakan oleh skrip yang sama. Diarisasi dihidupkan secara jelas atau dimatikan secara jelas pada setiap alat, dan dicatatkan yang mana pun pilihannya — alat yang dinilai dengan diarisasi dimatikan tidak setanding dengan alat yang dinilai dengan diarisasi dihidupkan. Pemberatan kata kunci atau entiti dimatikan pada pusingan pertama dan dihidupkan pada pusingan kedua, kedua-duanya dicatatkan; Microsoft melaporkan pengurangan WER sehingga 30% daripada pemberian senarai kata kunci kepada MAI-Transcribe-1.5, iaitu jumlah yang cukup besar sehingga perbandingan yang mencampurkan pusingan berpemberatan dengan pusingan tanpa pemberatan menjadi tidak bermakna.

Perhatikan pengendalian audio panjang secara khusus. Artificial Analysis terpaksa mencantas audio Earnings22 miliknya kepada kira-kira sembilan minit bagi model yang tidak mampu mengendalikan input panjang penuh secara boleh harap, dan kepada kira-kira 30 saat bagi model yang batasnya lebih ketat — nota terbitan mereka sendiri menamakan GPT-4o Mini Transcribe, Amazon Nova 2 Pro, NVIDIA Canary Qwen 2.5B dan Qwen3 ASR Flash daripada Alibaba antara sistem yang terjejas. Pencantasan mengubah keputusan, kerana ralat berkelompok pada sempadan potongan. Jika sesuatu vendor mencantas fail anda, itu ialah sifat produknya dan tempatnya di dalam kad markah, bukan artifak yang perlu dibetulkan sehingga hilang.

Akhir sekali, rekodkan rentetan versi model yang tepat berserta tarikh bagi setiap larian. «Whisper large-v3» bukan versi; whisper-large-v3, run 2026-08-31 barulah versi.

Langkah 5: jalankan semula kadnya apabila vendor mengeluarkan sesuatu, bukan apabila anda terkenang

Model pertuturan yang dihoskan berubah di bawah kaki anda. Nama titik akhirnya kekal sama sedangkan pemberat di sebaliknya tidak, dan tiada sesiapa menghantar e-mel kepada anda apabila minit mesyuarat anda menjadi sedikit lebih lemah pada kata nama khas.

Tiga pencetus sepatutnya menyalakan larian semula kad penuh, pada klip yang sama yang anda bina dalam langkah 1:

  1. Vendor menerbitkan catatan changelog yang menyentuh modelnya, pendiarinya, atau lapisan tanda baca dan pemformatannya.
  2. Satu selang kalendar berlalu — suku tahunan sudah memadai bagi kebanyakan pasukan, bulanan jika keluaran transkripsi menyuap apa-apa yang automatik di hilirnya.
  3. Kadar ralat istilah penanggung anda beranjak lebih daripada 5 mata antara mana-mana dua larian, yang sepatutnya mencetuskan siasatan sebelum mencetuskan penghijrahan.

Simpan setiap larian dalam satu jadual: tarikh, rentetan versi model, kelima-lima markah dimensi, jumlah berwajaran. Selepas tiga atau empat larian anda memiliki sesuatu yang tidak mampu diberikan mana-mana papan pendahulu — satu siri masa tentang bagaimana sesebuah produk tertentu berprestasi pada audio yang bunyinya seperti mesyuarat anda yang sebenar.

Kesimpulannya: ketepatan ialah ukuran tentang bilik anda, bukan sifat semula jadi model

Kadar ralat perkataan ialah sifat sesebuah model pada sesebuah korpus. Apa yang sebenarnya anda perlukan ialah sifat sesebuah model pada audio anda, bagi perbendaharaan kata anda, dengan orang anda bercakap bertindih-tindih — dan kuantiti itu tidak wujud sehingga anda mengukurnya. Tiada sesiapa boleh menerbitkannya untuk anda, kerana tiada sesiapa lain memiliki nama kod anda di dalam transkrip rujukan mereka.

Berita baiknya, pengukuran itu murah. Satu rakaman 12 minit, satu hari bekerja transkripsi yang teliti, dua pemasangan pip, dan sebuah kad markah yang muat pada satu muka surat. Pilihan mahalnya ialah pilihan yang diambil kebanyakan pasukan secara lalai: memilih berdasarkan peratusan terbitan, lalu menemui perbezaannya enam bulan kemudian, di dalam minit yang menyatakan bahawa pasukan itu bersetuju dengan sesuatu yang sebenarnya mereka tolak secara terang-terangan.

Angka yang mana lebih sanggup anda salah — satu tempat perpuluhan, atau satu keputusan?


Di mana Telli.sh berdiri: kami membina lapisan-lapisan yang justru diberi wajaran oleh kad markah ini. Telli.sh menjalankan pemisahan penutur, segmentasi, penghalusan dan peringkasan di atas pengecaman pertuturan, dengan terjemahan ke 44 bahasa sasaran dan antara muka dalam 15 bahasa, kerana 90 mata pada kad itu yang bukan WER mentah ialah tempat sesebuah transkrip bertukar menjadi minit yang boleh ditindaki seseorang. Jika anda mahukan titik data sebenar dan bukan sekadar penanda aras, jalankan klip 12 minit anda sendiri melaluinya lalu nilai hasilnya dengan tatacara di atas.

Mulakan nota AI secara langsung

Sumber


Kembali ke blog