product update14 minit bacaan

Lima peringkat, empat artifak: apa sebenarnya Telli.sh lakukan pada rakaman mesyuarat

Panduan menyeluruh keseluruhan saluran Telli.sh: rakaman langsung atau muat naik audio, transkripsi mesyuarat berkuasa AI dengan pengenalan penutur, terjemahan mesyuarat masa nyata ke 44 bahasa sasaran, ringkasan AI dalam 10 format, dan nota yang boleh dikongsi. Lengkap dengan batasan yang jujur, harga tepat, dan apa yang sebenarnya dituntut oleh ketepatan transkripsi.

K
Ken Jo
#product-update#ai-meeting-transcription#meeting-transcription-accuracy#speaker-identification#real-time-meeting-translation#multilingual-meeting-notes#meeting-minutes-automation#ai-meeting-notes

Lapan orang berdiri di dalam sebuah bilik. Seorang sedang menerangkan sebab migrasi itu tertangguh. Dua orang mendengar separuh hati. Seseorang di belakang menyebut ayat yang akan menjadi penting tiga minggu lagi, dan tiada sesiapa mencatatnya.

Itulah bahan mentahnya. Tulisan ini mengenai apa yang sistem kami lakukan terhadap bahan itu, peringkat demi peringkat, dari saat audio mula mengalir sehingga saat anda menampal pautan ke dalam sebuah saluran.

Kami nyatakan awal-awal supaya tiada siapa perlu meneka: ini tulisan produk mengenai Telli.sh, ditulis oleh pasukan yang membinanya. Kami menerbitkan tulisan begini secara berkala, seiring dengan artikel penyelidikan kami. Apa yang kami cuba lakukan di sini ialah menerangkan jentera itu dengan cukup tepat sehingga pembaca yang skeptikal boleh menyemak sendiri dakwaannya — nama model sebenar, angka sebenar, batasan sebenar — bukan kabus biasa bernama "dikuasakan AI".

Ringkasnya:

  • Satu rakaman melalui lima peringkat pemprosesan dan meninggalkan empat artifak yang disimpan berasingan: transkrip mentah, peta penutur, skrip yang telah dikemaskan, dan satu ringkasan bagi setiap format yang anda gunakan.
  • Pengenalan penutur berjalan di atas pyannote/speaker-diarization-community-1, seketul demi seketul, sambil membawa cap suara ke hadapan supaya orang yang sama mengekalkan label yang sama dari minit ke-5 hingga minit ke-50.
  • Terjemahan menerima 44 kod bahasa; antara mukanya sendiri wujud dalam 15 bahasa; ringkasan hadir dalam 10 format terbina dalam serta format tersuai yang anda tetapkan melalui nama, arahan dan senarai bahagian.
  • Pelan percuma ialah 60 minit sebulan tanpa kad. Pelan berbayar berharga 5, 8 dan 10 dolar sebulan untuk 300, 500 dan 1,000 minit.

Lapan rakan sekerja berdiri mengelilingi komputer riba dalam mesyuarat harian ringkas gaya stand-up

Gambar: Klean Denmark, "Daily sprint meeting", Wikimedia Commons, CC BY-SA 2.0. Persis jenis mesyuarat yang menjadi sebab seluruh saluran ini wujud.

Audio masuk melalui dua laluan, dan kedua-duanya tidak sama

Titik masuknya tepat dua, dan perbezaan antara keduanya membentuk segala yang berlaku selepas itu.

Yang pertama ialah rakaman langsung. Pelayar membuka AudioContext yang ditetapkan pada kadar pensampelan 16,000 Hz, memuatkan AudioWorklet, lalu menimbal masukan mikrofon dalam blok 4,096 sampel — pada 16 kHz bermakna satu paket setiap 256 milisaat. Setiap blok ditukar daripada apungan 32-bit kepada PCM integer 16-bit dan dihantar melalui WebSocket ke /ws/audio/{sessionId}. Soket kedua, /ws/session/{id}, membawa saluran kawalan: pertukaran bahasa, kemas kini konteks, arahan SUMMARIZE, serta arahan FINISH yang menutup sesi dan menulis nota.

Yang kedua ialah muat naik fail. Anda melepaskan rakaman ke dalam tetingkap muat naik, ia dialirkan ke POST /upload, dan jawapannya kembali sebagai JSON bersempadan baris — satu aliran, bukan bulatan berpusing — supaya antara muka dapat menunjukkan kemajuan sebenar melalui langkah bernama, bukan peratusan rekaan. Had ketatnya wajar disebut terus terang: 500 MB setiap fail, dan pemilih fail hanya menerima audio/*. Jika mesyuarat anda terkurung dalam rakaman skrin MP4, trek audionya perlu dikeluarkan dahulu. Hari ini kami tidak melakukannya bagi pihak anda.

Kedua-dua laluan bertemu pada tulang belakang pemprosesan yang sama. Dari peringkat satu ke hadapan, rakaman langsung dan fail yang dimuat naik dilayan secara serupa.

Rajah saluran Telli.sh: rakaman langsung dan muat naik fail bertemu pada pengecaman pertuturan, pemisahan penutur, terjemahan dan pengemasan, kemudian peringkasan, dengan setiap peringkat meninggalkan satu artifak

Setiap peringkat menyimpan keluarannya sendiri. Tiada apa yang ditulis ganti oleh peringkat selepasnya.

Peringkat 1 dan 2: mendengar perkataannya, kemudian menentukan itu perkataan siapa

Pengecaman pertuturan berjalan dahulu. Dalam pengeluaran, kedua-dua laluan kelompok dan laluan penstriman menggunakan model nova-3-general daripada Deepgram; asas kod turut menyertakan laluan yang sepenuhnya setempat berasaskan faster-whisper untuk pemasangan sendiri, dipilih melalui satu tetapan pembekal sahaja. Pilihan itu kurang penting daripada yang orang jangkakan, atas sebab yang telah kami tulis panjang lebar: model pertuturan teratas pada penanda aras bebas kini berhimpit dalam lingkungan kira-kira 1.5 mata peratusan kadar ralat perkataan. Enjin bukan lagi tempat perbezaan kualiti itu lahir.

Tempatnya ialah pengenalan penutur.

Diarisasi berjalan di atas pyannote/speaker-diarization-community-1. Butiran pelaksanaan yang benar-benar penting ialah cara ia menangani rakaman panjang. Daripada mendiarisasikan keseluruhan fail dalam satu laluan, saluran memproses audio seketul demi seketul dan menetapkan penutur sebaik sahaja setiap ketulan selesai — sambil mengekalkan kamus terkumpul cap suara bagi setiap penutur, lalu mengenal pasti semula terhadap set terkumpul itu pada setiap ketulan berikutnya. Mekanisme inilah yang menghalang kegagalan klasik apabila rakaman dua jam senyap-senyap menamakan semula orang yang sama sebagai SPEAKER_00, kemudian SPEAKER_03, kemudian SPEAKER_07 apabila mesyuarat berlarutan.

Apabila satu segmen bertindih dengan dua giliran bercakap, labelnya jatuh kepada giliran yang lebih banyak bertindih, dengan keserupaan cap suara menjadi pemutus bagi kes pertindihan kecil.

Anda menerima label generik — SPEAKER_00, SPEAKER_01 — kerana model tidak mungkin tahu bahawa SPEAKER_01 ialah ketua kejuruteraan anda. Anda menamakannya sekali dalam nota, dan pemetaan itu disimpan bersama nota lalu digunakan di mana-mana selepas itu, termasuk dalam eksport dan pautan kongsi. Itulah pembahagian kerja yang jujur: mesin memisahkan suara, anda memberi nama.

Apa yang benar-benar ditinggalkan oleh setiap peringkat

Peraturan reka bentuk yang kami pegang ialah: tiada peringkat memusnahkan keluaran peringkat sebelumnya. Anda mesti sentiasa boleh kembali kepada perkataan yang benar-benar diucapkan.

ArtifakDihasilkan olehKandungannyaKegunaannya
Transkrip mentahPeringkat 1 + 2Baris kata demi kata bercap masa, dengan label penutur pada setiap barisMenyemak apa yang diucapkan secara harfiah; klik satu baris untuk melompat ke audionya
Peta penuturPeringkat 2 (+ suntingan anda)Pemetaan label kepada nama dalam nota iniMenjadikan semua paparan lain boleh dibaca — digunakan dalam nota, eksport dan pautan kongsi
Skrip dikemaskanPeringkat 4Setiap blok ditulis semula menjadi satu baris topik tebal serta maksimum 3 poinMengimbas mesyuarat panjang tanpa membacanya
Baris terjemahanPeringkat 3Terjemahan yang melekat pada setiap baris asalMembaca mesyuarat yang berlangsung dalam bahasa yang bukan bahasa kerja anda
RingkasanPeringkat 5Satu dokumen berstruktur bagi setiap format yang digunakanBenda yang anda benar-benar hantar kepada orang lain

Dalam antara muka nota, semuanya muncul sebagai tiga jenis tab: Sejarah (transkrip mentah), Skrip (versi dikemaskan), dan satu tab bagi setiap format ringkasan yang anda jana. Jika audio rakaman disimpan, sebuah pemain berada di atasnya, dan mengklik mana-mana baris transkrip akan menggerakkan audio ke cap masa itu.

Peringkat 3: dalam terjemahan, angka yang penting ialah 44

Terjemahan mesyuarat masa nyata ialah ciri yang paling banyak menarik pengguna awal kami, dan skopnya wajar dinyatakan dengan tepat, kerana "menyokong lebih 100 bahasa" ialah dakwaan paling sukar disahkan dalam kategori ini.

Ada dua angka berbeza, dan kedua-duanya bukan angka yang sama:

  • 44 kod bahasa sasaran diterima untuk terjemahan. Set itu disenaraikan secara jelas dalam konfigurasi backend dan memisahkan zh-TW daripada zh — perkara yang lebih berat daripada bunyinya jika anda bekerja merentasi Taiwan dan China tanah besar.
  • 15 bahasa disokong untuk antara mukanya sendiri dan untuk bahasa yang digunakan AI menulis ringkasan anda: Inggeris, Korea, Jepun, Cina, Jerman, Perancis, Sepanyol, Itali, Portugis, Rusia, Poland, Vietnam, Thai, Indonesia dan Melayu.

Dalam sesi langsung, terjemahan berlaku secara berperingkat, bukan dihimpun di hujung. Apabila sempadan tanda baca tiba dalam transkrip, terjemahan segmen itu mengalir di sebelah teks asal, dan cache setiap sesi menghalang teks yang tidak berubah daripada diterjemah semula. Bagi muat naik fail, baris dikumpulkan mengikut kelompok pula: apabila tiada sesiapa memandang skrin, kadar pemprosesan lebih penting daripada kependaman.

Terdapat juga mod aliran kerja terjemahan, berasingan daripada mod nota, untuk keadaan apabila terjemahan itu sendiri yang menjadi hasil akhir — perbualan dwibahasa yang perlu anda ikuti secara langsung, bukan mesyuarat yang memerlukan minit.

Peringkat 4: peringkat yang tiada sesiapa minta tetapi semua orang perlukan

Di sini huraian bertukar menjadi pendapat, dan pendapat ini tidak akan kami lembutkan: pengemasan ialah peringkat yang paling dipandang rendah dalam saluran ini.

Transkrip kata demi kata pertuturan manusia hampir tidak boleh dibaca. Orang memulakan semula ayat, membiarkan hujungnya tergantung, menyebut "ya, ya, betul" empat kali, dan menanam satu keputusan di dalam sembilan puluh saat berdehem. Menyalin semua itu tanpa satu pun perkataan tersilap tetap sembilan puluh saat berdehem.

Justeru peringkat pengemasan mengambil setiap blok perbualan dan menulisnya semula di bawah kekangan ketat, yang ditakrifkan dalam templat gesaan dan bukan dalam kod, supaya kami boleh melaraskannya tanpa penempatan baharu. Setiap blok menjadi satu baris topik tebal yang diterbitkan daripada kandungannya — bukan daripada nama peranan, tanpa kurungan siku — diikuti paling banyak tiga poin, dengan sasaran kira-kira 300 aksara setiap blok. Nama penutur dan cap masa dibuang secara jelas: kedua-duanya sudah ada dalam transkrip mentah, dan mengulanginya hanya menjadikan paparan untuk mengimbas itu lebih sukar diimbas.

Satu kekangan dalam templat itu wajar disebut namanya: model diarahkan menyesuaikan laras bahasa dengan apa yang didengarinya, dan secara khusus tidak memaksakan nada mesyuarat perniagaan pada perbualan santai. Perbualan di koridor yang diringkaskan seolah-olah minit lembaga pengarah ialah artifak yang lebih buruk daripada tiada ringkasan langsung.

Kami memanggil hasilnya skrip — versi yang boleh dibaca sekali imbas, sejauh satu tab daripada versi yang boleh dipetik apabila timbul pertikaian.

Peringkat 5: sepuluh format ringkasan, kerana "ringkasan" bukan satu benda

Peringkat terakhir menghasilkan dokumen yang anda benar-benar hantar. Meminta LLM memberi "satu ringkasan" akan memberi anda ringkasan tentang tiada apa yang khusus, jadi format di sini ialah pilihan kelas pertama, bukan nilai lalai yang tersembunyi.

Sepuluh format tersedia terbina dalam: Ringkasan AI (umum), Minit Mesyuarat, Laporan Ringkas, Nota Kuliah, Khutbah / Ceramah, Rekod Kaunseling, Ringkasan Panggilan, Temu Bual, Nota Idea, dan Rangka Pembentangan. Setiap satu membawa struktur bahagiannya sendiri: minit mesyuarat menghasilkan gambaran keseluruhan, perkara yang dibincangkan, keputusan, dan langkah seterusnya; rangka pembentangan menghasilkan rangka, aliran slaid, mesej utama, nota pembentang, dan tindakan seterusnya. Tajuk bahagiannya sendiri disetempatkan mengikut bahasa dan bukan diterjemah semasa penjanaan — sebab itulah ringkasan bahasa Jepun terbaca seperti dokumen Jepun, bukan teks Inggeris yang diterjemah.

Apabila tiada satu pun daripada sepuluh itu sesuai, anda menetapkan format tersuai: satu nama, satu set arahan, dan senarai bahagian yang anda mahu, disimpan dan boleh diguna semula. "Kemas kini mingguan untuk lembaga dengan risiko dan keputusan yang belum selesai" ialah format yang ditulis sekali sahaja.

Mana-mana format boleh digunakan pada nota selepas itu, dan setiap satu menjana tabnya sendiri. Meringkaskan rakaman yang sama dengan tiga cara untuk tiga golongan pembaca di sini ialah penggunaan biasa, bukan jalan pintas.

Ketepatan transkripsi mesyuarat ialah satu tindanan, bukan satu nombor

Jika anda sedang membandingkan alat dalam kategori ini, inilah bahagian yang patut anda bantah.

Industri menerbitkan satu nombor — kadar ralat perkataan — dan nombor itu sudah tidak berguna untuk memilih antara produk, kerana semuanya berhimpit dekat lantai. Kami membedah hujah itu secara terperinci dalam Ketepatan STT sahaja tidak memadai, termasuk kes apabila satu perkataan "tidak" yang hilang membalikkan sesuatu keputusan sambil hanya menelan 0.016% daripada bajet ketepatan.

Versi praktikalnya: ketepatan transkripsi yang bertahan apabila berhadapan dengan mesyuarat sebenar dibina daripada lima lapisan, dan model akustik hanyalah lapisan paling bawah.

Rajah bertindan lima lapisan ketepatan: model akustik di dasar, kemudian atribusi penutur, konteks yang diberikan, pengemasan, dan semakan manusia, dengan kadar ralat perkataan hanya mengukur lapisan dasar

Kadar ralat perkataan mengukur lapisan 1. Lapisan 2 hingga 5 yang menentukan sama ada transkrip itu berguna.

Lapisan 3 ialah lapisan yang dikawal pengguna secara langsung tetapi paling kerap dilangkau. Sebelum merakam atau memuat naik, anda boleh memberikan blok konteks sehingga 500 aksara — topik, nama peserta, kod produk, akronim — dan melampirkan sehingga 3 fail rujukan (PDF, imej atau teks) yang teksnya diekstrak dalam pelayar lalu dilipat ke dalam bajet aksara yang sama. Konteks itu dihantar ke peringkat-peringkat AI.

Ini bukan hiasan. Kata nama khas serentak merupakan perkataan dengan muatan maklumat tertinggi dan kekerapan terendah dalam mana-mana mesyuarat: nama projek dalaman, nama keluarga yang jarang, kod produk. Memberitahu sistem lebih awal bahawa "Kestrel" ialah produk dan "Ravi" ialah orang mengambil lima belas saat, dan menghapuskan ralat yang jika tidak akan anda betulkan secara manual selama sepuluh minit. Jika selepas tulisan ini anda mengubah satu perkara sahaja, isikan kotak konteks.

Dari kosong ke nota yang dikongsi, dalam sebelas langkah

Secara konkrit, dari larian pertama hingga artifak yang boleh dikongsi:

  1. Daftar. Pelan percuma ialah 60 minit sebulan, tanpa kad kredit, dan menjalankan saluran yang sama persis dengan pelan berbayar — ini perbezaan kuota, bukan perbezaan ciri.
  2. Pilih laluan: mulakan rakaman langsung, atau buka tetingkap muat naik dan lepaskan fail audio (audio/*, di bawah 500 MB).
  3. Tetapkan pasangan bahasa. Sumber boleh dibiarkan pada pengesanan automatik; bahasa sasaran menentukan terjemahan dan ringkasan keluar dalam bahasa apa.
  4. Isikan kotak konteks — topik, nama, akronim, sehingga 500 aksara. Lampirkan sehingga 3 fail rujukan jika anda ada slaid atau agenda.
  5. Pilih folder jika nota perlu difailkan di tempat tertentu. Anda boleh memindahkannya kemudian.
  6. Rakam, atau tunggu aliran muat naik. Dalam sesi langsung, transkrip muncul sambil orang bercakap, dengan terjemahan mengalir di sebelahnya jika bahasa sasaran ditetapkan. Semasa muat naik anda akan nampak langkah bernama: pengecaman suara, analisis, pengemasan, ringkasan, pemuktamadan.
  7. Tamatkan sesi. Itu mencetuskan mesej kawalan FINISH, yang mengeluarkan segmen terakhir, menunggu pengemasan yang sedang berjalan, menyimpan audio, menjana ringkasan, dan menulis nota.
  8. Namakan semula penutur. SPEAKER_00 bertukar menjadi satu nama sekali sahaja, dan pemetaan itu merebak ke setiap paparan dan setiap eksport.
  9. Baca tab Skrip untuk tahu mesyuarat itu tentang apa; turun ke Sejarah dan klik satu baris untuk mendengar audio pada saat itu apabila ada sesuatu yang kelihatan tidak kena.
  10. Jana format ringkasan tambahan jika satu golongan pembaca perlukan Minit Mesyuarat dan satu lagi perlukan Laporan Ringkas.
  11. Kongsi atau eksport. Pautan kongsi bersifat baca sahaja, luput dalam 7 hari, dan boleh membawa kata laluan pilihan. Eksport memberi anda Markdown atau JSON, dengan ringkasan, blok yang dikemaskan, dan transkrip penuh dalam satu fail.

Muat naik rakaman yang anda sudah ada

Berapa kosnya, dalam angka tepat

Kuota dikira dalam minit audio yang diproses, dan itu sahaja yang memisahkan setiap peringkat.

PelanMinit sebulanBulananTahunanKos berkesan setiap 100 minit
Percuma60USD 0
Plus300USD 5.00USD 51.00USD 1.67
Pro500USD 8.00USD 81.60USD 1.60
Pro+1,000USD 10.00USD 102.00USD 1.00

Carta bar membandingkan minit rakaman bulanan bagi pelan Percuma, Plus, Pro dan Pro Plus, lengkap dengan harganya

Pengebilan tahunan ialah bulanan × 12 × 0.85. Kadar seminit bertambah baik apabila peringkat naik; salurannya tidak berubah.

Enam puluh minit percuma bersamaan satu mesyuarat panjang atau tiga mesyuarat ringkas. Cukup untuk menjawab satu-satunya soalan yang penting: adakah ia menghasilkan nota yang anda benar-benar akan hantar? Pada audio anda sendiri, bukan pada demo penjual.

Rakam mesyuarat anda yang seterusnya secara langsung

Apa yang Telli.sh tidak lakukan

Tulisan produk yang hanya menyenaraikan keupayaan ialah iklan. Ini lajur sebelahnya.

Ia tidak menerima fail video. Pemuat naik menerima audio/*. Keluarkan trek audionya dahulu.

Ia tidak menyertai panggilan anda. Tiada bot yang mendail masuk ke Zoom, Meet atau Teams lalu duduk dalam senarai peserta. Anda merakam bilik itu, atau audio mesin anda sendiri, atau memuat naik failnya selepas itu.

Ia tidak membaiki audio yang buruk. Inilah sempadan jujur bagi keseluruhan kategori. Satu mikrofon omniarah komputer riba di hujung meja dua belas orang, dalam bilik berdinding keras, akan menghasilkan diarisasi yang merosot tidak kira model siapa yang berjalan — pertuturan bertindih dan penutur yang jauh ialah tempat atribusi mula-mula patah. Sebuah telefon di tengah meja mengalahkan komputer riba di hujung meja setiap kali, dan kosnya sifar.

Ia tidak tahu perbendaharaan kata anda melainkan anda memberitahunya. Lihat lapisan 3 di atas. Kata nama khas yang luar biasa ialah punca ralat paling lazim, dan kotak konteks ialah penawarnya.

Label penutur bermula secara generik. Tiada sistem yang boleh meneka SPEAKER_01 ialah Priya. Namakan semula sekali bagi setiap nota.

Pautan kongsi ada had masa. Tujuh hari, kemudian pautan itu mati. Ini nilai lalai yang disengajakan untuk kandungan mesyuarat, bukan ciri yang kami terlupa — tetapi bermakna juga pautan kongsi bukan arkib. Eksport Markdown jika anda perlukan sesuatu yang kekal.

Kesimpulannya

Kesilapan kami pada peringkat awal ialah menganggap ini produk transkripsi. Ia bukan. Transkripsi ialah peringkat satu daripada lima, dan ia peringkat yang paling hampir selesai.

Apa yang sebenarnya kami bina ialah jarak antara sebuah rakaman dan sesuatu keputusan: mengetahui siapa yang bercakap, memampatkan sembilan puluh saat berdehem menjadi satu ayat di dalamnya, menyampaikan ayat itu dalam bahasa kerja pembacanya, dan meletakkannya di tempat yang boleh dibuka rakan sekerja. Rakaman ialah bukti. Nota ialah benda yang mengubah apa yang berlaku minggu depan.

Jika ada rakaman mesyuarat dalam komputer anda sekarang, itulah satu-satunya penanda aras yang berbaloi dijalankan. Milik kami mengambil enam puluh saat untuk disediakan dan menghasilkan nota yang kami hantar kepada empat orang.

Mulakan sesi langsung dengan terjemahan

Sumber


Kembali ke blog