อัปเดต STT ของ Deepgram มีความหมายอย่างไรต่อโน้ตสดของ Telli.sh
Deepgram ประกาศ UpdateListen สำหรับเซสชันสด การเว้นวรรคภาษาเกาหลีที่ดีขึ้น การจัดรูปแบบตัวเลขหลายภาษา และ batch diarization v2 เพราะ Telli.sh ใช้ Deepgram เป็นเอนจินเสียงหลัก การอัปเดตนี้จึงสำคัญกับโน้ต AI สด
Deepgram ได้เผยแพร่อัปเดต speech-to-text หลายรายการที่เกี่ยวข้องกับโน้ตประชุมแบบเรียลไทม์โดยตรง เราตรวจสอบ changelog ทางการเมื่อวันที่ 28 มิถุนายน 2026 ทิศทางชัดเจนว่า STT กำลังปรับตัวได้มากขึ้น รองรับหลายภาษาได้ดีขึ้น และเหมาะกับบทสนทนายาวมากขึ้น
เรื่องนี้สำคัญกับ Telli.sh เพราะเราใช้ Deepgram เป็นเอนจินเสียงหลักใน production เมื่อเอนจินดีขึ้น พื้นฐานของโน้ตสด ไฟล์เสียงที่อัปโหลด สรุป และบันทึกประชุมหลายภาษาก็ดีขึ้นตามไปด้วย

Image: Dejan Krsmanovic, Wikimedia Commons, CC BY 2.0.
Deepgram ประกาศอะไร
รายการล่าสุดคือ UpdateListen ที่ประกาศเมื่อวันที่ 15 มิถุนายน 2026 ฟีเจอร์นี้ช่วยให้เซสชันเสียงสดปรับการตั้งค่า Listen ระหว่างสนทนาได้โดยไม่ต้องเริ่มเซสชันใหม่ ค่าที่ปรับได้รวมถึงเกณฑ์จบเทิร์น timeout คำสำคัญ และ language hints
สำหรับผู้ใช้ นี่หมายถึงประสบการณ์โน้ตสดที่ปรับตัวได้ดีขึ้น เมื่อหัวข้อ คำศัพท์ หรือภาษาที่ใช้ในประชุมเปลี่ยนไป
ในเดือนพฤษภาคม Deepgram ยังประกาศการปรับปรุง STT หลายรายการ:
- transcript ภาษาเกาหลี
koและko-KRมีการเว้นวรรคคำที่ดีขึ้น ทำให้อ่านและตรวจทานง่ายขึ้น - profanity filtering รองรับโมเดลหลายภาษา Nova-2, Nova-3 และ Flux ด้วย
language=multi - Nova-3 multilingual สามารถจัดรูปแบบตัวเลขที่พูดออกมาเป็นตัวเลขในหลายภาษา
- batch speaker diarization v2 ใช้งานได้ผ่าน
diarize_model; Deepgram ระบุว่า v2 ได้รับความพึงพอใจมากกว่า diarizer เดิม 3.3 เท่าในการประเมินโดยมนุษย์แบบเปรียบเทียบ
มีข้อจำกัดสำคัญ: Deepgram ระบุว่า diarize_model ใช้กับ batch request ไม่ใช่ streaming Telli.sh จะจัดการความต่างนี้อย่างชัดเจนก่อนนำไปใช้จริง
ความหมายสำหรับผู้ใช้ Telli.sh
ประโยชน์ที่ตรงที่สุดคือคุณภาพ transcript ผู้ใช้ภาษาเกาหลีควรได้ข้อความดิบที่อ่านง่ายขึ้น การประชุมหลายภาษาจะได้ประโยชน์จากการจัดรูปแบบตัวเลขและการกรองเนื้อหา
ชั้นถัดมาคือการควบคุมเซสชันสด UpdateListen สำคัญมากกับโน้ต AI สด การประชุมเทคนิคอาจต้องเน้นคำเฉพาะของผลิตภัณฑ์ การคุยสองภาษาอาจต้องใช้ language hints และบทสนทนาที่เร็วอาจต้องตั้งค่าจังหวะจบประโยคต่างออกไป
สำหรับไฟล์เสียงที่อัปโหลดและงาน batch ยาว diarization v2 อาจช่วยให้โน้ตแยกตามผู้พูดดีขึ้น เราจะทดสอบกับเสียงประชุมจริงก่อนเปลี่ยนการทำงานใน production
STT ที่ดีต้องมีชั้นผลิตภัณฑ์
Deepgram ทำให้ transcript ดีขึ้น Telli.sh เปลี่ยน transcript ให้เป็น workflow: สถานะบันทึกสด ภาษาต้นทาง ข้อความที่ตรวจทานได้ การปรับปรุงด้วย AI สรุป การตัดสินใจ งานที่ต้องทำ และบันทึกประชุมที่กลับมาใช้ซ้ำได้
เป้าหมายไม่ใช่ให้ผู้ใช้ต้องตั้งค่าเพิ่ม เป้าหมายคือข้อผิดพลาดน้อยลง โน้ตชัดขึ้น และงานหลังประชุมน้อยลง