speech-to-text

อัปเดต STT ของ Deepgram มีความหมายอย่างไรต่อโน้ตสดของ Telli.sh

Deepgram ประกาศ UpdateListen สำหรับเซสชันสด การเว้นวรรคภาษาเกาหลีที่ดีขึ้น การจัดรูปแบบตัวเลขหลายภาษา และ batch diarization v2 เพราะ Telli.sh ใช้ Deepgram เป็นเอนจินเสียงหลัก การอัปเดตนี้จึงสำคัญกับโน้ต AI สด

T
Telli.sh Team
#deepgram#speech-to-text#live-notes#meeting-notes#transcription#ai-notetaker

Deepgram ได้เผยแพร่อัปเดต speech-to-text หลายรายการที่เกี่ยวข้องกับโน้ตประชุมแบบเรียลไทม์โดยตรง เราตรวจสอบ changelog ทางการเมื่อวันที่ 28 มิถุนายน 2026 ทิศทางชัดเจนว่า STT กำลังปรับตัวได้มากขึ้น รองรับหลายภาษาได้ดีขึ้น และเหมาะกับบทสนทนายาวมากขึ้น

เรื่องนี้สำคัญกับ Telli.sh เพราะเราใช้ Deepgram เป็นเอนจินเสียงหลักใน production เมื่อเอนจินดีขึ้น พื้นฐานของโน้ตสด ไฟล์เสียงที่อัปโหลด สรุป และบันทึกประชุมหลายภาษาก็ดีขึ้นตามไปด้วย

ไมโครโฟนบันทึกเสียงและเวิร์กสเตชันเสียง

Image: Dejan Krsmanovic, Wikimedia Commons, CC BY 2.0.

Deepgram ประกาศอะไร

รายการล่าสุดคือ UpdateListen ที่ประกาศเมื่อวันที่ 15 มิถุนายน 2026 ฟีเจอร์นี้ช่วยให้เซสชันเสียงสดปรับการตั้งค่า Listen ระหว่างสนทนาได้โดยไม่ต้องเริ่มเซสชันใหม่ ค่าที่ปรับได้รวมถึงเกณฑ์จบเทิร์น timeout คำสำคัญ และ language hints

สำหรับผู้ใช้ นี่หมายถึงประสบการณ์โน้ตสดที่ปรับตัวได้ดีขึ้น เมื่อหัวข้อ คำศัพท์ หรือภาษาที่ใช้ในประชุมเปลี่ยนไป

ในเดือนพฤษภาคม Deepgram ยังประกาศการปรับปรุง STT หลายรายการ:

  • transcript ภาษาเกาหลี ko และ ko-KR มีการเว้นวรรคคำที่ดีขึ้น ทำให้อ่านและตรวจทานง่ายขึ้น
  • profanity filtering รองรับโมเดลหลายภาษา Nova-2, Nova-3 และ Flux ด้วย language=multi
  • Nova-3 multilingual สามารถจัดรูปแบบตัวเลขที่พูดออกมาเป็นตัวเลขในหลายภาษา
  • batch speaker diarization v2 ใช้งานได้ผ่าน diarize_model; Deepgram ระบุว่า v2 ได้รับความพึงพอใจมากกว่า diarizer เดิม 3.3 เท่าในการประเมินโดยมนุษย์แบบเปรียบเทียบ

มีข้อจำกัดสำคัญ: Deepgram ระบุว่า diarize_model ใช้กับ batch request ไม่ใช่ streaming Telli.sh จะจัดการความต่างนี้อย่างชัดเจนก่อนนำไปใช้จริง

ความหมายสำหรับผู้ใช้ Telli.sh

ประโยชน์ที่ตรงที่สุดคือคุณภาพ transcript ผู้ใช้ภาษาเกาหลีควรได้ข้อความดิบที่อ่านง่ายขึ้น การประชุมหลายภาษาจะได้ประโยชน์จากการจัดรูปแบบตัวเลขและการกรองเนื้อหา

ชั้นถัดมาคือการควบคุมเซสชันสด UpdateListen สำคัญมากกับโน้ต AI สด การประชุมเทคนิคอาจต้องเน้นคำเฉพาะของผลิตภัณฑ์ การคุยสองภาษาอาจต้องใช้ language hints และบทสนทนาที่เร็วอาจต้องตั้งค่าจังหวะจบประโยคต่างออกไป

สำหรับไฟล์เสียงที่อัปโหลดและงาน batch ยาว diarization v2 อาจช่วยให้โน้ตแยกตามผู้พูดดีขึ้น เราจะทดสอบกับเสียงประชุมจริงก่อนเปลี่ยนการทำงานใน production

STT ที่ดีต้องมีชั้นผลิตภัณฑ์

Deepgram ทำให้ transcript ดีขึ้น Telli.sh เปลี่ยน transcript ให้เป็น workflow: สถานะบันทึกสด ภาษาต้นทาง ข้อความที่ตรวจทานได้ การปรับปรุงด้วย AI สรุป การตัดสินใจ งานที่ต้องทำ และบันทึกประชุมที่กลับมาใช้ซ้ำได้

เป้าหมายไม่ใช่ให้ผู้ใช้ต้องตั้งค่าเพิ่ม เป้าหมายคือข้อผิดพลาดน้อยลง โน้ตชัดขึ้น และงานหลังประชุมน้อยลง

เริ่มโน้ต AI สด

Sources


กลับไปที่บล็อก