MAT-SED: เส้นทางใหม่ของการตรวจจับเหตุการณ์เสียงด้วย Transformer แบบ Masked และการสร้าง Pre-training ใหม่
MAT-SED: เส้นทางใหม่ของการตรวจจับเหตุการณ์เสียงด้วย Transformer แบบ Masked และการสร้าง Pre-training ใหม่ MAT-SED: เส้นทางใหม่ของการตรวจจับเหตุการณ์เสียงด้วย Transformer แบบ Masked และการสร้าง Pre-training ใหม่ การตรวจจับเหตุการณ์เสียง (Sound Event Detection - SED) เป็นงานที่สำคัญในแวดวงการประมวลผลสัญญาณเสียง (Audio Signal Processing) โดยมีเป้าหมายเพื่อระบุประเภทของเหตุการณ์เสียงและช่วงเวลาที่เกิดขึ้นภายในสัญญาณเสียงที่กำหนด งานวิจัยนี้ นำเสนอ MAT-SED ซึ่งเป็นแบบจำลอง Transformer แบบ Masked Audio Transformer ใหม่ สำหรับงาน SED โดยเฉพาะ MAT-SED นี้ใช้ประโยชน์จากสถาปัตยกรรม Transformer ในการเรียนรู้ความสัมพันธ์ระยะไกลระหว่างองค์ประกอบสเปกโทรแกรม Masked Acoustic Modeling (MAM) หัวใจสำคัญของ MAT-SED คือ Masked Acoustic Modeling (MAM) ซึ่งเป็นวิธีการ Pre-training แบบใหม่ที่ได้รับแรงบันดาลใจจากความสำเร็จของ Masked Language Modeling (MLM) ใน Natural Language Processing (NLP) MAM จะ Mask ส่วนต่าง ๆ ของ Spectrogram อินพุตแบบสุ่ม และฝึกฝนแบบจำลองให้คาดการณ์องค์ประกอบที่ถูก...