• By BitSeed
  • เทคโนโลยีเสียงพูด
  • 18 Sep

การวิเคราะห์การดำเนินการทางเทคนิคของการปลุกด้วยเสียง

"Hey Siri" และ "น้อง小爱" ถูกเรียกกันหลายพันล้านครั้งต่อวันทั่วโลก แต่หลักการทางเทคนิคที่ทำให้อุปกรณ์ "ตื่นขึ้น" จริงๆ นั้น鲜为人知。ระบบคำปลุกที่มีคุณภาพควรจะรักษาอัตราการปฏิเสธผิดพลาดต่ำกว่า 5% ในสภาพแวดล้อมที่มีเสียงรบกวน ในขณะที่ควบคุมการปลุกผิดพลาดให้ไม่เกิน 0.5 ครั้งต่อชั่วโมง ซึ่งหมายความว่าระบบต้องอนุญาตเฉพาะ 36 ครั้งของการกระตุ้นผิดพลาดเมื่อประมวลผลเสียง 10,000 ชั่วโมง。เบื้องหลังความแม่นยำที่ยอดเยี่ยมเช่นนี้ คือการผสานรวมที่精妙ของการประมวลผลสัญญาณเสียง การเรียนรู้เชิงลึก และเทคนิคการคำนวณขอบขั้ว。

การแปลงจากคลื่นเสียงเป็นลักษณะเฉพาะคุณคือขั้นตอนแรกของการตรวจจับคำปลุก。สัญญาณเสียงดิบจะผ่านตัวกรองการเสริมเบื้องต้นเพื่อเสริมส่วนประกอบความถี่สูง เพิ่มอัตราสัญญาณต่อสัญญาณรบกวน。随後 ระบบจะแบ่งเสียงออกเป็นเฟรมด้วยช่วงเวลา 10 มิลลิวินาที และความยาวหน้าต่าง 25 มิลลิวินาที แต่ละเฟรมจะถูกแปลงเป็นการแสดงในโดเมนความถี่ผ่านการแปลงฟูเรียร์แบบชั่วคราว (STFT)。กระบวนการนี้จะสร้างแผนภูมิแอมพลิจูดเชิงเส้น ซึ่งจำเป็นต้องได้รับการประมวลผลเพิ่มเติม โดยการแมปผ่านกลุ่มตัวกรอง梅尔เพื่อแมปไปยังสเกล梅尔 ซึ่งการแมปความถี่แบบไม่เชิงเส้นนี้สอดคล้องกับลักษณะการรับรู้ของหูมนุษย์มากขึ้น。ในที่สุด 通过การหาลอการิทึมและการแปลงโคไซน์แบบไม่ต่อเนื่อง จะได้สัมประสิทธิ์คอสิเนียร์ความถี่梅尔 (MFCC) โดยการกำหนดค่าปกติคือเวกเตอร์ลักษณะเฉพาะคุณ 13-40 มิติ ลักษณะเหล่านี้ไม่เพียง แต่เก็บรักษาข้อมูลสำคัญของเสียงพูดเท่านั้น แต่ยังลดมิติข้อมูลได้อย่างมาก。

การเลือกสถาปัตยกรรมโมเดลการเรียนรู้เชิงลึกส่งผลโดยตรงต่อประสิทธิภาพการปลุก。วิธีการ主流ในปัจจุบันใช้สถาปัตยกรรมผสมผสานของเครือข่ายประสาทเทียมแบบคอนโวลูชัน (CNN) และเครือข่ายประสาทเทียมแบบวนซ้ำ (RNN)。CNN รับผิดชอบในการสกัดลักษณะแบบโมเดลเวลา-ความถี่局部 ในขณะที่ลดจำนวนพารามิเตอร์ผ่านการคอนโวลูชันแบบ可分离ลึกในขณะที่รักษาลักษณะการสกัดลักษณะเฉพาะคุณ;RNN หรือรูปแบบที่ปรับปรุง LSTM/GRU จะจับความสัมพันธ์แบบเวลาเพื่อระบุลำดับ音素ที่สมบูรณ์ของคำปลุก。การวิจัยล่าสุดแสดงให้เห็นว่าสถาปัตยกรรมที่ใช้ Res2Net 通过การผสานรวมลักษณะเฉพาะคุณหลายสเกล สามารถจัดการคำปลุกที่มีอัตราเร็วพูดต่างๆ ได้ดีขึ้น ลดอัตราการปฏิเสธผิดพลาดลงมากกว่า 12%。การนำ机制ความสนใจมาใช้ช่วยให้โมเดลสามารถโฟกัสไปที่ส่วนสำคัญของเสียง เพิ่มความแม่นยำในการตรวจจับต่อไป。

กลยุทธ์การตรวจจับสองขั้นตอนแก้ไขปัญหาความขัดแย้งระหว่างความเร็วแบบเรียลไทม์และความแม่นยำ。ขั้นตอนแรกใช้เครื่องสกัดลักษณะเฉพาะคุณแบบเบา ประมวลผลเฟรมเสียงทุก 80 มิลลิวินาที สร้างคะแนนความเชื่อมั่นระหว่าง 0-1。โมเดลที่ใช้ในขั้นตอนนี้มักมีขนาดเพียงไม่กี่สิบ KB สามารถทำงานแบบเรียลไทม์บน DSP ที่มีพลังงานต่ำ。เมื่อความเชื่อมั่นเกินเกณฑ์เบื้องต้น จะกระตุ้นการตรวจสอบละเอียดในขั้นตอนที่สอง ซึ่งใช้โมเดลตัวเข้ารหัสที่ซับซ้อนกว่าเพื่อวิเคราะห์บริบทเสียงที่ยาวขึ้น รวมกับโมเดลเสียงและโมเดลภาษาเพื่อ做出การตัดสินใจสุดท้าย。สถาปัตยกรรมแบบ级联นี้ไม่เพียง แต่รับประกันการตอบสนองที่มีความล่าช้า低 (ค่าปกติ<100ms) แต่ยังลดอัตราการปลุกผิดพลาดได้อย่างมีประสิทธิภาพ。

กลยุทธ์การปรับแต่งสำหรับการปรับใช้งานที่ขอบขั้วเป็นกุญแจสำคัญในการ实现การตรวจสอบตลอดเวลา。通过การควอนต์แบบจำนวนเต็ม 8 บิต ขนาดโมเดลสามารถถูกบีบอัดเหลือ 1/4 ของเดิม ในขณะที่การสูญเสียความแม่นยำควบคุมอยู่ภายใน 2%。การตัดสินใจโครงสร้าง去除ตัวกรองคอนโวลูชันเต็มๆ ลดปริมาณการคำนวณต่อไป。เทคนิคการกลั่นความรู้让โมเดลขนาดเล็กเรียนรู้การกระจายผลลัพธ์ของโมเดลขนาดใหญ่ ในขณะที่รักษาประสิทธิภาพและลดจำนวนพารามิเตอร์ลง 10 เท่า。บนโปรเซสเซอร์ ARM Cortex-M4F โมเดลที่ปรับแต่งแล้ว只需要เวลา 2-3 มิลลิวินาทีในการอนุมานแต่ละครั้ง กินพลังงานต่ำกว่า 1 มิลลิวัตต์ ซึ่งเพียงพอที่จะรองรับการทำงานเป็นเวลานานของอุปกรณ์ที่ใช้แบตเตอรี่供電。

การฝึกอบรมคำปลุกแบบกำหนดเองเผชิญกับความท้าทายที่独特。ซึ่งแตกต่างจากคำปลุกแบบคงที่ที่สามารถรวบรวมข้อมูลจริงจำนวนมาก คำปลุกแบบกำหนดเองมักมีตัวอย่างเพียงไม่กี่สิบรายการ。วิธีแก้ปัญหาคือการใช้ระบบข้อความไปยังเสียง (TTS) สร้างข้อมูลสังเคราะห์ 通过เทคนิคการเพิ่มข้อมูลเช่นการเปลี่ยนแปลง音高 การยืดเวลา การฉีดเสียงรบกวน等เพื่อขยายชุดข้อมูลฝึกอบรม。การวิจัยแสดงให้เห็นว่าการเพิ่มข้อมูลอย่างเหมาะสมสามารถลดอัตราการปฏิเสธผิดพลาดในสถานการณ์样本จำนวนน้อยลง 38%。การเรียนรู้แบบถ่ายโอน也是เทคนิคสำคัญ โดยเริ่มจากโมเดลคำปลุกทั่วไปที่ฝึกอบรมล่วงหน้า เพียงปรับแต่งชั้นสุดท้ายเพื่อ适应คำปลุกใหม่ ลดเวลาและความต้องการข้อมูลในการฝึกอบรมอย่างมาก。

ความแข็งแกร่งต่อเสียงรบกวน决定คุณค่าประยุกต์ใช้งานของระบบ。ในสภาพแวดล้อมจริงมี各种การรบกวน เช่นการสนทนาเบื้องหลัง ดนตรี เสียงรบกวนจากเครื่องจักร等。การฝึกอบรมแบบ多เงื่อนไข通过การเพิ่ม样本เสียงรบกวนชนิดต่างๆ ในเสียงที่สะอาด ทำให้โมเดลเรียนรู้ที่จะสกัดลักษณะเป้าหมายในสภาพแวดล้อมเสียงที่ซับซ้อน。เทคนิคการลดเสียงรบกวนแบบดั้งเดิม เช่นการลบสเปกตรัม การกรองวีเนอร์ เป็นขั้นตอนการประมวลผลเบื้องต้นที่สามารถเพิ่มอัตราสัญญาณต่อสัญญาณรบกวน。การวิจัยล่าสุดใช้การผสานรวม多模态เสียง-ภาพ 通过กล้องถ่ายภาพจับภาพการเคลื่อนไหวของริมฝีปากของผู้พูดเพื่อช่วยในการ判断 เพิ่มความแม่นยำในการตรวจจับขึ้น 15% ในสภาพที่มีเสียงรบกวนรุนแรง。

การยับยั้งการปลุกผิดพลาด需要การปรับแต่งเกณฑ์อย่างละเอียด和การฝึกอบรม样本ลบ。ระบบ必须能够แยกแยะการออกเสียงที่คล้ายคลึงกัน เช่น "Hey Siri" กับ "Hey Syria" "小爱同学" กับ "小艾同学"。通过การรวบรวมคำศัพท์ที่คล้ายคลึงกันจำนวนมากและการสนทนาประจำวัน作为样本ลบ ฝึกให้โมเดลมีความสามารถในการแยกแยะ。การปรับแต่งเกณฑ์แบบไดนามิก根据ระดับเสียงรบกวนในสภาพแวดล้อม和สถานการณ์การใช้งานเปลี่ยนแปลงความไวได้อย่างอัตโนมัติ ในสภาพแวดล้อมเงียบจะเพิ่มความไวเพื่อลดการปฏิเสธผิดพลาด ในสภาพแวดล้อมที่มีเสียงรบกวนจะลดความไวเพื่อหลีกเลี่ยงการปลุกผิดพลาด。ข้อมูลการวิจัย显示ว่าการใช้กลยุทธ์เกณฑ์ที่เหมาะสมสามารถลดอัตราการปลุกผิดพลาดจาก 13 ครั้งต่อชั่วโมงลงไปใกล้เคียงกับศูนย์。

การป้องกันความเป็นส่วนตัว实现ผ่านการประมวลผลฝั่งอุปกรณ์。การตรวจจับคำปลุกทั้งหมด都在อุปกรณ์โลคัล完成 มีเพียงเสียงที่ปลุกสำเร็จเท่านั้นที่จะถูกส่งไปยังคลาวด์เพื่อประมวลผลต่อไป。ข้อมูลเสียงจะถูก覆盖วนซ้ำในบัฟเฟอร์ ไม่ถูกเก็บไว้เป็นเวลานาน。บางระบบใช้วิธีการเรียนรู้แบบ联邦 เพื่อปรับปรุงประสิทธิภาพโมเดลอย่างต่อเนื่องในขณะที่ป้องกันความเป็นส่วนตัวของผู้ใช้ โดยอุปกรณ์จะคำนวณการอัปเดตโมเดลแต่ไม่ส่งเสียงดิบขึ้นไป มีเพียงข้อมูลเกรเดียนที่เข้ารหัสเท่านั้นที่จะถูกรวมเข้ากับเซิร์ฟเวอร์。

การปรับแต่งพลังงาน涉及การออกแบบร่วมกันของฮาร์ดแวร์และซอฟต์แวร์。ชิปการปลุกด้วยเสียงแบบเฉพาะ用途集成หน่วย DSP ที่ปรับแต่งและเครื่องเร่งประสาทเทียม能够ทำงานการตรวจจับการปลุกด้วยพลังงานที่极低。กลยุทธ์การปลุกแบบ分级让ระบบอยู่ในโหมดตรวจสอบที่ใช้พลังงานต่ำในส่วนใหญ่ของเวลา มีเพียงเมื่อตรวจพบสัญญาณที่คล้ายเสียงคนพูดเท่านั้นที่จะเปิดใช้งานโปรเซสเซอร์หลัก。บางระบบที่ทันสมัยใช้ประสาทเทียมแบบอนาล็อกเพื่อประมวลผลสัญญาณเสียงโดยตรงในโดเมนอนาล็อก หลีกเลี่ยงค่าใช้จ่ายพลังงานจากการแปลง ADC ทำให้พลังงานในโหมด待机ลดลงถึงระดับไมโครวัตต์。

ในฐานะผู้ให้บริการอุปกรณ์终端โต้ตอบเสียง AI เราได้สะสมประสบการณ์มากมายในการปฏิบัติงานด้านเทคนิคคำปลุก。通过การใช้สถาปัตยกรรมประสาทเทียมที่พัฒนาเอง อัลกอริทึมการสกัดลักษณะเฉพาะคุณที่ปรับแต่ง และวิธีการปรับใช้งานที่มีประสิทธิภาพที่ขอบขั้ว ผลิตภัณฑ์ลำโพงอัจฉริยะของเราสามารถ实现การปลุกด้วยเสียงที่เชื่อถือได้ในสภาพแวดล้อมที่ซับซ้อนทุกประเภท。ในสถานการณ์ห้องพักโรงแรม ระบบ需要กรองเสียงรบกวนจากเครื่องปรับอากาศและเสียงในทางเดิน;ในสถานการณ์การศึกษา ต้อง应对การรบกวนจากหลายคนพูดพร้อมกัน。ความท้าทายเหล่านี้ผลักดันเราปรับปรุงอัลกอริทึมอย่างต่อเนื่อง และในที่สุด实现ประสิทธิภาพการปลุกที่领先ในอุตสาหกรรม。การปลุกด้วยเสียงดูเหมือนฟังก์ชัน "เรียกตื่น" ที่ง่าย แต่จริงๆ แล้วเป็นการผสานรวมที่สมบูรณ์แบบระหว่างวิศวกรรมที่แม่นยำและอัลกอริทึมอัจฉริยะ。