- By BitSeed
- تقنيات الصوت
- 18 Sep
تحليل التنفيذ التقني للإيقاظ الصوتي
يُرن "Hey Siri" و"شابقة الصغيرة" مليارات المرات يوميًا في جميع أنحاء العالم، لكن أساسيات التكنولوجيا التي تجعل الأجهزة "تستيقظ" تظل غير معروفة على نطاق واسع. يتطلب نظام كلمات الإيقاظ المستقيم أن يحتفظ بحد أدنى من 5% من معدل الرفض الخاطئ في البيئات الصاخبة، مع ضبط الإيقاظ الخاطئ على 0.5 مرة لكل ساعة على الأقل - مما يعني أن النظام يجب أن يسمح بفقط 36 إشارة خاطئة عند معالجة 10000 ساعة من الصوت. وراء هذه الدقة الفائقة، هناك مزيج دقيق من معالجة إشارات الصوت والتعلم العميق وتكنولوجيا الحساب الحدودي.
التحويل من الموجات الصوتية إلى السمات هو الخطوة الأولى في الكشف عن كلمات الإيقاظ. يمر إشارة الصوت الأصلية أولاً من خلال مرشح التوطين المسبق لتحسين المكونات عالية التردد وتعزيز نسبة الإشارة إلى الضوضاء. ثم، يقسم النظام الصوت إلى إطارات بفاصل زمني 10 مللي ثانية وطول نافذة 25 مللي ثانية، حيث تُحول كل إطار إلى تمثيل المجال الترددي من خلال التحويل الفوري لجبر الشهية القصير (STFT). لا يزال من الضروري معالجة المخطط الترددي الخطي الناتج من هذه العملية بشكل أكبر - من خلال تعيين مجموعة مرشحات ميل إلى مقياس ميل، حيث هذا التحويل الترددي غير الخطي يتناسب بشكل أفضل مع خصائص الإدراك السمعي للإذن. أخيرًا، من خلال أخذ اللوغاريتم والتحويل الجيبي المتقطع، نحصل على معاملات التردد الميلية للانعكاس (MFCC)، والتكوين النموذجي هو متجه سمات ذو 13-40 بُعد، حيث تحافظ هذه السمات على المعلومات الرئيسية للصوت وتقلل بشكل كبير من بُعد البيانات.
يؤثر اختيار بنية نموذج التعلم العميق بشكل مباشر على أداء الإيقاظ. تستخدم النظم الرئيسية الحالية بنية مختلطة من الشبكات العصبية المتحكمية (CNN) والشبكات العصبية الدورانية (RNN). تتولى CNN استخراج أنماط التردد الزمنية المحلية - من خلال الالتهاب القابل للفصل العميق لتقليل عدد المعلمات مع الحفاظ على قدرة استخراج السمات ؛ بينما تتقن RNN أو متغيراتها LSTM/GRU العلاقات الزمنية والتعرف على تسلسل الصوت المكتمل لكلمة الإيقاظ. تشير الأبحاث الحديثة إلى أن بنية Res2Net القائمة على مزج السمات متعددة المقاييس قادرة على التعامل بشكل أفضل مع كلمات الإيقاظ ذات السرعات المختلفة، مما يقلل من معدل الرفض الخاطئ بنسبة 12% أو أكثر. سمح إدخال آلية الاهتمام للنموذج بالتركيز على الأجزاء الرئيسية من الصوت، مما ي提升 دقة الكشف بشكل أكبر.
يحل استراتيجية الكشف من مرحلتين التناقض بين التكاملية والدقة. تستخدم المرحلة الأولى مستخرج سمات خفيف الوزن، حيث تعالج إطار الصوت كل 80 مللي ثانية، وتولد درجة ثقة بين 0 و1. عادةً ما يكون حجم النموذج المستخدم في هذه المرحلة بضعة عشر كيلوبايت، ويمكن تشغيله في الوقت الفعلي على معالج إشارات رقمية منخفض الطاقة (DSP). عندما تتجاوز درجة الثقة العتبة الأولية، تُشغل المرحلة الثانية التحقق الدقيق - باستخدام نموذج مشفر أكثر تعقيدًا لتحليل سياق صوت أطول، مع الجمع بين النموذج الصوتي والنموذج اللغوي للإ做出 القرار النهائي. تضمن هذه البنية المتسلسلة как التجاوب منخفض التأخير للنظام (القيمة النموذجية <100ms) وتقليل معدل الإيقاظ الخاطئ بشكل فعال.
إستراتيجيات التحسين للتوزيع الحدودي هي المفتاح لتحقيق الاستماع طوال الوقت. من خلال التكميم النقطي 8 بت، يمكن ضغط حجم النموذج إلى 1/4 من الحجم الأصلي، مع ضبط فقدان الدقة على أقل من 2%. يزيل القص الهيكلي جميع مرشحات الالتهاب، مما يقلل من كمية الحسابات بشكل أكبر. تتيح تقنيات التقطيع المعرفي للنماذج الصغيرة تعلم توزيع خرجات النماذج الكبيرة، مع الحفاظ على الأداء وتقليل عدد المعلمات بمقدار 10 أضعاف. على معالج ARM Cortex-M4F، يحتاج النموذج المحسّن إلى 2-3 مللي ثانية فقط لكل استدلال، وينفق طاقة أقل من 1 ملي واط، ما يكفي لدعم تشغيل الأجهزة التي تعمل بالبطارية لفترات طويلة.
تواجه تدريب كلمات الإيقاظ المخصصة تحديات فريدة. على عكس كلمات الإيقاظ الثابتة التي يمكن جمع بيانات حقيقية هائلة لها، عادةً ما يكون لكلمات الإيقاظ المخصصة فقط بضعة عشر عينة. الحل هو استخدام نظام النص إلى الصوت (TTS) لتوليد البيانات المركبة، من خلال تقنيات تعزيز البيانات مثل تغيير النغمة拉伸 الوقت، وحقن الضوضاء لتوسع مجموعة التدريب. تشير الأبحاث إلى أن تعزيز البيانات المناسب يمكن أن يقلل من معدل الرفض الخاطئ في سيناريوهات العينات الصغيرة بنسبة 38%. التعلم النقل هو أيضًا تقنية أساسية - بدءًا من نموذج إيقاظ عام مُتدرب مسبقًا، وتفليف الطبقات الأخيرة فقط لكي تناسب كلمة الإيقاظ الجديدة، مما يقلل بشكل كبير من وقت التدريب وتطلبات البيانات.
يحدد قوة المقاومة للضوضاء القيمة العملي للنظام. توجد في البيئة الحقيقية عوامل ت干扰 مختلفة - المحادثات الخلفية، الموسيقى، الضوضاء الميكانيكية وما إلى ذلك. يتيح التدريب متعدد الشروط، من خلال إضافة عينات ضوضاء مختلفة إلى الصوت النقي، للنموذج تعلم استخراج السمات المستهدفة في بيئات صوتية معقدة. تعمل تقنيات التكثيف التقليدية مثل طرح الطيف والمرشح Винер كخطوات معالجة مسبقة ل提升 نسبة الإشارة إلى الضوضاء. تُستخدم الأبحاث الحديثة مزج متعدد الطرائق الصوتي-بصري، من خلال كاميرا لالتقاط حركات شفاه المتكلم للمساعدة في التقدير، مما ي提升 دقة الكشف بنسبة 15% في ظل ظروف ضوضاء متطرفة.
يتطلب تثبيط الإيقاظ الخاطئ ضبط دقيق للعتبات وتدريب العينات السالبة. يجب أن يُميز النظام بين النطق المُماثل - "Hey Siri" و"Hey Syria"، "شابقة الصغيرة" و"شابة الصغيرة". من خلال جمع الكثير من الكلمات المُماثلة والمحادثات اليومية كعينات سالبة، يُدرب النموذج على قدرته التمييزية. يغير ضبط العتبة الديناميكي حساسية النظام تلقائيًا وفقًا ل مستوى ضوضاء البيئة وسيناريو الاستخدام -提升 الحساسية في البيئة الهادئة لتقليل الرفض الخاطئ، وتقليل الحساسية في البيئة الصاخبة لتجنب الإيقاظ الخاطئ. تُظهر بيانات الأبحاث أن استراتيجية العتبة المناسبة يمكن أن تقلل من معدل الإيقاظ الخاطئ من 13 مرة لكل ساعة إلى قيمة قريبة من الصفر.
يتم تحقيق حماية الخصوصية من خلال المعالجة الجانبية. تتم جميع عمليات الكشف عن كلمات الإيقاظ على الجهاز المحلي، فقط الصوت الذي يُستيقظ بنجاح يتم نقله إلى السحابة للمعالجة اللاحقة. تُغطِّي البيانات الصوتية في المخزن المؤقتة دوريًّا، ولا يتم تخزينها طويلًا. تستخدم بعض الأنظمة مخطط التعلم الفيدرالي، مع الحفاظ على خصوصية المستخدم وتحسين أداء النموذج باستمرار - تُحسب تحديثات النموذج على جانب الجهاز بدون رفع الصوت الأصلي، فقط تُجمع معلومات التدرج المشفرة على الخادم.
يتضمن تحسين استهلاك الطاقة تصميمًا مشتركًا بين الأجهزة والبرامج. تضم رقاقات الإيقاظ الصوتية المخصصة وحدة معالجة إشارات رقمية محسّنة ومُسرع شبكة عصبية، التي تستطيع تشغيل الكشف عن الإيقاظ بكمية منخفضة جدًا من الطاقة. تُجعل استراتيجية الإيقاظ التفاضلية النظام处于 وضع استماع منخفض الطاقة большую часть الوقت، فقط عند الكشف عن إشارة تشبه الصوت البشري يُنشط المعالج الرئيسي. تستخدم بعض الأنظمة المتقدمة الشبكات العصبية التناظرية لمعالجة إشارات الصوت مباشرة في المجال التناظري، مما يتجنب تكلفة استهلاك الطاقة لتحويل ADC، وتقليل استهلاك الطاقة في وضع الانتظار إلى مستوى المايكرو واط.
كمزود لمنتجات الأجهزة الطرفية للتعامل الصوتي بالذكاء الاصطناعي، لدينا خبرة غنية في ممارسة تقنيات كلمات الإيقاظ. من خلال استخدام بنية الشبكة العصبية الذاتية التطويرية، خوارزمية استخراج السمات المحسّنة ومخطط التوزيع الحدودي الفعال، يمكن لمنتجات مكبرات الصوت الذكية لدينا تحقيق إيقاظ صوتي موثوق في جميع البيئات المعقدة. في سيناريو غرف الفندق، يحتاج النظام إلى تصفية ضوضاء المكيف الهوائي وصوتات الممرات ؛ في سيناريو التعليم، يتعين التعامل مع التداخل الناتج من تحدث العديد من الأشخاص في آن واحد. هذه التحديات دفعتنا إلى تحسين الخوارزميات باستمرار، لتحقيق أداء قيادي في الصناعة للإيقاظ النهائي. يبدو إيقاظ الصوت كوظيفة "الإيقاظ" البسيطة، إلا أنه في الحقيقة مزيج مثالي بين الهندسة الدقيقة والخوارزميات الذكية.





