- By BitSeed
- 음성 기술
- 18 Sep
음성唤醒의 기술 구현 분석
매일 전 세계에서 수십억 번의 "Hey Siri", "小爱同学"(샤오아이 동학)가 울리지만, 실제로 기기를 "깨우는" 기술 원리는 알려진 바가 거의 없습니다. 합격한唤醒词(워크업 워드) 시스템은 소음 환경에서 5% 미만의 거절 오류율을 유지해야 할 뿐만 아니라, 잘못된唤醒(誤喚醒)을 시간당 0.5회 이내로 제어해야 합니다. 즉, 시스템이 10000시간의 오디오를 처리할 때 단 36회의 잘못된 트리거만 허용된다는 의미입니다. 이러한 극致의 정확도 뒤에는 오디오 신호 처리, 딥 러닝 및 엣지 컴퓨팅 기술의 정교한 융합이 있습니다.
음파에서 특징으로의 변환은唤醒词 감지의 첫 단계입니다. 원시 오디오 신호는 먼저 고주파 성분을 강화하기 위해 프리엠퍼시스 필터를 거쳐 신호 대 잡음비를 향상시킵니다.接着, 시스템은 10밀리초 간격, 25밀리초 창 길이로 오디오를 프레임화하며, 각 프레임은 단시간 푸리에 변환(STFT)을 통해 주파수 영역 표현으로 변환됩니다. 이 과정에서 생성된 선형 진폭 스펙트로그램은 추가 처리가 필요합니다. 멜 필터 뱅크를 통해 멜 스케일로 매핑하는데, 이러한 비선형 주파수 매핑은 인간 귀의 지각 특성에 더욱 부합합니다.最终적으로 로그 취득 및 이산 코사인 변환을 통해 멜 주파수 켑스트럼 계수(MFCC)를 얻으며, 전형적인 구성은 13-40차원 특징 벡터입니다. 이러한 특징은 음성의 핵심 정보를 보존하면서 데이터 차원을 크게 줄입니다.
딥 러닝 모델 아키텍처의 선택은唤醒 성능에 직접적인 영향을 미칩니다. 현재 주류方案은 컨볼루션 신경망(CNN)과 순환 신경망(RNN)의 혼합 아키텍처를 채택하고 있습니다. CNN은 지역 시주파수 패턴을 추출하는 역할을 하며, 깊이 분리형 컨볼루션을 통해 매개변수 수를 줄이면서도 특징 추출 능력을 유지합니다. RNN 또는 그 변형인 LSTM/GRU는 시퀀스 종속 관계를 포착하여唤醒词의 완전한 음소 시퀀스를 인식합니다. 최신 연구에 따르면 Res2Net 기반 아키텍처는 다중 스케일 특징 융합을 통해 다양한语速(말 속도)의唤醒词를 더 잘 처리할 수 있으며, 거절 오류율을 12% 이상降低시킬 수 있습니다. 주의 메커니즘(Attention Mechanism)의 도입으로 모델은 오디오의 핵심片段에 초점을 맞출 수 있어 감지 정확도를进一步 향상시킵니다.
두 단계 감지 전략은 실시간성과 정확성의 모순을 해결합니다.第一阶段은 경량 특징 추출기를采用하여 80밀리초마다 오디오 프레임을 처리하고 0-1 사이의 신뢰도 점수를生成합니다. 이阶段에使用되는 모델은通常几十KB에 불과하여 저전력 DSP에서 실시간으로运行할 수 있습니다. 신뢰도가初步 임계값을超과하면第二阶段의 정밀 검증을触发합니다.更复杂的 인코더 모델을使用하여更长的 오디오 컨텍스트를分析하고 음향 모델과 언어 모델을结合하여最终 판정을 내립니다.这种级联 아키텍처는 시스템의低延迟 응답(典型值 <100ms)을保证할 뿐만 아니라, 잘못된唤醒率을有效降低시킵니다.
엣지 배포의优化策略는全天候监听을实现하는关键입니다. 8비트 고정 소수점 양자화를 통해 모델 크기를 원래의 1/4로压缩할 수 있으며, 정확도 손실은 2% 이내로控制됩니다. 구조화된 가지치기(Structured Pruning)는整个 컨볼루션 필터를 제거하여计算量을进一步减少시킵니다. 지식 증류(Knowledge Distillation) 기술은 작은 모델이 큰 모델의 출력 분포를学习하도록 하여 성능을 유지하면서 매개변수 수를 10배减少시킵니다. ARM Cortex-M4F 프로세서에서优化된 모델은每次推理에仅 2-3밀리초가 소요되며, 전력 소비는 1밀리와트 미만으로 배터리供电设备의长时间运行을支持할 수 있습니다.
自定义唤醒词的训练은独特한挑战에 직면해 있습니다.固定唤醒词는 방대한 실제 데이터를收集할 수 있는 것과不同하게,自定义唤醒词는通常几十개의 샘플만 가지고 있습니다.解决方案은 텍스트 투 스피치(TTS) 시스템을采用하여 합성 데이터를生成하고, 피치 변환, 시간拉伸, 노이즈 주입 등의 데이터 증강 기술을 통해训练集을 확장하는 것입니다.研究表明,合理的数据 증강은 소량 샘플场景에서 거절 오류율을 38%降低시킬 수 있습니다. 전이学习(Transfer Learning) 또한关键技术입니다.预训练된通用唤醒词 모델로부터 시작하여最后几层만 미세 조정하여新的唤醒词에适应함으로써训练时间과 데이터需求를大幅减少시킵니다.
노이즈 강건성(Noise Robustness)은 시스템의实用价值를决定합니다.真实环境에는背景对话, 음악, 기계 소음 등各种干扰가存在합니다.多条件训练은干净한 음성에各种 노이즈 샘플을添加하여 모델이复杂한 음향环境에서目标 특징을提取하도록学习시킵니다. 스펙트럼 차감법(Spectral Subtraction), 위너 필터링(Wiener Filtering) 등传统降噪技术은 전처리 단계로서 신호 대 잡음비를提升시킬 수 있습니다. 최신 연구는 오디오-비주얼 다중 모달리티 융합을采用하여 카메라를 통해 화자의 입술 동작을捕捉하여判断을辅助함으로써 극端한 노이즈 조건에서 감지 정확도를 15%提升시켰습니다.
잘못된唤醒抑制에는 정밀한 임계값 조정과 음성 샘플(负样本)训练이 필요합니다. 시스템은 유사한 발음을区分해야 합니다. 예를 들어 "Hey Siri"와 "Hey Syria", "小爱同学"와 "小艾同学"(샤오아이 동학과 샤오애 동학) 등입니다.大量의 유사 어휘와日常对话을 음성 샘플로收集하여 모델의 판별 능력을训练합니다.动态 임계값调整은环境 노이즈 수준과使用场景에 따라灵敏感도를自适应改变합니다.安静한环境에서는灵敏感도를提高시켜 거절 오류를减少시키고, 소음 환경에서는灵敏感도를降低시켜 잘못된唤醒을避免합니다.研究数据显示,合理的 임계값策略은 잘못된唤醒率을 시간당 13회에서 거의 0으로降至시킬 수 있습니다.
隐私保护는 단말 측(端侧) 처리로实现됩니다.所有的唤醒词 감지는本地设备에서完成되며,成功唤醒后的语音만 클라우드로传输되어后续处理를进行합니다. 오디오 데이터는 버퍼에서循环覆盖되며,长期存储되지 않습니다. 일부 시스템은 연방 학습(Federated Learning)方案을采用하여 사용자隐私를保护하면서 동시에 모델 성능을持续改进합니다.设备端에서 모델 업데이트를计算하지만原始 오디오는上传하지 않고, 암호화된 그래디언트 정보만 서버로聚合합니다.
전력 소비优化에는 하드웨어와 소프트웨어의协同设计이 관련됩니다.专用的语音唤醒 칩은优化된 DSP单元과 신경망 가속기를集成하여 극低 전력으로唤醒 감지를运行할 수 있습니다.分级唤醒策略는 시스템이 대부분의时间을 저전력监听 모드로 유지하다가, 인간의 목소리와类似한 신호를 감지하면 주 프로세서를激活합니다. 일부先进系统은模拟 신경망을采用하여模拟域에서直接 오디오 신호를 처리함으로써 ADC 변환의 전력 소비 비용을避免하고 대기 전력 소비를 마이크로와트级别로降至시킵니다.
AI 음성 상호작용 단말设备 제공업체로서, 우리는唤醒词 기술实践에서丰富한经验을积累하였습니다.自研的 신경망 아키텍처,优化된 특징 추출 알고리즘 및高效的 엣지 배포方案을采用함으로써, 우리의 스마트 스피커 제품은各种复杂环境에서可靠한语音唤醒을实现할 수 있습니다. 호텔 객실场景에서는 시스템이 에어컨 소음과 복도 소리를过滤해야 하며, 교육场景에서는多人이同时에说话하는干扰에应对해야 합니다.这些挑战은 우리가 알고리즘을不断优化하도록推动하였으며,最终业界领先的唤醒 성능을实现하였습니다.语音唤醒은看似简单한 "叫醒"功能이지만, 실제로는 정밀 공학과 지능 알고리즘의完美结合입니다.





