نویز متر - درک عمیق تری از سرکوب نویز به دست آورید
پس از درک تفاوت های اساسی بین سرکوب نویز (کاهش نویز محیطی بلندگو برای شنوندگان از راه دور برای شنیدن واضح) و کاهش نویز فعال (خنثی کردن نویز محیطی خود شنونده)، اجازه دهید بر روی چگونگی دستیابی به سرکوب نویز تمرکز کنیم.
یک روش استفاده از چندین میکروفون برای سرکوب داده ها است. جمعآوری دادهها از چندین مکان منجر به دریافت سیگنالهای مشابه (اما هنوز متمایز) توسط دستگاهها میشود. سیگنال صوتی دریافت شده توسط میکروفون نزدیک به جمعیت سخنگو به طور قابل توجهی قوی تر از میکروفون ثانویه است. دو میکروفون صدای پس زمینه غیر صوتی با قدرت سیگنال مشابه را دریافت خواهند کرد. اطلاعات صوتی جمع آوری شده توسط میکروفون صوتی قوی و میکروفون ثانویه را کم کنید و اکثریت باقیمانده اطلاعات صوتی است. هرچه فاصله بین میکروفون ها بیشتر باشد، تفاوت سیگنال بین میکروفون های نزدیک و دورتر بیشتر می شود و استفاده از این الگوریتم ساده برای سرکوب نویز آسان تر می شود. با این حال، زمانی که صحبت نمی کنید، یا زمانی که انتظار دارید داده های صوتی در طول زمان تغییر کند (مانند زمانی که راه می روید یا می دوید و تلفن شما مدام می لرزد)، کارایی این روش کاهش می یابد. حذف نویز چند میکروفون مطمئناً قابل اعتماد است، اما اشکالاتی در سخت افزار و پردازش اضافی وجود دارد.
بنابراین، اگر فقط یک میکروفون وجود داشت، چه؟ اگر از منابع صوتی اضافی برای تأیید/مقایسه استفاده نشود، یک راهحل میکروفون تکی بر درک ویژگیهای نویز دریافتی و فیلتر کردن آنها متکی است. این مربوط به تعاریف ذکر شده قبلی از نویز حالت پایدار و غیر ساکن است. نویز حالت پایدار را می توان به طور موثر از طریق الگوریتم های DSP فیلتر کرد، در حالی که نویز غیر ثابت یک چالش را ایجاد می کند، شبکه های عصبی عمیق (DNN) می توانند به حل مشکل کمک کنند.
این روش به یک مجموعه داده برای آموزش شبکه نیاز دارد. این مجموعه داده از نویزهای مختلف (حالت ثابت و غیر ثابت) و گفتار واضح تشکیل شده است که یک الگوی گفتاری نویز سنتز شده ایجاد می کند. مجموعه داده را به عنوان ورودی به DNN تغذیه کنید و آن را با صدای واضح خروجی بگیرید. این یک مدل شبکه عصبی ایجاد میکند که نویز را حذف میکند و فقط گفتار واضح را تولید میکند.
حتی با DNN های آموزش دیده، هنوز چالش ها و شاخص هایی وجود دارد که باید در نظر گرفته شوند. اگر میخواهید در زمان واقعی با تأخیر کم اجرا کنید، به قدرت پردازش قوی یا یک DNN کوچکتر نیاز دارید. هرچه پارامترهای DNN بیشتر باشد، سرعت اجرای آن کمتر است. نرخ نمونه برداری صدا تأثیر مشابهی بر سرکوب صدا دارد. نرخ نمونه برداری بالاتر به این معنی است که DNN باید پارامترهای بیشتری را مدیریت کند، اما به نوبه خود، خروجی با کیفیت بالاتری را به دست خواهد آورد. ارتباط صوتی باند باریک یک انتخاب ایده آل برای سرکوب نویز در زمان واقعی است.
این نوع پردازش همه وظایف فشرده است و رایانش ابری در انجام چنین وظایفی بسیار ماهر است، اما این روش تأخیر را به طور قابل توجهی افزایش می دهد. با توجه به اینکه انسان ها می توانند به طور قابل اعتماد تاخیرهای تقریباً 108 میلی ثانیه یا بیشتر را تشخیص دهند، تاخیر اضافی ناشی از پردازش رایانش ابری به وضوح نتیجه ایده آلی نیست. با این حال، اجرای DNN در لبه نیاز به برخی تنظیمات هوشمندانه دارد. CEVA همیشه متعهد به بهبود قابلیتهای پردازش صدا و گفتار است. این شامل وضوح گفتار معتبر و الگوریتمهای تشخیص فرمان است - این الگوریتمها ارتباط واضح و کنترل صدا را حتی در لبهها فراهم میکنند. خوش آمدید با ما تماس بگیرید و شخصا گوش دهید.






