Yapay Zeka Tabanlı Gürültü Engelleme: Nasıl Çalışır?

Summary

Yapay zeka gürültü engelleme, küçük ses çerçevelerinden kazanç maskelerini tahmin eden sinir ağları kullanarak gerçek zamanlı olarak konuşmayı gürültüden ayırır. RNNoise hafif ve yaygın, DeepFilterNet kalitede liderdir iki aşamalı filtreleme ile, Krisp platformlar arasında tutarlılık ve gizlilik sunar. İki yönlü filtreleme gelen ve giden ses temizler; tek yönlü baskılama yalnızca yarı sorun çözer.

Ses üretim masası arayüz, kulaklık ve dalga formu görüntüleme ile, yapay zeka gürültü engellemenin arkasındaki sinyal zincirini temsil ediyor

Yapay Zeka Gürültü Engelleme Nasıl Çalışır?

Yapay zeka gürültü engelleme, tipik olarak 10 ile 40 milisaniye arasındaki küçük ses çerçevelerinde bir sinir ağı çalıştırarak işler. Her çerçeve için model, sinyalin hangi kısımlarının ses (voice) ve hangi kısımlarının gürültü olduğunu tahmin eder, sonra yalnızca sesi iletir. Kavramsal olarak bu kadar basit. Ancak bunu canlı bir aramada yeterince hızlı çalışan, sesinizi robota dönüştürmeyen mühendislik, araçlar arasındaki gerçek farklılıkları ortaya çıkarır. Bu yazı, sinyal zincirini çerçeve çerçeve inceler, gerçekte karşılaşacağınız üç mimariyi (RNNoise, DeepFilterNet, Krisp) karşılaştırır ve teknolojinin hâlâ başarısız olduğu yerleri işaret eder.

Mikrofonunuzdan dinleyicinin kulağına kadar aslında ne oluyor?

Mikrofonunuz bir sürekli dalga formu yakalar: sesiniz, buzdolabı homurtusu, komşunun çim biçme makinesi, mekanik klavyenizin tıklaması, hepsi tek bir sinyale karışmış. Bir gürültü baskılama modeli bu kaynakların her birini ayrı ayrı tanımlamaya ve çıkarmaya çalışmaz. Bunun yerine çerçeve çerçeve çalışır, bir kazanç maskesi (gain mask) tahmini yapar; özünde ses çıkmadan önce uyguladığı frekans bandı başına bir ses düğmesi.

Geleneksel gürültü kapıları (noise gates) sabit bir eşik kullanır: X dB'nin altında, sessiz. Yapay zeka tabanlı baskılama, bu sabit kuralı binlerce saatte ses ve gürültüsü birlikte kaydedilen veriler üzerinde eğitilmiş bir model ile değiştirir. Model, ses perdesi, aksanı ve kayıt koşulları arasında sesin neye benzediğini öğrenir ve gerçek zamanlı olarak bu öğrenilmiş deseni uygular; statik bir kesme noktası yerine.

Pratik sonuç: sabit bir eşik, sessiz konuşma sırasında gürültünün geçmesine izin verir ya da sözcüklerin son kısımlarını kesintiye uğratır. Eğitilmiş bir model kazanç bandı başına, çerçeve başına uyarlanır ve bu nedenle durağan olmayan gürültülere, örneğin birinin arka planda konuşması, köpeğin havlaması veya kapının kapanması gibi durumlara, klasik bir kapıdan çok daha iyi dayanır. Bu uyarlanabilirlik, ses sınıflandırması gerçek zamanlı yapıldığında modelin öğrendiği gürültü desenlerine göre dinamik olarak yanıt vermesi anlamına gelir.

Modeller tipik olarak insan konuşmasından binlerce saat kayıtla eğitilir ve bu eğitim sırasında kontrollü gürültü koşulları eklenir. Böylece sistem, farklı konuşma tarzları, diyalektler ve çeşitli gürültü türleri karşısında sağlamlık kazanır. Bu çok yönlü eğitim yaklaşımı, modelin gerçek dünyadaki çeşitli senaryolarda başarılı performans göstermesini sağlar.

Close-up of a condenser microphone with pop filter, illustrating the raw signal a noise cancellation model has to work from

Çerçeve çerçeve döngü: model ses ve gürültüyü nasıl ayırt eder?

Döngü parçalara indirgenirse şu şekildedir: bir çerçeve yakala, özellik çıkar (genellikle bir spektrogram, çünkü frekans içeriği ses gürültüyü ham genlikten daha iyi ayırır), modeli çalıştır, frekans bandı başına kazanç değeri al, uygula, çerçeveyi çıkar. Çerçeve boyutuna bağlı olarak saniyede 25 ila 100 kez tekrar et.

Bu boşlukta şu anda iki mimari ailesi egemen. RNNoise'deki GRU (Gated Recurrent Unit) gibi tekrarlayan ağlar sesleri sıralı olarak işler ve son çerçevelerin hafızasını taşır, bu da sesin yavaşlaması gibi zamansal desenlerle yardımcı olur. Evrişimsel yaklaşımlar spektrogramdan doğrudan uzamsal özellikleri çıkar, bu da CNN'lerin görüntüleri nasıl işlediğine daha yakındır ve açıkça eğitilmedikleri gürültü türleri arasında daha iyi genelleştirilir.

Ses teknisyeni notu: çerçeve boyutu, çoğu insanın göz ardı ettiği gerçek kaldıraç. Daha kısa bir çerçeve (10ms) daha düşük gecikme anlamına gelir ancak model için çalışılacak daha az bağlam. Daha uzun bir çerçeve (20-40ms) modele daha fazla neden olacak şeyler verir, bu genellikle daha temiz çıktı anlamına gelir, canlı bir aramada duyabileceğiniz bir gecikmenin doğrudan maliyetiyle.

Bu denge, çerçeve boyutu, gecikme ve kalite arasındaki uzlaşma, her gürültü baskılama aracının çalıştığı tüm tasarım alanıdır. Kimse bunu kaçamaz. Farklı olan, her ürünün nereye oturmayı seçmesidir. Bazı araçlar gecikmeyi minimize ederken kaliteden taviz verir, diğerleri tam tersi yaklaşımı benimser.

RNNoise vs DeepFilterNet vs Krisp: aynı sorun, üç farklı uzlaşma

RNNoise, çoğu insanın atıfta bulunduğu açık kaynak temel. Klasik sinyal işlemeyi kompakt bir GRU ağıyla birleştirir, 22 frekans bandı boyunca 10 milisaniye çerçevelerinden kazanç tahmin eder. Model dosyası birkaç yüz kilobayt, tek bir CPU çekirdeğinde rahatça çalışır ve tarayıcı kullanımı için WebAssembly'ye derlenebilir. Durağan gürültülerde mükemmeldir: fan, HVAC vızıltısı, sabit sürücü gıcırtısı. Ancak tek kazanç-band tasarımı yaşını gösterir zor olaylarda: arka planda konuşan insanlar, ani gürültüler, ağır yankı.

DeepFilterNet iki aşamalı bir yaklaşım benimser: ilk geçiş, algısal olarak aralıklı bantlarda kazanç uygular, sonra ikinci aşama, yaklaşık 5 kHz'in altındaki frekanslar üzerinde kısa çok-çerçeveleme filtresi çalıştırarak basit bir kazanç maskesinin kaybettiği ses detayını yeniden inşa eder. Ölçülebilir olarak band-kazanç-yalnızca yöntemleri üstün performans gösterir ve açık kaynak seçenekleri arasında kalite lidereridir, ancak orada ulaşmak için daha fazla bilgi işlem gerekir: bir dizüstü bilgisayar CPU iş parçacığında gerçek zamanlı faktör 0,19 ve Raspberry Pi 4'te 0,42, RNNoise'in çok daha hafif ayak izine karşı. Eklenen gecikme yaklaşık 40ms'dir.

Krisp, cihaz üzerinde sahıplik mimarisini çalıştırır, aynı şekilde 10 milisaniye çerçevelerinde işler, tam model için yaklaşık 25ms eklenen gecikme (hafif ses izolasyonu varyantı için 15ms). İç tasarım yayımlanmamış, ancak ürün uzlaşması açıktır: Windows, macOS, Linux, Android, iOS ve tarayıcılar arasında platformlar arası tutarlılık, sunucu gidiş-dönüşü olmaksızın, gizlilik açısından gecikme kadar önemli olan. Bu sayıların neden önemli olduğuna bağlam için: ITU-T G.114, konuşmanın doğal hissetmesi için toplam tek yönlü ağız-kulak gecikmesini 150ms'nin altında tutmayı tavsiye eder, bu nedenle bu üçünün en yavaşı (bu derinlemesine incelemede gecikme karşılaştırması) bir aramanın sert hissetmeye başlamasından önce yeterince alan bırakır.

İki yönlü filtreleme neden hesaplamayı değiştirir?

Çoğu yerleşik gürültü baskılaması (dizüstü bilgisayarınızın işletim sistemine veya video arama uygulamanıza gömülü tür) yalnızca giden mikrofon sinyalini temizler. Aramada diğer katılımcılardan gelen gürültü hakkında hiçbir şey yapmaz. Krisp'in teknik belgeleri tekniği açıklıyor: her iki yönü filtreleme yapılması, mikrofonunuz cihazınızdan çıkmadan önce ve gelen ses hoparlörlerinize çarpmadan önce temizlenmesi.

Bu ayrım, çoğu açıklamanın kredi verdiklerinden çok daha önemli. Uzaktan bir röportaj kaydediyorsanız ya da havaalanı salonundan aramayla birlikte bir podcast oturumu yürütüyorsanız, tek yönlü baskılama sorunun yalnızca yarısını çözer. Kendi sinyalinizi temizleyeceksiniz ve hâlâ arka plandaki gürültüleriyle uğraşmak zorunda kalırsınız sonraya veya daha kötüsü canlı olarak, temiz bir şekilde sonradan ayırmanın yolu olmaksızın. İki yönlü işlem, gelen gürültüyü kaydına pişirilmeden önce yakalar. Podcast prodüktörleri ve uzaktan görüşmeci profesyonelleri için bu, arşivleme ve editing sürecinde önemli bir avantajdır.

Person on a video call wearing headphones in a busy cafe, the kind of noisy environment AI noise cancellation is built to handle

Yapay zeka gürültü engelleme hâlâ nerede yanlış yapıyor?

Kaynak materyaliniz müzik, çevre alan kaydı veya gerçekte saklamak istediğiniz kalıcı ses olmayan içerik varsa agresif ayarları atla. Bu modeller konuşmayı izole etmek için eğitilmiş; başka bir şey gürültü olarak kabul edilir ve bastırılır, enstrümantasyon, redaksiyon için tutmak isteyebileceğiniz oda tonu veya bir yapımcının normal şekilde tutacağı arka plandaki ortak sunucusunun kahkahası dahil.

Örtüşen konuşma hâlâ en zor durum. İki kişi bir kez konuştuğunda, DeepFilterNet'in iki aşamalı yaklaşımı dahi onları temizce ayırmakta güçlük çeker, çünkü model çerçeve başına kazanç değerleri seçiyor, bireysel konuşmacıları tanımlamıyor. İş akışınız çeşitli mikrofonlar çekmek ve çapraz konuşma içeriyorsa, mikrofon seviyesinde kaynak ayrımı (fiziksel mesafe, yönlü alma desenleri) işlem sonrası model herhangi bir şeyin düzeltebileceğinden daha iyi devam eder.

Ve agresiflik konusunda gerçek bir tavan vardır. Gürültünün yüzde 90'ını kaldıran ama sesi hala bir kişi gibi tutulan bir baskıcı, yüzde 99'unu kaldıran ancak sizi teneke gibi konuşan gibi bırakan birini yener. Bu modellerin herhangi birini rahat çalışan aralığının ötesine itin ve yapıtlar duymaya başlarsınız: sibilantlarda dalgalı, su altında bir kalite veya nefes sesleri sözcük ortasında kesilir. Kayıtınız bastırma sonrası öncesinden daha kötü görünüyorsa, fazla bastırmışsınız; bunu geri çevirin ve üzerine ikinci geçiş yerleştirmeye çalışmayın.

Yapay zeka gürültü engelleme vs. geleneksel ANC: rakipler değil, farklı araçlar

Aktif Gürültü İptali, kulaklıklarınızda olan tür, tamamen farklı bir sorundu ve iki sürekli karıştırıldığı için açıkça ayırmaya değer. ANC, gelen çevre gürültüsünü fiziksel olarak iptal etmek için ters bir ses dalgası üretir; kulaklığa ulaşmadan önce, 1970'lere kadar uzanan ve sabit, düşük frekans sesilerde (motor gıcırtısı) en iyi çalışan tamamen akustik, donanım-bağımlı bir işlem. Döngüde model çıkarsız olduğu için neredeyse anında tepki verir, sadece faz-ters dalga formu üretimi.

Yapay zeka gürültü engelleme, farklı bir problemi çözer: iletim veya kayıt için bir ses sinyalini temizlemek, ANC için asla tasarlanmadı yüksek frekans, durağan olmayan kaynaklar (konuşma ve sohbet) üzerinde çalışır. Biri kulaklarınıza ulaşanlarla ilgili. Diğeri herkesin gerisine ulaşanlarla ilgili. İyi uzak bir kurulum genellikle her ikisini de kullanır: ANC kulaklıkları sizin tarafınızı engellemeyi ve AI bastırması mikrofon beslemesinde temizliği yapmayı.

Overhead flat-lay of home studio recording gear: interface, cables, and notes, part of the chain noise suppression models process

Sonraki aramanızdan önce: gerçekten neyi kontrol etmeye değer?

Bunu güvenilir olmak istediğiniz bir şey için kullanmadan önce hızlı bir test çalıştırın: baskılama ile bir örnek kaydedin ve baskılama olmadan bir tane, sonra dizüstü hoparlörlerinde değil kulaklıklarda geri dinleyin. Özellikle iki şeyi kontrol edin: sibilantlar (s, sh, f sesleri) dalgalanma olmaksızın tutulur mu ve sesiniz sessiz yavaşladığında cümlelerinizin sonu kesilir mi. Bu iki başarısızlık modu başka herhangi bir şeyden önce ortaya çıkar.

Bütçe kıyafetlendiğinizde veya CPU kısıtlı bir cihazda, RNNoise'in WASM oluşturması durağan arka gürültü için yasal bir ücretsiz seçenektir. Açık kaynakta en temiz mümkün sonuç isteyorsanız ve bilgi işlem alanı vardır, DeepFilterNet'in iki aşamalı filtrelemesi ekstra gecikmeye değer. Dokunduğunuz her platform arasında aynı şekilde çalışan bir şey istiyorsanız, sunucu gidiş-dönüşü olmaksızın ve konfigürasyona model olmaksızın, bu, zaten kullandığınız her uygulamanın altında çalışan Krisp gibi ticari bir katmanın durumu. İhtiyaçlarınıza ve kullanım durumunuza göre doğru seçimi yapmak, uzun vadede daha iyi sonuçlar almanızı sağlayacaktır.

Bu hiçbiri kötü mikrofon konumu veya sert, yansıtıcı yüzeyleri olan bir odayı düzeltmez. Bastırma, kaynağı tedavi etme yerine bir onarım adımıdır. Sinyal işlemesini yakalamada doğru alın ve model daha az işi yapması gerekir, bu da temiz çıktının gerçekten başladığı yerdir. Ses üretim zincirindeki bu temel prensibi unutmayın: sonradan hiçbir filtre ve algoritma, kötü kaynak sinyal için mükemmel bir çıktı oluşturamaz. Doğru kaynak kalitesi, teknolojinin en iyi performansını göstermesinin temelidir ve bu her zaman hatırlanması gereken bir prensiptir.

Frequently asked questions

Hangi yapay zeka gürültü engelleme sistemleri en düşük gecikme sağlar?
Krisp yaklaşık 25ms (hafif varyant 15ms) eklenen gecikme sağlar. RNNoise 10ms'dir ancak kalite daha az. DeepFilterNet yaklaşık 40ms'dir ama kalitede en iyidir. ITU-T G.114 tarafından 150ms toplam gecikme sınırı içinde tümü güvenlidir.
İki yönlü gürültü engelleme tek yönlüden farklı nedir?
İki yönlü filtreleme gelen ve giden sesleri temizler; çoğu yerleşik sistem yalnızca mikrofonunuzu temizler. Podcast ve uzaktan röportajlar için, iki yönlü sistem, arayanın arka gürültüsünü de engeller; sonradan temiz bir şekilde kaydı düzeltmek mümkün değildir.
Yapay zeka gürültü engelleme müzik veya alan kaydı için kullanılabilir mi?
Hayır, bu modeller konuşmayı izole etmek için eğitilmiş. Müzik veya çevre alan kaydı uygulandığında, tüm müzik ve çevre tonu gürültü olarak bastırılır ve asla geri gelemez.
RNNoise, DeepFilterNet ve Krisp arasında hangi temel fark vardır?
RNNoise hafif ve ücretsiz ama kalitesi sınırlı. DeepFilterNet açık kaynakta kalite liderdir iki aşamalı filtreleme ile. Krisp ticari, platformlar arası tutarlılık ve gizlilik (sunucu yok) sağlar.
Gürültü engellemenin agresif ayarları kullanırken neden sorun yaşarım?
Gürültünün yüzde 99'unu kaldıran agresif bir baskıcı, sesinizi teneke gibi duyutsuz bırakabilir. Dalgalı sibilantlar, su altı kalitesi veya nefes kesilmesi görülebilir. Yüzde 90 gürültü kaldırma ancak doğal ses tutma, yüzde 99'a karşı daha iyi sonuç verir.