# ses parcasi ayirma: Yapay Zeka Ses Hattı için SDR Rehberi

URL: https://anyvoice.app/tr/journal/ses-parcasi-ayirma
Type: blog
Locale: tr
Published: 2026-08-24
Updated: 2026-08-25

---

> Ses parçası ayırma, stereo bir mixi orijinal oturum olmadan vokal, davul ve bas stemlerine ayrıştırır. Derin sinir ağları STFT tabanlı maske tahminiyle çalışır. SDR 2019'dan bu yana 4 dB artı.

## ses parcasi ayirma Nedir? Ses Mühendisleri için SDR Karşılaştırması

Ses parçası ayırma (ses parcasi ayirma), tamamlanmış bir stereo mixi -- vokal, davul, bas, gitar -- orijinal çok kanallı oturuma erişim olmadan izole bileşenlerine ayıran hesaplamalı bir süreçtir. Yapay zeka araçları bunu, zaman ve frekans boyutunda spektral örüntüleri analiz ederek tek bir stereo dosyadan ayrı çıkış parçaları üreterek gerçekleştirir. Ses mühendisleri, yapay zeka sesi uygulayıcıları ve kendi kaydetmedikleri kaynak materyalle çalışan prodüktörler için bu teknik, 2026'da temel bir yetkinliktir. Orijinal kayıt oturumuna erişimin her zaman mümkün olmadığı arşiv çalışmalarında, lisanslı yayın materyallerinde ve ticari müzikle çalışılan prodüksiyonlarda stem ayırma, iş akışını kurtaran kritik bir adım haline gelmiştir.

## "Stem" Nedir ve Mix Aşamasında Ayırma Neden Bu Kadar Önemlidir?

Profesyonel kayıt oturumlarında stem, bir araya bütünleştirilmiş ayrık parça gruplarını ifade eder: davul stemi, vokal stemi, enstrüman stemi. Stüdyolar on yıllardır alt grupları stemlere yönlendirerek teslimat formatı olarak kullanmıştır. Stemler, bir film miksercisinin tam oturuma geri dönmeksizin diyalogu müziğe karşı yeniden dengelemesini sağlar. Büyük bir albüm yayımı için stemler sekiz ila on altı dosyaya ulaşabilir; her biri içsel olarak dengelenmiş mantıksal bir grubu barındırır.

Ses parçası ayırma bu ilişkiyi tersine çevirir. Prodüksiyon sırasında alt grupları stemlere yönlendirmek yerine, tamamlanmış iki izli bir miksten bu stemleri tersine mühendislikle yeniden oluşturmaya çalışır. Temel varsayım şudur: mikslenmiş bir ses dosyası, yeterince eğitilmiş bir modelin kullanılabilir doğrulukta çıkarabileceği ölçüde frekans ve kaynak bilgisi barındırır.

Pratik sonuçlar somuttur. Orijinal oturum dosyalarına erişim olmadan ticari olarak yayımlanmış seslerle karşılaştığınız her durumda -- remix yapmak istediğiniz bir parça, eşleştirdiğiniz bir referans kayıt, arka plan müziğinin kaldırılması gereken bir anlatım klibi -- stem ayırma, yeniden kayıt dışındaki tek seçenektir.

## Sinir Ağları Karışık Bir Dosyayı Nasıl Ayrı Kaynaklara Ayrıştırır?

![Ayrı ses stemlerinin bireysel frekans bantlarını gösteren renkli spektrogram görselleştirmesi](https://fdzlnqpwsaniezitwiuw.supabase.co/storage/v1/object/public/cms-media/anyvoice/2026-08/92355e-inline1.webp)

Günümüz stem ayırma araçları, büyük veri kümeleri üzerinde eğitilmiş derin sinir ağlarıdır: orijinal çok kanallı kaynaklarıyla eşleştirilmiş profesyonelce mikslenmiş ses. Eğitim hedefi, hangi spektral ve zamansal örüntülerin hangi ses kaynağı kategorisine karşılık geldiğini, modelin hiç görmediği seslere güvenilir biçimde genelleyecek ölçüde öğrenmektir.

Bir dosya gönderdiğinizde işlem dört aşamada sırayla gerçekleşir.

**Spektrogram dönüşümü.** Ham dalga formu, Kısa Zamanlı Fourier Dönüşümü (STFT) kullanılarak iki boyutlu bir gösterime aktarılır: dikey eksende frekans, yatay eksende zaman. Bu, modele tek boyutlu bir örnek akışı yerine analiz edebileceği uzaysal bir nesne sunar.

**Örüntü tanıma.** Sinir ağı öğrenilmiş ilişkilerini spektrograma uygular; hangi zaman-frekans bölgelerinin en büyük olasılıkla vokal, davul, bas veya diğer tanımlı kategorilere ait olduğunu belirler. Eğitim verisi hacmi burada belirleyicidir: on binlerce vokal performansını türler genelinde görmüş bir model, daha dar bir küme üzerinde eğitilmiş olana kıyasla olağandışı tınılara çok daha iyi geneller.

**Maske tahmini.** Model bir maske kümesi oluşturur: 0 ile 1 arasındaki değer ızgaraları, her zaman noktasında her frekans kutusunun her steme ne kadar ait olduğunu gösterir. Vokal maskesinde belirli bir noktada 1'e yakın değer şunu ifade eder: buradaki enerjinin büyük çoğunluğu vokallere aittir. 0,5'e yakın değer belirsizliği gösterir ve geçirme bozulmaları buradan kaynaklanır.

**Ses yeniden yapılandırması.** Her maske orijinal spektrograma uygulanır, ardından Ters STFT aracılığıyla tekrar dalga formuna dönüştürülür. Sonuç genellikle dört dosyadır: vokal, davul, bas ve diğer enstrümanlar. Bunların toplamı orijinal mikse yaklaşır; bu "yaklaşma" nitelemesi kritiktir çünkü stem ayırma orijinalde bulunmayan düşük seviyeli bozulmalar üretir.

Kalitenin ölçütü bu bozulmaların ne kadar küçük ve işlenebilir olduğudur; var olup olmadıkları değil. Gerçek bir stüdyo oturumu farklı kanalları baştan ayrı kaydeder; sinir ağları ise karışmış enerjiyi geriye doğru ayrıştırmaya çalışır. İki süreç arasındaki fark, SDR ölçümlerinin neden bu kadar önem taşıdığını açıklar. Öte yandan eğitim verisi çeşitliliği büyük rol oynar: çok sayıda enstrümantasyon ve vokal stilini görmüş modeller, alışılmadık tınılara daha iyi uyum sağlar ve sınır koşullarında daha az yapıt üretir.

## SDR Skorları: Karşılaştırmalı Testler Gerçekte Ne Anlatıyor?

Stem ayırma araştırmalarında model kalitesi, desibel cinsinden raporlanan Sinyal-Bozulma Oranı (SDR) ile ölçülür. Yüksek değerler, daha az bozulmayla daha temiz bir ayırma anlamına gelir. 1 ila 2 dB'lik kazanımlar algısal olarak anlamlı iyileşmeler temsil eder.

Genel model ilerlemesi vokal ayırmadaki eğilimi doğrudan ortaya koyar:

- 
Spleeter (2019): yaklaşık 6,5 dB SDR

- 
Demucs v3 (2021): yaklaşık 7,3 dB SDR

- 
HTDemucs (2022): yaklaşık 8,7 dB SDR

- 
BS-RoFormer (2024): yaklaşık 10,9 dB SDR

2019 ile 2024 arasındaki 4 dB'lik fark, "kaba düzenlemeler için kullanılabilir" ile "son işlem temizliğiyle profesyonel remix bağlamında çalışılabilir" arasındaki mesafedir. BS-RoFormer çıktısı stüdyo çok izliliğinin temizliğiyle eşleşmez ve bu şekilde değerlendirilmemelidir. Ancak bozulma profili metalik rezonanslardan ve belirgin geçirmeden daha ince, daha işlenebilir frekans anomalilerine evrildi.

SDR karşılaştırmalı testleri standart bir test veri kümesine (MusDB18) karşı ölçülür. Materyaliniz prodüksiyon stiline, türe ve kaynak formata bağlı olarak daha iyi veya daha kötü performans gösterebilir. Özellikle vokal ağırlıklı içeriklerde skora dair iyimser beklenti yerine kendi materyalinizi test etmek çok daha güvenilir bir gösterge sunar. Türkiye'deki mix mühendisleri ve prodüktörleri için pratik bir kılavuz olarak şunu belirtmek gerekir: standart pop prodüksiyonu genellikle MusDB18 referans ortalamasına yakın sonuçlar verirken, yoğun Türk halk müziği veya çok katmanlı arabesk prodüksiyonu daha yüksek geçirme oranı üretebilir.

## Mevcut Modeller Nerede Güçlü, Nerede Yetersiz Kalıyor?

![Renkli kodlu stem parçalarını gösteren çok izli DAW ile profesyonel ses prodüksiyon istasyonu](https://fdzlnqpwsaniezitwiuw.supabase.co/storage/v1/object/public/cms-media/anyvoice/2026-08/546ee9-inline2.webp)

Stem ayırma, temiz prodüksiyon üzerinde güvenilir biçimde çalışır: vokalin enstrümanlarla örtüşmesi sınırlı olan, dinamik aralığı makul ölçüde tutarlı kayıtlar. Model performansı belirli koşullarda düşer.

Yoğun polifonik düzenlemeler sorunludur. Vokalin yaylı çalgılar veya tuşlularla geniş frekans aralığında örtüştüğü bir orkestra parçası, vokalin tek davul ve bas üzerinden ayrıldığı bir pop parçasından çok daha fazla maske belirsizliği üretir. Geçirme miktarı belgelenen iyileştirmelerle azaldı; sıfıra ulaşmadı.

Aşırı kompresyonlu kaynak materyal de performansı düşürür. Yayın için yoğun biçimde sıkıştırılmış ses, sinir ağının ayrı ses kaynaklarını farklılaştırmak için dayandığı dinamik zarfı bozar. Ses seviyesi savaşının zirve döneminden gelen kaynaklar, bu olumsuz koşullarda çalışır.

Stereo görüntüleme varsayımları da sınır vakaları oluşturur. Aşırı genişletilmiş stereo bant, modelin genellikle merkeze konumlandırılmış kaynaklara -- vokal, bazen bas -- ilişkin beklentilerini ihlal eder. Mid-side işleme gönderilmiş ses, ayırmadan önce normalleşmeye yardımcı olabilir.

zplane Peel Stems 2 gibi ticari araçlar, 44,1 kHz'de 245 ms gecikmeyle öne çıkar. Bu, iş akışı entegrasyonunun kritik olduğu gerçek zamanlı kullanım senaryolarına yakın bir sınırdır. Toplu işleme için bu rakam sıraya alınmış döngülerde önemli ölçüde düşer ve büyük arşivlerle çalışan mühendisler için fark edilebilir bir avantaj sağlar.

## Yapay Zeka Ses Hattında Stem Ayırma: Dört Somut Kullanım Alanı

Stem ayırmanın yapay zeka sesi bağlamındaki pratik değeri dört senaryoda yoğunlaşır.

**Klonlama öncesi temiz vokal örneği yakalama.** Ses klonu oluşturmadan önce gürültüsüz, enstrüman arka planı olmayan bir kaynak örneğine ihtiyaç duyarsınız. Ticari yayınlardan veya stüdyo izolasyonu olmayan röportajlardan çalışıyorsanız, stem ayırma kayda değer arka plan kalıntısı içerse bile en temiz başlangıç noktasını sağlar.

**Oturuma dönmeksizin post-prodüksiyonda diyalog onarımı.** İstenmeyen müzik veya ortam sesi içeren eski kayıtları temizlemek için orijinal oturuma erişim gerekmez. Ses içeriğini ayırın, bozulma profilini değerlendirin ve gereksinime göre karar verin. Bu yaklaşım özellikle arşiv materyali veya içeriği güncellenmiş eski reklamlar için değer taşır.

**Remix ve yeniden düzenleme için referans analizi.** Eşleştirdiğiniz bir referans parçanın davul ritmi veya bas hattının tını profilini tam mix içinde işlenmeden analiz etmek istiyorsanız, stem ayırma izole kaynaklara yakın bir erişim sunar. Sonuçların mükemmel olmadığını, ancak karşılaştırmalı analiz için yeterli olduğunu göreceksiniz.

**Çok dilli post-prodüksiyon için vokal kaldırma.** Farklı dillerde seslendirmek üzere arka plan müziğini korurken vokal katmanlarını kaldırmak, stem ayırmada anlamlı biçimde gelişti. Müzik geçirmesi yeniden seslendirme dosyasında işlem gerektirmeye devam etse de başlangıç kalitesi çok daha işlenebilir bir seviyeye ulaştı.

## 2026'da Bilinmesi Gereken Stem Ayırma Araçları

Araç alanı hem açık kaynak hem de ticari seçenekler açısından olgunlaştı. Aralarındaki farklar dikkate değerdir.

Açık kaynak modeller -- HTDemucs ve BS-RoFormer başta olmak üzere -- sınırlamaları kabul eden uygulayıcılar için en yüksek ham SDR performansını sunar: yerel çalıştırma, toplu işleme ve GPU gereksinimi, kullanıcı dostu grafik arayüz yok. Performans verilerini doğrudan kaynak almak isteyen geliştiriciler ve araştırmacılar için doğru seçim budur.

Ticari seçenekler (Descript, RipX, zplane Peel Stems 2) entegrasyon hızını ve çalışma ortamında doğrulanmış tutarlı sonuçları önceliklendirir. zplane'nin 245 ms gecikmesi ticari araçlar arasındaki referans noktasıdır; rakipler bu değere çeşitli koşullarda yaklaşır veya masaüstü toplu işlemeye geri döner.

Hangi aracı seçerseniz seçin, doğrulama için en az iki referans dosyası üzerinde karşılaştırma yapın: biri prodüksiyon ayarlarınıza uyan bilinen bir kayıt biçimiyle, diğeri sınır koşullu materyalle. SDR'yi kendi materyalinizde ölçün ve prodüksiyon ortamına sokmadan önce sonuçları değerlendirin. Araç seçimindeki maliyet-performans dengesi de göz ardı edilmemelidir: açık kaynak araçlar ücretsizdir, ancak kurulum, bakım ve GPU maliyetleri hesaba katılmalıdır. Küçük stüdyolar için ticari bir abonelik, altyapı yönetimi yükünü ortadan kaldırarak toplam iş yükünü azaltabilir.

## Bir Sonraki Oturumunuzdan Önce: Modelden Daha İyi Sonuçlar Almanın Yolları

Kaynak materyal kalitesi, model mimarisinden çok daha belirleyicidir. Gürültüsüz ve dinamik olarak doğal sesi fazla kompresyon uygulanmış yayın masterına karşı test ettiğinizde, birincisinin sürekli daha iyi ayrıştığını göreceksiniz.

**Önceden normalleştirin.** Ortalama RMS seviyesi sağlam olmadan, uç ses seviyesi aralığıyla gönderilen dosyalar daha yüksek maske belirsizliği üretir. Ayırmadan önce bir sınırlayıcı uygulamaksızın normalleştirme yapın.

**Spektrogram üzerinde dinleyerek değerlendirin.** Geçirme bölgeleri, bozulma yapıtlarının zaman ve frekansta nerede toplandığını görsel olarak ortaya koyar. Bu, işleme bütçesinin nereye gideceğini kesin bir sayı vermeden önce gösterir ve gereksiz işlem adımlarından kaçınmanıza yardımcı olur.

**Stem ayırma çıktısını hiçbir zaman son kaynak olarak ele almayın.** Vokal klonlama veya çok dilli seslendirme için kullanıyorsanız, beklenen bozulma profilini değerlendirin ve geri kalan geçirmeyi azaltmak için ek işlem adımı ekleyin. Çalışmaya hazır temiz kayıt değil, hammadde olarak değerlendirin: bu zihinsel çerçeve, çıktılardan gerçekçi beklentilerle çalışmanızı sağlar.

## FAQ

### Ses parçası ayırma ne kadar doğru sonuç verir?

BS-RoFormer gibi güncel modeller MusDB18 veri setinde vokal ayırmada yaklaşık 10,9 dB SDR elde eder. Pratik doğruluk kaynak materyale, prodüksiyon stiline ve türe göre değişir; profesyonel stüdyo izolasyonuyla eşdeğer değildir.

### Stem ayırma için GPU gerekli midir?

Açık kaynak modeller (HTDemucs, BS-RoFormer) GPU ile çok daha hızlı çalışır; CPU üzerinde de çalışır ancak birkaç dakika sürer. Descript gibi ticari masaüstü araçlar genellikle GPU olmadan optimize edilmiş performans sunar.

### Stem ayırmayla mixi orijinal kalitesinde yeniden yapılandırabilir miyim?

Hayır. Stem ayırma, toplamı orijinal mikse yaklaşan bileşenler üretir; yeniden yapılandırma birebir eşdeğer değildir. Düşük seviyeli bozulma yapıtları mevcuttur ve stüdyo çok izlili kalitesiyle eşleşmez.

### Vokal klonlamadan önce stem ayırma yapmalı mıyım?

Kaynak materyalinizde enstrüman arka planı veya ortam sesi varsa, stem ayırma klonlama sürecini besleyen örneği iyileştirebilir. Ticari yayın kayıtlarından çalışıyorsanız ve izole kayıt kaynağınız yoksa, bunu varsayılan ilk adım olarak değerlendirin.

### Hangi dosya formatları stem ayırmada en iyi sonucu verir?

Sıkıştırmasız veya kayıpsız kaynaklar (WAV, AIFF, FLAC) MP3'ten daha iyi performans gösterir. Kayıplı format yapıtları sinyale dahil olur ve ayırma sürecinde büyütülür.

### Stem ayırma gerçek zamanlı olarak kullanılabilir mi?

zplane Peel Stems 2 gibi ticari araçlar 44,1 kHz'de 245 ms gecikme bildirir; bu gerçek zamanlı uygulamalara yakın bir değerdir. Açık kaynak modeller genellikle gerçek zamandan yavaş çalışır ve toplu işleme için optimize edilmiştir.