스템 분리 오디오란 무엇인가: AI 음성 파이프라인의 핵심 기술
요약
스템 분리 오디오는 완성된 스테레오 믹스를 보컬, 드럼, 베이스 등 개별 트랙으로 역공학적으로 분해하는 기술입니다. 2019년 Spleeter(6.5dB SDR)부터 2024년 BS-RoFormer(10.9dB SDR)까지 4년 만에 품질이 크게 향상됐습니다. AI 음성 파이프라인에서는 클린 보컬 샘플 확보, 포스트 프로덕션 대화 수리 등 핵심 단계로 활용됩니다. 분리 품질의 기준은 아티팩트 유무가 아니라 처리 가능한 수준으로 억제하는 데 있습니다.
스템 분리 오디오(stem separation)란 완성된 스테레오 믹스를 보컬, 드럼, 베이스, 기타 등 개별 구성 요소로 분해하는 연산 처리 과정입니다. 원본 멀티트랙 세션 없이도 AI 도구가 시간과 주파수 패턴을 동시에 분석해 단일 스테레오 파일에서 개별 출력 트랙을 생성합니다. 오디오 엔지니어, AI 음성 제작자, 직접 녹음하지 않은 소재로 작업하는 프로듀서 모두에게 2026년 현재 스템 분리는 핵심 기술입니다.
'스템'의 정의와 믹스 단계에서 분리가 필요한 이유
전문 레코딩 세션에서 스템이란 여러 트랙을 하나로 합쳐 바운스한 논리적 단위를 가리킵니다. 드럼 스템, 보컬 스템, 악기 스템이 대표적입니다. 스튜디오에서는 수십 년간 서브그룹을 스템으로 라우팅해 납품 포맷으로 사용해왔습니다. 영화 믹서는 풀 세션으로 돌아가지 않고도 대사 음량을 음악 대비 재조정할 수 있고, 주요 앨범 납품 시 스템은 보통 8개에서 16개 파일로 구성됩니다.
스템 분리는 이 관계를 역전시킵니다. 프로덕션 중 서브그룹을 스템으로 라우팅하는 대신, 완성된 2트랙 믹스에서 그 스템을 역공학적으로 추출하려는 것입니다. 충분히 학습된 모델이라면 혼합 오디오 파일 안에 어떤 주파수가 어떤 음원에 속하는지에 대한 정보가 충분히 담겨 있어 실용적인 정확도로 추출 가능합니다.
실용적 함의는 구체적입니다. 세션 파일 없이 상업 발매 오디오를 다뤄야 할 때, 리믹스하고 싶은 트랙, 매칭할 레퍼런스 레코딩, 배경 음악을 제거해야 하는 내레이션 클립이라면 재녹음 외에 선택지는 스템 분리뿐입니다.
신경망이 혼합 파일을 개별 소스로 분리하는 방법

현대 스템 분리 도구는 대규모 전문 믹스 데이터셋으로 학습된 심층 신경망입니다. 학습 데이터는 전문적으로 믹스된 오디오와 그 원본 멀티트랙 쌍으로 구성됩니다. 학습 목표는 어떤 스펙트럼 및 시간 패턴이 어떤 음원 카테고리에 해당하는지 파악해, 처음 접하는 오디오에도 일반화할 수 있는 신뢰도를 확보하는 것입니다.
파일을 제출하면 네 단계로 처리됩니다.
스펙트로그램 변환. 원시 파형이 단시간 푸리에 변환(STFT)을 통해 2차원 표현으로 변환됩니다. 수직축에 주파수, 수평축에 시간을 배치해 모델이 1차원 샘플 스트림 대신 공간적 구조를 분석할 수 있게 됩니다.
패턴 인식. 신경망이 학습된 연관성을 스펙트로그램에 적용해, 어떤 시간-주파수 영역이 보컬, 드럼, 베이스, 또는 기타 정의된 카테고리에 속하는지 식별합니다. 장르 전반에 걸쳐 수만 건의 보컬 퍼포먼스를 학습한 모델은 좁은 데이터셋으로 학습한 모델보다 이례적인 음색에 더 잘 일반화됩니다.
마스크 추정. 모델이 각 시점, 각 주파수 빈에서 0과 1 사이의 값으로 구성된 마스크를 생성합니다. 보컬 마스크에서 1에 가까운 값은 해당 지점의 에너지가 주로 보컬임을 의미합니다. 0.5에 가까운 값은 모호성을 나타내며, 이 지점에서 블리딩 아티팩트가 발생합니다.
오디오 재구성. 각 마스크를 원본 스펙트로그램에 적용한 후 역 STFT(ISTFT)로 파형을 복원합니다. 결과물은 보컬, 드럼, 베이스, 기타 악기 네 개 오디오 파일이며, 합산하면 원본 믹스에 근사합니다.
'근사'라는 표현이 중요합니다. 스템 분리는 원본에 없던 저수준 아티팩트를 도입합니다. 분리 품질의 기준은 아티팩트가 없느냐가 아니라, 얼마나 작고 처리 가능한가입니다.
SDR 점수가 실제로 말해주는 것
스템 분리 연구에서 모델 품질은 신호 대 왜곡 비율(SDR)로 측정하며 dB 단위로 표시합니다. 값이 높을수록 아티팩트가 적은 깔끔한 분리를 의미하고, 1~2dB 향상은 청각적으로 체감할 수 있는 차이입니다.
공개 모델의 보컬 분리 성능 추이입니다.
Spleeter (2019): 약 6.5dB SDR
Demucs v3 (2021): 약 7.3dB SDR
HTDemucs (2022): 약 8.7dB SDR
BS-RoFormer (2024): 약 10.9dB SDR
2019년과 2024년 사이의 4dB 차이는 '거칠게 편집할 때 유용한 수준'과 '사후 처리 클린업이 포함된 전문 리믹스에서 활용 가능한 수준'의 차이입니다. BS-RoFormer 출력이 스튜디오 멀티트랙과 동등하지는 않으며, 그렇게 평가해서도 안 됩니다. 하지만 아티팩트 프로파일이 금속성 공명과 명백한 블리드에서 더 미묘하고 처리 가능한 주파수 이상으로 변화한 것은 사실입니다.
SDR 벤치마크는 표준 테스트 코퍼스(MusDB18 데이터셋)에서 측정됩니다. 제작 스타일, 장르, 소스 포맷에 따라 실제 성능이 달라질 수 있습니다.
현재 모델의 한계와 가능성

믹스에서 각 음원이 주파수 공간을 명확히 점유하는 경우, 즉 드럼이 저역, 보컬이 중역, 신디사이저가 고역을 채울 때 분리 품질이 향상됩니다. 반대로 보컬과 어쿠스틱 기타가 같은 주파수 대역을 공유하거나 밀도 높은 오케스트라 편곡에서는 마스크 추정의 모호성이 높아집니다.
주목해야 할 실용적 한계입니다.
보컬 블리드: 하모니 보컬이 많은 곡에서 개별 성부 분리가 불완전합니다.
저음역 모호성: 킥 드럼과 베이스 기타가 겹치는 100~200Hz 대역에서 블리딩이 발생합니다.
과처리 음원: 과도한 리버브나 딜레이가 적용된 음원은 분리 정확도가 낮아집니다.
비표준 편성: 클래식, 전통 음악, 실험 음악 등 학습 데이터에 적게 포함된 장르에서 일반화 성능이 떨어집니다.
zplane Peel Stems 2는 44.1kHz에서 245ms 레이턴시를 기록합니다. 실시간 처리에 근접한 수준이지만, 최고 품질 설정에서는 더 긴 처리 시간이 필요합니다.
AI 음성 파이프라인에서 스템 분리의 네 가지 활용 사례
AI 음성 작업, 특히 보컬 클로닝과 대화 수리 워크플로우에서 스템 분리는 '0단계'에 해당합니다.
클린 보컬 샘플 캡처. 음악이 깔린 영상이나 팟캐스트에서 보컬을 추출해 클로닝 샘플로 활용합니다. 배경 음악 없는 클린한 보컬을 확보하면 클론 품질이 크게 향상됩니다.
포스트 프로덕션 대화 수리. 세션으로 돌아가지 않고도 배경 음악이 깔린 내레이션 클립에서 음성을 분리해 재처리할 수 있습니다. 레벨 조정이나 편집 오류 수정에 효과적입니다.
리믹스 및 리마스터. 원본 세션 없이 상업 트랙에서 개별 요소를 추출해 새로운 맥락에 활용합니다.
레퍼런스 매칭. 목표 믹스의 특정 요소를 분리해 자신의 작업과 직접 비교하거나 주파수 특성을 분석합니다.
2026년에 주목할 스템 분리 도구
BS-RoFormer (2024): MusDB18 벤치마크에서 현재 최고 점수인 10.9dB SDR을 기록합니다. 오픈소스로 제공되며 로컬 실행이 가능합니다.
HTDemucs: Meta가 개발한 하이브리드 변환기 모델로 8.7dB SDR입니다. API 통합이 용이하고 Demucs 생태계에서 안정적인 선택지입니다.
Spleeter: Deezer가 2019년에 출시한 모델로 6.5dB SDR이지만 처리 속도가 빠릅니다. 빠른 프로토타이핑에 여전히 유용합니다.
zplane Peel Stems 2: 상용 도구로 44.1kHz에서 245ms 레이턴시를 제공합니다. GUI 기반 워크플로우를 선호하는 프로듀서에게 적합합니다.
배치 처리나 API 통합이 필요하다면 HTDemucs나 BS-RoFormer를 선택하세요. 단발 작업이라면 Peel Stems 2의 GUI가 더 효율적입니다.
다음 세션 전에: 모델에서 더 나은 결과 얻기
스템 분리 품질은 입력 소재의 특성에 크게 의존합니다.
고품질 소스 파일을 사용하세요. MP3 128kbps와 WAV는 분리 품질에서 체감할 수 있는 차이를 만들어냅니다. 손실 압축 아티팩트까지 처리해야 하는 모델에게 저품질 파일은 불필요한 부담입니다.
전처리에 투자하세요. 스템 분리 이전에 클리핑이나 DC 오프셋을 제거하면 마스크 추정 정확도가 높아집니다.
사후 처리를 계획하세요. 분리된 보컬을 클로닝 샘플로 사용하기 전에 소량의 디노이징과 EQ 처리를 거치면 클론 품질이 달라집니다.
MusDB18 벤치마크 수치와 실제 소재의 성능이 다를 수 있습니다. 중요한 프로젝트에서는 항상 작은 샘플로 먼저 검증하세요.