Hugging Face

nvidia/Nemotron-3-Diarization

NVIDIA Nemotron 3 Diarization, 최대 8명 화자 실시간 분리

NVIDIA가 최대 8명의 화자를 구분하는 오픈 웨이트 음성 분리 모델 Nemotron-3-Diarization을 공개했습니다. 스트리밍 지연 시간은 0.32초부터 설정할 수 있으며, 공개 평가에서 기존 Streaming Sortformer 모델보다 낮은 화자 분리 오류율(DER)을 기록했습니다.

AI 요약

Nemotron-3-Diarization은 음성에서 ‘누가 언제 말했는지’를 구분하는 1억 개 파라미터 규모의 오픈 웨이트 모델입니다. 녹음 파일을 한꺼번에 처리하는 오프라인 추론과 오디오가 들어오는 대로 처리하는 스트리밍 추론을 지원하며, 최대 8명의 화자를 다룹니다. NVIDIA는 회의, 통화, 팟캐스트와 음성 인식 파이프라인에서 사용할 수 있도록 모델과 추론 예제를 공개했습니다.

화자 정체성을 이어 가는 스트리밍 구조

모델은 Sortformer 방식에 따라 출력 채널을 각 화자가 처음 등장한 순서로 정렬합니다. 스트리밍 추론에서는 Arrival-Order Speaker Cache(AOSC)가 이전 청크에서 파악한 화자 정보를 보존하고, FIFO 큐가 최근 프레임 문맥을 다음 처리 단계에 전달합니다. 오디오를 작은 단위로 나눠 처리해도 화자 번호가 이어지도록 설계한 구조입니다.

입력 버퍼 지연 시간은 청크 길이와 미래 문맥 길이를 합한 뒤 80밀리초를 곱해 계산합니다. 제공된 설정은 30.4초 오프라인 방식, 1.04초 저지연, 0.64초 초저지연, 0.32초 울트라 저지연입니다. 별도로 모델 설명은 입력 버퍼를 80밀리초까지 낮출 수 있다고 안내하지만, 권장하는 최저 설정은 0.32초입니다. 이 지연 수치에는 모델 연산 시간이 포함되지 않습니다. 청크 단위 추론을 쓰면 오디오 전체 길이에는 제한이 없습니다.

모델과 사용 방법

구조는 Rotary Positional Embeddings(RoPE)를 사용하는 31층 Transformer 인코더입니다. 10밀리초 단위 Mel-spectrogram 입력을 8배로 다운샘플링해 인코더에서 80밀리초 프레임으로 처리한 뒤, Conv1D 계층으로 예측을 10밀리초 해상도까지 올립니다. 출력은 프레임마다 8개 화자의 활동 확률을 담은 텐서이며, 기본 해상도는 10밀리초입니다. 30밀리초, 80밀리초, 240밀리초처럼 10밀리초의 배수로 바꿀 수 있습니다.

NeMo Framework에서 SortformerEncLabelModel.from_pretrained("nvidia/Nemotron-3-Diarization")로 불러와 diarize()를 실행하면 시작 시각, 종료 시각, 화자 인덱스를 담은 구간 목록을 얻습니다. 입력은 16kHz 단일 채널 오디오이며 WAV, FLAC, OPUS, MP3와 배열, JSONL 매니페스트를 지원합니다. 배열을 입력할 때는 실제 샘플 레이트를 지정해야 합니다. Transformers에서도 AutoModelForAudioFrameClassificationAutoProcessor로 오프라인 및 스트리밍 추론을 수행할 수 있고, NeMo-Speech.cpp는 로컬 C++ 실행 환경을 제공합니다.

학습 데이터와 평가 결과

학습에는 실제 대화 약 1만 시간과 FastMSS로 만든 다중 화자 혼합 음성 약 8만2,611시간을 사용했습니다. 데이터에는 영어, 중국어, 힌디어, 칸나다어, 텔루구어, 벵골어 등 여러 언어가 포함됩니다. 학습은 NVIDIA A100 80GB GPU 8개를 탑재한 노드 8대에서 진행했으며, 시뮬레이션 음성으로 오프라인 학습을 한 뒤 실제 대화와 합성 데이터를 섞어 스트리밍 파인튜닝을 했습니다.

모델 카드가 제시한 평가에서 Nemotron-3-Diarization은 비교 대상인 diar_streaming_sortformer_4spk-v2.1보다 여러 데이터셋에서 낮은 DER을 기록했습니다. 예를 들어 DIHARD III 평가의 전체 DER은 30.4초 지연 설정에서 12.73, 0.32초 설정에서 13.55입니다. 비교 모델은 같은 설정에서 각각 19.09와 19.85입니다. CALLHOME-Part2의 전체 DER은 Nemotron 모델이 30.4초 설정에서 6.40, 0.32초 설정에서 7.19였고, 비교 모델은 11.57과 13.68이었습니다. 평가에는 겹쳐 말하는 구간도 포함했습니다.

다만 데이터셋별 점수는 참조 라벨과 평가 조건에 따라 달라집니다. 모델 카드는 AMI, AliMeeting, NOTSOFAR1에서 기존 구간 라벨이 실제 발화보다 긴 침묵까지 음성으로 표시할 수 있어, 강제 정렬(forced alignment) 참조 라벨을 사용했다고 설명합니다. 이 설정은 미검출 오류에 영향을 주므로, 재현 결과를 비교할 때는 동일한 RTTM 참조 파일과 분할, collar 및 겹침 조건을 맞춰야 합니다. 처리 속도 측정은 Blackwell RTX PRO 5000과 BF16 환경에서 수행했습니다.

모델 사용에는 OpenMDW License Agreement 1.1이 적용됩니다. NVIDIA는 실제 배포 전에 사용 목적에 맞는 데이터로 테스트하고 시스템 수준에서 검증하라고 안내합니다.

원문: Hugging Face / 번역·요약: Trawling