Edge0/Audio8-ASR-Infinite
Audio8 ASR Infinite — 24시간 연속 동작을 목표로 한 스트리밍 음성 인식 모델
Audio8 ASR Infinite는 중국어와 영어를 실시간으로 받아쓰는 스트리밍 음성 인식 모델입니다. 80·120·160ms 오디오 클록과 전사 지연을 조절하며, Rolling KV Cache로 24시간 연속 동작에서도 메모리와 지연을 일정하게 유지하도록 설계했습니다.
- 주제
AI 요약
Audio8 ASR Infinite는 반응 속도와 장시간 연속 처리를 목표로 만든 중국어·영어 음성 인식 모델입니다. 오디오 클록을 80ms, 120ms, 160ms 중에서 고르고, 전사 지연(target_delay_ms)을 조절해 반응 속도와 인식 정확도의 균형을 맞춥니다. 80ms 클록에서는 초당 12.5회, 120ms에서는 8.3회, 160ms에서는 6.25회 텍스트 토큰을 결정합니다.
스트리밍 처리와 무제한 길이 입력
체크포인트의 기본 문맥 길이는 30초입니다. 모델은 Rolling KV Cache와 정확한 RoPE 재기준화(RoPE re-basing)를 적용해 오래된 상태를 순환 처리합니다. 제작진은 이 방식으로 24시간 연속 동작에서도 메모리 사용량과 지연이 일정하며, 반복 출력이나 마지막 단어 누락이 없다고 설명합니다.
전사 지연은 선택한 오디오 클록의 정수배여야 합니다. 사후 학습(post-training)을 거친 조합은 80ms 클록에서 프레임 길이 4, 왼쪽 패딩 토큰 18개, 지연 240·320·480·560ms입니다. 120ms에서는 프레임 길이 6, 패딩 12개, 지연 240·480ms를 지원합니다. 160ms에서는 프레임 길이 8, 패딩 9개, 지연 320·480ms를 지원합니다. 다른 조합도 사용할 수 있지만 최적 성능을 보장하지는 않습니다.
모델 구성과 현재 범위
Audio8은 Voxtral Realtime의 실시간 오디오 아키텍처와 DSM 방식 스트리밍을 기반으로 합니다. 오디오 인코더는 Voxtral Realtime 4B에서 가져와 학습했고, 디코더와 LM Head는 Qwen2.5-3B-Instruct를 사용했습니다. 오디오 프로젝터와 프레임 길이 임베딩은 무작위 초기화 후 학습했습니다.
오디오 타워는 32개 레이어와 은닉 차원 1,280, 128개 멜 빈, 750 크기 슬라이딩 윈도로 구성됩니다. 텍스트 디코더는 36개 레이어, 은닉 차원 2,048이며, 쿼리 헤드 16개와 KV 헤드 2개를 씁니다. 가중치 형식은 bfloat16이고 모델 파일은 8.17GB입니다. 의미 기반 VAD 헤드에는 8개 클래스와 0.5·1·2·3초 예측 구간이 포함됩니다.
이번 배포는 스트리밍 ASR 미리보기입니다. 의미 기반 실시간 인식은 같은 프레임 간격과 오디오 순전파를 활용하는 정식 버전을 개발 중이라고 안내합니다. 현재 VAD 헤드가 포함되어 있지만, 페이지가 설명하는 미리보기 범위는 중국어·영어 전사입니다.
벤치마크
제작진이 제시한 수치는 EOS 출력을 억제한 탐욕적 디코딩(greedy decode) 결과입니다. 설정은 80ms 오디오 클록과 480ms 전사 지연이며, 오류율은 퍼센트 단위입니다. AISHELL-1 테스트 CER은 1.750, AISHELL-4는 2.893입니다. LibriSpeech test.clean WER은 3.042, test.other는 6.808이며, 네 평가의 평균은 3.623입니다.
비교 대상으로 제시한 Voxtral-Mini-4B-Realtime-2602는 AISHELL-1에서 CER 16.795, AISHELL-4에서 16.456, LibriSpeech test.clean에서 WER 2.210, test.other에서 5.552를 기록했습니다. 표의 평균 10.253은 두 평가 세트의 평균으로 표시됩니다. nemotron-3.5-asr-streaming-0.6b는 AISHELL-1 CER 12.927, AISHELL-4 CER 14.677, LibriSpeech test.clean WER 3.353, test.other WER 7.140이며 평균은 9.524입니다. 해당 모델의 일부 수치는 560ms 지연 설정으로 표시되어 있어, 표의 지연 조건을 함께 확인해야 합니다.
실행 방법
배포에는 제작진이 제공하는 수정판 vLLM 빌드를 사용합니다. 권장 실행 경로는 Docker Compose이며, 모델 저장소 전체 가중치 디렉터리가 필요합니다. 어댑터 형식이나 일부만 변환한 가중치는 지원하지 않습니다. Docker 구성은 웹 데모도 제공합니다. 터미널에서는 WebSocket 클라이언트로 실시간 오디오를 보내거나, Transformers 기반의 시뮬레이션 스트리밍 디코더를 실행할 수 있습니다. 모델과 토크나이저를 불러올 때는 저장소의 원격 코드를 허용하는 설정이 예제에 포함되어 있습니다.
원문: Hugging Face / 번역·요약: Trawling