FermionResearch/Phonon-2
Phonon-2 — 164MB 영어 음성 인식 모델
Fermion Research가 다운로드 크기 164MB인 영어 음성 인식 모델 Phonon-2를 공개했습니다. Open ASR Leaderboard의 영어 7개 데이터셋에서 평균 단어 오류율(WER) 5.21%를 기록했으며, Mac·Linux·Windows의 CPU와 GPU에서 실행할 수 있습니다.
- 주제
AI 요약
Fermion Research가 영어 음성 인식 모델 Phonon-2를 공개했습니다. 모델 다운로드 크기는 164MB이며, Open ASR Leaderboard의 영어 데이터셋 7종에서 평균 단어 오류율(Word Error Rate, WER) 5.21%를 기록했습니다. WER은 낮을수록 좋습니다. 제작사는 900MB 미만 모델 가운데 정확도가 가장 높다고 소개합니다.
크기와 정확도
Phonon-2의 평균 WER은 5.21%입니다. 비교 대상으로 제시한 2.5GB Parakeet TDT 0.6B v3 교사 모델의 4.96%보다는 높지만, 데이터셋별 결과에서는 의회 발언(LS clean)에서 교사 모델의 단어 정확도 100.8%를 달성했고 회의 데이터(AMI)에서는 교사 모델보다 낮은 WER을 기록했습니다. 표에 제시된 7개 결과는 LS clean 1.72%, LS other 3.92%, AMI 9.37%, Earnings-22 6.96%, GigaSpeech 8.35%, SPGISpeech 3.70%, VoxPopuli 2.46%입니다.
비교표에서 164MB Phonon-2의 평균 WER은 178MB Parakeet Redux의 5.69%, 415MB Phonon-1의 6.56%, 1,618MB Whisper large-v3-turbo의 6.58%보다 낮습니다. Parakeet TDT와 Canary 등 일부 행은 Open ASR Leaderboard에 공개된 결과이며, 나머지는 전체 테스트 세트에 해당 리더보드 코드를 적용한 결과라고 명시합니다.
압축과 처리 속도
모델 설명에 따르면 인코더 가중치는 학습된 다섯 단계 값 가운데 하나로 표현하며, 가중치당 약 2.1비트를 사용합니다. 제작사 측 측정으로는 M5 MacBook Air에서 오디오 1시간을 약 20초에 처리합니다. 처리 속도는 실시간의 174배이며, Zen 5 코어 8개(16 vCPU)에서는 143배, H100 한 대에서 배치 크기 128로 실행하면 6,680배입니다.
실행 방법과 라이선스
Apple silicon에서는 fermion-research 패키지와 MLX 관련 패키지를 설치한 뒤 phonon transcribe recording.wav 명령으로 전사할 수 있습니다. --json 옵션을 추가하면 단어마다 시작·종료 시각을 출력합니다. 같은 패키지는 Linux의 x86-64와 Arm, Windows CPU에서도 실행하며, Docker용 CPU·CUDA 이미지도 제공합니다. Phonon-2는 Mac 받아쓰기 앱 Detta에도 사용됩니다.
모델은 NVIDIA의 parakeet-tdt-0.6b-v3를 기반으로 합니다. 토크나이저와 구두점·대소문자·숫자 표기 규칙은 원본 모델을 따르며, 모델 라이선스는 원본과 같은 CC-BY-4.0입니다. 저장소 코드와 명령줄 도구에는 Apache 2.0 라이선스를 적용합니다.
원문: Hugging Face / 번역·요약: Trawling