Confucius4-R2T2 — 낮은 지연 시간과 높은 정확도를 지향하는 실시간 음성 인식 모델
Confucius4-R2T2는 이전에 출력한 문장을 수정하지 않는 append-only 방식의 실시간 음성 인식 모델입니다. 80ms부터 2초까지 디코딩 구간을 조절하며 평균 200~600ms 지연 시간을 목표로 하고, vLLM과 WebSocket 서버를 이용한 실시간 서비스 구성을 지원합니다.
Confucius4-R2T2는 이전에 출력한 문장을 수정하지 않는 append-only 방식의 실시간 음성 인식 모델입니다. 80ms부터 2초까지 디코딩 구간을 조절하며 평균 200~600ms 지연 시간을 목표로 하고, vLLM과 WebSocket 서버를 이용한 실시간 서비스 구성을 지원합니다.