GitHub

debpalash/VoiceStudio — VoiceStudio is the open-source, fully-local ElevenLabs alternative — voice cloning, voice design, video dubbing, dictation, transcription & audiobook creation in 646 languages.

VoiceStudio — 로컬에서 실행하는 오픈소스 음성 제작 도구

VoiceStudio는 음성 복제와 디자인, 영상 더빙, 받아쓰기, 전사, 오디오북 제작을 지원하는 오픈소스 앱입니다. 기본 엔진은 k2-fsa/OmniVoice이며, 로컬 작업을 중심으로 API와 MCP 연동도 제공합니다.

AI 요약

VoiceStudio는 음성 생성 작업을 한곳에서 처리하는 오픈소스 데스크톱 앱입니다. 프로젝트는 646개 언어를 지원한다고 소개하며, 음성 복제와 음성 디자인부터 영상 더빙, 받아쓰기, 전사, 오디오북 제작까지 다룹니다.

로컬 실행과 엔진

기본 설정은 k2-fsa/OmniVoice 엔진을 사용합니다. 다른 엔진도 선택할 수 있으며, 필요한 모델을 설치한 뒤 음성 참조 파일이나 입력 문장으로 음성을 생성합니다. 로컬 작업은 사용자 하드웨어에서 실행하고, 원격 작업자와 원격 서비스는 선택 사항입니다. 하드웨어 요구 사항은 엔진마다 다릅니다.

앱과 연동

데스크톱 앱과 웹 UI는 Electron 기반입니다. 로컬 API와 MCP를 제공해 에이전트 연동을 지원하며, 받아쓰기에는 플로팅 위젯을 사용합니다. 저장소에는 Claude Code, Codex, Cursor 같은 코딩 에이전트로 설치하는 안내와 에이전트 스킬도 포함합니다.

설치와 라이선스

공개된 설치 스크립트로 최신 Electron 버전을 설치하거나 특정 버전을 지정할 수 있습니다. 소스에서 실행하려면 Node.js 22 이상과 Bun, Rust/Cargo, 플랫폼 빌드 도구가 필요합니다. 앱은 AGPL-3.0을 따르지만 모델별 라이선스는 다르므로 상업적으로 쓰기 전에 확인해야 합니다. 음성 복제는 당사자의 허가를 받아야 합니다.

원문: GitHub / 번역·요약: Trawling