VoiceStudio - 음성 복제, 더빙, 받아쓰기를 로컬에서 처리하는 오픈소스 스튜디오
5 hours ago
2
- 계정이나 API 키, 구독 없이 내 컴퓨터에서 음성 작업을 처리하는 데스크톱 앱으로, 필요한 모델을 내려받으면 오프라인에서도 사용 가능
- 깨끗한 음성 샘플 5~15초로 별도 학습 없이 목소리를 복제하고, 입력한 문장을 그 목소리로 읽게 할 수 있음
- 기존 목소리를 복제하는 것 외에도 나이, 억양, 음높이와 말투를 설명해 새로운 목소리를 만드는 기능 제공
- 영상의 말을 텍스트로 옮기고 번역한 뒤, 화자별 목소리를 유지하도록 합성해 더빙 영상으로 내보내는 과정을 한곳에서 처리
- EPUB/PDF를 불러와 등장인물마다 다른 목소리를 배정하고, 장별 음성을 생성해 .m4b 오디오북으로 저장 가능
- 단축키를 누르고 말하면 받아쓴 내용을 현재 앱에 입력하며, 로컬 LLM으로 문장을 다듬을 수도 있음
- 자동 입력이 불가능한 환경에서는 클립보드에 복사하며, Wayland는 기본적으로 복사 방식 사용
- 음성과 배경음 분리, 화자 구분, AudioSeal 워터마크 삽입과 감지, 여러 파일의 일괄 처리 지원
- 음성 합성 엔진 16개와 음성 인식 엔진 11개를 골라 사용할 수 있으며, 언어 목록은 646개지만 실제 지원 언어와 음성 복제 기능, 품질은 엔진마다 다름
- 로컬 API, OpenAI 호환 음성 API와 MCP 서버를 제공해 다른 앱이나 AI 에이전트에서도 음성 생성과 텍스트 변환을 호출 가능
- macOS 13.3 이상 Apple Silicon, Windows 10/11 x64, Linux x86_64용 설치 파일과 Docker 제공
- Intel Mac은 별도 컴퓨터의 백엔드에 연결해야 하며, Linux AppImage는 glibc 2.39 이상 필요
- GPU 없이 CPU로도 실행 가능하며, 기본 작업은 RAM 16GB 이상과 GPU 사용 시 VRAM 8GB 이상을 권장하고 대형 엔진은 더 많은 메모리가 필요함
- 음성과 프로젝트는 기본적으로 로컬에 저장되지만, 원격 서버나 Colab을 사용하도록 설정하면 오디오가 해당 서버로 전송될 수 있음
- 앱은 AGPL-3.0이며 모델은 별도 라이선스 적용
-
Homepage
-
Tech blog
- VoiceStudio - 음성 복제, 더빙, 받아쓰기를 로컬에서 처리하는 오픈소스 스튜디오