내 목소리를 AI로 복제한다 — Voicebox, 하루 만에 별 500개의 이유
오픈소스 로컬 AI 음성 스튜디오 완전 분석·시작 가이드

하루 만에 별 508개. 오늘 GitHub 트렌딩 1위는 Voicebox다. "내 목소리를 AI로 복제해 어디서든, 데이터 유출 없이 쓴다"는 명제를 로컬에서 무료로 구현한 오픈소스 프로젝트다. 누적 별 32,000개를 넘어선 이 레포가 오늘 다시 폭발한 데는 이유가 있다.
이게 뭔가
한마디로 내 PC에서 돌아가는 AI 음성 스튜디오다. 핵심 기능은 세 가지다. 음성 복제(Voice Clone)는 내 목소리 샘플 몇 초를 입력하면 AI가 프로파일을 생성하고, TTS 생성은 복제한 목소리로 어떤 텍스트든 읽어준다. 모델은 Alibaba의 Qwen3-TTS다. Whisper 기반 받아쓰기(Dictation)는 마이크 입력을 텍스트로 변환해 포커스된 앱에 자동 입력한다.
모든 처리가 로컬에서 완결된다. 음성 데이터는 외부 서버로 나가지 않는다.
왜 지금 뜨는가
두 타이밍이 맞아떨어졌다.
첫째, Qwen3-TTS의 품질 도약. Alibaba의 최신 TTS 모델은 억양 자연스러움과 다국어 지원에서 ElevenLabs 같은 유료 클라우드 서비스와 실질적으로 경쟁할 만한 수준에 올랐다. Voicebox는 이 모델을 GUI + API로 감싼 가장 완성도 높은 오픈소스 래퍼다.
둘째, Apple Silicon 지원. MLX 백엔드를 통해 M1/M2/M3/M4 Mac에서 NVIDIA GPU 없이도 실시간에 가깝게 동작한다. "GPU 없으면 못 쓴다"는 로컬 AI의 가장 큰 진입장벽이 허물렸다. CUDA는 Windows·Linux용 NVIDIA 경로다.
"클라우드 TTS는 월 구독료가 부담되고, 내 목소리 데이터를 외부에 넘기기 싫다"는 수요가 이 프로젝트 하나로 정확히 수렴됐다.
핵심 기능
여러 목소리를 등록·전환하는 프로파일 관리, 복제 목소리로 고품질 오디오 파일을 생성하는 텍스트→음성(TTS), Whisper 기반 실시간 받아쓰기가 핵심이다. 로컬 REST API로 외부 에이전트·자동화 파이프라인에도 연결되며, macOS(MLX)와 Windows·Linux(CUDA)를 모두 지원한다.
누구에게 쓸모 있나
| 대상 | 활용 |
|---|---|
| 콘텐츠 창작자 | 매번 녹음 없이 내 목소리 TTS로 나레이션 |
| 개발자 | API로 AI 에이전트에 음성 I/O 연결 |
| 접근성 필요 사용자 | 받아쓰기로 키보드 없이 텍스트 입력 |
| 프라이버시 중시자 | 음성 데이터를 로컬에서만 처리 |
시작하기
별도 Python 환경 설정 없이 앱 형태로 배포된다. GitHub Releases에서 OS에 맞는 설치 파일을 내려받아 실행하면 된다. 세부 설정과 모델 다운로드 경로는 공식 문서를 참고.
사용 예시
⚠️ 아래 예시는 공식 문서 기준이며, 정확한 엔드포인트는 docs.voicebox.sh에서 최신 버전을 확인하라.
① 로컬 API로 TTS 생성 — 복제된 목소리로 텍스트를 오디오로 변환한다
curl -X POST http://localhost:PORT/api/tts \
-H "Content-Type: application/json" \
-d '{
"voice_id": "my-voice-profile",
"text": "안녕하세요, Voicebox 테스트입니다.",
"output": "output.wav"
}'
② 등록된 음성 프로파일 목록 조회 — 사용 가능한 복제 목소리를 확인한다
curl http://localhost:PORT/api/voices
# → [{"id": "my-voice-profile", "name": "My Voice", ...}]
③ Node.js 에이전트 연동 — AI 에이전트 응답을 음성으로 출력하는 파이프라인 예시
const res = await fetch("http://localhost:PORT/api/tts", {
method: "POST",
headers: { "Content-Type": "application/json" },
body: JSON.stringify({
voice_id: "my-voice-profile",
text: agentReply, // 에이전트가 생성한 텍스트
}),
});
const audio = await res.blob(); // 재생 or 저장
한계·주의
세 가지를 알고 써야 한다.
하드웨어 요구사항이 높다. NVIDIA GPU(CUDA) 또는 Apple Silicon(MLX)이 사실상 필수다. CPU 단독 실행은 가능하나 실시간 합성 속도가 크게 떨어진다.
윤리·법률 문제. 타인의 목소리를 무단으로 복제하는 것은 국내외에서 법적 문제가 될 수 있다. 본인 목소리, 또는 명시적 동의를 받은 목소리만 사용하라. 딥페이크·사기 용도는 명백한 위법이다.
품질은 아직 진화 중. Qwen3-TTS 기반이지만 감정 표현, 긴 문장의 억양 일관성은 유료 서비스 대비 차이가 있을 수 있다. 프로덕션 투입 전 충분한 샘플 테스트가 필요하다.
MIT 라이선스라 상업적으로도 쓸 수 있다. 다만 도구의 자유도가 높을수록 사용자의 책임도 무겁다.
출처
- jamiepine/voicebox — GitHub — GitHub
- Voicebox 공식 사이트 — voicebox.sh
- Voicebox 공식 문서 — docs.voicebox.sh
댓글 0
첫 댓글을 남겨보세요.
