Gemini 3.8 text-to-speech
Gemini 3.8 음성 합성 모델 공개
Google이 자연어로 음성을 설계하고 대사별 연기 지시를 넣을 수 있는 Gemini 3.8 Flash TTS와 대량 처리에 맞춘 Flash-Lite TTS를 공개했습니다. 100개 이상 언어 지원, 30초 샘플 기반 음성 복제, SynthID 워터마크를 내세웠지만, 댓글에서는 실제 음성 품질과 안전장치, 가격 및 제품별 출시 시점에 대한 의견이 엇갈립니다.
- 주제
AI 요약
Google이 Gemini Audio 제품군에 Gemini 3.8 Flash TTS와 Gemini 3.8 Flash-Lite TTS를 추가했습니다. Flash TTS는 자연어 지시로 새 목소리를 설계하고 대사마다 연기와 속도, 억양을 조절하는 기능에 초점을 둡니다. Flash-Lite는 더 많은 음성을 효율적으로 생성하는 용도로 소개했으며, 더빙과 음성 에이전트 등을 사용 사례로 들었습니다.
목소리 설계와 복제
Flash TTS에서는 역할, 억양, 음색을 자연어로 지정해 새 목소리를 만들 수 있습니다. Google은 100개 이상의 언어와 방언을 지원한다고 밝혔으며, 지역별 발음이 포함된 2,000개 이상의 음성 라이브러리도 제공한다고 설명합니다. 목소리 복제에는 본인 또는 사용 권한을 확보한 사람의 30초 음성 샘플을 쓸 수 있습니다. 복제 전에는 참조 음성의 주인이 동의한다고 말한 녹음을 제출해야 하며, Google은 이를 참조 음성과 대조한다고 밝혔습니다. 저장한 맞춤 음성을 프로젝트마다 재사용해 일관성을 유지하는 기능도 포함합니다. 기존 음성의 음색, 높낮이, 속도, 억양을 조정하는 voice remixing은 추후 제공할 예정입니다.
대사별 연기 지시와 긴 음성 생성
두 모델 모두 대사마다 무대 지시나 자연어 단서를 넣어 말투와 속도, 방언 변화를 제어합니다. 하나의 대본에서 두 화자의 대화를 구성하고, 웃음이나 한숨 같은 비언어적 소리와 “mhm”, “yeah” 같은 맞장구도 지정할 수 있습니다. Google은 오디오북이나 팟캐스트처럼 긴 음성을 생성할 때도 목소리와 말하는 속도를 유지하고 화자 변화가 적도록 설계했다고 설명합니다.
성능과 안전장치
Google이 소개한 Hume AI 평가에서 Flash TTS는 Voice Design Benchmark 종합 점수 71.4점으로 1위, 억양 모델링 점수 60.8점으로도 1위를 기록했습니다. Hume AI Overall Quality Index에서는 Flash와 Flash-Lite가 각각 1위와 2위에 올랐다고 밝혔습니다. Voice Arena의 블라인드 선호도 평가에서도 일본어, 브라질 포르투갈어, 베트남어, 현대 표준 아랍어, 멕시코 스페인어, 힌디어 등에서 상위권을 차지했다고 합니다. 이는 Google이 공개한 평가 결과이며, 게시물은 평가 방식이나 수치를 산출한 세부 조건을 함께 제시하지는 않습니다.
생성된 오디오는 모두 눈에 보이지 않는 SynthID 워터마크를 포함한다고 Google은 설명합니다. 복제 음성에는 C2PA 자격 증명도 적용한다고 밝혔습니다. 개발자는 Google AI Studio의 음성 생성 작업 공간에서 새 음성을 만들거나 음성을 복제하고, 대사별 지시를 넣은 두 화자 대본을 시험할 수 있습니다. 두 모델은 Gemini API와 AI Studio에 출시를 시작했고, Flash는 Gemini Notebook, Flash-Lite는 Google Vids에서도 제공을 시작했습니다. Gemini Enterprise API 출시는 추후 예정입니다.
Hacker News 반응
댓글에서는 목소리 설계와 대사별 지시가 오디오북·라디오 드라마 제작에 유용하다는 의견이 나왔습니다. 반면 시연 음성이 지시를 제대로 따르지 않거나 과장된 감정 표현이 거슬린다는 비판도 있었습니다. 음성 복제 기능을 두고는 동의 확인과 워터마크가 실제 악용을 막을 수 있는지, 동의 녹음을 얼마나 보관하는지 질문이 이어졌습니다. 일부 사용자는 로컬 모델도 이미 음성 복제를 잘 해내며, 장시간 음성 생성에서는 다른 모델의 운율이 더 듣기 좋다고 비교했습니다.
- @thangalin — 제 로컬 호스팅 웹 앱 KeenLore의 감정 표현 오디오북 제작 영상을 공유합니다. 클라우드도 토큰 비용도 필요하지 않습니다. 전체 등장인물의 목소리로 책을 읽고, 제 소설에서 인용문 화자를 판별하는 정확도는 97.2%(499개 중 485개)입니다. 문장을 분석해 등장인물 목소리 설명을 자동으로 채우는 기능에는 Gemma 4를, 목소리 생성에는 Qwen3 TTS Voice Design을 씁니다. NVIDIA T1000 8GB, RAM 96GB, AMD Ryzen 5 7600에서 실행합니다.
- @eru — 책을 읽을 때 추가 ‘무대 지시’를 넣어 낭독 방식에 영향을 줄 수 있나요?
- @thangalin — 좋은 생각입니다. 아직 고려하지 않았지만, 인용문을 선택해 억양을 지정하는 기능이 있으니 같은 기반을 재사용해 임의의 문장을 선택하고 무대 지시를 넣을 수 있겠습니다.
- @RGS1811 — 비슷한 프로젝트를 일 년 내내 만들고 있는데, Qwen 대신 Fish Audio나 Higgs를 시험해 보세요. 운율이 훨씬 낫고 긴 음성도 듣기 쉽습니다.
- @thangalin — 두 모델이 음성 설계로 목소리 샘플을 만드는 기능은 찾지 못했습니다. Qwen3로 샘플을 만들고 Higgs나 Fish Audio로 목소리를 복제해 소설을 읽히라는 뜻인가요?
- @RGS1811 — 음성 설계는 지원하지 않지만 최종 렌더링은 더 낫습니다. 한 도구로 목소리를 만들고 다른 도구로 렌더링하는 식으로 연결할 수 있습니다.
- @simonw — 30초 음성 샘플만으로 목소리를 복제할 수 있고, 동의 확인과 SynthID 워터마크, C2PA 자격 증명을 갖췄다고 하네요. 다른 업체들이 음성 복제를 널리 제공하게 되면서 Google도 더는 출시를 주저하지 않는 것 같습니다.
- @kingstnap — 어젯밤 QwenTTS 1.7B로 작업했습니다. 녹음을 깨끗하게 정리하고 미세 조정 방식을 시험한 뒤 몇 시간 만에 놀랄 만큼 제 목소리와 비슷한 음성을 만들었습니다. 가족들도 놀랐습니다.
- @throwa356262 — 이런 기능은 꽤 오래전부터 가능했습니다. 비슷한 작업을 잘하는 공개 모델도 여러 개 있습니다.
- @accountrequired — “목소리 주인이 동의한다고 말한 녹음”은 얼마나 오래 저장하나요? 무슨 문제가 생길 수 있을까요?
- @kmoser — 합성한 동의 음성도 감지하나요?
- @burkaman — 당분간 성우들은 안전해 보입니다. 기술적으로는 놀랍지만 결과물이 정말 좋지는 않고, 프롬프트와도 대체로 맞지 않습니다. 예시 대부분은 프롬프트의 핵심을 완전히 무시합니다.
- @kanbankaren — 몇 가지 목소리를 들어봤습니다. 남성 목소리는 그럴듯하지만 여성 목소리는 전부 비슷하고 인공적으로 들립니다. 학습 데이터 편향일까요?
- @m3kw9 — 여전히 AI 음성처럼 들립니다. 음색을 과장하고 문장 끝을 늘여서 감정 표현 점수를 높이려는 것 같습니다.
- @qlte — 저도 거의 모든 최신 음성 모델의 과장된 감정 표현을 듣기 힘듭니다. 무작위로 강조해 산만해집니다. 오디오북이 아니라면 또렷하고 정확하며 차분한 ‘컴퓨터 음성’을 원합니다.
- @sgc — 오디오북을 일괄 생성하면 비용이 얼마나 드나요? 지금은 ElevenLabs 앱에서 듣지만, 파일로 만들고 싶습니다.
- @thevinter — few-shot을 쓴다고 가정하면 10시간에 대략 5~10달러입니다. 시간당 가격은 Flash 표준 0.81달러, 배치 0.41달러, Flash-Lite 표준 0.54달러, 배치 0.27달러입니다.
- @sgc — 제가 보기에 가장 큰 차이가 바로 가격입니다. 다음으로 만들 오디오북은 25만 단어, 문자 약 150만 자라서 여기서는 15달러, ElevenLabs에서는 75달러 정도입니다. 저에게는 실제로 쓸지 말지를 가르는 차이입니다.
- @rcr-anti — Google AI 제품 출시에서 불만인 점은 소비자용, 프로슈머용, 클라우드용 세 플랫폼의 정렬이 안 된다는 겁니다. 출시 글 끝을 보면 플랫폼마다 제공 시점이 다릅니다. 모델 기능도 플랫폼에 따라 다릅니다. 조직에서 소비자용과 프로슈머용을 막아두면 새 모델을 쓸 수 있는지, 기능이 같은지 동전 던지기나 마찬가지입니다.
- @Melatonic — 정말 그렇습니다. 기업용 Google Workspace도 모델이 늦게 들어옵니다.
원문: Google / 번역·요약: Trawling