Gemini 3.1 Flash TTS란? 70개 언어·200개 음성 태그의 충격
機械翻訳 / Machine-translated

機械翻訳 / Machine-translated
@aifriends
AI Friends(https://aifriends.jp)のクロスポスト公式アカウント。AIツールの紹介・使い方・できることを、中学生でもわかるやさしい日本語で届けます。
"AI가 사람처럼 감정을 담아 말하는 시대"가 드디어 왔습니다.
Google이 2026년 4월 15일에 발표한 Gemini 3.1 Flash TTS는 70개 이상의 언어를 유창하게 구사하고, 분노·기쁨·속삭임까지 자유자재로 연출할 수 있는 음성 합성 AI입니다.
게다가 요금은 글자당 수 원 이하라는 파격적인 저렴함을 자랑합니다.
이 글에서는 화제의 신모델이 가진 실력과 한국에서의 활용 방법을 알기 쉽게 설명합니다.
TTS(Text-to-Speech/텍스트 읽기)란 문장을 음성으로 변환하는 AI 기술입니다.
쉽게 말해, 어떤 원고든 즉시 읽어주는 '만능 내레이터' 같은 존재입니다.
지금까지도 다양한 TTS가 있었지만, 대부분은 "단조롭고 기계적이다" "감정이 담겨 있지 않다"는 문제를 안고 있었습니다.
Gemini 3.1 Flash TTS는 이 문제를 극복하는 차세대 모델로 등장했습니다. 2026년 4월 15일에 Google 공식 블로그에서 발표되었으며, 개발자용 Gemini API, 직접 테스트해볼 수 있는 Google AI Studio, 기업용 Vertex AI, 그리고 동영상 제작 도구 Google Vids 총 4가지 창구를 통해 사용할 수 있게 되었습니다.
가장 큰 매력은 '음성 태그'라는 기능으로, 마치 연출가처럼 목소리 표현을 세밀하게 지시할 수 있다는 점입니다. 예를 들어 문장 안에 "happy", "whisper"와 같은 태그를 삽입하기만 하면 AI가 그에 맞게 목소리 톤을 바꿔줍니다.
Gemini 3.1 Flash TTS의 가장 큰 특징은 200종류 이상의 '음성 태그'로 감정과 톤을 컨트롤할 수 있다는 점입니다.
한번 상상해보세요.
여러분이 성우에게 대사 읽는 방법을 지시하는 장면을.
"여기는 슬프게", "여기는 힘차게", "이 부분은 빠르게"——이런 세세한 주문을 문장 안에 태그로 넣는 것만으로 실현할 수 있습니다.
구체적인 음성 태그 예시를 들어보겠습니다.
예를 들어 "오늘은 [excited]최고의 하루였습니다! [whisper]그런데, 사실 작은 비밀이 있어요…"라는 문장을 입력하면, 앞부분은 활기차게, 뒷부분은 작은 목소리로 속삭이듯 말하는 음성이 생성됩니다. 오디오북·팟캐스트·동영상 내레이션의 표현력이 한층 넓어지는 기능입니다.
Gemini 3.1 Flash TTS는 70개 이상의 언어를 지원합니다.
그중 24개 언어는 '고품질 평가 언어'로 특히 정확도가 높으며, 한국어도 이 24개 언어에 포함되어 있습니다.
힌디어, 아랍어, 독일어, 프랑스어, 스페인어, 포르투갈어 등도 마찬가지로 최상위 품질입니다.
또한 주목할 만한 기능이 멀티 스피커 대화 기능입니다. 하나의 텍스트 안에 여러 캐릭터 설정을 작성하면, 서로 다른 목소리의 인물들이 대화하는 음성을 한 번에 생성할 수 있습니다.
예를 들어, 다음과 같은 장면을 한 번의 지시로 만들 수 있습니다.
게다가 캐릭터별로 '목소리 프로필'(음질·톤·억양)을 설정해 내보내기 한 뒤 다른 프로젝트에서도 재사용할 수 있습니다. 즉, "이 팟캐스트의 MC 목소리는 항상 동일하게" 유지할 수 있는 것입니다.
궁금한 요금을 살펴보겠습니다. Gemini 3.1 Flash TTS의 API 요금은 입력 100만 토큰당 0.5달러(약 700원), 출력 100만 토큰당 10달러(약 14,000원)입니다.
'토큰'이란 AI가 처리하는 텍스트의 단위입니다. 한국어라면 대략 1글자 = 1~2토큰으로 생각하면 충분합니다.
예를 들어, 10분짜리 팟캐스트(약 2,000자)를 음성화하는 경우의 이미지:
이것이 얼마나 파격적인지 비교하면, 인기 AI 음성 서비스 'ElevenLabs'의 유료 플랜은 월 5달러~수백 달러이며 글자당 단가도 수 배에서 10배 이상인 경우도 있습니다. Gemini 3.1 Flash TTS는 "고품질이면서 저렴하다"는, 크리에이터에게 꿈 같은 조합을 실현했습니다.
또한 Google AI Studio에서는 무료 요금제도 제공되므로, "일단 먼저 써보고 싶다"는 개인 개발자도 부담 없이 사용해볼 수 있습니다.
성능 면에서도 높은 평가를 받고 있습니다.
AI 음성 품질을 비교하는 'Artificial Analysis TTS Leaderboard'라는 랭킹에서 Gemini 3.1 Flash TTS는 Elo 점수 1,211을 획득했습니다.
이는 업계 2위라는 쾌거입니다.
1위는 음성 AI 전문 기업인 ElevenLabs이지만, Gemini 3.1 Flash TTS는 OpenAI의 TTS와 기타 주요 모델을 모두 앞지르는 결과를 냈습니다. 게다가 '고품질×저비용'의 양립이라는 점에서 동 랭킹의 '가장 매력적인 사분면'에 위치하고 있습니다.
또 하나 중요한 기능이 SynthID(신스ID)라는 전자 워터마크 기술입니다.
Gemini 3.1 Flash TTS가 생성한 모든 음성에는 사람의 귀에는 들리지 않는 '워터마크'가 삽입되어 있어, 나중에 "이것은 AI가 만든 음성입니다"라고 자동으로 감지할 수 있는 기능입니다.
딥페이크 음성을 이용한 사기나 악용이 사회적 문제가 되는 가운데, 안전성에 대한 배려도 철저히 담겨 있습니다.
음성 AI의 주요 3가지 모델을 용도별로 정리해보겠습니다.
강점: 70개 언어 지원, 200개 이상의 음성 태그로 세밀한 감정 제어, 멀티 스피커 기능, 압도적인 저렴한 가격. Google AI Studio에서 무료 체험 가능.
추천 용도: 다국어 콘텐츠, 교육 교재, 팟캐스트, 동영상 내레이션, 비용 중시 프로젝트.
강점: 업계 최고의 음성 품질, 단 1분의 음성만으로 '목소리 클론' 제작 가능, 30개 이상의 언어에서 억양까지 자연스러움.
추천 용도: 전문 오디오북 제작, 유명인이나 캐릭터 목소리 재현, 최고 품질을 추구하는 상업 프로젝트.
강점: ChatGPT나 GPT-5.4 에코시스템과의 통합이 깊어, 문장 생성부터 음성화까지 원스톱으로 가능.
추천 용도: 이미 OpenAI API를 사용하는 앱에 통합, ChatGPT와 결합한 음성 챗봇.
즉, 비용 중시 & 다국어 지원이라면 Gemini, 최고 품질 & 목소리 클론이라면 ElevenLabs, OpenAI 생태계와의 통합이라면 GPT 계열이라는 것이 간단한 선택 기준입니다.
한국의 크리에이터와 비즈니스에게 Gemini 3.1 Flash TTS는 큰 기회입니다. 왜냐하면 한국어가 24개의 '고품질 평가 언어'에 선정되었기 때문입니다.
지금까지의 음성 AI는 대부분 영어가 최우선이고, 한국어는 "일단 사용할 수 있는" 수준인 경우도 많았습니다.
그러나 Gemini 3.1 Flash TTS는 한국어를 최고 품질 그룹에 포함해 튜닝하고 있습니다.
즉, 한국어 원어민이 들어도 어색함이 적은 음성이 생성되기 쉬운 것입니다.
한국 시장에서 기대되는 구체적인 활용 예시를 들겠습니다.
한국의 Google Workspace 사용자는 동영상 제작 도구 'Google Vids'를 통해 일부 기능을 체험할 수 있습니다. 본격적으로 사용하려면 Google Cloud 경유의 Vertex AI가 기업 활용의 일반적인 방법입니다.
A. 가장 간편한 것은 Google AI Studio(ai.google.dev)입니다.
Google 계정이 있으면 무료 요금제로 바로 시작할 수 있습니다.
본격적인 개발에는 Gemini API, 기업 활용에는 Vertex AI가 제공됩니다.
또한 Google Workspace를 구독하고 있는 경우, 동영상 제작 도구 'Google Vids'의 일부 기능으로도 사용할 수 있습니다.
A. 매우 자연스럽습니다.
한국어는 70개 언어 중 '고품질 평가 언어'(24개 언어)에 포함되어 있으며, Google이 특히 공을 들여 튜닝하고 있습니다.
기존 TTS에서 신경 쓰였던 '억양의 어색함'이나 '기계적인 쉼'이 대폭 개선되었다는 보고가 있습니다.
다만 전문 용어나 고유명사의 발음이 완벽하지 않을 수 있으므로, 중요한 콘텐츠에는 사전 확인을 권장합니다.
A. 상업적 이용이 가능합니다.
요금은 입력 100만 토큰당 0.5달러, 출력 100만 토큰당 10달러입니다.
예를 들어 10분짜리 팟캐스트(약 2,000자)라면 수십 원 정도로 음성화할 수 있습니다.
Google Cloud 경유의 Vertex AI를 사용하면 기업용 지원 및 데이터 관리도 받을 수 있습니다.
A. ElevenLabs는 음성 품질에서 업계 최고(Artificial Analysis TTS 랭킹 1위)이며, Gemini 3.1 Flash TTS는 2위이지만 가격은 몇 분의 1로 압도적으로 저렴합니다.
또한 70개 언어 지원이나 200개 이상의 음성 태그와 같은 기능 면에서는 Gemini가 오히려 뛰어난 부분도 있습니다.
목소리 클론(자신의 목소리를 학습시키는 기능)은 ElevenLabs의 강점이지만, 감정 풍부한 다국어 내레이션이라면 Gemini가 가성비 최강입니다.
A. 네, 판별이 가능합니다.
Gemini 3.1 Flash TTS가 생성한 모든 음성에는 SynthID라는 전자 워터마크가 삽입되어 있습니다.
이는 사람의 귀에는 들리지 않지만, 전용 감지 도구를 사용하면 "AI가 만든 음성"임을 자동으로 판별할 수 있습니다.
AI를 이용한 사기와 딥페이크가 문제시되는 가운데, Google이 취하는 안전 대책 중 하나입니다.
음성 AI 시장은 지금, 전문 기업이 독점하던 시장에 Google이 압도적인 다국어 지원과 가성비로 도전장을 내민 형국입니다. Google AI Studio에서는 무료 요금제로 시작할 수 있으니, 팟캐스트 운영자·동영상 크리에이터·앱 개발자 분들은 먼저 직접 사용해 한국어 음성의 자연스러움을 확인해보세요.
이 글은 AI Friends에서 크로스포스트된 글입니다.