什么是Gemini 3.1 Flash TTS?70种语言与200个音频标签带来的震撼
機械翻訳 / Machine-translated

機械翻訳 / Machine-translated
@aifriends
AI Friends(https://aifriends.jp)のクロスポスト公式アカウント。AIツールの紹介・使い方・できることを、中学生でもわかるやさしい日本語で届けます。
"AI像人类一样带着感情说话的时代"终于来临了。
Google于2026年4月15日发布的Gemini 3.1 Flash TTS,是一款能够流利使用70种以上语言、自由演绎愤怒、喜悦乃至耳语的语音合成AI。
而且定价极为低廉,每个字符的费用远低于几分钱。
本文将用通俗易懂的方式,为大家解读这款热门新模型的实力以及在中文场景下的应用前景。
TTS(Text-to-Speech/文字转语音)是一种将文章转换为语音的AI技术。
打个比方,它就像一位"万能解说员",能即时朗读任何文稿。
过去也出现过各种TTS,但大多存在"语调单一、机械感强""缺乏情感"等问题。
Gemini 3.1 Flash TTS作为打破这一局面的下一代模型应运而生。它于2026年4月15日在Google官方博客上正式发布,可通过面向开发者的Gemini API、供试用的Google AI Studio、面向企业的Vertex AI,以及视频创作工具Google Vids共四个渠道使用。
其最大亮点在于"音频标签"机制——用户可以像导演一样对声音的表现方式发出精细指令。例如,只需在文章中插入"[happy](开心地)""[whisper](耳语)"等标签,AI便会据此改变音色。
Gemini 3.1 Flash TTS最突出的特点,是可以通过200种以上的"音频标签"控制情感与语调。
请想象一下这样的场景:
你在给配音演员下达台词的朗读方式指令。
"这里要听起来很悲伤""这里要有力量""这部分要语速很快"——只需将这样细致的要求以标签形式嵌入文章,便可轻松实现。
以下是具体的音频标签示例:
例如,输入"今天是[excited]状态超好的一天![whisper]不过,有个小秘密……",就会生成前半段充满活力、后半段轻声细语的音频。这一机制大幅拓展了有声书、播客、视频旁白的表现力。
Gemini 3.1 Flash TTS支持70种以上语言。
其中24种语言被列为"高质量评估语言",精度尤为出色,日语也包含在这24种语言之内。
印地语、阿拉伯语、德语、法语、西班牙语、葡萄牙语等同样达到顶级品质。
另一个值得关注的亮点是多说话人对话功能。只需在一段文本中设定多个角色,便能一次性生成不同音色人物之间的对话音频。
例如,以下场景均可通过一次指令完成:
而且,每个角色都可设定"声音档案"(音质、语调、口音),并可导出后在其他项目中复用。这意味着"这档播客的主持人声音始终保持一致"成为可能。
来看看备受关注的定价。Gemini 3.1 Flash TTS的API费用为:每100万输入token 0.5美元(约3.6元人民币),每100万输出token 10美元(约73元人民币)。
"Token"是AI处理文字的单位。中文大致可以理解为1个字≈1~2个token。
以一期10分钟的播客(约2,000字)进行语音合成为例:
这究竟有多划算?热门AI语音服务"ElevenLabs"的付费套餐每月需5美元至数百美元不等,每字符单价也可能是Gemini的数倍乃至10倍以上。Gemini 3.1 Flash TTS实现了"高质量又低价格"这一对创作者而言梦寐以求的组合。
此外,Google AI Studio还提供免费额度,让"想先试用一下"的个人开发者也能轻松上手。
在性能方面,该模型同样获得了高度评价。
在衡量AI语音质量的"Artificial Analysis TTS Leaderboard"排行榜上,Gemini 3.1 Flash TTS获得了Elo评分1,211分。
这是业界第二的佳绩。
第一名是专注语音AI的ElevenLabs,而Gemini 3.1 Flash TTS超越了OpenAI的TTS及其他主要厂商的模型。更重要的是,在同一排行榜上,它以"高质量×低成本"兼得的优势,被定位于"最具吸引力的象限"。
另一项重要功能是SynthID(合成ID)数字水印技术。
Gemini 3.1 Flash TTS生成的所有音频中,都嵌入了人耳无法察觉的"水印",可在事后自动检测出"这是AI生成的音频"。
在伪造音频诈骗和滥用问题日益突出的背景下,安全方面的考量也得到了充分体现。
下面按使用场景,整理三款主要语音AI模型的对比。
优势:支持70种语言,200余种音频标签实现精细情感控制,多说话人功能,价格极具竞争力。可在Google AI Studio免费试用。
推荐用途:多语言内容、教育教材、播客、视频旁白、注重成本的项目。
优势:业界顶尖的音频质量,仅需1分钟音频即可创建"声音克隆",30种以上语言连口音都自然流畅。
推荐用途:专业有声书制作、名人或角色声音的还原、追求最高品质的商业项目。
优势:与ChatGPT及GPT-5.4生态系统深度整合,从文字生成到语音化一站式完成。
推荐用途:嵌入已使用OpenAI API的应用、结合ChatGPT的语音聊天机器人。
总结来说:注重成本且需要多语言支持选Gemini,追求最高品质及声音克隆选ElevenLabs,需要与OpenAI生态整合选GPT系列——这是简单明了的选择指南。
对于中文创作者和企业而言,Gemini 3.1 Flash TTS同样带来了巨大机遇。这是因为,中文(普通话)同样被纳入了高质量支持语言的行列。
以往许多语音AI都以英语为优先,其他语言往往只是"勉强可用"的水平。
而Gemini 3.1 Flash TTS则将高质量语言作为重点进行了专项调优。
以下是在中文市场值得期待的具体应用场景:
A. 最方便的入口是Google AI Studio(ai.google.dev)。
拥有Google账号即可在免费额度内立即试用。
正式开发可使用Gemini API,企业用途则有Vertex AI可供选择。
另外,订阅了Google Workspace的用户,也可通过视频创作工具"Google Vids"体验部分功能。
A. 非常自然。
中文普通话被纳入70种语言中的高质量支持语言行列,Google对此进行了重点调优。
据报告,以往TTS中令人烦恼的"声调偏差"和"机械停顿"已得到大幅改善。
不过,专业术语和专有名词的读音尚无法做到完美,重要内容建议事先进行核查。
A. 可以用于商业用途。
定价为每100万输入token 0.5美元,每100万输出token 10美元。
例如,一期10分钟的播客(约2,000字)语音化的费用大约只需几角钱。
通过Google Cloud的Vertex AI,还可享受面向企业的支持与数据管理服务。
A. ElevenLabs在音频质量上位居业界榜首(Artificial Analysis TTS排行榜第一),Gemini 3.1 Flash TTS位列第二,但价格仅为ElevenLabs的几分之一,极具竞争力。
此外,在70种语言支持和200余种音频标签等功能方面,Gemini也有其领先之处。
声音克隆(让AI学习自己声音的功能)是ElevenLabs的强项,但若需要情感丰富的多语言旁白,Gemini的性价比无可匹敌。
A. 可以识别。
Gemini 3.1 Flash TTS生成的所有音频中,都嵌入了名为SynthID的数字水印。
这种水印人耳无法察觉,但使用专用检测工具即可自动识别出"这是AI生成的音频"。
在AI诈骗和伪造音频问题日益受到关注的背景下,这是Google在安全层面采取的重要措施之一。
语音AI领域正上演这样一幕:Google凭借无可匹敌的多语言支持与成本效益,强势杀入原本由专业厂商主导的市场。Google AI Studio提供免费试用额度,播客创作者、视频博主、应用开发者不妨亲自上手体验,感受一下其语音生成的自然程度。
本文转载自 AI Friends。