星光澄海 | BLOG

Gemini 3.8推文本转语音功能 谷歌补全语音赛道环节

刚拿到Gemini 3.8文本转语音的测试样本,读一段300字的科技博客,没有之前大模型语音常见的断句生硬、重音错位,甚至能听出自然的思路停顿——这是这次功能最不一样的地方。

这次的TTS,不是凑数的附加功能
之前大模型的语音功能,要么是对接第三方TTS接口,音色单一只能做简单的新闻播报,要么是基础版,应付不了长文本的流畅度,读几句就卡壳。但Gemini 3.8的TTS是直接嵌在模型底层的,支持多说话人切换,还能根据文本内容调整语气——比如读科技博客里的疑问语气,会自然上扬,不是那种机械的升调。

门道在语境绑定,不是堆音色
之前的TTS要调整语气,得手动给指令,比如“用严肃语气”“这里要强调”,太麻烦。但Gemini 3.8的TTS能自己读通文本的逻辑。遇到括号里的注释内容,会自动放慢语速;遇到转折句,会拉长停顿的长度。这不是堆了多少音色库,是把TTS从“声音工具”变成了“表达工具”。之前的选手,比如ElevenLabs靠音色库垄断市场,OpenAI的TTS还没打通模型的上下文,Meta的同类功能也停留在基础播报的水平。

对行业来说,是拆了旧的墙
之前做有声书、播客的从业者,要走“大模型写稿→第三方TTS转语音→后期反复调整”的链路,成本高,还容易出现音色和内容不搭的问题,比如科技内容用甜腻的音色,违和感拉满。Gemini 3.8把这两个环节打通,以后直接生成带语音的内容,不用再跳转到第三方工具,省了不少麻烦。但对专业TTS公司来说,压力不小——他们的核心看家本事是音色库,而谷歌的看家本事是模型对内容的理解,这是他们短时间补不上的。

现在还不确定谷歌会不会把这个功能全面开放给普通用户,以后会不会成大模型的标配?留给行业的问题是,TTS的核心竞争力,到底是能模仿到极致的真人音色,还是能贴合内容的表达逻辑?


素材来源:Google DeepMind Blog · AI情报、大模型、AI应用落地
查看报道原文

发表第一条评论吧

支持 Markdown