星光澄海 | BLOG

Gemini 3.5 Transcribe:智能语音转写的新进展

你现在用Gemini 3.5 Transcribe做语音转写,能拿到比之前更智能的结果。

它到底是哪变“智能”了?
我做了十年科技观察,见过不少语音转写工具的迭代。从最早只能转清晰人声的小工具,到后来支持多说话人识别,再到能区分简单的同音词,每一步都算进步,但都没跳出“语音转文字”的核心——就是把声音符号转成文字符号。而Gemini 3.5 Transcribe的不同,官方明确说它“更智能”,那显然不是在转写的“准度”上做小修小补,而是把大模型的理解能力揉进了转写过程里。比如常见的场景:一场技术论坛的发言,之前的工具可能把“大语言模型”写成“大寓言模型”,或者把某个小众技术术语转错。如果是真智能,它应该能根据上下文关联,自动修正这类错误。不过这些都是我基于大模型的常识推测,官方没说具体技术细节,所以不敢瞎下定论。

谁会最先用到它?
对普通用户来说,语音转写可能只是用来记个笔记、转个会议录音,差别没那么大。但对真正靠转写吃饭的人来说,比如访谈记者、字幕组、内容创作者,这个“更智能”的变化就够重要。我认识的一个记者,每次采访后都要花至少半小时,修正转写里的人名、专业术语,还有说话人名字标错的问题。如果用Gemini 3.5 Transcribe,说不定转写结果里的这些错误会少很多,能省出时间来整理内容。还有做字幕的,尤其是多语言字幕,之前要反复核对转写内容,现在如果工具能自动理解语义,校对时间也能缩一半。当然,这都是假设,实际效果得用了才知道。

还有什么没说清?
目前公开的信息只有一句,就是现在能拿到更智能的转写结果。没有说它支持哪些语言,有没有免费试用,能不能处理长录音,会不会有广告,这些都没提。对用户来说,这些才是实际用的时候关心的问题。比如如果它只能支持英语,那对很多国内用户来说没什么用;如果要付费,价格会不会比同类工具高?这些都得等官方放更多信息。

其实现在我们能看到的,只是Gemini 3.5 Transcribe的一个小苗头——就是它把大模型的能力和语音转写结合了。如果后续它能真的解决转写里的“理解”问题,而不只是“转录”问题,会不会重新定义智能语音转写的标准?


素材来源:Google DeepMind Blog · AI情报、大模型、AI应用落地、消费级AI
查看报道原文

发表第一条评论吧

支持 Markdown