星光澄海 | BLOG

Gemini 3.7 Flash:更轻更快的实用级大模型

Google刚推的Gemini 3.7 Flash,官方明确说它的推理速度比上一代Gemini 3.0 Flash快了40%,API调用成本降低了30%。这不是那种喊着“全场景覆盖”的概念产品,是盯着中小开发者和边缘设备的实打实用品。

它的“轻”,不是缩水

很多人对轻量大模型的印象是“偷工减料”——参数砍半,能力跟着下滑。但Gemini 3.7 Flash不是这样。它支持文本、图像、音频甚至视频的多模态输入,处理1分钟的视频只需要2秒,生成响应的延迟控制在100毫秒以内。比如做个手机端的AI笔记应用,用户拍一段课堂视频,它能当场就把重点整理成文字,不用等半分钟;又比如IoT设备里的语音助手,以前要把语音传到云端处理,现在本地就能跑,不会因为网络卡半天没反应;甚至做个离线的AI翻译工具,不用联网就能处理图片里的外文,速度还比之前的轻量模型快一倍。

谁会盯着它动心思

轻量大模型的市场,现在其实已经挤了不少玩家。OpenAI有GPT-4o mini,字节跳动有豆包mini,阿里云有通义千问Light。这些产品都在抢“低延迟、低成本”的赛道,因为现在多数中小开发者,既承担不起大模型API动辄每千token几分钱的费用,也耗不起云端处理的半秒以上延迟——做个实时交互的应用,延迟半秒就已经很影响体验了。Gemini 3.7 Flash的优势,是Google在多模态处理上的积累:它对图像和音频的识别,比之前的Gemini 3.0 Flash准了不少,比如识别路边的交通标志、听懂带口音的普通话,出错率降了大概15%。

没说出来的门道也值得提,官方没公布具体参数,但提了“支持8位量化”——这是轻量模型的核心优化点。量化就是把模型的参数从32位浮点数转成8位整数,这样模型体积能缩到原来的四分之一,跑在手机或者智能音箱上也不占太多内存。现在市面上的不少轻量模型,要么体积大到没法塞进手机内存,要么量化后精度掉得厉害,连简单的逻辑题都算不对。Google这次应该是优化了量化算法,让轻量和精度能兼顾。

看起来Gemini 3.7 Flash就是补了之前轻量大模型的短板:要么快但不准,要么准但慢又贵。但问题也来了:Google会不会像之前那样,把模型的高端功能锁死,只开放给付费的企业开发者?或者会不会因为它是Google的产品,数据收集的规则更宽松?毕竟之前有不少AI公司因为数据隐私问题被开发者吐槽。那你会愿意在自己的小产品里集成这样的轻量大模型吗?


素材来源:Google DeepMind Blog · AI情报、大模型
查看报道原文

发表第一条评论吧

支持 Markdown