做一张2K分辨率的图,原来要走40步去噪,现在只要8步——通义千问团队刚发布的Qwen-Image-2.1-Turbo,把推理效率翻了5倍,还没换原来7B的基础架构。
核心调整:砍步骤不砍功能,同架构提速5倍
这个Turbo版是Qwen-Image-2.1的加速检查点,核心是把去噪步数从默认的40步降到8步。换句话说,同样用7B的视觉生成架构,同样配Qwen3-VL 8B文本编码器,它的推理速度是基础版的5倍。输出分辨率还是2K,支持的图像生成类别(人像、海报、UI布局等)和编辑功能(多参考图、局部修改、透明RGBA输出)完全保留。架构上它用32层的单流DiT,靠前缀KV缓存把文本和参考图的计算只做一次,后续步骤直接复用缓存,这是能把步数砍到8步的关键。还有个细节:它内置了推荐的8步采样 schedule,直接改步数没用,得显式传sigma参数,其他采样方式官方没测试过。
跑起来的门槛:参数和API价格
本地跑的话,基础版Qwen-Image-2.1的显存需求,Unsloth估算用GGUF格式是11G,INT8/FP8是24G。Turbo版没公开最低显存要求,因为架构没变,应该和基础版差不太多,毕竟只是换了个检查点。如果不想本地部署,阿里云Model Studio已经上线了它的API:每生成一张图0.1元人民币,每分钟最多120次请求。对比同平台的Pro版,价格是Pro的2.5倍(Pro是0.25元/图),请求上限是6倍(Pro是20 RPM)。另外要注意许可:它属于Qwen研究许可,商业自托管得单独申请,不能直接商用本地部署。
实际价值:效率和成本的平衡
和同类快图模型比,它的定位挺特别:Z-Image-Turbo是6B参数,没有专门的编辑模型;FLUX.2 klein是9B,分辨率只有1024×1024,还要RTX 4090级别的显存(约29G)。Qwen这个Turbo版,7B参数支持2K,有全功能编辑,API价格还特别友好。对中小开发者来说,不用自己攒算力,用阿里云的API生成2K图只要0.1元,比其他同类API便宜不少,请求次数也够日常开发用。现在也有局限:没有Turbo版的基准测试分,基础版在Qwen-Image-Bench上拿到了60.28分(目前公开的最高分之一),Turbo版没测过,但应该和基础版差不多。
这次Turbo版的核心是把图像生成的效率和成本拉到了新水平,尤其是API价格压得很低。现在图像模型卷速度和成本,越来越多的开发者会不会放弃本地部署,转向用公有API?毕竟对要快速迭代的项目来说,效率和成本比模型参数大小更实在。
素材来源:MarkTechPost · AI情报、大模型、科研前沿
查看报道原文

发表第一条评论吧