星光澄海 | BLOG

LOCAA:让科学压缩调参少走72%弯路

科学计算的大模拟数据,压缩是刚需,但调压缩参数太费劲儿:要兼顾失真度、压缩比,还得匹配不同数据类型,二进制搜索得测61.5次才能搞定常见场景,换个压缩器或数据集就得重来。现在有个叫LOCAA的系统,平均只要17次——少了72.4%的工作量。

之前的调参有多坑?

为啥调参这么费?用户靠数值误差边界(EB)给压缩器设下限,结果却要兼顾质量指标(比如峰值信噪比PSNR)和端到端性能。不同数据集、不同压缩器,EB和最终效果的关系全变,没个通用策略,只能靠穷搜。这事儿对科学圈尤其麻烦——科学模拟数据量大,压缩错了要么失真太狠没法用,要么压缩比不够省不下空间,调参数就得耗掉不少算力时间。

LOCAA的调参逻辑,真的省事儿?

LOCAA是个基于LLM的自动调参智能体,核心靠三个动作:压缩中循环搜索(试压缩同时算结果)、集成工具执行(调用专门的压缩工具跑)、压缩器感知引导(懂不同压缩器的脾气)。不用用户定死搜索策略,能直接接自定义的目标和约束——比如要“压缩比最大+PSNR达标+时间够短”这种混合要求。

实测下来,12个字段(来自两个科学应用)的固定压缩比场景,LOCAA比二进制搜索少1.98倍试验,比另一个工具FRaZ少5.03倍;针对地球系统模型的6个字段,要兼顾PSNR和结构相似性约束,LOCAA把平均试验从61.5次砍到17次,减了72.4%;再加持久内存的话,同一场景多时间步的试验数还能再降27.9%。

对科学计算的影响是什么?

科学圈的压缩需求很杂:有的要固定压缩比省空间,有的要保数据质量做后续分析,有的还要赶时间出结果。LOCAA覆盖了三个核心场景:固定比压缩、多质量约束调参、质量+时间约束调参,还支持三个科学应用、五个压缩器。相当于把“找最优压缩参数”这件事,从需要专人盯、耗算力的苦差事,变成了系统自动跑就能搞定的常规操作。

看起来,工具增强的LLM agent,确实能解决这类特定领域的重复性调参问题——毕竟科学场景的规则清晰,LLM能快速学懂压缩器和数据的适配逻辑。那问题来了:会不会未来科学软件里,调压缩参数这件事,直接交给LOCAA这类系统就行?


素材来源:arXiv (LLM/多模态新论文) · AI情报、AI智能体、AI应用落地、消费级AI
查看报道原文

发表第一条评论吧

支持 Markdown