在神经算子调优任务里,大模型的留集测试nRMSE,几乎在所有对比里都比随机搜索、贝叶斯优化更低。这是arXiv上一篇归类于cs.AI、cs.LG、physics.comp-ph的论文,针对“大模型是靠初始任务设定,还是靠实验反馈调整决策”这个问题给出的结论。
比传统调优更稳的表现
研究针对的场景很明确:用大模型在有限试错预算下选微调配置,覆盖偏微分方程(PDE)族内和跨族的迁移。要弄清大模型的决策逻辑,光看最终性能不够,得靠控制干预排除干扰。
两个核心决策来源
论文做了两组严格的控制干预,拆解出大模型的决策依据。第一组是初始偏置:在还没拿到任何验证分数时,大模型选的第一个配置,已经接近对应随机搜索池的top水平——这说明它的初始设定有用,不是瞎碰;冷启动测试显示,针对不同PDE描述,它选的基础学习率会跟着调整,不是固定值。第二组是反馈敏感度:一旦拿到实验反馈(也就是验证分数),调整已评估配置的分数,每一次都会改变大模型下一个要选的配置;但如果只是改写这些配置的描述(不碰分数),就不会有类似的整体效果。这就确定了:大模型的决策,同时结合了任务依赖的初始先验,和对实验反馈的敏感度。
对调优场景的实用提示
如果是做数值计算、模型调优的人,这个结论直接能落地。比如以前用贝叶斯优化或随机搜索,前期试错要花不少时间;现在用大模型当助手,既能借它的初始偏置省前期成本,也能靠它对反馈的敏感度,后期调整更精准。不过别迷信大模型——它的初始偏置不是绝对正确的,反馈也得是真实的实验结果,不能瞎编数据。
当大模型给出的初始配置和后续实验反馈明显矛盾时,我们该优先调整哪一边?
素材来源:arXiv (LLM/多模态新论文) · AI情报、大模型、科研前沿
查看报道原文

发表第一条评论吧