星光澄海 | BLOG

Agentic AI建生产排程约束模型 实测表现如何?

直接调用大型语言模型生成生产排程的约束规划脚本,正确率只有14.8%;换成多智能体架构后,这个数字跳到了59.3%——这是一篇关于Agentic AI辅助生产排程建模的arXiv研究,给行业提供了一组实打实的实测数据。

研究的核心动作:把两条AI路线拼起来

之前LLM的应用方向分成两类:一类是专门做自动建模,靠特定训练或问题专属架构,但很难在工业里落地;另一类是用智能体做运营决策辅助,但默认优化模型已经存在。这次研究把两者结合,测试通用LLM做成智能体(不用任务专属训练),能不能从自然语言的生产排程问题,生成并实现约束规划模型。

为了避免AI生成代码时的幻觉(也就是瞎写),研究还加了个Model Context Protocol服务器,用来检索求解器的文档,给智能体提供上下文信息,减少乱编的情况。

实测结果:正确率跳了4倍,但还有硬骨头

研究测了六个行业里的排程问题,覆盖流水车间、作业车间、柔性作业车间、资源受限仓库排程四类,用了三个LLM,从建模准确率、执行成功率、延迟、token消耗四个维度评估。

结果很明确:建模部分现在的LLM基本能搞定,但实现(也就是生成能跑的脚本)是主要障碍。直接调用LLM生成的正确脚本占比14.8%,换成多智能体后,这个比例升到59.3%;四个难度较低的问题,多智能体的正确率甚至到了80.6%。但和内部物流紧密相关的复杂模型,还是没突破,是目前的开放挑战。

对生产场景的提示

生产排程的优化模型,原本得靠专家花很多精力做。这次研究说明,不用任务专属训练的通用智能体,已经能帮着搞定建模环节,还能通过上下文检索降低幻觉,比直接用LLM靠谱得多。

但现在的问题是,复杂场景的落地还是不行。多智能体能把正确率拉到近60%,但涉及内部物流的复杂排程,AI还是搞不定。

我的看法是,Agentic AI确实是生产排程建模的一个可行方向,至少不用再让专家从零开始搭模型了。但复杂场景里,AI能帮着搭框架,核心的约束和逻辑,还是得靠人类专家兜底?如果后续给智能体加个自动试跑、修改脚本的小功能,会不会再把正确率往上提?还是说对生产排程这种容不得错的场景,AI永远没法完全替代人类的判断力?


素材来源:arXiv (LLM/多模态新论文) · AI情报、大模型、AI智能体、科研前沿
查看报道原文

发表第一条评论吧

支持 Markdown