星光澄海 | BLOG

Kaggle Game Arena:用游戏测LLM的新战场

Kaggle在arXiv的cs.AI分类下发布了一份技术报告,推出了名为Game Arena的开源平台——它不靠静态跑分,要让大模型在游戏里正面battle。

不是静态跑分,是真·游戏对线。
市面上大部分大模型测评,是让模型做固定任务,比如问答、文本分类,属于静态基准。这类测试到后期,模型性能会碰到天花板,很难再拉开差距。Game Arena的逻辑完全不同:它搭建了结构化的游戏环境,让模型之间、或者模型和规则之间对战,模型的实力会随着迭代自然提升,不会出现那种“跑分见顶”的尴尬。

三类游戏,覆盖LLM的核心能力。
目前Game Arena的试点游戏有三个,刚好对应不同的博弈场景:
第一个是象棋,属于完全信息环境,棋盘和所有步骤都公开,能测模型的长期战略规划能力——比如能不能算到后面五步棋的布局,会不会犯低级的战术错误。
第二个是扑克,不完全信息环境,玩家的手牌是隐藏的,得靠对手的下注、说话推断信息,考验模型在不确定性下的判断和欺骗能力,比如要不要诈唬,要不要弃牌。
第三个是狼人杀,多人博弈场景,有明确的角色、信息差和阵营划分,要应对多个玩家的博弈,测模型的适应力和复杂交互下的鲁棒性。
这三个场景,刚好能系统摸清楚模型的战略规划、环境适应、不确定性应对这三块硬实力。

可复现的对战,能扩展的平台。
很多大模型测评的结果,因为是黑箱操作,没法复现,也没法验证。Game Arena的核心优势之一,是靠扎实的基础设施保证测评结果的可复现性——每一场对战的过程、数据都是公开透明的,任何人都能跑一遍,看结果是不是一致。而且这个平台不是固定的,能随时加新游戏、新变体,未来可能会有更多不同类型的博弈场景进来。

现在大模型测评的痛点,其实是“测不准”——要么基准太偏门,要么结果不透明,没法真的说明模型的真实能力。Game Arena用游戏的思路,把测评拉到了一个更贴近真实决策的场景里。不过问题是:当大模型在象棋里赢了人类特级大师,在狼人杀里骗到了好人,这到底算模型真的拥有了博弈智能,还是只会在特定游戏规则里钻空子?


素材来源:arXiv (LLM/多模态新论文) · AI情报、大模型、科研前沿
查看报道原文

发表第一条评论吧

支持 Markdown