星光澄海 | BLOG

AlphaOpsBench:测LLM生成的量化策略到底能不能用

128万条二元预测市场数据、1.836亿条清洗后的成交记录、77.5万次历史回放任务——这些是AlphaOpsBench测试用的核心数据量。

测的不是“写得出代码”,是“真能用”
之前研究LLM生成量化策略的基准,都默认用标准化资产、规整的数值特征,甚至能直接编译成代码。但预测市场的策略根本不是这样:一个粗糙的想法可能没写清交易结果、因果来源、信号阈值、仓位大小、订单规则、退出条件,甚至结算行为。AlphaOpsBench就是专门解决这个问题的,它测的是从“基于来源的经济假说”到“可审计的执行程序”的全流程,用了581条保留原始逻辑的策略记录,还有Polymarket那个规模达128万二元市场、1.836亿清洗后成交、带结算证据和订单簿历史的数据集。

大模型生成的策略,到底靠谱到什么程度
这次测试分两种生成模式:直接生成(Direct)和分阶段设计再编码(Staged),用了36个受控任务、24个预先注册的真实策略。结果很扎眼:在受控任务里,直接生成的通过率是35/180,分阶段的是20/180;到了真实策略,两个模式连一个通过严格全流程有效性测试的都没有。更有意思的是,大模型重复生成的同一种策略,经济选择(比如阈值、仓位)差异特别大,稳定性堪忧。还有个细节:78.3万次计划的历史回放里,77.5万次都成功了,但回放完成只是“能跑”,远达不到“和原始策略逻辑一致”的保真要求。另外,测试还发现:交易成本不只是事后扣减,还会改变后续的交易路径——这是之前没被重视的点。

对量化圈来说,这不是新工具,是新标准
AlphaOpsBench把策略的核心维度拆成了保真度、行为有效性、历史可执行性、财务表现,是第一个针对预测市场LLM量化研究的“有证据意识”的基准。它不是说LLM生成策略不行,是说之前的评测太松了,真正要落地的策略,缺的是对整个生命周期的验证,不是能跑代码就行。

当LLM生成策略的门槛越来越低时,量化研究员要不要把“通过AlphaOpsBench的严格测试”当成策略上线的前置条件?


素材来源:arXiv (LLM/多模态新论文) · AI情报、大模型、AI应用落地、科研前沿
查看报道原文

发表第一条评论吧

支持 Markdown