星光澄海 | BLOG

GraphWrit3R:跳过中间环节的3D场景图生成端到端方案

之前做3D场景图生成,得先画一堆中间图,还得靠人工标好的物体标签,根本不实用——直到GraphWrit3R出来。

旧方法的死穴:步骤多、靠标注、不灵活

现在主流的3D场景图生成方案,都卡在三个核心问题上。首先是管线太碎,得拆成多个阶段,中间还得加各种显式表示,环节多了就容易出错,错一个环节后面全崩。其次,很多方法推理时必须拿人工标好的物体当参考,可现实里没人有那么多现成标注,这套方案根本没法落地。最后,要么是闭源的专有模型,改不了也用不了;要么是跑起来慢到没法用,完全没实用价值。

GraphWrit3R的门道:单模型搞定多输入,跳过中间层

GraphWrit3R是真的端到端,不用拆任何中间步骤。它的输入很灵活:可以是3D点云,可以是高斯溅射图,或者两者结合,直接输出结构化JSON格式的完整场景图——里面列了所有物体、它们的语义属性,还有物体间的空间和功能关系,刚好避开了前面说的所有问题。
它的技术逻辑不复杂:点云用Sonata编码,高斯溅射用Chorus编码,两个东西先投影到同一个体素网格里,再靠新提出的逐体素对比对齐损失融合到一起,最后交给大语言模型解码成场景图。因为搭了LLM,它还支持开放词汇查询,就是遇到没提前定义的物体或关系,也能识别出来。

比依赖人工标注的方案还准?

GraphWrit3R的效果已经在3DSSG基准上得到验证:它在目标类别、谓词、三元组召回率三个指标上,都达到了当前最优,而且比那些依赖人工标注的方法表现还好。研究团队还做了定性分析,对比了不同输入模态的组合、不同的对比损失设计、还有token融合策略,这些细节都为后续优化提供了方向。
对行业来说,GraphWrit3R最大的价值是跳过了人工标注这个坎,端到端的设计也更稳定,不用怕中间环节出错。但它现在的优势是在基准测试里,那到真实场景里,开放词汇查询的精度会不会掉?毕竟基准里的场景都是规整的,现实里的物体和关系可比基准复杂多了——这可能是它接下来要解决的问题,也是整个3D场景图生成要迈的下一个坎?


素材来源:arXiv (LLM/多模态新论文) · AI情报、AI应用落地、AI基础设施、科研前沿
查看报道原文

发表第一条评论吧

支持 Markdown