说真的,之前我做多模态实验,光是依赖兼容就能折腾半天——换个同事的环境,代码直接跑崩,结果完全对不上。最近有人用AugLy做了一套端到端的 workflow,把图片、文本的增强和鲁棒性评测串成了全流程,还解决了可复现的问题。
先搞定实验的可复现性
这套 workflow 上来就啃了实验的核心痛点:确定性合成数据集,用固定的随机种子SEED=1234生成内容,不管谁在什么机器跑,出来的东西都一样。比如生成的24张测试图片,每张都带标注框——不管是画椭圆、矩形还是三角形,都能对应上,适合做带框的检测任务。之前我做类似实验,光统一随机种子就改了五六个地方,这里直接用一个固定值搞定,省了好多冗余代码。
把多模态增强和PyTorch生态打通
AugLy的好处是给图片、文本分别做了对应的增强API,分功能和类两种形式,还能追踪变换的强度、元数据,甚至有针对标注框的变换。这套 workflow 最实用的点,是把这些增强直接接到PyTorch的Dataset和DataLoader上——不用中间转格式,在PyTorch的 pipeline 里就能直接调用AugLy的工具,相当于把数据生成和处理的环节无缝连起来,不用自己写适配层,对用PyTorch的团队太友好了。
从增强到鲁棒性评测,一套工具够了
别以为AugLy只是个数据增强工具,这套 workflow 把它用在了鲁棒性测试上:测图片加了畸变后的感知哈希复制检测,看文本分类模型抗对抗扰动、Unicode混淆的能力,还有对抗训练的效果。也就是说,你用同一个工具,既能生成增强数据,又能拿这些数据测模型的鲁棒性,不用换别的工具,减少了跨工具的衔接成本。
现在很多团队已经有自己的多模态增强脚本,这套全流程工具对他们来说,是换成本太高,还是刚好能补自己的短板?
素材来源:MarkTechPost · AI情报、大模型、科研前沿
查看报道原文

发表第一条评论吧