星光澄海 | BLOG

OpenAI代理群数月攻击在线数据库 挖掘各类冷门事实

研究人员最近揪出了OpenAI的一批“偷偷摸摸干活”的代理群——这批群已经忙活了好几个月,一直在扫各类在线公开数据库,目标是那些不太显眼的冷门事实。

这批代理群是谁?干了啥?

这批代理集群属于OpenAI,而且是“未授权”的——也就是说,他们爬那些数据库的时候,没拿到站点运营方的许可。和普通的批量爬虫不一样,他们走的是集群协同的路子:多个小模块分工配合,有的负责遍历数据库的所有节点,有的负责过滤掉无关的无效信息,还有的专门盯着那些没被人注意到的冷门条目。他们避开了维基百科这类被爬烂的高频站点,专攻各类边缘在线数据库,从旧档案、小众学术库到一些零散的公开数据,就为了挖那些“不为人知”的细碎事实。这事持续了好几个月,直到最近被监测到异常的访问量,才终于被研究人员曝光。

这事最关键的地方在哪?

核心不是“挖了什么事实”,是“怎么挖的”。普通爬虫是单点作业,效率低不说,还很容易被站点的反爬机制拦住,根本没法长时间悄悄运行。但OpenAI的这批代理群是分布式的,多个节点分散发送请求,很难被识别成恶意爬取行为,甚至连站点的运营方都没察觉到。再加上他们专门挑冷门数据库——这些站点本来访问量就低,爬取的动静更小,所以才能神不知鬼不觉地忙活好几个月。更重要的是,他们的操作全程没拿到授权,这才是最值得关注的点。

对AI行业来说,这是个什么信号?

这事戳中了AI行业的一个核心痛点:AI要想变得更聪明、输出更独特的内容,就得不断补充新的训练数据。之前大家抢的都是公开热门数据,现在这类数据的缺口越来越大,就只能往更边缘的地方找。OpenAI这次的操作,相当于把数据挖掘的赛道从“热门库”拓展到了“冷僻库”。

这也可能引发新的争议:之前AI数据的争议大多集中在“爬了不该爬的热门内容”,现在变成了“爬了没被授权的冷门内容”——而且冷门内容的授权问题更模糊,很多小站点根本没精力处理AI爬取的请求,甚至都不知道自己的库被爬了。其他做AI代理的公司会不会跟进?如果OpenAI靠这种方式拿到了更多独特数据,他们的模型输出会不会比别家更有细节?

你觉得,AI为了获取更多训练数据,去爬各种冷门在线数据库,是技术迭代的正常路径,还是在悄悄触碰数据合规的灰色地带?


素材来源:TechCrunch AI · AI情报、AI智能体、科研前沿
查看报道原文

发表第一条评论吧

支持 Markdown