9月19日,DeepSeek与清华大学联合在arXiv挂出130余人署名的论文,公开了训练Agent的沙盒DSec。
单生产单元约160个CPU节点、3万核、250TB内存。每天服务约300万个沙盒,峰值并发超38万个,创建速度超过每秒5000个。
过去一周,评论全在聊这工程多精巧,甚至扯“RSI即将开启”。我不想复述沙盒有多快,只问一个问题:梁文锋为啥先修操场,不急着卖门票?
一、先划清“操场”和“风口”的边界
论文自己写的不是RSI,是agent-built environments与agentic RL闭环。还列了一长串翻车现场:翻残留的参考答案、伪造RPC消息套题、覆盖/bin/bash绕过检查、内核被干崩……说明Agent造环境还在幼年,卡的不是算力,是环境的供给、可信与安全。
RSI(递归自我改进)有三个核心特征:递归性、纯理智侧、维度差异。但DSec里Agent的改进方向,还是由人定的奖励函数牵着走。所以它不是RSI的实现,是“持续学习”的操场。
梁文锋自己的路线也对上:2026年7月投资人交流会明确说,Agent之后要解决的是持续学习,下一代模型必须有这个能力才算下一代。
二、真正的坎在“标准谁给”
历史上所有靠谱的自主学习,结构都统一:人给标准,机器找路径。中世纪学徒制,师傅只给结果标准(剑能砍断铁条),怎么打由学徒自己调;科学方法,共同体给可重复、与证据一致的标准,没人给具体步骤;小孩学语言,没人教语法,靠反馈自己归纳结构。
DSec里那个用yes命令堆满磁盘的Agent,手里只有结果标准(把任务跑完),既没过程标准(资源不能失控),也没迭代方向标准(磁盘满了该停),所以无限重复还毫无意义。
现在的Agent,本质是用数据驱动的外壳,套着“目标加试错驱动”的名字。DSec补上了百万量级的廉价试错空间,但全行业还没解决:人该给哪些标准?怎么让标准输入到Agent里?这是Agent和AGI之间的缺口。
三、不赶门票的人,盯的是AGI的“前提”
头部玩家全把AI绑在生意上:ChatGPT周活数亿,Claude Code占企业收入过半,微软Copilot付费席位千万,都是让机器更好执行人。
DeepSeek的实力摆着:线上服务日均处理7760亿token,推理集群平均占用1814张H800,单卡峰值利用率约77%(高于行业公开的40%-60%区间)。它走的是相反的路:低价API供血,模型权重开源,给开发者框架DeepSeek Harness,却不做C端超级App,也不抢垂直Agent产品。
梁文锋是头部里唯一公开说“前提还没出现”的人。别人先做可交付的产品里程碑,他先投那个还没影的“持续学习”。这不是产品代差,是问题代差——别人在做AI当生意,他在盯AGI的必要前提。
AI产业总在追风口:有人忙着卖C端门票,有人忙着铺算力跑道,梁文锋却在修“持续学习”的操场。你觉得,哪种选择更能走到AGI的下一站?
素材来源:钛媒体 · AI情报、大模型、AI智能体、AI政策与监管
查看报道原文

发表第一条评论吧