2016年3月首尔,我亲眼看到自己参与开发的项目,在李世石对阵AlphaGo的第二局里,下出被当时评论误以为是bug的第37手。那步棋后来成了AlphaGo赢下比赛(5局4胜)的关键,连李世石本人都直言,那步棋让他改变了对AI的看法——原来AI不只是靠概率算,也会“创造”。
AlphaGo的“双系统”,才是真推理
深蓝击败卡斯帕罗夫那年,靠的是人类硬编码规则,每秒算2亿个位置,提前看6-8步。但围棋复杂到,算清所有可能性得超级计算机跑几十亿年。AlphaGo能赢,是靠了两种能力的结合:类似人类的“快直觉”和“慢思考”。
它的策略网络,就是直觉——会猜人类高手会走的棋。第37手被它判定,只有1万步里才会出现的专家级落子,单靠直觉根本不会选。真正让AlphaGo出这招的,是它的搜索机制:构建了上千个分支的游戏树,模拟未来几十种走法,权衡每一步的后果,这就是“慢思考”。两者缺一不可:直觉给方向,搜索补逻辑,AlphaGo才下出那步反常识的棋。
今天的大模型,还停留在“直觉层面”
ChatGPT刚出来时,大家发现光会编话没用,后来有了“链思维”——让模型中间加步骤,比如算数学题分步骤写,看起来像推理,但本质还是“下一个token预测”:同一个模型,只是多迭代了几步,不是独立的推理机制。
它和AlphaGo的差距明摆着:
没有可检查的认知状态——它的推理过程,没地方记录假设、证据、怀疑的点,没法跟踪逻辑链;
知识和推理混在一起——所有内容都藏在神经网络的权重里,分不清哪些是“已知”,哪些是“推导方法”;
链思维是事后编的——答案错了,它能编出看起来合理的过程,不是真的一步步推出来。
高风险场景,缺真推理寸步难行
去年我离开DeepMind,就是觉得现在的AI没法用在医药、工程、科研这些地方。这些领域要的不只是答案,是可追溯的过程:如果AI误诊,得知道是推理错了,还是用错了证据,还是假设不对。
AlphaGo的游戏树,就是解决这个问题的雏形——它会明确记录考虑过的所有变化,每一步的判断都有依据,推理过程是可查的。现在的大模型没这套,所以哪怕它编的话再顺,也不敢随便让它碰人命、碰工程。
如果真推理的核心是“可被检查、可被追溯的权衡过程”,那今天的大模型要补上这一环,是要彻底推翻现有架构,还是能在next-token的基础上,额外加一层独立的“推理引擎”?
素材来源:MIT Tech Review AI · AI情报、大模型、AI基础设施、科研前沿
查看报道原文

发表第一条评论吧