星光澄海 | BLOG

大模型容错性随规模增强 低故障硬件或成节能突破口

4万GPU小时的训练跑下来,AI研究者撞破了一个反常识的结论:大模型的容错性,不是随规模变大而下降,反而会增强。

反常识的训练结果
这次训练用的是模拟故障的数字硬件,不是真实的故障芯片。研究者盯着大型语言模型(LLM)的表现追踪,发现模型越做越大,对硬件故障的耐受度越高——之前行业默认,模型规模上去后,单个小错误会被放大成连锁问题,没想到完全反过来了。

核心是纠错码的自主学习
研究者修正了原有的神经缩放定律,用4万GPU小时的训练数据,把这个容错趋势量化成了可衡量的规律。更关键的发现是:模型在训练过程中,自发学会了在“优质纠错码”的框架里计算。不管模型参数做多大,这个纠错过程带来的额外算力开销始终有限,不会像其他优化手段那样,随规模增长变成难以承受的负担。

能落地的节能方向
这个结论不是纯理论猜想。如果后续验证成立,未来跑AI推理,不用再死磕硬件的绝对可靠性——直接用那些低能耗、带故障的芯片就行。现在AI推理的能耗已经是行业卡脖子的问题,特别是大规模部署的场景,这一步要是走通,能省的电量大概率是量级级别的。

不过有个关键问题没被这项研究解答:模拟的故障硬件,和真实芯片的故障模式差异大吗?模型自主学的纠错逻辑,能不能无缝适配真实硬件的实际故障?毕竟实验室里的模拟,和实际产品的稳定性要求,从来都不是一回事。


素材来源:arXiv (LLM/多模态新论文) · AI情报、AI芯片与算力、科研前沿、消费级AI
查看报道原文

发表第一条评论吧

支持 Markdown