星光澄海 | BLOG

笔记本跑7000亿参数GLM?GitHub这款工具靠SSD当显存走红

有人用普通笔记本电脑,靠GitHub上一款叫Colibrì的开源工具,跑起了7000亿参数的GLM大模型——全程不用GPU,靠SSD当“虚拟显存”。

7000亿参数的模型,能塞进笔记本?

之前大模型的参数规模动辄千亿级,跑模型的硬件门槛极高,必须依赖带高端GPU的服务器,单张A100的显存也就80GB,跑千亿参数模型都吃力,7000亿级的更是要多卡集群。但Colibrì的出现打破了这个惯性,让普通笔记本也能跑起来。它的核心是绕开了GPU显存的硬限制,把大模型的部分参数“暂存”在SSD里,需要计算时再动态调度,不用把全量参数塞进GPU显存。

靠SSD当显存的门道在哪?

这不是简单把大模型塞进SSD里运行。Colibrì做了参数分层调度:把模型中不常调用的权重存在SSD,常调用的放内存,计算时只把当前需要的部分加载到内存,CPU就能完成推理,全程不需要GPU。原来需要多卡集群的7000亿参数GLM,现在只要笔记本有足够的SSD空间(7000亿参数的模型,大概需要几十GB的存储空间),搭配16GB以上的普通内存,就能启动运行。GitHub上的热度也能看出,开发者对这种“降维跑大模型”的需求很直接——不用凑钱买高端GPU,自己的笔记本就能碰上千亿参数的模型。

对普通人和行业意味着什么?

之前用大模型,要么是调用云服务商的API,要么是自己搭服务器,成本和门槛都高。Colibrì的方案把大模型的使用场景拉到了个人设备上,不需要依赖云端,也不用额外采购硬件。对想调试大模型的开发者来说,不用再按小时租GPU服务器;对普通用户来说,未来可能在自己的笔记本上运行定制化的大模型,不用受限于云端的性能和延迟。不过现在的问题也明显:速度比GPU加速的方案慢,参数调度的过程会消耗时间,大模型的推理效率还不够实用,但至少打开了一条新的路。

当大模型不再绑定GPU和云端,我们离每个人都能在自己的设备上跑专属的7000亿参数模型,还有多远?


素材来源:量子位 · AI情报、大模型、AI芯片与算力、开源生态
查看报道原文

发表第一条评论吧

支持 Markdown