前几天刷到个项目,把70B参数的大模型推理,塞进了单块4GB显存的GPU里。今天这个项目叫AirLLM,跑在Jupyter Notebook上,刚拿到541个GitHub星标。
这项目到底干了啥
就是AirLLM这个开源项目,实现了70B大模型的推理运行,只需要一块4GB显存的GPU,而且是在Jupyter Notebook环境里就能玩。放在以前,别说70B,哪怕参数更小的模型,要跑通推理,显存要求也远高于4GB。这个数字本身就够反常识的。
它的门槛降在哪
以前想试试70B大模型的能力,要么得找好几块卡拼起来做分布式,要么得租云厂商的高显存实例,费用和门槛都不低。现在AirLLM的这个实现,相当于把原本需要“大显存”的门槛,拉到了几乎人人能碰得到的程度——4GB级的GPU,不管是旧的消费级游戏卡,还是云里的小实例,都不难拿到。对开发者来说,不用再为了测一个70B模型,凑一堆资源,省了不少折腾的功夫。
现在的信号
今天刚涨了541个星标,说明大家对这个痛点的关注度很高。毕竟大模型的轻量化,一直是开源圈的方向,但能把70B直接压到4GB,这个突破的幅度,比之前的小修小补要实在。而且它是推理场景,不是微调,对于很多想快速做小应用、做原型的人来说,拿起来就能用。
那接下来的问题是,这种单卡轻量化的思路,会不会让更多人愿意自己动手玩70B模型?还是说,它会倒逼那些提供高显存服务的厂商,调整自己的产品策略?
素材来源:GitHub Trending · AI情报、大模型、AI芯片与算力、AI应用落地
查看报道原文

发表第一条评论吧