当前位置:首页 > 科研成果库

异构算力调度:为什么大模型离不开这群"算力搬水工"?

2026-10-10 00:12:50小研科研成果库8
上周帮一个做AI绘本的创业朋友调项目,卡在算力这块整整卡了两天。他手头有三块不一样的卡,一块是服务器淘汰下来的A卡,两块是消费级的N卡,还有两块云服务器的CPU闲着,愣是跑不起来一个7B参数的微调。我当时帮他排错,差点把键盘砸了! 后来找了个做异构算力调度的朋友丢了个工具过来,居然跑通了,成本还不到原来租云GPU的三分之一。我当时就觉得,这东西有意思,很多人只吹大模型,没人说清楚背后这个「隐形基建」到底是怎么回事。

你用AI的时候,算力正在偷偷堵车

现在做AI,早就不是清一色用同一款芯片的时代了。华为有Ascend,谷歌有TPU,苹果有A系列的神经引擎,边缘设备还有各种NPU,这些不同架构不同性能的芯片,就是所谓的「异构算力」。 以前这些芯片都是各管一块,CPU跑逻辑,GPU跑模型,老死不相往来。问题来了,现在AI任务越来越碎,你一个AI聊天请求,从接入用户到生成回复,要走五六步,每一步要的算力不一样。让GPU去干处理HTTP请求的活,就像让开重型卡车的司机去送外卖,油费比运费还贵,纯纯浪费。 很多数据中心里,经常出现一边GPU闲出屁,一边CPU忙到炸,或者反过来,算力缺口喊得凶,大量闲置算力就这样烂在那里没人用。大模型爆火之后,这个问题更严重了。芯片产能跟不上,价格涨得飞起,没人敢一股脑买一堆同型号芯片放着。大家都开始凑,买一点这个,淘一点二手闲置,拼一点云算力,凑出来一个能用的池子。 那这么多不一样的芯片放在一起,谁来分活?这就是异构算力调度要干的事。 数据中心异构算力集群设备图数据中心异构算力集群设备图

说白了就是给算力当外卖调度员

我见过最直白的解释,就是做算力界的派单平台。你有一个活儿要干,系统先给你拆成不同的环节,每个环节要什么性能算清楚,然后从整个算力池子里找最适合性价比最高的那个芯片来干,干完再把结果拼起来给你。 很多人以为异构就是堆芯片,其实核心从来不是堆,是调。堆芯片谁不会啊,调得匀调得省才是真本事。 举个例子,你让AI生成一张二次元头像,整个任务拆三块:第一块是验证用户身份、处理请求参数,这个活逻辑简单,CPU一块核心就能干,五毛钱够了。第二块是生成图像的核心推理,要做大量矩阵计算,就得扔给半精度的GPU干,这个是大头。第三块是给头像加滤镜裁尺寸,这种小活边缘节点的NPU就能干,还不用占中心的算力。以前整个任务全扔给GPU,一块一小时几块钱,现在拆完,总成本能降一半还多。对吧? 我那个朋友之前为什么跑不通?就是原来的工具只会把整个任务扔给单块GPU,他那块GPU显存不够,一跑就崩。调度工具把模型分层拆了,一部分放GPU,一部分放CPU的内存里,居然就跑起来了,虽然慢了点,但够他做小规模微调用了,完全能接受。 不过话说回来,调度不是万能的。我见过有人吹说异构调度能把全国各地闲置的消费级卡都攒起来训千亿参数大模型,听听就算了。不同芯片之间数据传输要时间,不同节点同步要成本,攒一百张散卡,还不如十张同构卡跑的快,成本还更低。 异构算力调度任务拆分分配示意图异构算力调度任务拆分分配示意图

现在落地还有哪些绕不开的坑

现在落地还有哪些绕不开的坑现在落地还有哪些绕不开的坑 我接触过几个做调度的研发团队,吐槽最多的就是三个问题。 第一个,调度本身就耗算力。你为了省一百块算力,花了五十块做调度,那不划算啊。尤其小任务,调度的额外开销比任务本身还大,完全得不偿失。现在很多调度工具都是针对大规模任务优化的,小任务用了反而亏。 第二个,兼容性真的烂。不同厂家的芯片指令集不一样,有的模型你得重新编译适配才能跑在不一样的芯片上,改一次代码半个月没了,很多小团队根本耗不起。我见过一个团队,为了让模型同时跑在N卡和Ascend芯片上,专门养了三个人做适配,人力成本比省下来的算力钱还多。 第三个,数据延迟拖后腿。如果你调的算力是在别的城市的机房,传一次几十G的模型数据,半小时过去了,用户等AI回复等的都走了,你调再多算力有什么用?现在只有对延迟不敏感的离线任务,才能随便调跨地域的算力,实时任务根本不敢碰。 说实话,现在很多项目都停留在「能跑通就行」,离好用还远着呢。我之前试过一个号称「全国闲置算力调度」的平台,跑一个小推理,延迟快十秒,谁用啊。 那这东西是不是就是炒概念骗投资的?也不是。现在用的最好的地方,其实是大模型的推理端。推理任务本身就是碎片化的,峰值谷值差很大,大促或者搞活动的时候请求能涨十倍,自己囤一堆同构GPU,闲的时候百分之九十都闲着,太浪费了。用异构调度,把峰值请求分流出去,拼一堆不同来源的算力,成本能降好多。 还有很多中小创业团队,买不起几万一块的专业卡,靠调度拼一堆闲置卡就能做项目调试,这已经是很大的进步了,把门槛降了不止一点。 别信那些说「异构调度能解决一切算力荒」的鬼话,它就是个优化工具,不是魔法,该不够还是不够,只是能让你手里现有的算力,多干三分之一的活,这就已经很值钱了。以后算力会像水电一样,你在家用不完的手机算力,公司服务器闲下来的芯片,都能卖出去,要算力的人随便从网里抓,不管是什么芯片,都能拿来用。要实现这个,核心就是异构算力调度。现在坑多,都是新东西必然要踩的,慢慢趟就好了。