高效能计算平台:藏在科研突破背后的隐形发动机
为什么现在AI、大模型都在抢高效能计算平台?
去年帮我师弟跑个蛋白质结构模拟,一开始用学校旧的集群,跑了半个月,结果出一堆错。后来借了新上线的国产高效能计算平台,三天就出结果了。你说气不气?
大模型训练、创新药分子筛选、极端气候模拟、航天轨道计算...哪一个离得了足够的算力支撑?但算力不是堆几箱芯片就够的。
国产高效能计算平台水冷机房实拍
很多人觉得,不就是多买几台服务器拼起来吗?不对。高效能计算平台的核心,从来不是堆硬件,是把算力、存储、网络全部拧成一股绳,让上百上千个任务同时跑的时候,不会出现“十个人用就卡成PPT”的情况。
说实话,我见过太多课题组,钱花了几千万买硬件,结果调度逻辑烂得一塌糊涂,整体使用率连30%都到不了。纯纯的浪费纳税人的钱。
chatGPT火了之后,国内多少公司砸钱做大模型,多数人喊的算力卡脖子,其实一半不是买不到高端芯片,是没有好的平台把现有芯片的性能给榨出来。对吧?同样一张A100,好的平台能跑满90%的利用率,烂平台跑30%就卡得动不了,差距一下子就拉开了。
高效能计算平台的核心坑,90%的搭建者都踩过
我前两年参加过一个行业研讨会,某地方政府投了好几个亿建公共算力平台,结果上线大半年,没几个科研团队愿意用。为啥?不是算力不够,是用起来太麻烦。你要提交个任务,得敲三页命令行,运行环境还要自己一步步配,配错了找客服都找不到。谁愿意浪费半个月调环境,不如自己攒个工作站慢慢跑。
说实话,很多人对高效能计算平台的误解太深,觉得就是“超级计算机的共享版”,其实核心竞争力从来都不是峰值算力有多高,而是能不能把算力实实在在喂给用户的任务。现在成熟的平台,核心绕不开两个点:
第一个是异构算力的统一调度能力。现在不同任务要跑不同架构的芯片,CPU跑通用计算,GPU跑并行训练,专用AI加速卡跑大模型推理,好的平台能自动识别任务需求,把对应算力分配下去,不会出现GPU闲着让任务硬跑CPU的蠢事。第二个是开箱即用的科研场景适配,做结构生物学的不用自己搭AlphaFold环境,做量子化学的不用自己编译Gaussian,做气候模拟的不用自己调模型参数,点一下就能启动任务,这才是真的省时间。
高效能计算平台异构算力调度架构图
还有一个大坑,绝大多数人都容易忽略,就是能耗。我算过,一个峰值100P的高效能计算平台,一年电费就能烧掉大几千万。之前听过一个笑话,某高校的平台建起来之后,因为电费超预算,夏天机房空调都不敢开满,只好给各个课题组限额度,搞得怨声载道,钱花了还落不着好。
不过话说回来,现在新出的高效能计算平台都开始解决这个问题了,直接上全液冷,再加智能调峰,不用的任务自动降功率,闲时直接关节点,能省三分之一以上的电费,这就是实打实的降本。
现在很多厂商卖平台,还在拿“峰值多少PFLOPS”当噱头吹,用户真正关心的,从来都是你能帮我跑成多少事,不是你理论峰值有多少。峰值再高,任务一上去调度就挤爆,有啥用?
国产高效能计算平台的新机会在哪?
国产高效能计算平台的新机会在哪?
放在十年前,国内高端的高效能计算平台,不管是硬件还是调度软件,大半都依赖国外厂商,价格贵不说,出了问题维修都要等半个月。这两年不一样了。不管是芯片还是上层的调度系统,国产方案已经追上来了,性能不落下风,价格还便宜一半。
去年我帮一个课题组测过某国内厂商做的面向生命科学的高效能计算平台,跑AlphaFold多序列比对,速度比我之前用的国外厂商平台快了近20%,真的惊到我了。
现在各地都在建公共高效能计算平台,对中小企业和普通课题组开放算力,按使用量付费,这真的是功德无量的事。之前认识一个做创新药研发的创业者,早年创业的时候租不起稳定算力,只能靠接外包养自己的核心项目,进度拖了整整两年。现在他把任务放到当地的公共高效能计算平台上,一个月花几万块就能跑足够的分子模拟,项目推进速度快了不止一倍,今年已经进临床了。
很多人只看到顶刊上的科研成果光鲜,看不到背后高效能计算平台堆了多少算力,托住了多少试错。这两年国内拿得出手的重大突破,从新冠小分子药物研发,到嫦娥探月的数据处理,再到FAST的脉冲星搜索,哪一个离得了高效能计算平台的支撑?
当然,现在行业里还有问题。比如很多小地方的平台,建起来了没人会运营,好资源闲置浪费。还有很多敏感科研数据对安全要求高,平台的防护能力还要继续跟上。但总的来说,路已经走对了,剩下的就是把细节一点点磨好。
未来的科研,本来就是越往深走,越拼基础工具,拼算力平台。谁能把好用、实惠、安全的高效能计算平台做出来,谁就能接住下一波科研突破的门票。不信你过几年回头看。