一场让人憋屈的AI研究标杆对比分析:我们到底差在哪?
前几天翻看斯坦福刚出的AI Index报告,厚厚几百页,翻着翻着突然就气笑了——不是笑别人,是笑咱们自己。真的,有些数据刺眼得让人失眠。
随便举个例子?自然语言处理领域那几颗皇冠上的明珠:GLUE、SuperGLUE、SQuAD…… 你猜霸榜的都是谁?翻来覆去就那几个名字,Google Brain、OpenAI、微软。偶尔有清华或者北大的团队挤进去,还没来得及鼓掌呢,下一轮就被刷下来了。这感觉就像——怎么说呢,像你辛辛苦苦练了三年球,结果上场发现对面全是NBA全明星。
顶尖AI实验室参数量增长趋势图
但说实话,光盯着参数太片面了。Google的LaMDA、PaLM,包括被吹上天的DeepMind的Gato,这些模型强的不只是大,而是架构创新和训练方法的精益求精。比如Gato,一个模型搞定600多个任务,从聊天到玩游戏到控制机械臂。这背后是强化学习和Transformer的无缝融合——咱们这边呢?好多还停留在'换个更大的BERT刷榜'的阶段。前两天和一个在大厂研究院的老同学喝酒,他猛灌一口,说:'我们就像在沙滩上盖摩天楼,地基是别人的,建材是别人的,连设计图都得偷偷描。' 我默默给他倒了杯茶。
高校AI领域顶会论文机构分布图
我特别想吐槽的是评价体系。国外那些组好像不太在乎'论文数量',反而追求一个'一作去微软研究院一待就是五年'的慢工出细活。咱们呢?博士生三年不发够三篇顶会怕是毕不了业,结果搞出一堆同质化严重的'微创新',在某个小众数据集上把SOTA提高了0.1%,然后宣称'重大突破'。唉。这种对比太让人绝望了。
大厂实验室的军备竞赛:算力即真理?
有时候我真怀疑,这帮硅谷巨头是不是偷偷开了算力外挂。看看GPT-3,1750亿参数,训练一次据说烧掉几百万美元。几百万美元啊!咱们国内好多AI创业公司,A轮融资都没这个数。更气人的是,他们还不开源论文细节了——以前装装样子,现在直接'商业机密'。你连复现都复现不了,还谈什么对标?
顶尖AI实验室参数量增长趋势图
但说实话,光盯着参数太片面了。Google的LaMDA、PaLM,包括被吹上天的DeepMind的Gato,这些模型强的不只是大,而是架构创新和训练方法的精益求精。比如Gato,一个模型搞定600多个任务,从聊天到玩游戏到控制机械臂。这背后是强化学习和Transformer的无缝融合——咱们这边呢?好多还停留在'换个更大的BERT刷榜'的阶段。前两天和一个在大厂研究院的老同学喝酒,他猛灌一口,说:'我们就像在沙滩上盖摩天楼,地基是别人的,建材是别人的,连设计图都得偷偷描。' 我默默给他倒了杯茶。
学术界的隐形冠军:那些闷声发大财的组
不过,要是以为只有工业界在领跑,那就太天真了。学术界藏着不少'扫地僧'——卡内基梅隆的机器人研究院,MIT的CSAIL,还有瑞士苏黎世联邦理工那个逆天的CV组。他们不天天上头条,但一出手就是颠覆性的。比如NeRF(神经辐射场),直接把三维重建炸开了锅,几乎每一篇SIGGRAPH论文都离不开它。你猜NeRF谁搞的?伯克利的一个博士生和几个教授,轻轻松松。
高校AI领域顶会论文机构分布图
我特别想吐槽的是评价体系。国外那些组好像不太在乎'论文数量',反而追求一个'一作去微软研究院一待就是五年'的慢工出细活。咱们呢?博士生三年不发够三篇顶会怕是毕不了业,结果搞出一堆同质化严重的'微创新',在某个小众数据集上把SOTA提高了0.1%,然后宣称'重大突破'。唉。这种对比太让人绝望了。