2024科研成果那些事儿:有的炸裂,有的让人捏把汗
刚看完一篇论文,突然想聊聊最近那些让人睡不着觉的科研成果。真的,有些东西你亲眼看到还是会倒吸一口凉气——这玩意儿居然已经实现了?
Sora:眼见不再为实
OpenAI冷不丁扔出Sora的时候,我正喝着咖啡刷手机,差点没呛着。这货能直接生成一分钟的连贯视频,不是那种卡顿、扭曲的AI动画,是那种——怎么说呢——有光影变化、有物理轨迹、甚至有角色情绪的视频。你告诉它“一只戴着贝雷帽的柯基在巴黎街头骑自行车”,它就真给你整出来,连轮子转动的模糊感都模拟出来了。
OpenAI Sora生成的一只柯基骑车视频截图
以前觉得AI做视频顶多是素材拼接,结果它直接奔着世界理解去了。神经网络的规模一上来,涌现能力拦都拦不住。不过这事也挺让人后怕的。以后网上随便一个视频,是真的是假的?深度伪造门槛低到这种程度,那些换脸诈骗、虚假新闻……唉,技术跑得比监管快太多了。
我特地翻了论文,发现它用的是扩散模型结合transformer,把视频压缩成patch然后预测。根本不需要人类手动标注运动轨迹,自己就从数据里悟出了三维常识。说实话,看到那个demo里,有个纸船沉进水里的镜头,水面波纹扩散得跟真的一样,我第一反应不是兴奋,是有点毛骨悚然——这理解力快赶上人类直觉了。
谷歌的机器人,开始有“常识”了?
记得去年还在吐槽机器人端个水杯都颤颤巍巍,今年DeepMind的RT-2一出来,画风突变。你给它看一张桌上摆着苹果和罐头的图片,问它“哪个东西可以吃”,它能指出来。让它把可乐罐扔进垃圾桶,它没摔!它甚至知道易拉罐要丢进可回收那个桶——这背后得有多少隐含知识?
原理不复杂,就是拿视觉-语言模型(VLM)直接驱动机器人动作。以前机器人学一个动作要成千上万次训练,现在直接利用网络图片和文本里的常识。好比说,你从没教过它“纸巾是用来擦东西的”,但它看过无数张人拿纸巾的照片,推也推出来了。这思路真绝,一下子把泛化能力拉上去好几个台阶。
Google DeepMind RT-2机器人执行抓取任务演示
不过话说回来,我看了他们论文里的失败案例,机器人有时候会把塑料香蕉当真香蕉去剥……笑死,但也很真实。人类小孩不也常犯这种错嘛。总体来讲,从程序设定到自主学习,这步子迈得挺大。也许过不了多久,家里真能有个能帮你找东西、收拾桌子的铁家伙。
基因编辑:从治疗到“定制”?
基因编辑:从治疗到“定制”?
CRISPR技术刚拿诺奖那会儿,我们还在欢呼它能治镰刀细胞贫血病。结果今年直接出现了体内基因编辑疗法获批的消息——不是把细胞抽出来改完再输回去,是直接注射载体,在人体内现场修改DNA。有个叫Verve Therapeutics的公司,用一种碱基编辑工具,对着导致高胆固醇的PCSK9基因“咔”一剪,患者坏胆固醇水平直接掉下来60%以上,而且效果持续。
妈呀,这才是真正的“一针治愈”!我想起之前采访过的一个医生,他说传统疗法得天天吃药,病人依从性差得要命。现在倒好,一次搞定。但等等,如果我们可以改胆固醇基因,那是不是也能改身高、肌肉、甚至智力相关的基因?伦理那把剑又悬起来了。
这让我联想到去年那个基因编辑婴儿的破事,虽然那是严重违规,但技术门槛降低后,总有人会动歪脑筋。科研界现在吵成一锅粥,一边是罕见病患者嗷嗷待哺,一边是“定制婴儿”的噩梦。我觉得吧,技术本身没错,但监管和公众讨论必须跟上了,别等到出事了再补牢。
脑机接口:从猴子到人
脑机接口:从猴子到人
Neuralink今年又搞了个大新闻,第一个人类植入者能靠意念玩文明6了……虽然公司争议一堆(什么动物实验伦理啊、数据不透明之类的),但你不能否认这个进展本身是震撼的。头发丝细的电极插入大脑,读取神经元信号,再无线传输,让瘫痪病人控制光标。这种几年前还像科幻的玩意,居然慢慢落地了。
当然,这条路坑多着呢。电极耐久度、感染风险、信号解码准确率……我有个做生物电子的朋友说,大脑里的免疫细胞会把电极当异物包围,时间一长信号就弱了。还有,谁有权限读取你的思想?万一被黑了呢?这些都不是杞人忧天。但话说回来,对于失去运动能力的人,这真的是光。
所以你看,2024年的科研成果,一面是惊艳到让人起鸡皮疙瘩的进步,一面是让人辗转反侧的隐忧。有时候我觉得自己像个在老式火车上看着高速列车呼啸而过的乘客,兴奋又有点跟不上。不过啊,科技从来不是刹车能刹住的,关键是我们怎么握紧方向盘。对吧?