科研成果:当年跑电泳的我,真没想到AI能把蛋白质结构玩成这样
说实话,我至今仍记得在实验室里跑坏第七块电泳胶的那个晚上——蛋白纯化愣是做不出来,导师叹了口气说“慢慢来,结构生物学就是靠耐心磨出来的”。十年过去了,谁曾想,一群写代码的家伙把这事儿变成了“上传序列,等几分钟,三维结构就出来”的魔法。哦不,是科学。当 DeepMind 甩出 AlphaFold3 的那个下午,我盯着屏幕上的预测精度数据,后脖子一阵发麻……你敢信?原子级别的坐标误差居然压缩到了令人发指的程度。
AlphaFold3预测蛋白质三维结构渲染图
不过话说回来,如果你不是这行的,可能感受不到这种冲击到底有多大。简单来说,以前解析一个蛋白质结构,需要先把这个蛋白提纯、结晶(这一步就能卡死半数课题),然后用 X 射线衍射或者冷冻电镜狂拍数据,最后吭哧吭哧搭建模型——短则数月,长则数年。而 AlphaFold 这类工具的出现,就像把算盘直接升级成了量子计算机。更绝的是,它连蛋白与 DNA、RNA 甚至小分子配体的结合都能预测。我有个在制药公司的朋友当时就炸了:“这下先导化合物筛选要彻底变天了!” 但他紧接着又叹了口气——因为公司采购部门的流程比蛋白质折叠还慢。
从“手工作坊”到“AI工厂”的蛋白质解析
科研这玩意儿吧,有时候特别像赌博。你押注一个方向,花掉三四年青春,最后可能只证明这条路走不通。结构生物学过去就是这种赌博的典型:筛结晶条件靠的是穷举法,一种缓冲液、一种沉淀剂地试,试到怀疑人生。我还记得隔壁实验室的师姐,花了两年时间才拿到一颗肉眼可见的晶体,结果一衍射,分辨率还不到 3 埃——当时她差点没把液氮罐踹翻。所以当 AI 模型第一次在 CASP(结构预测评估竞赛)上碾压传统方法时,整个领域的气氛既亢奋又有点尴尬:我们这些受过正经科研训练的人,竟然输给了一堆矩阵计算?
但很快大家就回过味儿来了——工具而已,谁用不是用呢。AlphaFold3 这次最让我服气的地方,是它把扩散模型的思想塞进了结构预测里。没用物理上的分子动力学模拟,而是直接对原子坐标进行去噪生成。效果呢?看那个评价指标吧,对蛋白质-配体复合物的预测成功率比上一代高了好几个量级。我一个搞计算化学的师弟拍着大腿说:“这思路早就该有人试了!但除了 DeepMind,谁敢这么烧算力?” 是啊,学术圈哪有人家那种几千块 GPU 的豪横。对了,就在去年年底,《Nature》上还有篇文章质疑过这种“黑箱”的可靠性,说它在某些柔性区域会整出些奇怪的构象。但你要是问药物化学家——他们才不管那么多,只要能在虚拟筛选里把命中率往上提几个点,那就是救命的东西。毕竟靶点那么多,试错成本高到离谱。
基于扩散模型的蛋白质-配体结合预测流程图
意外收获:为什么犯错也是科学的一部分
意外收获:为什么犯错也是科学的一部分
聊个挺有意思的插曲。前阵子 AlphaFold 预测了一个与帕金森病相关的蛋白 LRRK2,结果某个关键 loop 区的朝向和后来冷冻电镜解出来的不太一样。开发团队承认模型在那个区域置信度低,但有些研究者不干了,说这容易误导课题方向。可偏偏有个课题组顺着那个“错误”构象往下挖,竟然发现了一种全新的别构调节位点——要是完全信了预测,反而错过了发现。你看,科学里这种歪打正着的事儿简直太多了。所以说,AI 给的是概率最高的解,不一定就是生物学真实状态,尤其蛋白在溶液里本来就是不断抖动的。我现在反而不那么执着于“绝对准确”了,误差区间里可能藏着新大陆。对吧?
不过话说回来,我们这些习惯了“眼见为实”的实验派,对计算预测总归有点膈应。以前发文章,没有电镜密度图都不好意思说这是结构;现在呢,一堆文章直接用预测结构做对接分析,审稿人居然也放水了。时代变得真快。有个老院士在一次会议上吐槽:“现在的学生都不愿意学晶体学了,反正 AI 都能猜出来。” 听着是抱怨,可转头他就让助理去给服务器上了块新的 A100 显卡。人类的嘴,骗人的鬼。
当科研成果撞上现实:期望与落差
当科研成果撞上现实:期望与落差
最魔幻的是什么呢?是技术牛得飞起,但落到应用上照样一地鸡毛。就在上个月,我看到一家明星 AI 制药公司又裁员了——说是管线推进不及预期。你看,从靶点结构预测到变成一颗能吃的药,中间隔着 ADME 性质、毒性、临床效果,无数道鬼门关。AlphaFold 帮你把锁孔形状看清了,可钥匙还是得一把一把试。更别提很多疾病靶点本身就没啥口袋,预测再准你也塞不进分子。我一个做转化研究的朋友喝着咖啡说:“这帮投资人以为买了 AlphaFold 的 API 就能印钞票,天真。” 我倒觉得,成果转化慢可以理解,但千万别因此就觉得基础研究没价值。当年赵忠尧发现正电子的时候,谁能想到后来 PET-CT 能满大街做癌症筛查?
眼下,结构预测的边界还在往外扩。前几天刷预印本,看到日本人用类似模型设计出了耐高温 PET 水解酶,直接怼到塑料瓶上,降解效率翻了好几倍。这种应用多实在啊。还有人在尝试预测 GPCR 与下游信号蛋白的复合物——那可是药企的靶点金矿。只是啊,数据饥渴和泛化能力仍是死穴。有些罕见蛋白,数据库里就几十条同源序列,模型直接蒙圈。不过这倒也给实验科学家留了口饭吃,我们依然得老老实实去提蛋白、扫电镜,提供训练数据。所以你看,这不是替代,是共谋。
最后唠叨一句:下次再有人对你吹“AI 颠覆科研”,你就把 AlphaFold 的预测结果和真实晶体结构叠一下,RMSD 差了多少自己心里有数就行。工具是好工具,但别跪着用。科研嘛,永远需要那点儿怀疑精神和运气——嗯,再加一台不报错的冻干机就更好了。