当前位置:首页 > 科研成果库

强化学习技术,凭什么让人又爱又恨?

2026-08-04 03:52:44小研科研成果库14
去年冬天,我窝在家里看了一场Dota2的比赛。不是人类的,是AI——OpenAI Five。那操作,怎么说呢,就像开了天眼。完美地拉扯、反补、开雾,团战配合行云流水。我当时脑子里只有一个念头:这玩意儿要是来打天梯,我还玩个屁啊。 这是强化学习的杰作。说白了,就是让AI在试错中学习。做对了给颗糖,做错了挨一巴掌。听起来跟驯兽差不多,对吧?但就是这套方法,搞出了AlphaGo,把李世石给下哭了。 OpenAI Five在Dota2比赛中团战画面OpenAI Five在Dota2比赛中团战画面 不过……强化学习不是万能的。它也有让人抓狂的时候。比如你让一个刚出生的机器人去学走路,它可能先把自己拆了。

游戏界的‘弑神者’

你还记得2016年吗?AlphaGo对李世石,第二局那断三三一手。我当时看直播,差点从椅子上摔下来。这哪是下棋,这是逆天。后来DeepMind整出了AlphaZero,更绝。它只用了几个小时的训练,就从零开始超越了人类几千年的棋谱积累。没有任何人类知识,纯靠自己左右互搏。 这种感觉很奇妙。就像你教一个小孩算术,他花了一下午,然后推演出了微积分。恐怖吗?太恐怖了。但说实话,AlphaZero的成功也暴露了强化学习的‘暴力美学’——靠着海量算力,暴力搜索最优解。围棋还算好的,状态空间有限。到星际争霸,AlphaStar虽然赢了高手,但那手速,那多线操作,明显是‘非人类’。所以有人不服,说它作弊。 AlphaZero自我对弈训练神经网络可视化AlphaZero自我对弈训练神经网络可视化 其实,作弊不作弊的不重要。重要的是,它证明了强化学习在复杂策略游戏里能干掉人类。而游戏,只是一个开始。

RLHF:驯服大模型的野性

这两年,ChatGPT火得一塌糊涂。但你知道它背后也有强化学习吗?那个技术叫RLHF——基于人类反馈的强化学习。之前GPT-3出来时,大家都说它是杠精养成器。你问它‘怎么健身’,它回你‘先死一次重生’。气人不?大模型预训练阶段,从互联网上扒拉数据,什么脏话黑话都学了,张嘴就是种族歧视、性别偏见。更要命的是,它没有‘对齐’人类价值观。 RLHF怎么做的?简单讲,先让人工标注员给模型的输出打分,训练一个奖励模型。然后让大模型在这个奖励模型的指引下,用强化学习微调。这样一来,模型就学会了说人话,知道什么该说,什么不该说。我试过早期的ChatGPT和同期的原始GPT-3.5,差距真的太大了。就像一个是街头混混,一个是绅士。 ChatGPT训练流程中RLHF示意图ChatGPT训练流程中RLHF示意图 不过,RLHF也有坑。奖励模型是人训的,人有偏见吧?于是模型也变得政治正确得过头,有时候像个端水大师。而且,它还是时不时会胡说八道,因为强化学习奖励的是‘听起来像人话’,不是‘事实正确’。所以你看看,现在大模型还在拼命优化事实性。

落地之痛:在现实世界栽跟头

波士顿动力的机器人后空翻很帅吧?但那是硬编码加一点强化学习调出来的。真的完全用强化学习训练一只四足机器人从零开始走路?它会先学会抽搐,然后学会把自己摔成零件。我有个朋友搞机器人,说那场面简直像恐怖片。 这就是现实。强化学习在游戏里大杀四方,一到真实世界就抓瞎。为什么?因为模拟环境和真实世界之间的鸿沟太大了,俗称sim-to-real gap。仿真里地面摩擦力是恒定的,真实世界呢?你今天打蜡,明天洒了水,立马不一样。传感器噪声、光照变化,任何一个微小差异都能让机器人的策略崩溃。而且,强化学习样本效率极低。你要训练一个端到端的视觉抓取策略,可能要花几十万次尝试。你等不起,机器人也坏不起。 自动驾驶也是。虽然Waymo、特斯拉都在用强化学习做决策规划,但核心的安全模块还是大量靠规则和传统方法。因为强化学习万一学出一个奇怪的策略,比如为了躲避纸箱突然变道撞车,那可就完犊子了。所以啊,理想很丰满,现实很骨感。 强化学习训练四足机器人蹒跚学步场景强化学习训练四足机器人蹒跚学步场景 不过总有人不信邪。最近有些团队尝试用世界模型加想象训练,先在梦里学会,再迁移到现实。有点成效,但离实用还远着呢。

反思与执念:强化学习是AGI的钥匙吗?

我有时觉得,强化学习是一种信仰。Rich Sutton在《The Bitter Lesson》里说,算力碾压一切精巧设计。强化学习正是这种理念的极致——只需要一个简单的奖励信号,堆上足够的计算,就能涌现智能。这很疯狂,也很有魅力。 然后你看最近的研究。Decision Transformer,把决策变成序列建模,像GPT一样预测下一个动作。这路子有点野,但居然work。再比如,用强化学习优化大模型的推理过程,搞出了o1、o3这种会思考的模型。它们不再直接蹦答案,而是步步推理,自我纠正。那一刻我有点恍惚:这算是摸到AGI的边了吗? 但冷静下来想想,问题依然成堆。奖励函数设计,是玄学。多任务迁移,是玄学。安全性对齐,更是玄学。你无法保证一个强化学习智能体不会为了追求奖励而走火入魔。再说了,真实的智能需要好奇心、内驱力,而不仅仅是外界奖励。我们还没搞明白如何给机器植入这些。 所以,强化学习技术,到底是鸡肋还是王牌?或许,时间会给出答案。但无论如何,它已经改变了游戏规则,不是吗?