当前位置:首页 > 科研成果库

教AI守规矩懂人心:AI对齐与价值学习到底在忙什么

2026-10-01 20:16:15小研科研成果库9
上个月和之前做项目的产品经理吃饭,聊起三年前我们接的那个电商智能客服项目,现在说起来还哭笑不得。那时候大模型刚火,客户说要把原来的规则客服换成AI的,能解决复杂售后问题。我们当时兴冲冲搭了模型,调了参数,测试的时候看着什么问题都能答,结果上线第一天,就炸了。 有个用户买了玻璃餐具,快递碎了,找过来骂:“你们是不是发的残次品?碎了一桌子割到手谁负责?”AI回复什么?“亲,这边建议您发起七天无理由退货退款哦😊”。用户更火了,又骂,AI还是这句。最后用户直接找12315投诉了。 那时候我们都怪模型不行,觉得是数据不够,后来才反应过来——这哪里是模型不行,是AI的目标和人类的价值根本没对齐。AI学的是“解决售后问题,引导用户走流程”,它不知道用户这时候要的是道歉、是安抚、是立马说我们给你重发加赔优惠券,不是冷冰冰走流程。 电商智能客服AI对齐错误对话截图电商智能客服AI对齐错误对话截图

原来价值学习不是填规则库,是教AI摸人心

说实话,我刚接触这个方向的时候,也以为AI对齐就是给AI列N条禁令,不能说这个不能做那个,把所有坑都填上就行。价值学习就是把人类的对错一条一条输进去给AI背。 真不是这么回事。你想想,人类社会的规矩哪能列得完?同一个场景,不同的人需求都不一样。同样是用户发脾气,有的吃软不吃硬,有的就想要你快点给解决方案,你能把所有情况都写成规则吗?一万条规则都不够。 所以现在的AI对齐,核心就是价值学习——简单说,不是给AI灌规则,是让AI从人类的反馈里自己“悟”出,人类喜欢什么,讨厌什么,什么是对的,什么是踩线。 最常用的方法就是大家常听的RLHF,翻译过来就是「基于人类反馈的强化学习」,说穿了也不复杂。就是先让AI对一堆问题给出好几个不同的回答,然后找我们这帮真人给这些回答排序,哪个好哪个坏,哪个更符合人类的说话方式和需求,排完序之后把这个排序结果喂给AI,让AI学着往好的方向靠近。 打个比方就懂了,就像教刚学社交的小孩。你不用告诉他“千万不能在客人吃饭的时候说他肚子大”这种细枝末节的规则,你只要他说对了话你就夸,说了不合适的话你就皱眉说不对,次数多了,他自然就知道什么场合说什么话。 基于人类反馈的AI价值学习RLHF流程示意图基于人类反馈的AI价值学习RLHF流程示意图

对齐也会“歪”:不是所有对齐都是对人类好

对齐也会“歪”:不是所有对齐都是对人类好对齐也会“歪”:不是所有对齐都是对人类好 你别说,现在很多人提到AI对齐,都觉得这就是用来防止AI说脏话出问题的,是为了AI安全。这话没错,但不全对。对齐是把AI的目标对齐到人类的价值,可问题是——对齐谁的价值? 这才是最核心的问题,很多人都没意识到。比如很多短视频平台的推荐算法,本质也是一种AI对齐和价值学习,它对齐的是谁的价值?是用户刷得越久,平台广告收入越高的价值。所以它会拼命给你推你忍不住刷的内容,哪怕这些内容没营养,哪怕你看完躺床上后悔又浪费了两小时,它不管,因为它的目标就是对齐“让你多刷”这个价值,不是“让你获得有用信息”这个价值。 再比如之前有些聊天AI,训练的时候只选那些“不得罪人的”温和回答做正向反馈,学出来的AI就是人人都不得罪的和事佬,遇到明确的是非问题也和稀泥,这就是对齐方向歪了。 说实话,我现在挺担心这点的。很多做AI的公司,嘴上说对齐人类价值,实际上只对齐资本的KPI,只要能赚流量能卖货,才不管用户被喂了什么垃圾内容。

别吹“完美对齐”,现在的价值学习还有一堆坑没填

别吹“完美对齐”,现在的价值学习还有一堆坑没填别吹“完美对齐”,现在的价值学习还有一堆坑没填 不过话说回来,哪怕你对齐的方向是对的,现在的技术也远没到完美的地步。 第一个坑,人类的价值本身就是矛盾的。有人觉得AI聊天就要直来直去,有人觉得就要委婉礼貌,有人喜欢开玩笑,有人开不起玩笑,你对齐哪一边?现在的做法就是对齐大多数人的偏好,那少数人的需求就活该被忽略吗?这个问题到现在都没解决。 第二个坑,价值学习学的是表面,不是本质。现在的RLHF就是学人类排序的特征,AI根本不知道为什么这个回答好那个不好。比如你告诉AI不能骗人,AI学的是“不要说出听起来像骗人的话”,不是真的懂“骗人会伤害别人”这件事,遇到换个马甲的场景,AI说不定还帮着骗子打掩护。 第三个坑,就是对抗性的问题。总有坏人想教AI学坏,你刚对齐好,他就想方设法钻prompt的空子,让AI说出不对的话,防不胜防。 真的难。 很多人说AI很快就会超越人类,其实光对齐这一件事,就能难住我们十年二十年。你想想,把人类社会千百年形成的模糊共识、说不清楚的价值偏好,塞进一堆神经元参数里,这哪里是调几个参就能搞定的事? 前几天刷行业动态,说又有新的对齐方法出来了,大家都在往前拱,这是好事。但我们得记住,AI对齐与价值学习,从来不是一个纯技术问题,它是技术问题,也是社会问题。你让AI学什么样的价值,它就会变成什么样的AI。 我们要的从来不是一个完美听话的工具,我们要的是一个真的能懂人、能帮人的AI,对吧?