可信AI技术:当AI“说谎”时,我们该信谁?
最近大模型圈子里那个“义正言辞地胡说八道”的案例,我看了好几遍。一个律师拿AI生成的案例提交给法庭,结果全是虚构的。法官气笑了,网友也笑了。但我没笑出来——这背后是一个刺痛人的问题:当AI以极高的自信给出错误答案时,我们有什么能力分辨? 这就是可信AI技术要解决的,也恰恰是最难啃的骨头。
自然语言模型的流畅度,是一种幻觉——它对语法、逻辑、甚至情感的模仿越到位,就越容易让人放下防备。可它的底层不过是在算词的概率分布。你问它一个事实,它可能为了“顺口”编一个。这能叫智能吗?我不这么觉得。
一、AI的“自信”是最大的不可信
我之前真的看过一个研究团队的测试:让GPT模型回答常识问题,然后给答案附上置信度评分。结果是,模型对错误答案的置信度,和正确答案几乎没有差别。你问它“地球是方的吗?”,它可能给你一个坚决的“否”,但你要问它“某部电影里主角的生日是哪天”,它编得一本正经。这不是特例,而是普遍现象。
所以现在业内的人都在谈校准(calibration)——让模型的置信度真正反映它的正确率。说白了,就是让它学会说“我不知道”。可这远比想象中难。模型没有自我意识,它无法知道自己不知道。这变成了可信AI的第一道坎。
人工智能模型置信度校准示意图
二、可解释性:把黑箱撕开一道缝
二、可解释性:把黑箱撕开一道缝
另一条路是让AI把决策过程“吐出来”。这很难,因为深度学习本来就是黑箱。
我们这边有团队在做基于归因的可解释性,比如用SHAP值去分解它到底看了哪些输入特征。听起来不错?但实际问题扑朔迷离。拿机器翻译来说,一个词在源语言里明明有歧义,模型却根据一个看似无关的词做了判断。你给的解释,可能比模型本身还难懂。
更麻烦的是,人类对“解释”的需求也是分层的。专家要的是数学证明,普通用户要的是“为什么”。产品经理要的是“能不能给个理由”。这么多要求,一个框架怎么同时满足?反正我还没见过完美的方案。
但这不是说没进展。去年有一篇论文,用概念瓶颈模型让图像分类器在输出前先产生一组人类可理解的概念。比如判断肺结节时,先输出“毛刺状边缘”、“分叶”、“钙化”等,再基于这些概念做判断。这个思路确实更让人安心,至少它把中间的推理过程暴露出来了。
三、鲁棒性与对抗攻击:你看到的不是真相
你以为AI看到的和你一样?错了。
给一张图片加上肉眼根本看不见的噪点,模型就会把“熊猫”认成“长臂猿”。这是几年前的经典对抗样本。可到现在,这个问题依然没有根本解法。更离谱的是,对抗样本还会“迁移”——在一个模型上生成的扰动,放到另一个模型上照样有效。这意味着,黑客不需要知道目标模型的结构,就能发起攻击。
说实话,我每次看到自动驾驶的新闻,心里都会咯噔一下。要是有人拿一个贴纸贴在“停车”标志上,让模型识别成“限速”,那真不是开玩笑的。最近有研究团队在真实世界里做了测试,用一张纸就能骗过主流目标检测器。这叫什么?这叫把“可信”两个字按在地上摩擦。
所以鲁棒性不是学术游戏,它是要命的事。现在的趋势是用对抗训练来增强模型——就是在训练时故意加入对抗样本,让模型“见多识广”。但代价是训练成本翻倍,而且只能防已知的攻击模式。你在明处,攻击在暗处,这仗不好打。
对抗样本攻击自动驾驶汽车识别系统示意图
四、可信AI的落地,难在哪儿?
四、可信AI的落地,难在哪儿?
说到落地,问题更糟。技术上的难点还好解决,难的是人和制度。
你有没有发现,很多AI公司嘴上说“负责任”,实际上连一个模型卡都拿不出来。模型卡是什么?就是像食品包装上的配料表一样,标注模型的训练数据、性能、偏见、适用场景。就这么个东西,至今没有成为行业标配。为什么?因为不赚钱啊。谁会花钱给自己找麻烦呢?
另一方面,监管也跟不上。欧盟的《人工智能法案》吵了好几年,总算有框架了,但落地还得靠各成员国自己消化。美国这边更乱,各州自己搞一套。企业呢?能拖就拖。这让我想起一个朋友说的:可信AI最核心的技术是“说服老板给预算”。
不过话说回来,技术本身也在倒逼变革。像谷歌、微软这些大厂已经开始把可解释性和公平性评估做成自动化工具链的一部分。虽然离理想状态还差得远,但至少方向对了。
还有一个坑是数据泄露。你训练一个医疗AI,用的患者数据有没有脱敏?脱敏得干不干净?去年有研究指出,所谓匿名数据可以通过重识别攻击还原出个人身份。这就尴尬了——你越可信,就越要证明自己不可追踪。
所以你看,可信AI技术从来不是单点问题。算法、数据、人、制度,全拧在一起。想要解决,得一块一块啃。
五、未来会怎样?
五、未来会怎样?
我不知道。但我知道,如果继续装瞎,AI的路会越走越窄。
有一个趋势我很看好:大模型出题,小模型评分。让一个专门负责“挑错”的模型去验证另一个模型的输出。听起来像辩论赛?对,就是让AI互相打脸。这也许是成本最低的可信机制。
还有一个是数据谱系——记录每一条数据从哪来、怎么清洗、怎么标注。它不能直接解决可信问题,但至少给审计留了线索。靠谱吗?比什么都没有强。
先说这么多吧。这些事情,说起来轻飘飘,做起来真是掉头发。但总得有人去做,对吧?