自然语言处理:原来AI真的能读懂你发的半句话?
昨天早上赶地铁,给产品经理发了半句话:「那个NLP的需求,改下,别卡敏感词」,对方十秒就回了改好的原型。换十年前,我得把这句话拆成五百字需求文档,对方还得问三遍「敏感词规则是哪个版本来着?」。
这其实就是最朴素的自然语言处理——懂没说全的意思,接跳脱的话头。
手机端日常自然语言处理应用场景图
很多人觉得自然语言处理就是搞AI聊天,太窄了。它本质上就是让机器听懂人类的语言,不管是文字还是语音,把人类说的话,变成机器能处理的信号,再把机器的结果变成人能看懂的话。就这么回事。
自然语言处理技术演进阶段对比图
不过话说回来,不是说有了大模型,原来的技术就没用了。你现在做输入法分词,用老方法比大模型快多了,还省算力,犯不上杀鸡用牛刀对吧。
别神话,它至今还有搞不定的坎
我见过太多项目负责人,一开口就是「不就是语义理解吗,大模型都出来了,一周给我上线」,每次听到我都头大。自然语言处理能做到今天这个程度,真的不代表它完美了。
它搞不定的事儿多了去了。比如你说「我今天跟小王去咖啡店,他买单,他真大方」,这里两个他,谁都知道都是小王,AI大部分时候也能对。那换一句:「小王跟小张说他老板太抠门,他真的忍不了了」,你说这里两个「他」分别指谁?是小王忍不了,还是小张忍不了,还是他老板忍不了?别说AI了,有时候人脱离上下文都猜不对,对吧?
还有言外之意,人类说话最喜欢拐弯抹角,你对象跟你说「今天的奶茶有点甜」,可能意思是她嫌甜了,下次别买全糖,AI能读出字面意思,能读出潜台词吗?大部分时候不行。自然语言处理现在能懂「话」,但还远做不到真的懂「人」。
更别说风险了,现在诈骗分子用自然语言处理生成你家人的声音,几秒钟就能骗走打工人辛辛苦苦攒的几万块。还有人用它批量生成造谣文案,一分钟能发几百篇,防都防不住。技术本身没好坏,但用在歪地方,坑人坑得太狠了。
说实话,做这行越久,越不敢吹自然语言处理有多神。它确实方便了我们的生活,帮我们省了好多重复劳动,原来要几十个人翻一个月的资料,现在大模型几个小时就能出初稿,原来要一百个客服接的咨询,现在智能客服能接八成,这些都是实打实的好处。
但它还是有边界,还是会翻车,还是需要人不断调,不断改。下次你跟AI聊天,它顺顺当当接住了你没说全的话,别觉得是什么遥不可及的黑科技,那是好几代工程师抠了几十年细节,一个坑一个坑踩出来的结果。
要真让AI像你身边的朋友一样,懂你的欲言又止,懂你的言外之意,还差得远呢。
你天天用,却没察觉它存在
大部分人对自然语言处理的认知,只停留在大模型聊天,其实它早就在你手机里躺了十几年。 你输入法打出「今天去超市买」,它自动跳出「水果」「菜」,不是瞎蒙的,是它学过几十万中国人的说话习惯,知道你接下来大概率会说什么。你收快递的时候填地址,系统自动把省市区街道分开,不用你一个个选框填,也是它在干活。甚至你手机拦截诈骗短信,把广告推去垃圾邮箱,全靠自然语言处理先扫一遍,判断这东西是不是你要的。 说实话,我刚入行的时候,第一个项目就是做短信拦截,那时候为了调准诈骗关键词,翻了上万条垃圾短信,翻到眼睛都花了。那时候哪想到十几年后,这玩意儿能直接生成一篇长篇小说啊。
手机端日常自然语言处理应用场景图
很多人觉得自然语言处理就是搞AI聊天,太窄了。它本质上就是让机器听懂人类的语言,不管是文字还是语音,把人类说的话,变成机器能处理的信号,再把机器的结果变成人能看懂的话。就这么回事。
从抠字典到懂语境,踩过数不清的坑
我师傅跟我讲过九十年代的自然语言处理,那时候全靠人写规则。做中文分词,就得手动编词典,把所有词都录进去,碰到没录的词,直接歇菜。 最经典的例子就是「南京市长江大桥」,按老规则拆,会拆成「南京 市长 江大桥」,你说扯不扯?那时候为了补这些歧义,工程师不知道熬了多少夜,加了不知道多少条规则,换个新领域,比如医疗报告,准确率瞬间掉一半。 后来有了统计机器学习,不用人手动写所有规则了,喂够数据,机器自己学分词规则,准确率一下子上去了。但那时候还是搞不定语义,你说「我把苹果放在桌子上」和「我用苹果发了个邮件」,两个苹果完全不是一个东西,机器经常搞混。 直到Transformer结构出来,预训练大模型火了,一切都变了。我第一次用BERT做语义识别的时候,那种震撼现在都记得——原来它真的能分清楚不同语境下的同一个词,原来它真能接住你说的半截话。 我打个比方,原来的自然语言处理,就像你让一个刚学中文的外国人,拿着字典逐字查你的话,查完拼起来理解意思,碰到俚语、歧义直接懵。现在的大模型自然语言处理,就像一个从小在中国长大的普通人,天天听人说话,看多了各类文章,潜移默化就懂了什么话在什么场合是什么意思,哪怕你没说全,也能猜个八九不离十。
自然语言处理技术演进阶段对比图
不过话说回来,不是说有了大模型,原来的技术就没用了。你现在做输入法分词,用老方法比大模型快多了,还省算力,犯不上杀鸡用牛刀对吧。
别神话,它至今还有搞不定的坎
别神话,它至今还有搞不定的坎
我见过太多项目负责人,一开口就是「不就是语义理解吗,大模型都出来了,一周给我上线」,每次听到我都头大。自然语言处理能做到今天这个程度,真的不代表它完美了。
它搞不定的事儿多了去了。比如你说「我今天跟小王去咖啡店,他买单,他真大方」,这里两个他,谁都知道都是小王,AI大部分时候也能对。那换一句:「小王跟小张说他老板太抠门,他真的忍不了了」,你说这里两个「他」分别指谁?是小王忍不了,还是小张忍不了,还是他老板忍不了?别说AI了,有时候人脱离上下文都猜不对,对吧?
还有言外之意,人类说话最喜欢拐弯抹角,你对象跟你说「今天的奶茶有点甜」,可能意思是她嫌甜了,下次别买全糖,AI能读出字面意思,能读出潜台词吗?大部分时候不行。自然语言处理现在能懂「话」,但还远做不到真的懂「人」。
更别说风险了,现在诈骗分子用自然语言处理生成你家人的声音,几秒钟就能骗走打工人辛辛苦苦攒的几万块。还有人用它批量生成造谣文案,一分钟能发几百篇,防都防不住。技术本身没好坏,但用在歪地方,坑人坑得太狠了。
说实话,做这行越久,越不敢吹自然语言处理有多神。它确实方便了我们的生活,帮我们省了好多重复劳动,原来要几十个人翻一个月的资料,现在大模型几个小时就能出初稿,原来要一百个客服接的咨询,现在智能客服能接八成,这些都是实打实的好处。
但它还是有边界,还是会翻车,还是需要人不断调,不断改。下次你跟AI聊天,它顺顺当当接住了你没说全的话,别觉得是什么遥不可及的黑科技,那是好几代工程师抠了几十年细节,一个坑一个坑踩出来的结果。
要真让AI像你身边的朋友一样,懂你的欲言又止,懂你的言外之意,还差得远呢。