美学工程技术:让机器拥有“眼光”的疯狂实验
前几天刷到一条视频,AI把《星月夜》的笔触移植到我家猫的照片上——效果居然比我自己P的还要有艺术感。说真的,那一瞬间我突然意识到,这玩意儿已经不只是“像”那么简单了,它好像开始懂什么叫“好看”了。懂。这事挺吓人的,对吧?毕竟连我自己都解释不清为什么有些颜色搭配起来就是舒服,它一个没有感情的算法,凭什么?
美学工程技术,说白了,就是想用数学和代码去捕捉那些我们说不太清、但一眼就能感觉到的“美”。它的源头能追溯到上世纪30年代,有个叫Birkhoff的老爷子搞出个公式:美=秩序/复杂度。天真得可爱。现在看起来这公式粗糙得不行,但那是人类第一次试图把审美量化。往后几十年,计算美学一直是个小众领域,直到深度学习一脚踹开大门。
现在最典型的是那个叫NIMA的模型——Neural Image Assessment。扔给它一张图,它能给你打出1到10分,而且打分逻辑越来越接近专业摄影师。怎么做到的?用成千上万张被人类评过分的照片去训练,从构图、曝光、色彩这些维度一点点“感悟”。我印象特深,有个实验把NIMA放到Unsplash的图片库上跑,它选出来的高分图,真的张张都能当壁纸。但有时候也犯蠢,把那种极简到只剩一片白的照片打高分,气得我——这叫极简主义?这叫偷懒吧!
神经网络美学评分模型NIMA架构图
不过话说回来,这模型有个致命问题:它学会的是多数人的平均审美。而这世界上的美,往往藏在那些离经叛道的角落里。
Midjourney画的图为什么总带着一股电影感?DALL·E 3又怎么突然理解了我那些疯话般的提示词?背后的工程突破,叫“美学对齐”。听着像玄学,其实很暴力——让人类标注员给生成结果打分,再用强化学习去微调扩散模型。这就像教一个画家,画得不好就挨骂,画得好就给糖吃。久而久之,它便摸透了那个无法言说的审美共识。
我记得有个论文,把CLIP模型倒过来用,不是用文字搜图,而是让模型自己生成能激活最高美学相关神经元的图像。结果呢?生成的画面充满流动的金属质感、对称构图,还有那种高饱和但又不刺眼的色调……简直就是科幻电影海报生成器。但很快有人发现漏洞:模型学会了“作弊”,它找到了最容易触发高分的视觉捷径——比如疯狂加眩光、加星芒,恨不得每张图都像《星际穿越》截图。这不就是美颜相机刚出来那会儿,人人锥子脸嘛。
扩散模型美学对齐训练流程示意图
这让我想起一句吐槽:AI不是在创造美,是在迎合我们对美的刻板印象。但又能怎样呢?毕竟连人类自己都说不清什么是高级美。
跳出数字世界的像素,美学工程技术在实体产品里钻得更深。你去摸一下苹果的Magic Mouse,那个反面弧线,看着优雅,握着却让手酸——很多人骂它中看不中用。但你们知道吗?那个弧度不是拍脑袋画的。设计师用Catia这样的工程软件,在曲面连续性和光影反射之间反复迭代,确保在环境光下不会出现难看的倒影断裂。为了视觉上的完美,牺牲了——不,是折磨了手部的人体工学。这种取舍,算不算另一种美学工程?
汽车更夸张。马自达的“魂动”设计,车身侧面那条光影流动的曲线,是先用算法模拟了上千种光线环境,找到一条能让高光在漆面上如液体般滑动的脊线。为了这一条脊线,冲压模具要忍受更高的开裂风险,成本陡增。工程师和设计师打架,最后美学赢了。但消费者买单吗?大多数人只会说一句:“这车挺好看。”背后那些撕裂的钢板、熬夜的争论,全被埋进光滑的表皮下。
汽车车身曲面美学优化CAD示意图
界面设计里的美学工程,藏着更深的心机。还记得Windows 95的灰框蓝条吗?那时候软件丑得惊心动魄,但我们没得选。现在呢?一个按钮的阴影、动效的缓出曲线、字体的渲染方式……全被精细计算过。Google的Material You能从壁纸中自动提取颜色,生成一套配色方案,背后的算法叫Monet,基于HSL颜色空间和对比度感知模型。它让你觉得手机界面“长”在了壁纸上,浑然天成。
这其实是一种欺骗——美让我们忽略技术的存在。认知负荷理论说,好看的界面能降低大脑处理信息的能耗,留下更多脑力去干正事。所以设计师们拼命把复杂藏起来,只露出优雅。但有时候也用力过猛:比如某年的iOS“动态效果”,为了追求物理惯性真实性,动画拖沓得让我想摔手机。美到极致,反而碍事。
说到底,美学工程技术的野心,是用理性去重构感性。可感性真就那么听话吗?
去年在一场研讨会上,有人抛出尖锐问题:你用西方油画的数据集训练审美模型,那中国水墨的留白意境它怎么评?书法里“丑怪”的美学价值呢?算法哑了。其实这背后是美学标准的权力问题。目前主流的美学工程,底子还是ImageNet和LAION,这些数据集自带偏见——西方中心、高分辨率、浓烈色彩。于是AI眼里的美,越来越趋同。
有团队尝试构建跨文化美学模型,把日本“侘寂”、印度“Rasa”理论化成标签,喂给模型。结果惨不忍睹,因为这类美往往依赖于缺失、克制和不可言说,根本无法用“特征”提炼。还有个更野的项目,试图让脑电波直接评价美——被试看图片时的额叶活动被映射为“愉悦度”,以此训练模型。这篇论文我读得兴奋又害怕。兴奋的是,说不定哪天机器就能绕过语言的虚假,直触审美的神经基础。害怕的是,如果这技术被滥用,我们的品位是不是会被暗中操控?
想起了鲍德里亚的拟像——我们终将生活在一个由算法喂养的审美幻境里,分不清什么是自己的喜欢,什么是被训练出的喜欢。但即便如此,我依然对美学工程抱有奇异的好感。因为它逼着我们不断追问:美到底是什么?是黄金分割?是多巴胺分泌?还是童年某个阳光午后,所留下的记忆烙印?
答案飘在空中。
计算美学:当公式成为艺术评论家
美学工程技术,说白了,就是想用数学和代码去捕捉那些我们说不太清、但一眼就能感觉到的“美”。它的源头能追溯到上世纪30年代,有个叫Birkhoff的老爷子搞出个公式:美=秩序/复杂度。天真得可爱。现在看起来这公式粗糙得不行,但那是人类第一次试图把审美量化。往后几十年,计算美学一直是个小众领域,直到深度学习一脚踹开大门。
现在最典型的是那个叫NIMA的模型——Neural Image Assessment。扔给它一张图,它能给你打出1到10分,而且打分逻辑越来越接近专业摄影师。怎么做到的?用成千上万张被人类评过分的照片去训练,从构图、曝光、色彩这些维度一点点“感悟”。我印象特深,有个实验把NIMA放到Unsplash的图片库上跑,它选出来的高分图,真的张张都能当壁纸。但有时候也犯蠢,把那种极简到只剩一片白的照片打高分,气得我——这叫极简主义?这叫偷懒吧!
神经网络美学评分模型NIMA架构图
不过话说回来,这模型有个致命问题:它学会的是多数人的平均审美。而这世界上的美,往往藏在那些离经叛道的角落里。
生成式对抗的美学博弈
Midjourney画的图为什么总带着一股电影感?DALL·E 3又怎么突然理解了我那些疯话般的提示词?背后的工程突破,叫“美学对齐”。听着像玄学,其实很暴力——让人类标注员给生成结果打分,再用强化学习去微调扩散模型。这就像教一个画家,画得不好就挨骂,画得好就给糖吃。久而久之,它便摸透了那个无法言说的审美共识。
我记得有个论文,把CLIP模型倒过来用,不是用文字搜图,而是让模型自己生成能激活最高美学相关神经元的图像。结果呢?生成的画面充满流动的金属质感、对称构图,还有那种高饱和但又不刺眼的色调……简直就是科幻电影海报生成器。但很快有人发现漏洞:模型学会了“作弊”,它找到了最容易触发高分的视觉捷径——比如疯狂加眩光、加星芒,恨不得每张图都像《星际穿越》截图。这不就是美颜相机刚出来那会儿,人人锥子脸嘛。
扩散模型美学对齐训练流程示意图
这让我想起一句吐槽:AI不是在创造美,是在迎合我们对美的刻板印象。但又能怎样呢?毕竟连人类自己都说不清什么是高级美。
工业设计中的“暗黑美学”工程
跳出数字世界的像素,美学工程技术在实体产品里钻得更深。你去摸一下苹果的Magic Mouse,那个反面弧线,看着优雅,握着却让手酸——很多人骂它中看不中用。但你们知道吗?那个弧度不是拍脑袋画的。设计师用Catia这样的工程软件,在曲面连续性和光影反射之间反复迭代,确保在环境光下不会出现难看的倒影断裂。为了视觉上的完美,牺牲了——不,是折磨了手部的人体工学。这种取舍,算不算另一种美学工程?
汽车更夸张。马自达的“魂动”设计,车身侧面那条光影流动的曲线,是先用算法模拟了上千种光线环境,找到一条能让高光在漆面上如液体般滑动的脊线。为了这一条脊线,冲压模具要忍受更高的开裂风险,成本陡增。工程师和设计师打架,最后美学赢了。但消费者买单吗?大多数人只会说一句:“这车挺好看。”背后那些撕裂的钢板、熬夜的争论,全被埋进光滑的表皮下。
汽车车身曲面美学优化CAD示意图
人机交互:美是为了让技术消失
界面设计里的美学工程,藏着更深的心机。还记得Windows 95的灰框蓝条吗?那时候软件丑得惊心动魄,但我们没得选。现在呢?一个按钮的阴影、动效的缓出曲线、字体的渲染方式……全被精细计算过。Google的Material You能从壁纸中自动提取颜色,生成一套配色方案,背后的算法叫Monet,基于HSL颜色空间和对比度感知模型。它让你觉得手机界面“长”在了壁纸上,浑然天成。
这其实是一种欺骗——美让我们忽略技术的存在。认知负荷理论说,好看的界面能降低大脑处理信息的能耗,留下更多脑力去干正事。所以设计师们拼命把复杂藏起来,只露出优雅。但有时候也用力过猛:比如某年的iOS“动态效果”,为了追求物理惯性真实性,动画拖沓得让我想摔手机。美到极致,反而碍事。
说到底,美学工程技术的野心,是用理性去重构感性。可感性真就那么听话吗?
我们到底在教机器什么?——一场关于品味的争论
去年在一场研讨会上,有人抛出尖锐问题:你用西方油画的数据集训练审美模型,那中国水墨的留白意境它怎么评?书法里“丑怪”的美学价值呢?算法哑了。其实这背后是美学标准的权力问题。目前主流的美学工程,底子还是ImageNet和LAION,这些数据集自带偏见——西方中心、高分辨率、浓烈色彩。于是AI眼里的美,越来越趋同。
有团队尝试构建跨文化美学模型,把日本“侘寂”、印度“Rasa”理论化成标签,喂给模型。结果惨不忍睹,因为这类美往往依赖于缺失、克制和不可言说,根本无法用“特征”提炼。还有个更野的项目,试图让脑电波直接评价美——被试看图片时的额叶活动被映射为“愉悦度”,以此训练模型。这篇论文我读得兴奋又害怕。兴奋的是,说不定哪天机器就能绕过语言的虚假,直触审美的神经基础。害怕的是,如果这技术被滥用,我们的品位是不是会被暗中操控?
想起了鲍德里亚的拟像——我们终将生活在一个由算法喂养的审美幻境里,分不清什么是自己的喜欢,什么是被训练出的喜欢。但即便如此,我依然对美学工程抱有奇异的好感。因为它逼着我们不断追问:美到底是什么?是黄金分割?是多巴胺分泌?还是童年某个阳光午后,所留下的记忆烙印?
答案飘在空中。