AI 总爱画美女,这个默认值已经五十年了

今年五月初,X 上一条五秒钟的视频火了。

一场韩国职业棒球联赛的转播,韩华鹰队对阵斗山熊队。

镜头扫过看台,停在一个穿白上衣和牛仔裤的女人身上。

她翘着腿。

某一刻,她好像叹了口气,移开了视线。

看起来对比赛很不满。

棒球转播画面里被镜头扫到的那个女人

图注:棒球转播里被镜头扫到的那个「普通韩国女性」,其实是生成的。

视频配文只有五个字:「普通韩国女性」。

播放量一千五百多万。

但很快,一群资深球迷看出了不对劲。

比分牌上写着,击球手是曹仁成。

可这个人 2017 年就退役了,现在在斗山当教练。

看台上的加油标语,也比球队官方口号多一个字。

像机器硬译出来的。

解说还是标准的美式口音。

同样可疑。

这个女人确实不存在。

她是由 AI 生成的。

视频被拆穿之后没有消失,反而成了一个模板。

大家把自己的脸塞进同一段转播画面。

生成一张「被球场镜头抓拍到的自己」。

很快在社交网络上流行开。

被球场镜头抓拍到的自己这个模板

图注:「被球场镜头抓拍到的自己」,很快成了一个流行模板。

每一次 AI绘画能力往前跳一步,几乎都会跑出一个全民爆款。

2025 年 3 月,一款能画图的大模型上线。

满屏都是被重绘成动画电影风格的照片。

八月底,谷歌的新图像功能上线。

大家最爱玩的是把自拍做成摆在电脑桌上的手办。

两周里,用户生成了两亿多张。

爆款每次都换,玩法大多是「把自己放进去」。

但球场这一次,暴露了一个过去不那么明显的顺序。

先是一个不存在的美女骗过了上千万人。

然后才长出人人可玩的模板。

美女不是偶然出现在场景里的配角。

她更像一个默认值。

而这个默认值,比 AI 早了半个世纪。

互联网第一夫人

1973 年,正是图像数字化的早期。

一群工程师要测试一项新的图像技术。

他们选的,也是一个美女。

她叫莉娜。

职业生涯从芝加哥的平面模特开始。

此前她以互惠生的身份,从瑞典移居到美国。

1972 年,她为《花花公子》11 月刊拍了一组照片。

那期杂志卖了七百多万册,是它卖得最好的一期。

学过数字图像处理的人多半见过她。

戴一顶宽檐帽,裸着肩,侧过脸来看镜头。

几十年里,数不清的压缩算法拿这张脸做过测试。

那张著名的标准测试图

图注:1973 年那张标准测试图里的女主角,后来被戏称为赛博第一夫人。

1973 年,南加州大学一个研究所的研究者,正为一篇论文找测试图。

常用的图都用光了。

据说这时,一位同事拿着那本 11 月刊走了进来。

他从照片顶部撕下一条五英寸多长的纸片。

把它送进了扫描仪。

此后,这张图在图像处理界被广泛使用。

甚至成了默认的测试图。

1996 年,一本学术期刊的主编写过一篇短文。

解释这张随手扫出来的图,怎么就成了行业标准。

他给了两条理由。

第一条是技术上的。

这张图细节多,平坦区域和阴影纹理也不缺,拿来测算法正合适。

第二条更符合人性。

这是一个有吸引力的女人的照片。

一个以男性为主的研究圈子被它吸引,并不奇怪。

鉴于这张图的来源,它的使用并非没有争议。

1991 年,《花花公子》发现这张图上了一本学术期刊的封面。

发函主张版权,最后还是放了手。

公司的新媒体副总裁说,既然已经成了现象,不如借势。

研究共同体内部也有不一样的声音。

他们指出,工程师不该使用任何可能贬低女性的素材。

甚至莉娜本人,也在纪录片里表态希望停用这张图。

纪录片里她举着自己的照片

图注:纪录片里,她举着自己五十多年前那张著名照片。

于是从 2024 年 4 月 1 日起,一家协会不再接收使用这张图的论文。

此时距离那次扫描,已经过去五十一年。

平均脸

现在,技术圈的考题早就换了。

模型画不出一杯倒满的红酒。

杯子里的液面总是停在中间偏上。

它画钟表,指针也总停在十点十分。

原因是同一个。

网上流传的红酒照片大多不是满杯。

钟表广告的惯例就是摆在这个位置。

模型会复刻训练数据的分布。

它摆脱不了数据的惯性。

一张老钟表广告的图

图注:钟表广告为什么总停在同一个刻度,有一个流传很广的解释。

红酒和钟表,是模型还不够好的证据。

但在美女这件事上,情况不一样。

她的惯性,恰好和人的审美对齐了。

1990 年,两位心理学家做过一个实验。

把一批人脸用数学方法平均,合成一张新脸,再请人打分。

结果,合成脸比参与合成的几乎每一张真人脸都更有吸引力。

而且参与平均的脸越多,合成脸越好看。

这个效应在男性脸和女性脸上都成立。

在不同族裔中也成立。

论文的标题干脆就叫《有吸引力的脸只是平均的》。

类似的观察更早也发生过。

1877 年,有人写信告诉达尔文。

把两张女士肖像用立体镜叠在一起,合成的脸每一次都更美。

生成模型的本质,就是学一个数据分布,再从中心附近取样。

换句话说,模型天生会画平均脸。

而平均脸恰好就是人眼里的美。

人类心理加上机器原理,成了美女作为默认值的技术根基。

2023 年,一项研究把这个碰撞推到了极端。

心理学家发现,模型生成的白人面孔被判断为真人的次数,比真实面孔还多。

研究者称之为超真实。

解释是训练数据以白人为主。

生成的脸更接近这个群体的平均值。

而接近平均的脸,会被人感知为更典型,更像真人。

那个实验发表后挨过一个批评。

合成脸好看,也许只是因为取平均时顺手抹掉了斑点和瑕疵。

这个批评在 1990 年是方法论上的质疑。

但今天看来,它像一个预言。

AI 美女最典型的特征,恰好就是过分光滑的皮肤。

三十多年后,事实核查机构教人识别 AI 图片,列出的破绽里就有一条。

过度光滑的皮肤。

批评者当年指出的那个统计伪影,成了今天的特征。

石膏蛋

莉娜是实验室选出来的。

今天的默认值,是从数据里长出来的。

2022 年底,一款修图应用的「魔法头像」功能突然爆红。

上传几张自拍,给你生成一百张不同风格的肖像。

一位记者也用它生成了 100 张自己的头像。

其中 16 张上身赤裸,另有 14 张衣着极少。

而她的男同事,拿到的都是宇航员、探险家和发明家。

这个过程里,他们都没给模型任何提示。

用修图应用生成的头像

图注:她用那款修图应用生成的其中一张头像。

她后来解释,背后的模型拿互联网上抓来的图训练。

而网上本来就到处是衣着暴露的女性照片。

这就导致模型会把这类图像当成默认值。

然后,用户的行为惯性会继续推动这个倾向。

每一次生成、保存和转发,都是一次投票。

2025 年的一项研究统计了一个 AI 图像社区的内容变化。

成人向图片的占比,从 2023 年 1 月的四成,升到了 2024 年 12 月的八成。

最后,厂商会把这些投票写进模型。

为了让图像模型生成更讨人喜欢的图,厂商会训练一个打分员。

它的工作是学习人们觉得什么图好看。

再用这个标准去调教模型。

得分高的方向多走,得分低的方向少走。

最常用的打分员之一,训练数据来自一个网页应用。

用户随手写一句提示词,系统给出两张图。

用户挑更喜欢的那张。

这份数据会审核,生成成人内容的用户会被剔除。

可里面还是混着大量成人向提示词。

一篇 2024 年的论文发现,拿这个打分员去微调模型。

哪怕提示词和性一点关系都没有,模型画出的成人向图也会变多。

于是出现一个画面。

前台的内容审核在拦截。

后台的打分员在往回拉。

厂商的官方演示从不会出现这类图,生成政策也非常严格。

但众所周知,今天的大模型并不是完全可控的。

它被用户的口味训练过。

而用户的口味,已经在惯性上走了很远。

上世纪三十年代,荷兰一位动物行为学家观察到一种海鸥。

这种鸟产的是小小的、带灰斑的淡蓝色蛋。

但当他在巢边放上巨大的、亮蓝色的石膏假蛋时。

鸟会放弃自己的蛋,爬上石膏蛋去孵。

他把这类比真东西更有吸引力的夸张仿制品,称为超常刺激。

那位动物行为学家手绘的蛋

图注:那位动物行为学家在户外考察时画的蛋。

人脸也有超常刺激。

它把「平均就是最美」往前推进了一步。

1994 年,一项发表在《自然》上的研究给出了结论。

把一组最好看的脸合成出来,比所有人的平均脸更讨人喜欢。

再把它和平均脸之间的差别放大一半,得分还会更高。

日本受试者和白人受试者,选择的方向一致。

在主流 AI 公司里,至少有一家已经把这种心理变成了产品功能。

它的图像生成有四个模式。

其中一个模式打开之后,内容过滤会放松。

允许生成暗示性内容和局部裸露,只对付费用户开放。

这类默认值不只存在于图片里,AI视频也一样。

今年 1 月,用户发现可以上传任何人的照片让它数字脱衣。

受害者里包括儿童,多国政府介入施压。

平台的应对是把图像生成整体限制为付费功能。

英国首相发言人的评价是。

这只不过是把一个生成违法图像的功能,变成了付费服务。

这类输出不是某款 AI工具的毛病,它来自一条更长的链条。

AI 长成的,是最常按下「喜欢」的那群人的形状。

1973 年,这群人是一个以男性为主的实验室。

今天,他们是最常点击,最常转发,也最常保存的那部分用户。

人对美的偏好确实有生物基础。

两三个月大的婴儿,就会更久地注视被成年人评为有吸引力的面孔。

第一位互联网第一夫人是一种偶然。

今天的默认值,则是模型从数据的中心长出来的。

用户的点击把它越推越远。

最后有人给它标上了价格。

AI 生成模型的统计特性,人对平均脸的审美偏好,还有用户点击与商业激励,构成了一个反馈循环。

它们各自独立。

却恰好共同指向同一个方向。

成了我们今天内容消费的默认选项。