人工智能设计的菜单乍看之下可能很专业,但许多用户会注意到其中某些令人不适的地方:过于对称的三明治、完美圆形的冰淇淋球、以近似绘画的方式流淌的奶酪,或者看起来像在吞食自己尾巴的虾。这些细节并不一定意味着图片明显是假的,但会赋予它一种统一而光滑的外观,与真实食物有所不同。
本文将这一现象视为人工智能输出趋同的问题,而不仅仅是餐厅菜单设计中的视觉错误。生成式模型从海量数据中学习模式,然后针对“为汉堡餐厅创建菜单”之类的请求,生成其认为合适的回应。当模型接受训练的材料本身就很相似时,产出便更像是在重复利用一种视觉品味。
训练数据推动模型趋向熟悉的形式
Reality Defender技术总监Alex Lisle表示,其中一些图片看起来就像某种外来生物试图在不理解披萨基本原理的情况下制作披萨。他认为,原因与模型从中提取能力的数据有关。当被要求为一家快餐店设计菜单时,模型可能会参考Wendy’s、Burger King和McDonald’s等知名连锁品牌的菜单,而这些材料本身就共享相近的视觉风格。
结果并不是某一份特定菜单的完全复制,而是重新生成最常见的特征:理想化的灯光、对称的摆放、光滑的表面,以及被认为更具诱惑力的颜色。Elon University的Imagining the Digital Future Center主任Lee Rainie指出,数据优化侧重于看起来可接受且不具冒犯性的内容,这可能转变为一种同质化,抹去边缘特征和差异。
如果人工智能生成的材料进入后续训练数据集,问题会进一步恶化。Lisle将这种情况与模型崩溃(Model Collapse)区分开来。模型崩溃是一种更严重的情形,发生在模型输出被反复重新输入自身时,从而导致质量广泛下降。而据他的描述,菜单中出现的是趋同或同质化:它会减少结果的多样性和质量,但不会让模型彻底失去用途。
反复修改可能加剧缺陷
问题并不总是来自第一次生成图像。X平台上一名叫Labtec的用户展示了一项实验:他通过ChatGPT创建菜单,然后修改了100次。随着修改不断重复,食物图片看起来越来越不像真实食物,反而变得更加圆润和光滑。本文称,TechCrunch重复了这项实验,并发现了类似结果。
对于使用生成工具更改菜单中菜品价格、名称或细节的餐厅而言,这一情形十分重要。每次单独的修改看起来可能影响有限,但这些修改的累积可能会逐渐让图片偏离自然外观。在这种情况下,人工智能不再只是节省时间的工具,而会成为编辑循环的一部分,强化设计师试图隐藏的人工痕迹。
人们为什么会察觉到虚假感?
Rainie认为,人们有时具备一种难以解释的能力,能够区分生成图片和真实图片,即使他们无法指出可疑之处。本文将这种不适与所谓的恐怖谷效应(Uncanny Valley)联系起来。德国Duisburg-Essen大学的研究人员发现,与明显虚假的图片相比,看起来半真实的食物图片可能更容易引发厌恶和不适。
在食物方面,这种矛盾更加明显:传统广告本身通常会通过摆盘和打光来夸大食物,使其看起来比现实更好,就像广告中的Big Mac三明治图片一样。但人工智能的输出可能会把这种美化推向一个极端,使食物失去人们熟悉的特征。当顾客发现奶酪、面包或虾在视觉上并没有按照预期呈现时,有意为之的美化就会转变为反感的来源。
实际会发生什么变化?
对餐厅而言,启示并不是人工智能在设计中的所有应用都失败了,而是仅仅依赖完美外观可能损害信任。无法准确反映实际食物的图片可能造成顾客预期与实际体验之间的落差,同时也表明需要进行人工审核,由人来发现模型关于“漂亮图片”的标准无法概括的细节。
其意义并不局限于菜单。Lisle表示,历史上人们依赖视觉和听觉,将其视为可靠证据,包括法院系统赋予录音和图片特殊地位的做法,如今已不再同样安全。如果有时很难区分真实食物图片与生成图片,那么在更敏感的领域验证视听内容,就会成为一个不仅关乎审美、也关乎实际操作的问题。
来源并未为这一问题提供最终的技术解决方案,也没有证明每一份人工智能生成的菜单都会引发拒绝。但它说明了当前模型的一个重要局限:追求生成广泛可接受的输出,可能最终会消除地方性和个体性特征,随后重新生成一种关于食物或其他内容“应当呈现何种样子”的单一图像。