Un menu conçu par l’intelligence artificielle peut sembler professionnel au premier regard, mais de nombreux utilisateurs y remarquent quelque chose de dérangeant : des sandwichs trop symétriques, des boules de glace parfaitement rondes, du fromage qui coule d’une manière plus proche du dessin, ou des crevettes qui semblent avaler leur propre queue. Ces détails ne signifient pas nécessairement que l’image est manifestement fausse, mais ils lui donnent un aspect uniforme et lisse, différent de celui de la nourriture réelle.
L’article aborde ce phénomène comme un problème de convergence des résultats de l’intelligence artificielle, et non comme une simple erreur visuelle dans la conception d’un menu de restaurant. Les modèles génératifs apprennent des motifs à partir de quantités massives de données, puis produisent ce qu’ils considèrent comme une réponse appropriée à une demande telle que la création d’un menu pour un restaurant de hamburgers. Lorsque les documents sur lesquels ils ont été entraînés sont déjà similaires, le résultat se rapproche du recyclage d’un style visuel unique.
Les données d’entraînement favorisent la forme familière
Alex Lisle, directeur technique de Reality Defender, affirme que certaines de ces images semblent avoir été produites par une créature étrange tentant de préparer une pizza sans en comprendre les principes fondamentaux. Selon lui, la cause est liée aux données à partir desquelles les modèles ont acquis leurs capacités. Lorsqu’on demande de concevoir le menu d’un restaurant de restauration rapide, les modèles peuvent s’appuyer sur des menus et des chaînes connues comme Wendy’s, Burger King et McDonald’s, qui partagent déjà un style visuel assez proche.
Le résultat n’est pas une copie exacte d’un menu donné, mais un mélange qui reproduit les caractéristiques les plus courantes : l’éclairage idéal, la disposition symétrique, les surfaces lisses et les couleurs censées être les plus appétissantes. Lee Rainie, directeur de l’Imagining the Digital Future Center de l’Elon University, souligne que l’amélioration des données se concentre sur ce qui paraît acceptable et non offensant, ce qui peut se transformer en une uniformisation effaçant les aspérités et les différences.
Le problème s’aggrave lorsque des contenus générés par l’intelligence artificielle intègrent les ensembles de données d’entraînement ultérieurs. Lisle distingue cette situation de l’effondrement du modèle (Model Collapse). L’effondrement du modèle est un scénario plus grave qui apparaît lorsque les résultats d’un modèle sont réinjectés en lui-même à plusieurs reprises, ce qui entraîne une dégradation générale de la qualité. Ce qui apparaît dans les menus, selon sa description, relève plutôt d’une convergence ou d’une uniformisation qui réduit la diversité et la qualité des résultats sans rendre complètement le modèle inutile.
Les modifications répétées peuvent aggraver les défauts
Le problème ne vient pas toujours de la première génération de l’image. Un utilisateur de la plateforme X, sous le nom de Labtec, a présenté une expérience au cours de laquelle il a créé un menu avec ChatGPT, puis l’a modifié 100 fois. À mesure que les modifications se répétaient, les images de nourriture ressemblaient de moins en moins à de la nourriture réelle et devenaient plus rondes et plus lisses. L’article indique que TechCrunch a reproduit l’expérience et obtenu un résultat similaire.
Ce scénario est important pour les restaurants qui utilisent des outils génératifs afin de modifier les prix des articles, leurs noms ou de petits détails du menu. Chaque modification prise isolément peut sembler limitée, mais leur accumulation peut éloigner progressivement l’image de son apparence naturelle. Dans ce cas, l’intelligence artificielle n’est pas seulement un outil permettant de gagner du temps : elle devient un élément d’un cycle de retouche susceptible de renforcer les caractéristiques artificielles que le concepteur tente de dissimuler.
Pourquoi les gens perçoivent-ils l’impression de faux ?
Rainie estime que les gens possèdent parfois une capacité difficile à expliquer à distinguer une image générée d’une image réelle, même lorsqu’ils ne parviennent pas à identifier l’élément suspect. L’article relie ce malaise à ce que l’on appelle l’effet de la vallée dérangeante (Uncanny Valley). Des chercheurs de l’université de Duisburg-Essen, en Allemagne, ont constaté que les images de nourriture semblant presque réelles pouvaient susciter davantage de dégoût et de malaise que les images manifestement fausses.
Dans le cas de la nourriture, le paradoxe est plus évident : la publicité traditionnelle elle-même exagère généralement la disposition et l’éclairage des aliments pour les faire paraître meilleurs qu’ils ne le sont en réalité, comme dans les images publicitaires du Big Mac. Mais les résultats de l’intelligence artificielle peuvent pousser cet embellissement à un niveau où la nourriture perd ses caractéristiques familières. Lorsque le client remarque que le fromage, le pain ou la crevette ne se comportent pas visuellement comme il s’y attend, l’amélioration recherchée devient une source de répulsion.
Qu’est-ce qui change concrètement ?
La leçon pour les restaurants n’est pas que toute utilisation de l’intelligence artificielle dans la conception est vouée à l’échec, mais que se fier uniquement à une apparence parfaite peut nuire à la confiance. Les images qui ne représentent pas fidèlement la nourriture réelle peuvent créer un écart entre les attentes du client et son expérience, tout en soulignant la nécessité d’une révision humaine capable de repérer les détails que les critères du modèle concernant la « belle image » ne permettent pas de réduire à une formule.
La portée de cette observation dépasse les menus. Lisle affirme que le recours historique à la vue et à l’ouïe comme preuves fiables, notamment dans les systèmes judiciaires qui ont accordé une place particulière aux enregistrements et aux images, n’est plus aussi sûr. S’il est parfois difficile de distinguer une véritable image de nourriture d’une image générée, la vérification des contenus visuels et audio dans des domaines plus sensibles devient une question pratique, et pas seulement esthétique.
La source ne propose pas de solution technique définitive à ce problème et ne prouve pas que tous les menus générés par l’intelligence artificielle susciteront le rejet. Elle met toutefois en évidence une limite importante des modèles actuels : la recherche de résultats largement acceptables peut finir par éliminer les caractéristiques locales et individuelles, puis reproduire une représentation unique de ce à quoi la nourriture, ou tout autre contenu, devrait ressembler.