인공지능으로 디자인된 음식 메뉴는 처음에는 전문적으로 보일 수 있지만, 많은 사용자는 그 안에서 불편한 무언가를 발견한다. 지나치게 똑같은 샌드위치, 완벽하게 둥근 아이스크림 공, 그림에 가까운 방식으로 흘러내리는 치즈, 또는 마치 자신의 꼬리를 삼키는 듯한 새우가 그 예다. 이러한 세부 요소가 반드시 이미지가 노골적으로 가짜라는 뜻은 아니지만, 실제 음식과는 다른 획일적이고 매끈한 외관을 만들어낸다.
이 글은 이러한 현상을 단순히 식당 메뉴 디자인의 시각적 오류가 아니라, 인공지능 출력의 수렴 문제로 다룬다. 생성형 모델은 방대한 데이터에서 패턴을 학습한 뒤, 버거 식당 메뉴를 만들어 달라는 요청에 적절하다고 판단하는 결과를 생성한다. 모델이 학습한 자료 자체가 이미 서로 비슷하다면, 결과물은 하나의 시각적 취향을 재활용하는 것에 가까워진다.
학습 데이터는 익숙한 형태를 지향하게 한다
Reality Defender의 기술 책임자인 Alex Lisle은 이러한 이미지 중 일부가 마치 어떤 낯선 존재가 피자의 기본 원리를 이해하지 못한 채 피자를 만들려는 것처럼 보인다고 말한다. 그는 그 원인이 모델이 기능을 추출한 데이터와 관련 있다고 본다. 패스트푸드 식당의 메뉴를 디자인해 달라는 요청을 받으면, 모델은 Wendy’s, Burger King, McDonald’s와 같은 유명 메뉴와 체인점을 참고할 수 있으며, 이 자료들은 실제로 서로 유사한 시각적 스타일을 공유한다.
그 결과는 특정 메뉴의 정확한 복사본이 아니라 가장 흔한 특징을 재현하는 혼합물이다. 이상적인 조명, 대칭적인 배치, 매끄러운 표면, 더 매력적이라고 여겨지는 색상이 여기에 포함된다. Elon University의 Imagining the Digital Future Center 소장인 Lee Rainie는 데이터 개선이 무난하고 불쾌감을 주지 않는 것으로 보이는 요소에 집중한다고 지적한다. 이러한 과정은 가장자리와 차이를 지워버리는 획일성으로 변할 수 있다.
인공지능으로 생성된 자료가 이후의 학습 데이터에 포함되면 문제는 더욱 심각해진다. Lisle은 이 경우와 모델 붕괴(Model Collapse)를 구분한다. 모델 붕괴는 한 모델의 출력물을 반복적으로 같은 모델에 다시 입력할 때 발생하는 더 심각한 시나리오로, 전반적인 품질 저하를 초래한다. 반면 그가 설명한 음식 메뉴에서 나타나는 현상은 결과의 다양성과 품질을 낮추는 수렴 또는 획일화이지만, 모델을 완전히 쓸모없게 만들 정도는 아니다.
반복적인 수정은 결함을 키울 수 있다
문제는 항상 최초의 이미지 생성에서만 발생하는 것은 아니다. Labtec이라는 이름을 사용하는 한 사용자는 X에서 ChatGPT를 통해 메뉴를 만든 뒤 100번 수정한 실험을 공개했다. 수정이 반복되면서 음식 이미지는 실제 음식과 점점 덜 비슷해졌고, 더욱 둥글고 부드러워졌다. 이 글은 TechCrunch가 실험을 반복한 결과 비슷한 결과를 확인했다고 전했다.
이 시나리오는 항목의 가격이나 이름, 또는 메뉴의 작은 세부 사항을 바꾸기 위해 생성 도구를 사용하는 식당에 중요하다. 각각의 수정은 개별적으로는 사소해 보일 수 있지만, 누적되면 이미지가 점차 자연스러운 모습에서 멀어질 수 있다. 이 경우 인공지능은 단순히 시간을 절약하는 도구가 아니라, 디자이너가 감추려는 인공적인 특징을 강화할 수 있는 편집 과정의 일부가 된다.
사람들은 왜 가짜라는 느낌을 포착할까?
Rainie는 사람들이 의심스러운 요소를 정확히 특정하지 못하더라도 생성된 이미지와 실제 이미지를 구분하는, 때로는 설명하기 어려운 능력을 지니고 있다고 본다. 이 글은 이러한 불편함을 언캐니 밸리 효과(Uncanny Valley)와 연결한다. 독일 Duisburg-Essen 대학교의 연구자들은 거의 실제처럼 보이는 음식 이미지가 명백히 가짜인 이미지보다 혐오감과 불편함을 더 유발할 수 있다는 사실을 발견했다.
음식의 경우 이 역설은 더욱 뚜렷하다. 전통적인 광고 역시 음식이 실제보다 더 좋아 보이도록 배치와 조명을 과장하는데, 광고 속 Big Mac 샌드위치 사진이 그 예다. 그러나 인공지능의 출력물은 이러한 미화가 음식의 익숙한 특성을 잃게 되는 수준까지 나아갈 수 있다. 손님이 치즈나 빵 또는 새우가 자신이 예상하는 방식으로 시각적으로 보이지 않는다는 사실을 알아차리면, 의도된 개선은 거부감의 원인으로 바뀐다.
실제로 무엇이 달라지는가?
식당이 얻는 교훈은 디자인에 인공지능을 사용하는 것이 모두 실패한다는 것이 아니라, 완벽한 외관에만 의존하면 신뢰를 해칠 수 있다는 점이다. 실제 음식을 정확히 나타내지 못하는 이미지는 손님의 기대와 경험 사이에 간극을 만들 수 있다. 또한 ‘아름다운 이미지’에 대한 모델의 기준으로 환원되지 않는 세부 사항을 알아차릴 수 있는 인간의 검토가 필요하다는 점을 보여준다.
그 의미는 음식 메뉴를 넘어선다. Lisle은 법정 시스템을 포함해 녹음과 사진에 특별한 지위를 부여해 온 역사적 관행처럼, 시각과 청각을 신뢰할 수 있는 증거로 의존하는 일이 이제는 예전만큼 안전하지 않다고 말한다. 실제 음식 이미지와 생성된 음식 이미지를 구분하기가 때로 어렵다면, 더욱 민감한 분야에서 시청각 콘텐츠를 검증하는 일은 단순히 미적인 문제가 아니라 실질적인 문제가 된다.
이 자료는 이 문제에 대한 최종적인 기술적 해결책을 제시하지 않으며, 인공지능으로 생성된 모든 메뉴가 거부감을 불러일으킨다고 입증하지도 않는다. 그러나 현재 모델의 중요한 한계를 보여준다. 폭넓게 받아들여질 수 있는 결과물을 만들려는 노력이 지역적이고 개별적인 특성을 제거한 뒤, 음식이나 다른 콘텐츠가 어떤 모습이어야 하는지에 대한 하나의 이미지를 반복적으로 만들어낼 수 있다는 점이다.