La empresa Synthesia creó una versión digital interactiva de la periodista de TechCrunch Dominic-Madori Davis, después de capturar varias imágenes de ella y grabar dos minutos de su voz. El resultado no fue simplemente una imagen que recita un texto escrito, sino un Avatar que escucha las preguntas y las convierte en texto; después utiliza un modelo lingüístico para formular la respuesta y transforma la respuesta en voz, mientras un modelo de video mueve los rasgos del personaje durante el habla.
La periodista eligió entrenar la versión interactiva con una historia que escribió sobre las razones del aumento de los casos de fraude en empresas emergentes respaldadas por capital de riesgo en comparación con las que no cuentan con ese respaldo. Por ello, el gemelo era “determinista”; es decir, solo responde dentro del ámbito para el que fue preparado y redirige las preguntas que quedan fuera de él hacia la historia original.
¿Cómo se construyó el gemelo digital?
El equipo de Synthesia necesitó unos días para crear los modelos. La periodista obtuvo versiones personales que leen los textos que se les proporcionan y versiones interactivas capaces de escuchar y responder, con opciones con gafas o sin ellas. El sistema utiliza los modelos de Synthesia para video y voz, y permite elegir modelos alternativos de Cartesia, ElevenLabs, Google y OpenAI, además de opciones para alojar el gemelo en la nube elegida por el cliente o en Synthesia.
La empresa sitúa estas capacidades dentro de tres categorías principales: una plataforma para crear y distribuir video utilizando Avatars tradicionales; la plataforma interactiva Sessions para encuestas y ejercicios de simulación; y una interfaz API que permite integrar modelos de voz y video con otros servicios para crear Avatars interactivos u otros productos.
¿Qué revela el experimento?
La periodista comprobó que la voz era cercana a la suya en la versión personal, pero sus amigos consideraron que el parecido en la versión interactiva era menos convincente. Aun así, la presencia fue suficiente para producir una sensación de extrañeza, hasta el punto de que sus padres intentaron hacer preguntas personales cuyas respuestas solo conocen los miembros de la familia, sin obtener respuesta debido a las restricciones impuestas por el entrenamiento.
Este resultado muestra una diferencia importante entre un Avatar de alcance controlado y una versión impulsada por un modelo conversacional abierto. El primero es relativamente predecible, pero su utilidad es limitada fuera del material con el que fue entrenado. El segundo puede parecer más flexible, pero abre la posibilidad de respuestas inventadas o comportamientos difíciles de controlar.
¿Por qué es importante esta noticia?
La autora considera que el posible uso en el periodismo es la cuestión más importante: ¿aceptará el público que las noticias sean presentadas por una personalidad digital? ¿Puede un Avatar sustituir al periodista o permitir que los directores ejecutivos hablen con una versión digital del periodista en lugar de hacerlo con la persona misma? Su postura es clara en un punto fundamental: la esencia del periodismo es la confianza, y no cree que este elemento pueda delegarse fácilmente en la inteligencia artificial.
Fuera de los medios, la idea puede resultar más atractiva para empresas y particulares, ya que una versión digital podría responder preguntas durante la ausencia de su propietario o ayudar en la capacitación y la atención de empleados y clientes. Sin embargo, el experimento no demuestra que estos modelos estén preparados para sustituir a los seres humanos, sino que muestra que el control del alcance de la respuesta y el consentimiento para utilizar la voz y la imagen siguen siendo elementos centrales de su diseño.
Siguen abiertas las preguntas sobre un uso más amplio: ¿cuándo sabrá el público que está hablando con una versión artificial? ¿Quién asumirá la responsabilidad por una respuesta incorrecta? ¿Y qué límites impedirán que el gemelo digital pase de ser una interfaz práctica a una personalidad que haga creer al usuario que posee una autonomía o unos conocimientos que no tiene? Estas preguntas se basan en la naturaleza del propio experimento, no en la promesa de que la tecnología evolucionará necesariamente en una dirección determinada.