Das Unternehmen Synthesia erstellte eine interaktive digitale Version der TechCrunch-Journalistin Dominic-Madori Davis, nachdem mehrere Bilder von ihr aufgenommen und zwei Minuten ihrer Stimme aufgezeichnet worden waren. Das Ergebnis war nicht bloß ein Bild, das einen geschriebenen Text vorliest, sondern ein Avatar, der Fragen anhört und in Text umwandelt, anschließend ein Sprachmodell zur Formulierung der Antwort nutzt und die Antwort in Sprache umwandelt, während ein Videomodell die Gesichtszüge der Figur beim Sprechen bewegt.
Die Journalistin entschied sich, die interaktive Version mit einer Geschichte zu trainieren, die sie über die Gründe für die höhere Zahl von Betrugsfällen bei durch Wagniskapital finanzierten Start-ups im Vergleich zu nicht entsprechend finanzierten Unternehmen geschrieben hatte. Daher war das Double „deterministisch“; das heißt, es antwortet nur innerhalb des Bereichs, auf den es vorbereitet wurde, und verweist Fragen außerhalb dieses Bereichs zurück auf die ursprüngliche Geschichte.
Wie wurde das digitale Double erstellt?
Das Team von Synthesia benötigte einige Tage, um die Modelle zu erstellen. Die Journalistin erhielt persönliche Versionen, die von ihr bereitgestellte Texte vorlesen, sowie interaktive Versionen, die zuhören und antworten konnten, jeweils mit Optionen mit oder ohne Brille. Das System verwendet die Video- und Sprachmodelle von Synthesia und bietet außerdem die Möglichkeit, alternative Modelle von Cartesia, ElevenLabs, Google und OpenAI auszuwählen. Hinzu kommen Optionen, das Double in der vom Kunden gewählten Cloud oder bei Synthesia zu hosten.
Das Unternehmen ordnet diese Möglichkeiten drei Hauptkategorien zu: einer Plattform zur Erstellung und Verbreitung von Videos mit herkömmlichen Avataren, der interaktiven Sessions-Plattform für Umfragen und Simulationstrainings sowie einer API, die die Integration von Sprach- und Videomodellen in andere Dienste ermöglicht, um interaktive Avatare oder andere Produkte zu entwickeln.
Was zeigt das Experiment?
Die Journalistin stellte fest, dass die Stimme in der persönlichen Version ihrer eigenen Stimme nahekam, doch ihre Freunde hielten die Ähnlichkeit in der interaktiven Version für weniger überzeugend. Dennoch reichte die Präsenz aus, um ein Gefühl des Unheimlichen zu erzeugen. Sogar ihre Eltern versuchten, persönliche Fragen zu stellen, deren Antworten nur Familienmitglieder kennen, erhielten jedoch wegen der durch das Training auferlegten Einschränkungen keine Antwort.
Dieses Ergebnis verdeutlicht einen wichtigen Unterschied zwischen einem Avatar mit festgelegtem Themenbereich und einer Version, die von einem offenen Konversationsmodell angetrieben wird. Ersterer ist relativ vorhersehbar, außerhalb des Materials, mit dem er trainiert wurde, jedoch nur begrenzt nützlich. Letzterer kann flexibler wirken, eröffnet aber Raum für erfundene Antworten oder schwer kontrollierbare Verhaltensweisen.
Warum ist diese Nachricht wichtig?
Die Autorin hält die mögliche Nutzung im Journalismus für die wichtigste Frage: Akzeptiert das Publikum, dass Nachrichten von einer digitalen Persönlichkeit präsentiert werden? Und könnte ein Avatar den Journalisten ersetzen oder es Vorstandsvorsitzenden ermöglichen, mit einer digitalen Version des Journalisten statt mit der Person selbst zu sprechen? Ihre Haltung ist in einem grundlegenden Punkt eindeutig: Das Wesen des Journalismus ist Vertrauen, und sie glaubt nicht, dass sich dieses Element ohne Weiteres an künstliche Intelligenz delegieren lässt.
Außerhalb der Medien könnte die Idee für Unternehmen und Einzelpersonen attraktiver sein; eine digitale Version könnte Fragen beantworten, während ihr Besitzer abwesend ist, oder bei der Schulung sowie bei der Betreuung von Mitarbeitern und Kunden helfen. Das Experiment belegt jedoch nicht, dass diese Modelle bereit sind, Menschen zu ersetzen. Es zeigt vielmehr, dass die Kontrolle über den Antwortbereich und die Zustimmung zur Nutzung von Stimme und Bild weiterhin zentrale Bestandteile ihrer Gestaltung sind.
Die Fragen einer weitergehenden Nutzung bleiben offen: Wann weiß das Publikum, dass es mit einer künstlichen Version spricht? Wer trägt die Verantwortung für eine falsche Antwort? Und wo liegen die Grenzen, die verhindern, dass sich das digitale Double von einer praktischen Benutzeroberfläche zu einer Persönlichkeit entwickelt, die dem Nutzer eine Eigenständigkeit oder ein Wissen vorgaukelt, über das sie nicht verfügt? Diese Fragen ergeben sich aus der Natur des Experiments selbst, nicht aus dem Versprechen, dass sich die Technologie zwangsläufig in eine bestimmte Richtung entwickeln wird.