Компания Synthesia создала интерактивную цифровую копию журналистки TechCrunch Dominic-Madori Davis после съёмки нескольких её изображений и записи двух минут её голоса. В результате получилась не просто картинка, зачитывающая написанный текст: Avatar слушает вопросы и преобразует их в текст, затем использует языковую модель для формулировки ответа и превращает ответ в голос, а видеомодель одновременно анимирует черты лица персонажа во время речи.
Журналистка решила обучить интерактивную копию на материале, который она написала о причинах более высокой частоты случаев мошенничества в стартапах, финансируемых венчурным капиталом, по сравнению со стартапами, не получающими такого финансирования. Поэтому двойник был «детерминированным»: он отвечает только в пределах подготовленной для него области и перенаправляет вопросы, выходящие за её рамки, к исходному материалу.
Как был создан цифровой двойник?
Команде Synthesia потребовалось несколько дней для создания моделей. Журналистка получила персональные версии, зачитывающие предоставленные ею тексты, и интерактивные версии, способные слушать и отвечать, с вариантами в очках или без них. Система использует модели Synthesia для видео и голоса, а также позволяет выбирать альтернативные модели от Cartesia, ElevenLabs, Google и OpenAI. Кроме того, доступны варианты размещения двойника в облаке, выбранном клиентом, или у Synthesia.
Компания относит эти возможности к трём основным категориям: платформе для создания и распространения видео с использованием традиционных Avatars, интерактивной платформе Sessions для опросов и симуляционных упражнений, а также API, позволяющему интегрировать модели голоса и видео с другими сервисами для создания интерактивных Avatars или различных продуктов.
Что показывает этот эксперимент?
Журналистка обнаружила, что в персональной версии голос близок к её собственному, однако её друзья сочли сходство в интерактивной версии менее убедительным. Тем не менее присутствие было достаточно ощутимым, чтобы вызвать чувство странности: её родители даже пытались задавать личные вопросы, ответы на которые знают только члены семьи, но не получили ответа из-за ограничений, заданных в процессе обучения.
Этот результат демонстрирует важное различие между Avatar с ограниченной областью применения и версией, работающей на основе открытой разговорной модели. Первый относительно предсказуем, но мало полезен за пределами материала, на котором он обучен. Второй может казаться более гибким, но открывает возможности для выдуманных ответов или поведения, которое трудно контролировать.
Почему эта новость важна?
Автор считает, что главным вопросом является возможное использование технологии в журналистике: согласится ли аудитория получать новости от цифрового персонажа? Может ли Avatar заменить журналиста или позволить руководителям компаний разговаривать с цифровой копией журналиста вместо него самого? Её позиция ясна в одном принципиальном вопросе: суть журналистики — это доверие, и она не считает, что этот элемент можно легко передать искусственному интеллекту.
За пределами СМИ идея может быть более привлекательной для компаний и частных лиц: цифровая копия могла бы отвечать на вопросы в отсутствие своего владельца или помогать в обучении, а также в обслуживании сотрудников и клиентов. Однако эксперимент не доказывает, что эти модели готовы заменить людей; он показывает, что контроль над областью допустимых ответов и согласие на использование голоса и изображения остаются центральными элементами их проектирования.
Более широкие вопросы использования остаются открытыми: когда аудитория должна понимать, что разговаривает с искусственной копией? Кто несёт ответственность за ошибочный ответ? И какие границы не позволят цифровому двойнику превратиться из практичного интерфейса в персонажа, который создаёт у пользователя иллюзию самостоятельности или знаний, которыми он не обладает? Эти вопросы основаны на самой природе эксперимента, а не на обещании, что технология неизбежно будет развиваться в определённом направлении.