Synthesia 创建了 TechCrunch 记者 Dominic-Madori Davis 的互动数字版本,过程包括为她拍摄多张照片并录制两分钟的声音。最终结果并不只是一张朗读书面文本的图片,而是一个能够听取问题并将其转换为文本的 Avatar,然后利用语言模型拟定回答,再将答案转换为声音,同时由视频模型在说话时驱动这一角色的面部表情。
这名记者选择用自己撰写的一篇报道来训练互动版本,报道内容是:与未获得风险资本支持的初创公司相比,获得风险资本支持的初创公司为何会出现更多欺诈案件。因此,这个数字孪生是“确定性的”;也就是说,它只会在为其准备的范围内回答问题,并会将超出范围的问题重新引导至原始报道。
数字孪生是如何构建的?
Synthesia 团队花了几天时间创建这些模型。这名记者获得了能够朗读她提供文本的个人版本,以及能够听取问题并作出回答的互动版本,还可以选择佩戴眼镜或不佩戴眼镜的形象。该系统使用 Synthesia 的视频和音频模型,同时允许选择 Cartesia、ElevenLabs、Google 和 OpenAI 提供的替代模型,此外还可以选择将数字孪生托管在客户选定的云端,或托管在 Synthesia 自身的平台上。
公司将这些功能分为三大类:利用传统 Avatars 创建和分发视频的平台;用于调查和模拟训练的互动 Sessions 平台;以及允许将音频和视频模型与其他服务整合的 API,以构建互动 Avatars 或不同的产品。
这一实验揭示了什么?
这名记者发现,个人版本的声音与她本人相近,但她的朋友认为互动版本的相似度不那么令人信服。不过,其存在感仍足以产生一种诡异感,以至于她的父母试图提出只有家人知道答案的私人问题,但由于训练所施加的限制,他们没有得到回答。
这一结果说明了限定范围的 Avatar 与由开放式对话模型驱动的版本之间存在重要差异。前者相对而言具有可预测性,但在其训练材料之外的用途有限。后者看起来可能更加灵活,却为编造答案或难以控制的行为留下了空间。
为什么这条消息很重要?
作者认为,在新闻业中的潜在用途是最重要的问题:公众是否接受由数字人物提供新闻?Avatar 是否可以取代记者,或者让首席执行官与记者的数字版本交谈,而不是与记者本人交谈?她在一个基本问题上的立场很明确:新闻业的核心是信任,而她认为这一要素无法轻易委托给人工智能。
在媒体之外,这一想法对企业和个人可能更具吸引力;数字版本可以在其本人缺席时回答问题,或协助培训以及员工和客户服务。但这一实验并不能证明这些模型已经准备好取代人类,而是表明,对回答范围的控制,以及对声音和图像使用的授权,仍然是其设计的核心部分。
更广泛使用方面的问题仍然悬而未决:公众何时会知道自己正在与一个人工生成的版本交谈?错误回答由谁承担责任?哪些边界可以防止数字孪生从一个实用界面变成一个让用户误以为其拥有自主性或并不具备的知识的角色?这些问题源于实验本身的性质,而不是源于技术必然会朝着某个特定方向发展的承诺。