Synthesiaは、TechCrunchのジャーナリストであるDominic-Madori Davisのインタラクティブなデジタル版を、彼女を複数の角度から撮影し、2分間の音声を録音した後に作成した。結果は、単に書かれた文章を読み上げる画像ではなかった。Avatarは質問を聞いてテキストに変換し、次に言語モデルを使って回答を作成し、その回答を音声に変換する。一方、動画モデルは話している間の人物の表情を動かす。
ジャーナリストは、ベンチャーキャピタルの支援を受けたスタートアップ企業で、支援を受けていない企業と比べて不正行為の事例が増加している理由について執筆した記事を、インタラクティブ版の訓練に使用することを選んだ。そのため、このツインは「決定論的」だった。つまり、準備された範囲内でしか回答せず、その範囲外の質問は元の記事へと誘導する。
デジタルツインはどのように構築されたのか?
Synthesiaのチームは、モデルの作成に数日を要した。ジャーナリストは、自分が提供した文章を読み上げるパーソナル版と、聞いて回答できるインタラクティブ版を受け取った。また、眼鏡をかけた状態と、かけていない状態の選択肢もあった。このシステムは、動画と音声にSynthesiaのモデルを使用するほか、Cartesia、ElevenLabs、Google、OpenAIの代替モデルを選択できる。さらに、顧客が選んだクラウド、またはSynthesia上でツインをホスティングする選択肢も用意されている。
同社は、これらの機能を主に3つのカテゴリーに分類している。従来型のAvatarsを使って動画を作成・配信するプラットフォーム、アンケートやシミュレーション演習向けのインタラクティブなSessionsプラットフォーム、そして音声・動画モデルを他のサービスと統合し、インタラクティブなAvatarsやさまざまな製品を構築できるAPIだ。
この実験は何を明らかにするのか?
ジャーナリストは、パーソナル版の音声は自分の声に近いと感じたが、友人たちはインタラクティブ版の類似性について、説得力がやや低いと考えた。それでも、十分に不気味さを感じさせる存在感があり、彼女の両親は家族しか答えを知らない個人的な質問を投げかけようとした。しかし、訓練によって設けられた制限のため、回答を得ることはできなかった。
この結果は、範囲を限定されたAvatarと、オープンな会話モデルによって動作する版との重要な違いを示している。前者は比較的予測しやすいが、訓練された資料の外では有用性が限られる。後者はより柔軟に見える一方、捏造された回答や、制御が難しい行動が生じる余地を広げる。
なぜこのニュースが重要なのか?
著者は、ジャーナリズムにおける潜在的な利用こそが最も重要な問いだと考えている。ニュースをデジタルな人物が伝えることを、一般の人々は受け入れるのだろうか。また、Avatarがジャーナリストの代わりになったり、経営幹部が本人ではなくジャーナリストのデジタル版に話しかけられるようになったりする可能性はあるのだろうか。彼女の立場は、重要な一点において明確だ。ジャーナリズムの本質は信頼であり、その要素を人工知能に容易に委ねられるとは考えていない。
メディア以外では、このアイデアは企業や個人にとって、より魅力的かもしれない。デジタル版は、本人が不在の間に質問へ回答したり、研修や従業員・顧客向けサービスを支援したりできる。しかし、この実験は、こうしたモデルが人間に取って代わる準備が整っていることを証明するものではない。むしろ、回答の範囲を管理し、音声と画像の利用に同意することが、その設計において依然として中心的な要素であることを示している。
より広範な利用をめぐる疑問は、依然として残されている。一般の人々は、いつ自分が人工的な版と話していると知るのか。誤った回答について誰が責任を負うのか。そして、デジタルツインが実用的なインターフェースから、利用者に自らが持っていない自律性や知識を持つと誤認させる人物へと変わるのを防ぐ境界線はどこにあるのか。これらは、技術が必ず特定の方向に発展するという約束に基づくものではなく、実験そのものの性質に基づく問いである。