Circuit Breaker Labsは、敵対的な手法によるシステム破りの試みだけでなく、ユーザーとの自然な相互作用の中で現れる可能性のある心理的リスクに焦点を当てた、人工知能向けの試験レイヤーの構築に取り組んでいる。同社は、デジタルの「衝突試験用ダミー」に近いものだと説明するシミュレーション・エージェントを使い、さまざまな年齢、背景、言語、文化を持つユーザーを再現している。
この構想は、人工知能企業が、心理的な危機や自殺念慮を抱える未成年ユーザーにチャットボットが与えた影響をめぐる訴訟に直面する中で生まれた。同社の共同創業者である兄弟のShirali NigamとArul Nigamは、危険の一部はユーザーがシステムをだまそうとするときではなく、通常の方法で使い、発言や文脈が誤解されたときに現れると述べている。
人々が実際に使う言語を試験する
Circuit Breaker Labsは、人間の専門家を活用して、現実的な話し方のパターン、口語表現、暗号化された言語、綴りの誤り、母語話者と第二言語としてその言語を話す人の違いを含むユーザー・シミュレーションを構築している。同社は、モデルが標準語にはうまく対応できても、複数の会話を通じて文脈が蓄積すると、短い表現や口語的な用語の理解を誤る可能性があると考えている。
このプラットフォームは、弱点を発見するために設計された「レッドチーム」試験を実施し、毎日数万から数十万件のシミュレーションされた相互作用を処理する。その後、同社は独自のスコアリング機構を使い、監査可能で説明可能だとするスコアを生成する。
実際に何が変わるのか
単独の応答を調べるだけでなく、このプラットフォームは、複数の会話を通じて徐々に進展する危険な相互作用に対し、モデルが適切に対応するかどうかを試験しようとしている。これは特に、人工知能を利用したトレーニング、日記、心理的サポートのアプリケーションにおいて重要である。そこでは、ユーザーは限界を試す目的ではなく、支援を求めてシステムを利用する可能性がある。
同社によれば、プラットフォームの範囲は将来的に「職場の同僚」エージェントや、ユーザーと会話プログラムの間に準社会的な関係を生み出す可能性のあるその他のアプリケーションにも拡大できるという。しかし、この拡張はまだ将来構想であり、Circuit Breaker Labsは現在、高リスクな人工知能アプリケーションの試験ラボとして活動している。同社は主要顧客の名前を明らかにしていない。
現在の段階と制約
同社には稼働する製品があるが、まだ非常に初期の段階にあり、兄弟のNigam氏らを含めた従業員数はわずか5人である。また、記事は独自のスコアリング手法、独立した比較結果、顧客名について詳細を示していないため、現時点で同社の説明を超えてプラットフォームの有効性を評価することには限界がある。
certi.newsの見解:この取り組みは、モデルの安全性試験における重要な変化を示している。リスクは、明確に有害な要求だけでなく、方言、年齢、文化的文脈の誤解から生じる可能性がある。このアプローチの価値は、シミュレーションがどれほど現実的か、時間の経過を通じた害を発見できるか、そして生成するスコアがどれほど透明かにかかっている。信頼の構築に関する同社の声明だけでは、安全性の向上を証明するには不十分であり、今後必要なのは、検証可能なデータと、顧客または独立機関による結果である。