Компания Circuit Breaker Labs занимается созданием уровня тестирования искусственного интеллекта, ориентированного на психологические риски, которые могут возникать во время обычного взаимодействия с пользователями, а не только на попытки взломать систему с помощью агрессивных методов. Компания использует симуляционных агентов, которых она описывает как своего рода цифровые «манекены для краш-тестов», чтобы представлять пользователей разного возраста, происхождения, языка и культуры.
Эта идея появилась в период, когда компании, занимающиеся искусственным интеллектом, сталкиваются с исками, связанными с влиянием чат-ботов на несовершеннолетних пользователей, переживающих психологические кризисы или имеющих суицидальные мысли. Основатели компании, братья Shirali Nigam и Arul Nigam, говорят, что некоторые источники риска проявляются не тогда, когда пользователь пытается обмануть систему, а когда он использует её обычным образом, и его слова или контекст понимаются неправильно.
Тестирование языка таким, каким люди действительно его используют
Circuit Breaker Labs привлекает экспертов-людей для создания симуляций пользователей, включающих реалистичные речевые модели, разговорные выражения, зашифрованный язык, орфографические ошибки, а также различия между носителем языка и человеком, для которого этот язык является вторым. Компания считает, что модель может хорошо работать со стандартным языком, но ошибаться в понимании короткого выражения или разговорного термина, когда контекст накапливается в ходе нескольких разговоров.
Платформа проводит тесты в формате «красной команды», предназначенные для выявления уязвимостей, выполняя от десятков тысяч до сотен тысяч симулированных взаимодействий в день. Затем компания использует специальный механизм оценки для формирования показателей, которые, по её утверждению, поддаются аудиту и интерпретации.
Что меняется на практике?
Вместо того чтобы ограничиваться проверкой отдельных ответов, платформа пытается оценить, будет ли модель надлежащим образом реагировать на опасное взаимодействие, которое постепенно развивается в течение нескольких разговоров. Это особенно важно для приложений на основе ИИ для обучения, ведения дневников и психологической поддержки, где пользователь может обращаться к системе за помощью, а не с целью проверить её границы.
Компания говорит, что впоследствии область применения платформы может расшириться на агентов, выступающих в роли «коллег по работе», и другие приложения, способные создавать квазисоциальные отношения между пользователем и разговорной программой. Однако это пока лишь перспектива, поскольку Circuit Breaker Labs в настоящее время работает как лаборатория тестирования высокорисковых приложений искусственного интеллекта и не раскрыла имена своих основных клиентов.
Текущий этап и ограничения
У компании есть работающий продукт, но она всё ещё находится на очень раннем этапе, а число её сотрудников составляет всего пять человек, включая братьев Nigam. Кроме того, материал не содержит подробностей о специальной методике оценки, результатах независимого сравнения или именах клиентов, что пока ограничивает возможность оценить эффективность платформы за пределами описания самой компании.
Анализ certi.news: Эта инициатива свидетельствует о важном изменении в тестировании безопасности моделей: риск может возникать из-за неправильного понимания диалекта, возраста или культурного контекста, а не только из-за явно вредоносного запроса. Ценность такого подхода будет зависеть от реалистичности симуляции, её способности выявлять вред с течением времени и прозрачности создаваемых ею показателей. Заявлений компании о создании доверия недостаточно, чтобы самостоятельно доказать повышение безопасности; в дальнейшем необходимы проверяемые данные и результаты от клиентов или независимых организаций.