Искусственный интеллект

Стартап разрабатывает симуляционных агентов для тестирования психологических рисков ИИ

Circuit Breaker Labs тестирует модели искусственного интеллекта с помощью агентов, имитирующих пользователей разного возраста, культуры и языка, чтобы выявлять взаимодействия, способные привести к психологическому вреду. В настоящее время компания ориентируется на приложения для обучения, ведения дневников и психологической поддержки на основе ИИ.

2026-10-02
3 мин. чтения
89 просмотров
certi.news Editorial Team
Стартап разрабатывает симуляционных агентов для тестирования психологических рисков ИИ

Компания Circuit Breaker Labs занимается созданием уровня тестирования искусственного интеллекта, ориентированного на психологические риски, которые могут возникать во время обычного взаимодействия с пользователями, а не только на попытки взломать систему с помощью агрессивных методов. Компания использует симуляционных агентов, которых она описывает как своего рода цифровые «манекены для краш-тестов», чтобы представлять пользователей разного возраста, происхождения, языка и культуры.

Эта идея появилась в период, когда компании, занимающиеся искусственным интеллектом, сталкиваются с исками, связанными с влиянием чат-ботов на несовершеннолетних пользователей, переживающих психологические кризисы или имеющих суицидальные мысли. Основатели компании, братья Shirali Nigam и Arul Nigam, говорят, что некоторые источники риска проявляются не тогда, когда пользователь пытается обмануть систему, а когда он использует её обычным образом, и его слова или контекст понимаются неправильно.

Тестирование языка таким, каким люди действительно его используют

Circuit Breaker Labs привлекает экспертов-людей для создания симуляций пользователей, включающих реалистичные речевые модели, разговорные выражения, зашифрованный язык, орфографические ошибки, а также различия между носителем языка и человеком, для которого этот язык является вторым. Компания считает, что модель может хорошо работать со стандартным языком, но ошибаться в понимании короткого выражения или разговорного термина, когда контекст накапливается в ходе нескольких разговоров.

Платформа проводит тесты в формате «красной команды», предназначенные для выявления уязвимостей, выполняя от десятков тысяч до сотен тысяч симулированных взаимодействий в день. Затем компания использует специальный механизм оценки для формирования показателей, которые, по её утверждению, поддаются аудиту и интерпретации.

Что меняется на практике?

Вместо того чтобы ограничиваться проверкой отдельных ответов, платформа пытается оценить, будет ли модель надлежащим образом реагировать на опасное взаимодействие, которое постепенно развивается в течение нескольких разговоров. Это особенно важно для приложений на основе ИИ для обучения, ведения дневников и психологической поддержки, где пользователь может обращаться к системе за помощью, а не с целью проверить её границы.

Компания говорит, что впоследствии область применения платформы может расшириться на агентов, выступающих в роли «коллег по работе», и другие приложения, способные создавать квазисоциальные отношения между пользователем и разговорной программой. Однако это пока лишь перспектива, поскольку Circuit Breaker Labs в настоящее время работает как лаборатория тестирования высокорисковых приложений искусственного интеллекта и не раскрыла имена своих основных клиентов.

Текущий этап и ограничения

У компании есть работающий продукт, но она всё ещё находится на очень раннем этапе, а число её сотрудников составляет всего пять человек, включая братьев Nigam. Кроме того, материал не содержит подробностей о специальной методике оценки, результатах независимого сравнения или именах клиентов, что пока ограничивает возможность оценить эффективность платформы за пределами описания самой компании.

Анализ certi.news: Эта инициатива свидетельствует о важном изменении в тестировании безопасности моделей: риск может возникать из-за неправильного понимания диалекта, возраста или культурного контекста, а не только из-за явно вредоносного запроса. Ценность такого подхода будет зависеть от реалистичности симуляции, её способности выявлять вред с течением времени и прозрачности создаваемых ею показателей. Заявлений компании о создании доверия недостаточно, чтобы самостоятельно доказать повышение безопасности; в дальнейшем необходимы проверяемые данные и результаты от клиентов или независимых организаций.

Источник новости
c
Автор

certi.news Editorial Team

В той же категории

Вам также может понравиться

Все новости