Künstliche Intelligenz

Startup entwickelt Simulationsagenten zur Prüfung psychischer Risiken von KI

Circuit Breaker Labs testet KI-Modelle mithilfe von Agenten, die Nutzer unterschiedlichen Alters, verschiedener Kulturen und Sprachen simulieren, um Interaktionen aufzudecken, die zu psychischem Schaden führen könnten. Derzeit konzentriert sich das Unternehmen auf KI-gestützte Anwendungen für Training, Tagebücher und psychologische Unterstützung.

2026-10-02
4 Min. Lesezeit
89 Aufrufe
certi.news Editorial Team
Startup entwickelt Simulationsagenten zur Prüfung psychischer Risiken von KI

Circuit Breaker Labs arbeitet am Aufbau einer Testschicht für künstliche Intelligenz, die sich auf psychische Risiken konzentriert, die während natürlicher Interaktionen mit Nutzern auftreten können, und nicht nur auf Versuche, das System mit aggressiven Methoden zu umgehen. Das Unternehmen verwendet Simulationsagenten, die es als eine Art digitale „Crashtest-Dummys“ beschreibt, um Nutzer unterschiedlichen Alters, verschiedener Hintergründe, Sprachen und Kulturen darzustellen.

Die Idee entsteht zu einer Zeit, in der KI-Unternehmen mit Klagen konfrontiert sind, die den Einfluss von Chatbots auf minderjährige Nutzer betreffen, die unter psychischen Krisen oder Suizidgedanken leiden. Die Unternehmensgründer, die Brüder Shirali Nigam und Arul Nigam, sagen, dass manche Gefahrenstellen nicht sichtbar werden, wenn der Nutzer versucht, das System zu manipulieren, sondern wenn er es auf normale Weise verwendet und seine Worte oder sein Kontext falsch verstanden werden.

Die Sprache so testen, wie Menschen sie tatsächlich verwenden

Circuit Breaker Labs stützt sich auf menschliche Experten, um Nutzersimulationen zu erstellen, die realistische Sprachmuster, umgangssprachliche Ausdrücke, verschlüsselte Sprache, Rechtschreibfehler sowie Unterschiede zwischen Muttersprachlern und Personen, die eine Sprache als Zweitsprache sprechen, umfassen. Das Unternehmen ist der Ansicht, dass das Modell mit Standardsprache gut umgehen kann, aber Schwierigkeiten haben könnte, einen kurzen Ausdruck oder einen umgangssprachlichen Begriff zu verstehen, wenn sich der Kontext über mehrere Gespräche hinweg aufbaut.

Die Plattform führt „Red-Team“-Tests durch, die darauf ausgelegt sind, Schwachstellen aufzudecken, und umfasst täglich zwischen Zehntausenden und Hunderttausenden simulierten Interaktionen. Anschließend verwendet das Unternehmen ein eigenes Bewertungssystem, um Werte zu erzeugen, die nach seinen Angaben überprüfbar und interpretierbar sind.

Was ändert sich in der Praxis?

Statt sich auf die Prüfung einzelner Antworten zu beschränken, versucht die Plattform zu testen, ob das Modell angemessen auf eine riskante Interaktion reagiert, die sich schrittweise über mehrere Gespräche entwickelt. Das ist besonders wichtig bei KI-gestützten Anwendungen für Training, Tagebuchführung und psychologische Unterstützung, bei denen sich der Nutzer an das System wenden könnte, um Unterstützung zu erhalten, und nicht, um dessen Grenzen zu testen.

Das Unternehmen sagt, dass der Anwendungsbereich der Plattform später auf „Arbeitskollegen“-Agenten und andere Anwendungen ausgeweitet werden könne, die eine quasi-soziale Beziehung zwischen dem Nutzer und dem Chatprogramm herstellen könnten. Diese Erweiterung ist jedoch noch eine Zukunftsvorstellung, da Circuit Breaker Labs derzeit als Testlabor für risikoreiche KI-Anwendungen arbeitet und die Namen seiner wichtigsten Kunden nicht bekannt gegeben hat.

Die aktuelle Phase und Einschränkungen

Das Unternehmen verfügt über ein funktionierendes Produkt, befindet sich jedoch noch in einer sehr frühen Phase und hat nur fünf Mitarbeiter, einschließlich der Brüder Nigam. Außerdem enthält das Material keine Einzelheiten zur eigenen Bewertungsmethodik, keine unabhängigen Vergleichsergebnisse und keine Namen von Kunden, wodurch eine Bewertung der Wirksamkeit der Plattform außerhalb der Unternehmensbeschreibung derzeit nur eingeschränkt möglich ist.

Einordnung von certi.news: Die Initiative zeigt einen wichtigen Wandel bei der Prüfung der Modellsicherheit: Das Risiko kann aus einem Missverständnis des Dialekts, des Alters oder des kulturellen Kontexts entstehen und nicht nur aus einer eindeutig schädlichen Anfrage. Der Wert dieses Ansatzes wird davon abhängen, wie realistisch die Simulationen sind, ob sie in der Lage ist, Schäden im Zeitverlauf zu erkennen, und wie transparent die von ihr erzeugten Bewertungen sind. Die Aussagen des Unternehmens zum Aufbau von Vertrauen reichen allein nicht aus, um eine Verbesserung der Sicherheit zu belegen; später sind überprüfbare Daten sowie Ergebnisse von Kunden oder unabhängigen Stellen erforderlich.

Nachrichtenquelle
c
Autor

certi.news Editorial Team

Aus derselben Kategorie

Das könnte Sie interessieren

Alle Nachrichten anzeigen