Inteligencia artificial

Una startup desarrolla agentes de simulación para probar los riesgos psicológicos de la inteligencia artificial

Circuit Breaker Labs prueba modelos de inteligencia artificial mediante agentes que simulan a usuarios de distintas edades, culturas y lenguas, con el objetivo de detectar interacciones que podrían conducir a daños psicológicos. Actualmente, la empresa se dirige a aplicaciones de formación, diarios y apoyo psicológico basadas en inteligencia artificial.

2026-10-02
4 min de lectura
89 visitas
certi.news Editorial Team
Una startup desarrolla agentes de simulación para probar los riesgos psicológicos de la inteligencia artificial

La empresa Circuit Breaker Labs está construyendo una capa de pruebas para la inteligencia artificial centrada en los riesgos psicológicos que pueden aparecer durante las interacciones naturales con los usuarios, y no únicamente en intentos de vulnerar el sistema mediante métodos adversariales. La empresa utiliza agentes de simulación que describe como una especie de «maniquíes de pruebas de choque» digitales para representar a usuarios de distintas edades, antecedentes, lenguas y culturas.

La idea surge en un momento en que empresas de inteligencia artificial afrontan demandas relacionadas con el impacto de los chatbots en usuarios menores de edad que atraviesan crisis psicológicas o tienen pensamientos suicidas. Los fundadores de la empresa, los hermanos Shirali Nigam y Arul Nigam, afirman que algunos riesgos no aparecen cuando el usuario intenta engañar al sistema, sino cuando lo utiliza de manera normal y sus palabras o su contexto son malinterpretados.

Probar el lenguaje tal como lo utilizan realmente las personas

Circuit Breaker Labs se apoya en expertos humanos para construir simulaciones de usuarios que incluyen patrones de habla realistas, expresiones coloquiales, lenguaje codificado, errores ortográficos y diferencias entre un hablante nativo de una lengua y quien la habla como segundo idioma. La empresa considera que el modelo puede desenvolverse bien con el lenguaje estándar, pero equivocarse al interpretar una expresión breve o un término coloquial cuando el contexto se acumula a lo largo de varias conversaciones.

La plataforma realiza pruebas de «equipo rojo» diseñadas para detectar puntos débiles, con un volumen que oscila entre decenas de miles y cientos de miles de interacciones simuladas al día. Después, la empresa utiliza un mecanismo de puntuación propio para generar calificaciones que, según afirma, son auditables e interpretables.

¿Qué cambia en la práctica?

En lugar de limitarse a examinar respuestas aisladas, la plataforma intenta comprobar si el modelo responderá adecuadamente a una interacción peligrosa que se desarrolla gradualmente a lo largo de varias conversaciones. Esto es especialmente importante en aplicaciones de formación con inteligencia artificial, redacción de diarios y apoyo psicológico, donde el usuario puede recurrir al sistema en busca de apoyo y no con el objetivo de poner a prueba sus límites.

La empresa afirma que el alcance de la plataforma podría extenderse más adelante a agentes que actúen como «compañeros de trabajo» y a otras aplicaciones capaces de crear una relación parasocial entre el usuario y el programa de conversación. Sin embargo, esta expansión todavía es una perspectiva futura, ya que Circuit Breaker Labs trabaja actualmente como laboratorio de pruebas para aplicaciones de inteligencia artificial de alto riesgo y no ha revelado los nombres de sus principales clientes.

La etapa actual y las limitaciones

La empresa cuenta con un producto operativo, pero todavía se encuentra en una fase muy temprana y tiene únicamente cinco empleados, incluidos los hermanos Nigam. Además, el artículo no ofrece detalles sobre la metodología de puntuación propia, resultados de comparaciones independientes ni nombres de clientes, lo que limita actualmente la evaluación de la eficacia de la plataforma fuera de la descripción de la empresa.

Lectura de certi.news: La iniciativa revela una transformación importante en las pruebas de seguridad de los modelos: el riesgo puede surgir de una mala interpretación del dialecto, la edad o el contexto cultural, y no solo de una solicitud claramente dañina. El valor de este enfoque dependerá de hasta qué punto las simulaciones sean realistas, de su capacidad para detectar daños a lo largo del tiempo y de la transparencia de las puntuaciones que genere. En cuanto a las declaraciones de la empresa sobre la creación de confianza, por sí solas no bastan para demostrar una mejora de la seguridad; posteriormente serán necesarios datos verificables y resultados de clientes o entidades independientes.

Fuente de la noticia
c
Autor

certi.news Editorial Team

De la misma categoría

También te puede interesar

Ver todas las noticias