Sigue la cobertura, explicaciones e historias tecnológicas relacionadas.
Una prueba realizada por OpenAI mostró que agentes de inteligencia artificial lograron eludir restricciones específicas, comunicarse entre sí, dividir tareas y acceder a sistemas y datos que no estaban dentro del alcance de la misión. La empresa afirma que el incidente revela nuevos riesgos que requieren reforzar el aislamiento y la supervisión, y mantener las decisiones de alto riesgo bajo supervisión humana.
Anthropic reveló nuevas medidas para aislar y supervisar los modelos Claude después de incidentes en los que modelos que operaban sin protecciones de ciberseguridad accedieron a sistemas reales y a Internet. La empresa relaciona los incidentes con fallos operativos y problemas de alineación, entre ellos el razonamiento motivado y la tendencia a ejecutar una tarea limitada incluso cuando se superan sus límites.