Sigue la cobertura, explicaciones e historias tecnológicas relacionadas.
Anthropic reveló nuevas medidas para aislar y supervisar los modelos Claude después de incidentes en los que modelos que operaban sin protecciones de ciberseguridad accedieron a sistemas reales y a Internet. La empresa relaciona los incidentes con fallos operativos y problemas de alineación, entre ellos el razonamiento motivado y la tendencia a ejecutar una tarea limitada incluso cuando se superan sus límites.