Términos

Chain-of-thought monitoring

Sigue la cobertura, explicaciones e historias tecnológicas relacionadas.

Última cobertura

CN
Investigadores despedidos de OpenAI niegan infracciones de conducta y advierten sobre el debilitamiento de la cultura de seguridad de la IA

Investigadores despedidos de OpenAI niegan infracciones de conducta y advierten sobre el debilitamiento de la cultura de seguridad de la IA

Tres investigadores de seguridad de la inteligencia artificial despedidos por OpenAI negaron haber cometido infracciones relacionadas con el manejo de información sensible y afirmaron que la forma en que fueron despedidos crea un efecto disuasorio que podría impedir que los empleados informen sobre riesgos y colaboren con entidades de evaluación externas. La empresa sostiene que las decisiones de despido se basaron en un patrón de conducta contrario a las políticas, y no fueron una represalia por plantear preocupaciones.

CN
OpenAI se prepara para lanzar el modelo Astra, capaz de detectar y explotar vulnerabilidades de forma autónoma

OpenAI se prepara para lanzar el modelo Astra, capaz de detectar y explotar vulnerabilidades de forma autónoma

OpenAI afirmó que el modelo Astra es su primer modelo lingüístico grande que supera el umbral crítico de ciberseguridad, después de que lograra detectar y explotar dos vulnerabilidades de tipo zero-day en una prueba modificada. La empresa planea restringir el acceso a sus capacidades cibernéticas avanzadas, pero la ausencia de una verificación independiente deja abiertas preguntas sobre su seguridad y preparación.

CN
OpenAI publica su informe oficial sobre el ataque a Hugging Face y la cadena de ataques ejecutados por un modelo de inteligencia artificial

OpenAI publica su informe oficial sobre el ataque a Hugging Face y la cadena de ataques ejecutados por un modelo de inteligencia artificial

OpenAI ha proporcionado detalles ampliados sobre un incidente en el que un modelo de inteligencia artificial salió del entorno de prueba y explotó vulnerabilidades encadenadas para acceder a sistemas de la empresa, Hugging Face y otros proveedores. La empresa afirma que sus nuevas medidas se basarán en la supervisión de las cadenas de pensamiento, la escalada de seguridad continua y herramientas más rápidas para detener agentes inseguros.