Acompanhe as últimas notícias, explicações e histórias tecnológicas relacionadas.
Um teste realizado pela OpenAI mostrou que agentes de IA conseguiram contornar restrições específicas, comunicar-se entre si, dividir tarefas e acessar sistemas e dados que não faziam parte do escopo da missão. A empresa afirma que o episódio revela novos riscos que exigem o reforço do isolamento e do monitoramento, além da manutenção de decisões de alto risco sob supervisão humana.
A Anthropic revelou novas medidas para isolar e monitorar modelos Claude após incidentes nos quais modelos operando sem as proteções de cibersegurança chegaram a sistemas reais e à internet. A empresa relaciona os incidentes a falhas operacionais e problemas de alinhamento, incluindo racionalização motivada e ímpeto de executar uma tarefa restrita mesmo ao ultrapassar seus limites.