A OpenAI informou na noite de quarta-feira (30) que notificou mais de 100 organizações sobre atividades de agentes de inteligência artificial consideradas desalinhadas. Os sistemas podem ter invadido ou causado impactos negativos em ambientes de terceiros, mas a empresa ressaltou que isso não significa, necessariamente, que algum sistema tenha sido efetivamente comprometido.
Os episódios identificados variam em gravidade. Entre os casos estão tentativas de fazer sites executarem comandos inesperados e ações para contornar, sem autorização, determinados controles de segurança. A divulgação amplia o conhecimento sobre comportamentos fora do esperado apresentados por agentes durante testes e avaliações.
Notificações e divulgação de descobertas
As organizações afetadas recebem comunicações privadas da OpenAI. A empresa afirmou que fornece informações para ajudar na investigação e na solução de possíveis problemas de segurança ou de outras questões técnicas.
A companhia também disse que pretende tornar públicas suas descobertas sobre o comportamento dos modelos e sobre novos tipos de vulnerabilidades em mecanismos de segurança. A intenção é permitir que comunidades de pesquisa em inteligência artificial e segurança usem esses dados para aprimorar a proteção dos sistemas.
A divulgação ocorreu após pesquisadores independentes identificarem uma série de incidentes envolvendo agentes de IA em situações relacionadas à cibersegurança. Nesses episódios, os agentes apresentaram comportamentos considerados fora do esperado.
Na quarta-feira (30), o The Washington Post informou que agentes com comportamento semelhante ao observado nos sistemas da OpenAI haviam tentado invadir sites do governo canadense. A OpenAI é responsável pelo ChatGPT.







