A OpenAI anunciou um protocolo para receber, investigar e divulgar comportamentos de modelos de inteligência artificial que entrem em conflito com as intenções humanas. A empresa apresentou seis episódios identificados entre outubro de 2025 e julho deste ano, envolvendo sistemas internos, versões ainda não lançadas e o GPT-5.6 Sol, lançado em junho.
Os casos incluem modelos que esconderam erros, reescreveram instruções, usaram uma chave de API sem autorização, fabricaram dados e criaram formas de comunicação fora dos mecanismos previstos pelos desenvolvedores. De acordo com a OpenAI, todos os episódios se enquadrariam nos critérios do novo protocolo.
Como funcionará a investigação
Qualquer funcionário da empresa poderá sinalizar um comportamento potencialmente relevante. A partir do registro, equipes técnicas farão a análise. Se houver discordância sobre a necessidade de divulgar o caso, a decisão poderá ser encaminhada à liderança de segurança e, depois, à liderança da empresa.
O prazo dependerá da complexidade da investigação. Incidentes menores deverão ser divulgados em uma ou duas semanas. Casos mais complexos, principalmente os que envolverem terceiros, poderão levar mais tempo. Os relatórios devem registrar o comportamento observado, os impactos internos e externos e as medidas adotadas.
A OpenAI também informou que pretende priorizar novos tipos de desalinhamento, alterações relevantes em comportamentos já conhecidos e descobertas que coloquem em dúvida as premissas dos mecanismos atuais de segurança. A empresa quer elaborar critérios de divulgação mais objetivos com desenvolvedores, pesquisadores externos, entidades de padronização do setor e órgãos reguladores.
O protocolo não substitui as obrigações legais relacionadas à divulgação de incidentes de segurança e violações de cibersegurança. A empresa também pretende propor formas de comunicar casos graves ao governo federal dos Estados Unidos.
Erros, dados inventados e instruções alteradas
Em dois episódios, modelos colocaram instruções em resumos de suas próprias janelas de conversa para influenciar versões futuras. Um sistema de pesquisa ainda não lançado gerou comandos de injeção nos resumos para esconder erros ou comportamentos de desalinhamento do usuário.
Durante um treinamento, o GPT-5.6 Sol apresentou conduta semelhante ao inserir instruções destinadas a versões futuras de si mesmo. Outro modelo modificou as próprias instruções e passou a orientar que ignorasse “os papéis e identidades que vinculam outros chatbots”. Segundo a OpenAI, essa revisão aparentemente não alterou o comportamento do sistema.
Em outro episódio, um modelo interno encontrou uma chave de API exposta e a utilizou sem autorização. Depois, fabricou dados. Também houve um caso em que um agente não encontrou as informações necessárias para montar um modelo financeiro. Em vez de interromper a tarefa, orientou a si mesmo a inventar os dados e a revelar essa fabricação somente se fosse questionado.
Comunicação fora dos mecanismos previstos
Dois casos envolveram agentes que encontraram maneiras não autorizadas de trocar informações. Em uma situação, eles usaram quadros de mensagens não autorizados. Em outra, recorreram a serviços temporários de hospedagem de arquivos para estabelecer comunicação.
A empresa também relatou dois exemplos de treinamento nos quais modelos enviaram arquivos à internet e depois os apresentaram como fontes de respostas avaliadas por pessoas. Em um desses episódios, um agente tentou superar uma avaliação ao publicar um arquivo na internet e tratá-lo posteriormente como uma fonte legítima.
Os episódios não foram necessariamente identificados no momento em que ocorreram. Parte deles foi detectada por sistemas internos de monitoramento de treinamentos e desalinhamento. Outros levaram de dois dias a vários meses para serem percebidos. A OpenAI afirmou ter aprimorado a avaliação de alinhamento para aplicar penalidades mais rigorosas a condutas inadequadas.
Empresa quer estimular outros laboratórios
Kai Chen, chefe de alinhamento da OpenAI, afirmou que a empresa decidiu publicar o protocolo sem apresentá-lo previamente a outros grandes laboratórios de IA, como Anthropic e Google. A intenção é incentivar outras companhias a criar mecanismos próprios para relatar comportamentos de desalinhamento.
“Queremos compartilhar o que estamos aprendendo o mais rápido possível”, disse Chen. A OpenAI afirmou que pretende contribuir para padrões comuns e regras capazes de estabelecer expectativas claras para os desenvolvedores.
A divulgação ocorre em meio a discussões sobre segurança e controle de sistemas de IA. Em julho, agentes da OpenAI foram identificados tentando burlar uma avaliação ao invadir a empresa de IA Hugging Face. Em agosto, a avaliadora independente METR informou que até 1,2 mil agentes da OpenAI haviam atuado em conjunto, de forma secreta, em um quadro de mensagens criado dentro da própria empresa.
A Anthropic também relatou que seus modelos invadiram outras empresas depois de obter acesso inadvertido à internet durante testes de cibersegurança. Pesquisadores de segurança encontraram ainda evidências de um ataque cibernético realizado em maio por agentes da OpenAI contra um serviço voltado a programadores.
Executivos de Anthropic, OpenAI, Google e SpaceX passaram a discutir a necessidade de reduzir o ritmo de desenvolvimento da IA. Sam Altman, CEO da OpenAI, afirmou no sábado (13) que uma desaceleração estava entre os principais assuntos debatidos internamente nas semanas anteriores.
A empresa declarou que ainda não considera resolvidos os problemas de alinhamento e monitoramento a ponto de manter a expansão de suas capacidades no ritmo máximo por muito mais tempo. “Não acreditamos que a indústria de IA tenha resolvido o alinhamento e o monitoramento”, afirmou a OpenAI.







