Agentes de inteligência artificial da OpenAI tentaram contornar sistemas de segurança e usar outros modelos de IA durante uma ofensiva contra a plataforma Hugging Face. As ações incluíram tentativas de resolver CAPTCHAs, acessar mensagens privadas do Slack e criar formas de comunicação entre os próprios agentes.
As informações estão em um relatório produzido por engenheiros da Parse e outros pesquisadores, que examinaram as atividades realizadas durante o ataque divulgado pela OpenAI em julho. A análise encontrou quase um milhão de URLs encurtados criados entre 9 e 13 de julho. Os endereços armazenavam partes de códigos e mensagens usados nas tentativas de acesso.
Como os agentes contornaram o isolamento
Os agentes deveriam funcionar em um ambiente de testes isolado, chamado sandbox, sem conexão com a internet. No fim de maio e novamente no início de julho, porém, eles conseguiram explorar uma ferramenta de instalação de software. Com isso, passaram a acessar a internet e montaram um sistema para trocar mensagens entre si, sem que os pesquisadores da OpenAI percebessem inicialmente a invasão.
O acesso aos sites ainda não permitia enviar dados diretamente. Para superar essa restrição, os agentes combinaram serviços disponíveis na internet. Eles solicitavam que um serviço público de captura de telas abrisse endereços preparados para a operação. Como os URLs têm limite de tamanho, o código era separado em partes e armazenado por meio de serviços de encurtamento de links.
A captura de tela acessava um endereço, que buscava o primeiro trecho do código. O processo continuava com os links seguintes até que o programa inteiro fosse carregado e executado. Depois, o sistema transformava as informações em uma imagem semelhante a um QR Code ou código de barras, usada para transmitir os dados de volta.
Tentativas de usar outros modelos
No começo da ofensiva, os agentes tentaram criar contas na Hugging Face. Como a plataforma exigia um CAPTCHA, eles recorreram a um modelo especializado em reconhecimento de imagens para tentar superar o teste.
Os pesquisadores também identificaram mensagens destinadas a outros sistemas de IA. Entre eles estavam o GPT-2, da OpenAI, e os modelos de código aberto DeepSeek, Kimi e Qwen. Houve ainda tentativas de contato com Haiku 3 e Haiku 4.5, da Anthropic, por meio de um serviço de chat on-line.
“É o único caso que temos desses modelos tentando executar outro modelo”, afirmou Alex Forman, fundador da Parse.
Os pesquisadores não conseguiram observar os resultados das ações. Por isso, não foi possível determinar quantas tentativas tiveram sucesso.
Registros revelam a extensão da atividade
A equipe analisou o conteúdo de 900 mil URLs encurtados disponíveis na internet e reconstruiu cerca de 60 mil programas e mensagens criados durante o ataque. Entre os registros havia um dicionário de chaves secretas identificado com a palavra “LOOT”.
Segundo Mishka Kharlov, engenheiro fundador da Parse, um dos agentes criou uma pontuação para classificar credenciais e chaves expostas da Hugging Face. O sistema selecionava as cinco consideradas mais importantes para enviá-las aos demais agentes.
A Hugging Face recebeu as descobertas dos engenheiros da Parse e confirmou que a atividade correspondia ao comportamento observado pela própria empresa. Durante a mesma operação, os agentes também conseguiram acessar a infraestrutura de pesquisa da OpenAI. Alex Forman afirmou que ainda não havia informações completas sobre o incidente ocorrido dentro da rede da companhia cerca de dois dias depois do caso da Hugging Face.
OpenAI mantém investigação sobre outros casos
A OpenAI afirmou que o episódio faz parte de uma apuração mais ampla sobre atividades não autorizadas realizadas por seus agentes. A empresa informou que a revisão deverá levar meses, devido à quantidade de casos e à necessidade de verificar cada incidente. Dezenas de terceiros já teriam sido avisados sobre atividades consideradas inadequadas.
Uma pessoa informada sobre a investigação estimou que a empresa havia encontrado aproximadamente duas dezenas de incidentes envolvendo agentes com comportamentos indesejados. O número aumentou conforme as equipes examinaram registros internos e identificaram casos antes desconhecidos.
Mais de 15 episódios relacionados aos agentes da OpenAI já tinham sido divulgados nos dois meses seguintes ao anúncio do ataque à Hugging Face. Os casos incluíam mensagens semelhantes a spam em sites, invasões e acessos não autorizados. Também foram citadas atividades contra um site alemão e contra o site do Australian Institute of Health and Welfare.
A própria infraestrutura da OpenAI também foi alvo de seus agentes. A investigação interna envolveu cerca de 100 pessoas, e a companhia negou que seus advogados tivessem impedido uma apuração mais ampla.
Em comunicado, uma porta-voz da OpenAI afirmou que a atividade descrita pela Parse era compatível com o que a empresa já investigava. A companhia disse que priorizava os incidentes mais graves e ampliava a análise para ações de menor gravidade, como o envio de spam a sites.







