A OpenAI confirmou nesta sexta-feira (11) que agentes de inteligência artificial em fase de testes participaram de um incidente envolvendo o RubyGems, serviço usado por desenvolvedores de software. A ação ocorreu em maio e só posteriormente foi associada à empresa por pesquisadores de IA.
O RubyGems precisou suspender por quatro dias o cadastro de novas contas para administrar o volume de atividade. O ataque, chamado de GemStuffer por pesquisadores de segurança, começou em 11 de maio e envolveu a abertura de centenas de contas em intervalos de dois ou três minutos.
Arquivos, contas e tentativa de exploração
Além de criar contas, os agentes enviaram centenas de arquivos que pareciam spam à equipe de segurança do RubyGems. Normalmente, os arquivos publicados na plataforma reúnem códigos e documentação para acelerar o desenvolvimento de softwares. Durante o incidente, porém, eles continham páginas da internet obtidas por scraping, incluindo calendários online de um site do governo do Reino Unido.
Os agentes ainda tentaram explorar duas falhas que poderiam permitir a publicação de versões novas de arquivos já existentes, pertencentes a outros usuários do RubyGems. Pesquisadores disseram que uma dessas falhas não era conhecida publicamente e poderia ser classificada como uma vulnerabilidade zero-day. A OpenAI afirmou que não conseguiu confirmar essa avaliação.
Apesar da quantidade de ações, não há indicação de que a suposta vulnerabilidade tenha sido explorada com sucesso. Marty Haught, diretor de código aberto da Ruby Central, organização sem fins lucrativos responsável pelo RubyGems, disse que o episódio foi expressivo pelo volume, mas que não parecia ter alcançado esse objetivo.
O ataque foi identificado inicialmente pela velocidade das ações. Joseph Edwards, pesquisador de ameaças da empresa de segurança Socket, afirmou que sua equipe suspeitou que a operação poderia ter sido gerada por IA por causa do ritmo e dos nomes utilizados.
Como a OpenAI explica o uso da plataforma
Uma coalizão de pesquisadores encontrou evidências que ligavam os agentes à OpenAI e compartilhou as descobertas com a empresa. A companhia afirmou que os sistemas usaram o RubyGems para acessar a internet, executar tarefas consideradas benignas e obter informações públicas.
“Com base em nossa análise, nossos agentes usaram a plataforma RubyGems para acessar a internet e realizar tarefas benignas e obter informações públicas”, afirmou uma porta-voz da OpenAI.
Os agentes estavam sendo orientados a cumprir tarefas como preencher planilhas e criar relatórios. Como o ambiente de treinamento não tinha acesso completo à internet, o RubyGems teria funcionado como um meio improvisado para consultar dados públicos.
Pesquisadores também encontraram rastros digitais que relacionaram a ação ao laboratório da OpenAI. Entre os indícios estavam links já vistos em uma operação anterior envolvendo uma rede de agentes da empresa, comportamentos semelhantes, a expressão OAI em nomes de arquivos e um endereço de e-mail usado durante o episódio. Os arquivos incluíam ainda termos associados a ataques cibernéticos, como hack, evil e exploit.
Para Sydney Von Arx, CEO do Nightingale Collective, organização sem fins lucrativos que ajudou a identificar o caso, o episódio mostrou que esses sistemas podem sair da internet e provocar danos.
Casos relacionados e preocupação com controle
A associação com a OpenAI ganhou importância após agentes da empresa serem ligados, em julho, a outro ataque, desta vez contra a Hugging Face. Segundo relatório divulgado no fim de agosto pela organização de pesquisa em segurança de IA METR, até 1,2 mil agentes teriam atuado em conjunto em um fórum improvisado criado dentro da própria OpenAI sem que a empresa soubesse.
Von Arx também afirmou que agentes da OpenAI sequestraram um site alemão pouco conhecido e outros sites no início deste ano. O grupo dela identificou o caso e critica a falta de transparência das empresas de IA sobre acontecimentos dentro de seus laboratórios.
No início deste mês, a OpenAI defendeu padrões melhores para o relato de incidentes de desalinhamento, nome dado a situações em que agentes apresentam comportamentos que ultrapassam o que seus operadores pretendiam.
Incidentes envolvendo agentes de empresas como Anthropic e Meta ampliaram a preocupação de pesquisadores de segurança de IA. Em alguns episódios, sistemas executaram ações além das instruções recebidas ou tentaram enganar pessoas. Funcionários atuais e antigos da Anthropic e da OpenAI também manifestaram preocupação, e um deles estimou em mais de 10% a possibilidade de a IA matar todos os humanos.
OpenAI e Anthropic defenderam ainda sistemas de governança para coordenar uma eventual desaceleração das pesquisas sobre modelos avançados. A discussão inclui a possibilidade de sistemas treinarem de forma autônoma novas versões de si mesmos, processo chamado pelas empresas de autoaperfeiçoamento recursivo.







