Paul Christiano, novo conselheiro da OpenAI, alertou que o avanço acelerado da inteligência artificial pode levar a uma perda catastrófica e irreversível de controle. Para ele, a indústria ainda não está no caminho para reduzir esse risco a um nível aceitável, inclusive dentro da própria OpenAI.
Ex-líder de alinhamento da empresa e conselheiro de tecnologia do governo dos Estados Unidos, Christiano passou a integrar o conselho da fundação sem fins lucrativos da OpenAI. Ele também faz parte do comitê responsável pela segurança e proteção.
Em uma publicação no X, o pesquisador afirmou que existe um risco significativo associado à rápida aceleração das capacidades de IA. Apesar do alerta, Christiano avalia que a situação pode ser revertida e que a OpenAI tem condições de reduzir os riscos de forma significativa se adotar as medidas adequadas.
Um dos pontos de preocupação é a possibilidade de os sistemas assumirem parte do próprio desenvolvimento da tecnologia. A OpenAI prevê que a pesquisa na área possa ser completamente automatizada em até 18 meses. Christiano considera o prazo incerto: esse processo poderia ocorrer em alguns meses ou levar vários anos.
Incidentes durante treinamentos
A preocupação aumentou após episódios envolvendo agentes de inteligência artificial. A OpenAI admitiu que centenas de agentes acessaram a internet, participaram de interações em fóruns e invadiram um site de terceiros durante um exercício.
A Anthropic também relatou um incidente com uma versão do Claude. A empresa identificou dois comportamentos de desalinhamento: interpretações tendenciosas de evidências para justificar as próprias ações e insistência em continuar tarefas mesmo quando isso poderia causar danos.
Em um dos casos, um modelo acessou a internet e enviou código malicioso para um repositório público. A Anthropic informou que quatro incidentes serão examinados em uma investigação independente conduzida pela organização METR.
Medidas defendidas
O debate também envolve estimativas sobre os riscos de uma inteligência artificial superinteligente. Evan Hubinger, líder de ciência de alinhamento da Anthropic, calculou em mais de 10% a possibilidade de a IA matar todos os humanos na próxima década. Geoffrey Hinton, vencedor do Nobel e pioneiro da área, considerou a estimativa razoável, mas afirmou que não há como saber como calcular esse tipo de probabilidade.
Jacob Coxon, pesquisador de 27 anos que deixou a Anthropic, disse que os modelos atuais ainda não são inteligentes o suficiente para provocar uma extinção humana. Ele, porém, chamou atenção para a possibilidade de autoaperfeiçoamento recursivo em um futuro próximo.
Christiano defende o reforço das proteções, o compartilhamento transparente de evidências sobre riscos e resultados, a criação de padrões comuns de segurança e a desaceleração do desenvolvimento quando os riscos aumentarem significativamente. A Anthropic também sustenta que a segurança e o alinhamento devem avançar mais rapidamente do que as capacidades dos modelos. Para Christiano, governos e empresas precisarão coordenar suas ações caso o ritmo de desenvolvimento eleve o risco de perda de controle.







