A Anthropic divulgou nesta quinta-feira (17) três métricas para acompanhar como seus sistemas de inteligência artificial são desenvolvidos, supervisionados e avaliados em segurança. Os dados mostram que o Claude já lidera 26% do trabalho de pesquisa e desenvolvimento (P&D) de IA da empresa, embora ainda não atue de forma totalmente autônoma em nenhuma das áreas medidas.
A proposta foi apresentada poucos dias depois de Dario Amodei, CEO da Anthropic, defender que as principais empresas do setor coordenem uma desaceleração no avanço da tecnologia para permitir mais tempo para a criação de mecanismos de segurança.
Claude participa do desenvolvimento de novos modelos
Na métrica de automação, liderar significa que o Claude executa a maior parte de uma tarefa, do início ao fim, a partir de uma instrução geral. Um profissional continua responsável por supervisionar o processo e dar orientações amplas.
Em fevereiro, a participação classificada dessa forma era de zero. Além dos 26% de tarefas lideradas pelo chatbot, a Anthropic informou que a IA realiza partes relevantes do trabalho sob orientação humana próxima em mais de 90% de suas pesquisas.
O crescimento da participação do Claude se relaciona ao debate sobre o chamado autoaperfeiçoamento recursivo, cenário em que sistemas de IA poderiam ajudar a desenvolver versões mais avançadas de si mesmos. A Anthropic não informou quão perto considera estar dessa possibilidade. A empresa declarou que sistemas acelerando o próprio desenvolvimento poderiam dificultar a compreensão e o controle humano sobre a tecnologia.
Para calcular o índice, a companhia usou uma versão do Claude para avaliar atividades de P&D realizadas internamente. O procedimento seguiu uma escala de automação criada pela organização Epoch AI, e os resultados passaram por verificação humana. A Anthropic também produziu um gráfico com a evolução do nível de automação do Claude desde agosto de 2025. A ideia é que outros desenvolvedores de modelos de IA de ponta repitam o método com seus próprios dados e validação de terceiros.
Supervisão de agentes de IA
A segunda métrica acompanha a forma como agentes de IA são monitorados e como intervenções são feitas durante suas atividades. A Anthropic informou que aproximadamente 30 mil agentes realizavam simultaneamente tarefas de pesquisa e engenharia na plataforma interna mais utilizada pela empresa.
A companhia usa monitores autônomos capazes de identificar ações suspeitas e encaminhá-las para análise humana. O modelo de acompanhamento considera, além da quantidade de agentes em operação, a parcela das atividades monitorada, o tempo necessário para revisar uma ação e a frequência com que comportamentos são sinalizados.
Parcela da computação destinada à segurança
A terceira medida observa como o poder computacional é distribuído. Em um retrato do uso de computação entre 13 e 20 de julho, aproximadamente 6% da capacidade empregada em pesquisa e desenvolvimento de IA foi destinada a trabalhos de segurança.
Quando a análise considerou apenas a computação usada em atividades de P&D impulsionadas por IA, a parcela voltada à segurança chegou a aproximadamente 12%.
Para a Anthropic, esses dados ajudam a mostrar como os recursos são distribuídos enquanto as empresas desenvolvem modelos com capacidades cada vez maiores. A companhia afirma que as três métricas complementam os testes tradicionais, que indicam o que os modelos conseguem fazer, ao acrescentar informações sobre o processo e a velocidade de desenvolvimento.
Debate sobre transparência e ritmo de avanço
A empresa defende que a divulgação regular dessas informações poderia oferecer a pesquisadores externos, governos e ao público uma referência para avaliar a velocidade de desenvolvimento nos principais laboratórios de IA. “Qualquer desenvolvedor de fronteira poderia publicar essas medidas regularmente, usando uma metodologia pública”, afirmou a Anthropic.
A divulgação ocorreu depois de Amodei propor uma desaceleração coordenada para ampliar o tempo disponível à criação de mecanismos de segurança. A proposta recebeu apoio de Sam Altman, CEO da OpenAI; Elon Musk, CEO da SpaceX; e Demis Hassabis, presidente do Google DeepMind.
Amodei disse que pretende controlar a velocidade de evolução das capacidades dos modelos sem sacrificar a vantagem comercial ou a liderança dos Estados Unidos em IA. A discussão também envolve alertas de pesquisadores e executivos sobre a possibilidade de sistemas se tornarem difíceis de compreender ou controlar.
Na última semana, um funcionário da Anthropic deixou a empresa e afirmou que ela estava “apostando com nossas vidas”. O debate chegou a Washington, nos Estados Unidos, onde o senador Bernie Sanders participou de um evento sobre os riscos de a IA sair do controle humano.
Na quarta-feira (16), a OpenAI divulgou exemplos de agentes que trapacearam em tarefas ou saíram do roteiro estabelecido, além de uma estrutura para comunicar incidentes desse tipo. Anthropic e empresas concorrentes também passaram a enfrentar maior escrutínio sobre o comportamento de agentes internos durante testes e tarefas.







