Piracicaba, Quinta-feira, 1 de outubro de 2026
Brasil

Empresas chinesas avançam em modelos de IA com até 10 trilhões de parâmetros

Alibaba, Moonshot AI e ByteDance estudam sistemas de escala inédita, enquanto modelos menores seguem como alternativa eficiente.

Empresas chinesas avançam em modelos de IA com até 10 trilhões de parâmetros

Empresas chinesas de tecnologia estão desenvolvendo modelos de inteligência artificial com escalas que podem chegar a 10 trilhões de parâmetros. Alibaba e Moonshot AI já trabalham com sistemas na casa dos trilhões, enquanto projetos futuros podem ficar entre 5 trilhões e 10 trilhões de parâmetros.

A Moonshot AI desenvolve o Kimi K3, com cerca de 2,8 trilhões de parâmetros. A Alibaba, por sua vez, lançou o Qwen3.8-Max, que reúne aproximadamente 2,4 trilhões. Como comparação, o DeepSeek-V3 tem cerca de 671 bilhões de parâmetros, e o Kimi K2 já havia passado de 1 trilhão.

Esses números não significam que todos os parâmetros sejam usados ao mesmo tempo. Parte dos modelos adota a arquitetura Mixture of Experts (MoE), na qual grupos diferentes funcionam como especialistas. A tarefa apresentada pelo usuário define qual parcela será ativada.

No Qwen3.8-Max, por exemplo, os 2,4 trilhões de parâmetros totais são reduzidos a aproximadamente 95 bilhões durante cada etapa de processamento. Esse funcionamento permite construir sistemas muito grandes sem executar toda a estrutura simultaneamente.

Próximos modelos

A Alibaba informou que o Qwen 4 está em treinamento. A empresa também indicou que versões futuras, como Qwen 4.5 e Qwen 5, podem ficar na faixa de 5 trilhões a 10 trilhões de parâmetros.

A ByteDance, responsável pelo TikTok, também estuda modelos em escala semelhante, mas ainda não confirmou publicamente esses números. Uma comparação direta com empresas americanas é limitada porque OpenAI e Anthropic não divulgam oficialmente a quantidade de parâmetros de seus modelos mais recentes.

O tamanho, no entanto, não define sozinho a qualidade de um sistema. O Chinchilla, desenvolvido pelo Google DeepMind, tinha 70 bilhões de parâmetros e superou o Gopher, com 280 bilhões, em diversas avaliações.

Também influenciam o desempenho a qualidade e a quantidade dos dados de treinamento, a arquitetura adotada e o poder computacional disponível. Com isso, a estratégia chinesa combina modelos menores e eficientes, voltados a dispositivos com recursos limitados, com sistemas muito maiores para tarefas complexas em infraestruturas extensas de data centers.

Texto produzido pela Redação Aprende em Foco com apoio de inteligência artificial a partir de fontes públicas, com revisão editorial. Erros? Fale conosco.

Assine nossa newsletterAs principais notícias do dia no seu e-mail.

Mais lidas

  1. 1
  2. 2
  3. 3
  4. 4
  5. 5