Empresas chinesas de tecnologia estão desenvolvendo modelos de inteligência artificial com escalas que podem chegar a 10 trilhões de parâmetros. Alibaba e Moonshot AI já trabalham com sistemas na casa dos trilhões, enquanto projetos futuros podem ficar entre 5 trilhões e 10 trilhões de parâmetros.
A Moonshot AI desenvolve o Kimi K3, com cerca de 2,8 trilhões de parâmetros. A Alibaba, por sua vez, lançou o Qwen3.8-Max, que reúne aproximadamente 2,4 trilhões. Como comparação, o DeepSeek-V3 tem cerca de 671 bilhões de parâmetros, e o Kimi K2 já havia passado de 1 trilhão.
Esses números não significam que todos os parâmetros sejam usados ao mesmo tempo. Parte dos modelos adota a arquitetura Mixture of Experts (MoE), na qual grupos diferentes funcionam como especialistas. A tarefa apresentada pelo usuário define qual parcela será ativada.
No Qwen3.8-Max, por exemplo, os 2,4 trilhões de parâmetros totais são reduzidos a aproximadamente 95 bilhões durante cada etapa de processamento. Esse funcionamento permite construir sistemas muito grandes sem executar toda a estrutura simultaneamente.
Próximos modelos
A Alibaba informou que o Qwen 4 está em treinamento. A empresa também indicou que versões futuras, como Qwen 4.5 e Qwen 5, podem ficar na faixa de 5 trilhões a 10 trilhões de parâmetros.
A ByteDance, responsável pelo TikTok, também estuda modelos em escala semelhante, mas ainda não confirmou publicamente esses números. Uma comparação direta com empresas americanas é limitada porque OpenAI e Anthropic não divulgam oficialmente a quantidade de parâmetros de seus modelos mais recentes.
O tamanho, no entanto, não define sozinho a qualidade de um sistema. O Chinchilla, desenvolvido pelo Google DeepMind, tinha 70 bilhões de parâmetros e superou o Gopher, com 280 bilhões, em diversas avaliações.
Também influenciam o desempenho a qualidade e a quantidade dos dados de treinamento, a arquitetura adotada e o poder computacional disponível. Com isso, a estratégia chinesa combina modelos menores e eficientes, voltados a dispositivos com recursos limitados, com sistemas muito maiores para tarefas complexas em infraestruturas extensas de data centers.







