O Google prepara o Gemini 4 para lançamento muito antes do fim de 2026, enquanto amplia o Gemini 3.8 Live com uma opção de interação visual. A informação sobre o próximo modelo foi divulgada por Koray Kavukcuoglu, chefe do Google DeepMind, que afirmou que a empresa pretende disponibilizar uma versão inicial pós-treinamento o mais rápido possível.
Kavukcuoglu disse que os resultados obtidos até agora são animadores e que o Google quer manter um ritmo acelerado de novas versões. O Gemini 4 está na etapa de refinamento, período que inclui testes internos e a implementação de mecanismos de segurança. O executivo também afirmou que, em sua visão, é uma “certeza” que o Google estará sempre na fronteira do desenvolvimento de inteligência artificial.
Avatar animado no Gemini Enterprise
A novidade apresentada nesta quinta-feira (24) é o Gemini 3.8 Live com Live Avatar, disponível no Gemini Enterprise. O recurso coloca uma persona animada na tela e combina geração de vídeo de baixa latência com os recursos de diálogo ao vivo do Gemini.
Durante a conversa, o avatar movimenta a boca de acordo com a fala e apresenta expressões faciais. A ferramenta também processa informações visuais e de áudio simultaneamente, além de exibir dados na tela. Em segundo plano, pode buscar informações ou executar determinadas tarefas sem interromper o diálogo.
O Google cita o check-in de um hóspede em um hotel como exemplo de uso: o avatar conversa com a pessoa enquanto aciona ferramentas necessárias para realizar a tarefa. A proposta é voltada a aplicações empresariais, incluindo atendimento ao cliente e experiências interativas.
Conversas em 97 idiomas
O Live Avatar pode alternar entre 97 idiomas. Segundo o Google, a sincronização labial e as expressões são adaptadas durante a mudança de idioma sem perda de fidelidade visual ou introdução de “desvio visual”. Em uma demonstração da empresa, o mesmo avatar conversa em inglês e japonês com movimentos da boca correspondentes às falas.
As organizações podem escolher avatares de uma biblioteca ou criar personagens personalizados a partir de uma imagem de referência. A opção permite preservar características visuais, a identidade de um personagem ou elementos de uma marca. Atualmente, a criação personalizada está restrita a uma lista de empresas autorizadas.
O Google afirma ainda que os conteúdos gerados por seus produtos de inteligência artificial recebem a marca d’água invisível SynthID, incorporada ao áudio e ao vídeo para ajudar na identificação de material criado por IA. O Gemini 3.8 Live havia sido apresentado em setembro como um modelo para diálogos em tempo quase real, com processamento de informações visuais, alternância entre 97 idiomas e execução de ferramentas em segundo plano.







