A Spirit AI está treinando robôs humanoides com registros de movimentos cotidianos feitos por cerca de mil contratados equipados com sensores. A startup chinesa pretende usar esses dados para criar sistemas capazes de interpretar comandos de voz e executar tarefas no mundo físico.
A empresa concentra seus primeiros planos em linhas de produção e serviços comerciais. A expansão para residências deve ocorrer depois dos avanços nesses ambientes. A expectativa é permitir interações em linguagem natural até meados de 2027.
Dados coletados fora das simulações
Em vez de depender principalmente de ambientes virtuais, a Spirit AI reúne informações de situações reais. Dezenas de robôs Moz1 com rodas já atuam em linhas de produção da CATL e da JD.com.
A startup informa ter captado mais de US$ 670 milhões, cerca de R$ 3,41 bilhões, desde sua fundação em 2024. A avaliação da empresa é de 20 bilhões de yuans, o equivalente a US$ 2,9 bilhões, aproximadamente R$ 14,76 bilhões.
Em ambientes estruturados de sala de estar, o índice de sucesso em tarefas simples chegou a 90%. O resultado faz parte do desenvolvimento de modelos voltados a ações físicas, não apenas à interpretação de comandos.
Limites do software e da movimentação
Para Gao Yang, cofundador e cientista-chefe da Spirit AI, o principal problema está no sistema que coordena as máquinas. “O cérebro é, de fato, o elo mais fraco em toda a pilha de robótica”, afirmou.
A empresa prevê alcançar o marco do GPT-3.0 até meados de 2027. A proposta é que uma pessoa converse com o robô em linguagem natural e peça uma sequência de ações para cumprir determinada tarefa.
Movimentos delicados continuam entre os desafios técnicos. Desenroscar uma tampa de garrafa, por exemplo, exige um nível de controle ainda difícil de aperfeiçoar. Para reduzir riscos, os robôs usam controle de força em todo o corpo e ativam a frenagem de emergência quando identificam força excessiva na interação com o ambiente.







