Os robôs em geral, e os humanoides em particular, podem lembrar filmes muito antigos ou vídeos do YouTube travando no carregamento: tremidos e aos trancos. A China Mobile acaba de abrir o código de uma solução. Ela se chama Open-RAIL e resolve um descompasso entre o cérebro dos robôs, ou seja, os modelos de IA, e o corpo deles.
Os modelos de IA que comandam robôs, normalmente modelos de visão-linguagem-ação (VLAs, na sigla em inglês), como o GR00T, da Nvidia, e o π0, da Physical Intelligence, podem ser um pouco lentos. Eles observam o mundo, pensam e geram um “action chunk”, ou seja, uma curta sequência de movimentos planejados, cerca de cinco a dez vezes por segundo. Os motores dos robôs, por outro lado, precisam de comandos novos de 200 a 1.000 vezes por segundo. É uma diferença de 30 vezes ou mais.
“Os métodos existentes sofrem com tremores, travamentos ou até pausas na execução das ações robóticas, o que não apenas limita a velocidade de execução alcançável, mas também reduz a taxa geral de sucesso na conclusão das tarefas”, escrevem os pesquisadores da China Mobile no artigo.
Cinco a dez vezes por segundo parece rápido, e é, de certa forma. (Na verdade, nosso cérebro funciona em uma velocidade parecida.) Mas as CPUs e GPUs dos robôs estão controlando o corpo do robô, integrando dados de vários sensores, incluindo vídeo, LIDAR e áudio, conectando-se a um sistema central de gerenciamento e fazendo muitas outras coisas. Além disso, os VLAs são redes neurais enormes, e calcular qualquer coisa leva tempo, mesmo com chips avançados e bastante memória. Então, quando o robô começa a executar comandos, depois espera o próximo, depois se move, depois espera, o resultado é um movimento travado, desajeitado e ineficiente.
Na verdade, se o robô estiver servindo chá ou café, isso também pode causar sujeira, se não for perigoso. A solução padrão hoje? Simplesmente ir devagar.
Segundo o artigo da China Mobile, muitas demonstrações de VLAs desaceleram a execução em um fator de 4 a 8 para disfarçar os tremores. O que pode explicar por que alguns vídeos de demonstração de robôs humanoides vêm com um pequeno “2X” ou “4X” no canto. E o que pode explicar por que os humanoides tendem a ser um pouco mais lentos do que se esperaria.
O novo software de código aberto funciona garantindo que o corpo do robô não precise esperar novos comandos do cérebro. Ele divide o movimento em três threads independentes: observação a 30 Hz, ou vezes por segundo, inferência do modelo a 5-10 Hz e controle dos motores de 200 Hz a 1 kHz. Isso significa que, enquanto o robô executa um chunk, o modelo já está trabalhando no próximo. Em seguida, uma rotina de suavização em duas etapas refina o resultado: primeiro suaviza o movimento dentro de cada chunk e depois mescla as emendas entre os chunks de movimento.
Resultado: um movimento limpo, simples e suave… talvez até quase humano.
Isso é mais ou menos análogo ao que nosso próprio cérebro e nosso corpo fazem. Os músculos ajudam por serem macios e elásticos, suavizando o movimento, claro, mas nossa medula espinhal cuida de correções rápidas que nem precisam chegar ao cérebro, e nosso cérebro planeja com antecedência, prevendo o futuro e preparando os próximos movimentos antes que os atuais terminem. Os movimentos também se sobrepõem – como na rotina de duas etapas que mescla as emendas entre movimentos distintos no Open-RAIL –, com um começando pouco antes de o anterior terminar, como quando estendemos a mão para pegar um copo e o levantamos antes mesmo de concluir totalmente a parte de segurá-lo. Nosso cérebro também busca a suavidade, assim como a suavização do Open-RAIL.
Segundo os pesquisadores, o software reduziu os trancos em 100 vezes. É mais ou menos a diferença entre um adolescente aprendendo a dirigir em um carro com câmbio manual e um câmbio automático de alto padrão. O Open-RAIL também consegue mais do que dobrar a velocidade do robô e aumenta as taxas de sucesso das tarefas de 10% a 73%. Esses números são da própria equipe, claro, e o site do projeto não os detalha tarefa por tarefa. Uma replicação independente ajudaria… e deve vir em breve, graças ao fato de que o software agora tem código aberto e está disponível gratuitamente.
Outros têm métodos diferentes para resolver esse problema, claro. A Physical Intelligence publicou seu próprio método de chunking em tempo real em 2025, e a Hugging Face o incorporou ao seu framework aberto LeRobot. O artigo do Open-RAIL se compara a essa abordagem, bem como a outros métodos acadêmicos, como A2C2 e VLASH.
Curiosamente, porém, o Open-RAIL não é tanto um único algoritmo, mas uma camada completa de implementação, que inclui um sistema servidor-cliente com um painel de controle web que expõe mais de 40 parâmetros de execução. Ele também faz gravação automática de dados no formato do LeRobot e teleoperação com humano no circuito (human-in-the-loop), para que um operador possa corrigir o robô no meio de uma tarefa e incorporar essa correção aos dados de treinamento.
Adicionar um novo modelo exige de 50 a 100 linhas de código, segundo a equipe, e uma camada padrão de abstração de hardware teoricamente vai reduzir a integração de um novo robô “de semanas para horas”.
Até agora, os modelos compatíveis incluem o Nvidia GR00T, o π0 (pronuncia-se “pi-zero”) e o π0.5, da Physical Intelligence, o ACT, o RDT, o SmolVLA, o GO-1, da AgiBot, e o próprio modelo TAO, da China Mobile.
Os robôs compatíveis incluem o AgiBot G1, o WA2, da NAVIAI, e o Lingxi, da China Mobile, sendo que o site do projeto também lista o G1, da Unitree.