A Reward AI lançou o OM-1 (Omnibody Model 1) —, uma política de manipulação universal treinada em demonstrações de humanos usando uma luva vestível com sete graus de liberdade. Conforme relata a MarkTechPost, nenhum teleoperação ou dados coletados nos próprios robôs foram utilizados durante o treinamento.

De acordo com a fonte, a política opera em manipuladores industriais e robôs humanoides com velocidade humana e aprende uma nova tarefa em menos de 30 minutos de dados. O sistema combina rastreamento eletromagnético da mão com uma camada de controle treinada por reforço; para o rastreamento, afirma-se haver 60% menos desvio de trajetória em comparação ao método visual-inercial, na velocidade de 67.

O significado prático da abordagem é a possibilidade de transferir demonstrações humanas para diferentes plataformas robóticas sem teleoperação. Esta é uma conclusão analítica, não um resultado de implementação confirmado: os pesos, o código e a API do OM-1 ainda não estão publicamente disponíveis.