
A Reward AI lançou o OM-1 (Omnibody Model 1) —, uma política de manipulação universal treinada em demonstrações de humanos usando uma luva vestível com sete graus de liberdade. Conforme relata a MarkTechPost, nenhum teleoperação ou dados coletados nos próprios robôs foram utilizados durante o treinamento.
De acordo com a fonte, a política opera em manipuladores industriais e robôs humanoides com velocidade humana e aprende uma nova tarefa em menos de 30 minutos de dados. O sistema combina rastreamento eletromagnético da mão com uma camada de controle treinada por reforço; para o rastreamento, afirma-se haver 60% menos desvio de trajetória em comparação ao método visual-inercial, na velocidade de 67.
O significado prático da abordagem é a possibilidade de transferir demonstrações humanas para diferentes plataformas robóticas sem teleoperação. Esta é uma conclusão analítica, não um resultado de implementação confirmado: os pesos, o código e a API do OM-1 ainda não estão publicamente disponíveis.
comentário editorial
Por que importa
Uma consequência provável é o aumento do interesse no treinamento de robôs baseado em demonstrações humanas em vez de telepresença. O próximo sinal observável será a publicação dos pesos, do código, da API ou de testes independentes do OM-1. Incerteza significativa persiste devido à existência de apenas uma fonte e à ausência de materiais primários.