
Reward AI a lancé OM-1 (Omnibody Model 1) —, une politique de manipulation universelle entraînée sur des démonstrations humaines capturées à l'aide d'un gant portable à sept degrés de liberté. Selon MarkTechPost, aucune téléopération ni aucune donnée collectée directement sur les robots n'a été utilisée lors de l'entraînement.
D'après la source, la politique fonctionne sur des bras manipulateurs industriels et des robots humanoïdes à vitesse humaine, et apprend une nouvelle tâche en moins de 30 minutes de données. Le système combine un suivi électromagnétique de la main et une couche de contrôle entraînée par renforcement; pour le suivi, il est affirmé un dépassement de trajectoire inférieur de 60% par rapport à la méthode visuo-inertielle, à une vitesse de 67.
La portée pratique de cette approche réside dans la possibilité de transférer des démonstrations humaines vers différentes plateformes robotiques sans téléopération. Il s'agit d'une déduction analytique et non d'un résultat de déploiement confirmé: les poids, le code et l'API d'OM-1 ne sont pas encore accessibles au public.
commentaire éditorial
Pourquoi c’est important
Conséquence probable : un intérêt accru pour l'entraînement des robots sur des démonstrations humaines plutôt que sur la téléprésence. Le prochain signal observable sera la publication des poids, du code, de l'API ou de tests indépendants d'OM-1. Une incertitude substantielle subsiste en raison de l'existence d'une source unique et de l'absence de documents primaires.