Reward AI выпустила OM-1 (Omnibody Model 1) — универсальную политику манипуляции, обученную на демонстрациях людей с помощью носимой перчатки с семью степенями свободы. Как сообщает MarkTechPost, при обучении не использовались телеприсутствие и данные, собранные на роботах.

По данным источника, политика работает на промышленных манипуляторах и гуманоидных роботах с человеческой скоростью, а новую задачу осваивает менее чем за 30 минут данных. Система сочетает электромагнитное отслеживание кисти и слой управления, обученный с подкреплением; для отслеживания заявлено на 60% меньшее превышение траектории, чем у визуально-инерциального метода, при скорости 67 см/с.

Практическое значение подхода — возможность переносить человеческие демонстрации на разные роботизированные платформы без телеприсутствия. Это аналитический вывод, а не подтверждённый результат внедрения: веса, код и API OM-1 пока публично недоступны.