Apple Machine Learning Research は、強化学習における可逆性の測定とリセットに関連するアプローチである REVERSAL-BENCH に関する資料を発表した。タイトルでは、リセットなし学習の「崖(cliff)」についても言及されている。

発行元の簡潔な説明によれば、自律的強化学習の中心的な目標の一つは、外部リセットなしでポリシーを継続的に学習することである。本資料はこの課題を、可逆性軸と特別なリセットオラクルに関連付けている。

この情報源はページのメタデータのみで提示されているため、テストの仕組み、得られた結果、あるいは REVERSAL-BENCH の実用上の利点を確立することはできない。