Apple Machine Learning Research publicó un material sobre REVERSAL-BENCH, un enfoque relacionado con la medición de la reversibilidad y el reinicio en el aprendizaje por refuerzo. El título también menciona el «abismo» del aprendizaje sin reinicios.

Según la breve descripción del editor, uno de los objetivos centrales del aprendizaje por refuerzo autónomo es el entrenamiento continuo de políticas sin reinicios externos. El material vincula esta tarea con un eje de reversibilidad y un oráculo de reinicio especial.

La fuente se presenta únicamente mediante metadatos de la página, por lo que no es posible determinar el diseño de la prueba, los resultados obtenidos ni las ventajas prácticas de REVERSAL-BENCH.