
Apple Machine Learning Research publicó un material sobre REVERSAL-BENCH, un enfoque relacionado con la medición de la reversibilidad y el reinicio en el aprendizaje por refuerzo. El título también menciona el «abismo» del aprendizaje sin reinicios.
Según la breve descripción del editor, uno de los objetivos centrales del aprendizaje por refuerzo autónomo es el entrenamiento continuo de políticas sin reinicios externos. El material vincula esta tarea con un eje de reversibilidad y un oráculo de reinicio especial.
La fuente se presenta únicamente mediante metadatos de la página, por lo que no es posible determinar el diseño de la prueba, los resultados obtenidos ni las ventajas prácticas de REVERSAL-BENCH.
comentario editorial
Por qué importa
Si el material completo confirma la premisa declarada, la siguiente señal importante será la publicación de la descripción de la metodología y los resultados de las pruebas. Por ahora, la incertidumbre es considerable: solo está disponible un resumen meta-descriptivo de una fuente.