Databricks опубликовала материал об отказоустойчивом обучении PyTorch в среде AI Runtime. В центре описания — обучение на GPU-масштабе, где сбои, по заявлению издателя, являются регулярными.

В качестве подходов названы интеллектуальная загрузка данных и создание контрольных точек. Согласно синопсису Databricks Blog, они должны поддерживать высокую скорость обучения между сбоями и снижать стоимость восстановления после них.

В доступном источнике нет подробностей о тестовой конфигурации, количественных результатах, типах сбоев или сравнении с другими методами. Данные представлены в виде метаданных страницы, а не полного текста публикации.