Отказоустойчивость Spark через линейдж RDD
При сбое исполнителя Spark партиции, которые он хранил, теряются. Вместо репликации данных (как в HDFS) Spark использует линейдж: записанную последовательность трансформаций, породивших каждую партицию.
Драйвер обнаруживает сбой, определяет потерянные партиции и пересчитывает их, воспроизводя трансформации от ближайшего сохранённого предка. Этот подход дешевле репликации для большинства нагрузок, потому что трансформации обычно узкие (map, filter) и работают с локальными данными.