Конвейер трансформаций Apache Spark RDD

RDD (Resilient Distributed Datasets) — фундаментальная абстракция Spark: неизменяемая, распределённая коллекция записей, обрабатываемая параллельно.

Трансформации map, filter, flatMapленивые: они строят DAG зависимостей без выполнения, пока действие (reduce, collect) не запустит вычисление.

Такая модель позволяет Spark оптимизировать выполнение: объединять трансформации, минимизировать перемешивания данных и восстанавливаться после сбоев по информации о происхождении (lineage).