Конвейер трансформаций Apache Spark RDD
RDD (Resilient Distributed Datasets) — фундаментальная абстракция Spark: неизменяемая, распределённая коллекция записей, обрабатываемая параллельно.
Трансформации map, filter, flatMap — ленивые: они строят DAG зависимостей без выполнения, пока действие (reduce, collect) не запустит вычисление.
Такая модель позволяет Spark оптимизировать выполнение: объединять трансформации, минимизировать перемешивания данных и восстанавливаться после сбоев по информации о происхождении (lineage).