Spark — распределённый движок обработки данных: batch и micro-batch/streaming аналитика на кластере с API на Scala/Java/Python/R и SQL. Держит вычисления в памяти эффективнее классического MapReduce для многих workload.
Разбор
- Компоненты: Spark SQL, Structured Streaming, MLlib, GraphX (реже).
- Работает на YARN/K8s/standalone, читает S3/HDFS/JDBC…
- Не заменяет OLTP БД и не является оркестратором (для этого Airflow).
- Единица работы — Job, делящийся на stages/tasks.
Итог
Spark = распределённые трансформации больших данных с SQL/DataFrame API.