Partition — порция данных, обрабатываемая одной task параллельно. Число партиций влияет на параллелизм: слишком мало — простой CPU, слишком много — overhead scheduling.
Разбор
- Источник (файлы/Kafka) задаёт начальные партиции.
repartition/coalesce меняют число.
- Партиции таблицы Hive/Iceberg ≠ обязательно Spark partitions 1:1, но связаны.
- Смотрите spark UI: tasks per stage.
Итог
Partition = единица параллелизма task; размер и число критичны для скорости.