DDP запускает реплику модели на каждом процессе/GPU; градиенты синхронизируются all-reduce, параметры остаются согласованными.
Разбор
- Каждый процесс видит свой shard данных (DistributedSampler).
- Broadcast параметров при старте.
no_sync для gradient accumulation.
- NCCL backend обычен на NVIDIA.
Итог
DDP = реплики + sync градиентов для data parallel обучения.