Если модель не влезает на один GPU: pipeline/tensor parallel режут слои/матрицы; DDP предполагает реплику целиком на device.
Разбор
- FSDP шардирует параметры/состояния оптимизатора.
- Сложность инженерии и коммуникации выше.
- Микробатчи и bubble в pipeline.
- Гибриды DP+MP обычны в LLM.
Итог
Не влезает модель — шардирование; не влезает batch — DDP/accum.