num_workers параллелит чтение/аугментации в процессах; pin_memory готовит page-locked host memory для более быстрого H2D copy на CUDA.
Разбор
- Слишком много workers → contention CPU/RAM.
- На Windows/macOS нюансы spawn и pickle Dataset.
persistent_workers снижает overhead пересоздания.
prefetch_factor управляет глубиной очереди.
Итог
Параллельный prefetch + pin_memory снимают data bottleneck.