Увеличивают parallel map/interleave, cache/snapshot, shard per worker, prefetch, иногда dataset service; выравнивают host CPU с числом GPU.
Разбор
- Избегают Python GIL в py_function.
- TFRecord+локальный SSD лучше NFS.
options.experimental_distribute.
- Профайлер input pipeline — источник истины.
Итог
Data parallel бесполезен, если input не кормит все реплики.