Кладут тензоры через .to(device, non_blocking=True) при pin_memory=True, минимизируют Python-циклы и лишние sync.
Разбор
- Перенсите dict/list рекурсивно одной утилитой.
- Аугментации на GPU меняют пайплайн.
- Слишком мелкий batch не скрывает latency transfer.
- Профилируйте data wait vs compute.
Итог
Эффективный H2D = pin_memory + non_blocking + достаточный compute.