На Tensor Core GPU NHWC/channels_last + fp16/bf16 часто ускоряет свёртки; на маленьких тензорах/CPU выигрыша нет, возможны лишние convert.
Разбор
- Проверяйте реальный throughput images/s.
- Убедитесь, что модель и входы в одном format.
- Некоторые ops падают обратно в NCHW.
- Сравнивайте accuracy — численно может чуть плавать.
Итог
Speedup layout+AMP — эмпирика на целевом GPU и модели.