Смотрят profiler: input pipeline vs device compute, размер модели, overhead Python callbacks, частые save на диск, неоптимальный map.
Разбор
- prefetch/AUTOTUNE первыми.
- Уменьшают verbose/log each step.
- Проверяют, не на CPU ли оказалась модель.
- Сравнивают steps/sec baseline.
Итог
Медленный fit почти всегда data, placement или слишком частый I/O.