Несколько tape-backward с суммированием градиентов (или scaled loss) до одного apply_gradients; делят loss на число микробатчей.
Разбор
- С Strategy аккуратно агрегируют per-replica.
- BN статистики от micro-batch.
- Смешение с LossScaleOptimizer требует порядка unscale.
- Эффективный batch растёт без роста VRAM пика.
Итог
Accumulation имитирует large batch в ограниченной памяти.