Паддинг до max len / бакетинг, Masking/mask_zero в Embedding, передача mask в RNN/Attention; loss с sample_weight или ignore padded.
Разбор
- ragged tensors — альтернатива.
- Бакеттинг ускоряет vs один гигантский pad.
- Проверяйте, что mask доходит до loss.
- tf.data padded_batch.
Итог
Маски и бакеттинг — ключ к честному sequence training.