Adam адаптирует шаги через моменты; классический L2 в loss ≠ decoupled weight decay — для AdamW используют AdamW (Keras 3 / tensorflow_addons исторически).
Разбор
- Learning rate критичен вместе с beta.
- Decoupled decay предпочтителен для трансформеров.
- Clipnorm/clipvalue — стабилизация.
- Состояние оптимизатора нужно для resume.
Итог
Выбирайте Adam vs AdamW осознанно относительно decay.