SGD обновляет веса по градиенту (часто с momentum); Adam адаптирует per-parameter шаги через моменты m/v — быстрее сходится на многих задачах, но иначе обобщает.
Разбор
- AdamW отделяет weight decay от адаптивного шага.
- SGD+momentum+расписание всё ещё силён в vision.
- Learning rate и weight decay критичны для обоих.
- Не смешивайте state оптимизатора при смене типа без понимания.
Итог
Выбор оптимизатора — компромисс сходимости и обобщения.