Ньютон использует H⁻¹∇f для квадратичной модели; быстрее локально при хорошем H, но дорог и хрупок при невыпуклости/сингулярности. GD/SGD дешевле и устойчивее в deep learning.
Разбор
- Gauss–Newton/Levenberg–Marquardt — компромиссы.
- Quasi-Newton (L-BFGS) приближает H.
- Сёдла: чистый Ньютон может быть плох без модификаций.
- Масштаб признаков влияет на обусловленность H.
Итог
Кривизна (гессиан) ускоряет шаг, но цена и стабильность решают выбор метода.