MLE ищет θ, максимизирующий P(data|θ); MAP максимизирует P(θ|data) ∝ likelihood×prior. При плоском априоре они совпадают; сильный prior сдвигает оценку.
Разбор
- Лог-likelihood удобнее суммировать.
- Переобучение MLE на малых n → нужен prior/регуляризация.
- Асимптотически MLE часто нормален и эффективен.
- Неидентифицируемость ломает оба подхода.
Итог
MLE — «лучшие параметры под данные»; MAP — ещё и под априор.