MLM (BERT) маскирует часть токенов и учит восстанавливать их по двунаправленному контексту — pretrain для encoder-моделей понимания.
Разбор
- Отличается от каузальной LM next-token.
- Динамическое маскирование на эпохах.
- Хорошо для классификации/NER после FT.
- Не оптимально для длинной генерации.
Итог
MLM — pretrain «угадай пропуск» с двусторонним контекстом.