LM оценивает вероятность последовательности токенов P(t1..tn), обычно через цепное правило. Используется для генерации, скоринга беглости и как база pretrained трансформеров.
Разбор
- Авторегрессия: следующий токен по предыдущим.
- Masked LM учит восстанавливать пропуски.
- Перплексия — метрика качества LM.
- Доменный mismatch ухудшает LM.
Итог
Языковая модель — вероятностный взгляд на «какой текст правдоподобен».