Pretrain учит общие представления на большом сыром тексте; fine-tune адаптирует модель под задачу с разметкой (классификация, NER, QA). Перенос снижает потребность в данных задачи.
Разбор
- Заморозить нижние слои или учить все — выбор.
- Доменный continue-pretrain полезен.
- Катастрофическое забывание при агрессивном FT.
- LoRA/adapters — эффективный FT.
Итог
Сначала общий язык на корпусе, потом узкая задача на лейблах.