Классификация сопоставляет документу/предложению метку: тональность, тема, токсичность. Пайплайн: токенизация → энкодер → голова softmax/sigmoid + CE loss.
Разбор
- Мультикласс vs мультилейбл.
- Дисбаланс классов типичен.
- Длинные документы — truncation/иерархии.
- Baseline: TF-IDF + линейная модель.
Итог
Text classification — метка по смыслу текста при выбранной схеме классов.