Токенизация — разбиение текста на единицы анализа (слова, субслова, символы), с которыми работает модель. От выбора токенизатора зависят словарь, OOV и длина последовательности.
Разбор
- Whitespace — грубо для морфологически богатых языков.
- Subword (BPE/WordPiece/Unigram) — стандарт трансформеров.
- Язык и домен влияют на правила.
- Одинаковый токенизатор нужен на train и inference.
Итог
Токенизация задаёт алфавит единиц, на котором учится NLP-модель.