Токенизируют текст тем же токенизатором, проецируют символьные/словные spans на первые субтокены (или все), игнорируют спецтокены; тесты на round-trip encode/decode границ.
Разбор
- Off-by-one из пробелов/нормализации.
- WordPiece «##» куски.
- Мультиязычный Unicode.
- Инструменты dataset libraries помогают.
Итог
Align — явная проекция сущностей на subword ids без сдвига границ.