Трансформер — архитектура на self-attention и feed-forward блоках, без рекуррентности как основы: параллелит последовательность и ловит дальние зависимости через внимание.
Разбор
- Encoder, decoder или encoder-decoder варианты.
- Позиционные кодировки нужны без RNN/CNN порядка.
- Основа BERT/GPT/T5 и т.д.
- Квадратичная сложность внимания по длине.
Итог
Трансформер — стек внимания и MLP с позициями вместо классической RNN-основы.