Каждая голова считает attention в своём подпространстве проекций Q/K/V, затем конкатенируется. Разные головы могут ловить разные типы связей (синтаксис, кореференция и т.д. — эвристически).
Разбор
- Параметр head_dim = d_model / n_heads.
- Не все головы интерпретируемы.
- Стоимость растёт с длиной² и числом голов.
- Pruning голов — research/prod оптимизация.
Итог
Несколько голов — параллельные представления внимания.