Модель влияет на то, что логируется; следующие обучения усиливают старые предпочтения (popularity bias). Смягчают exploration, IPS, регулярные рандомизации, diversity constraints.
Разбор
- Долгосрочные метрики в A/B.
- Снижение веса исторических показанных.
- Cold-start контента.
- Аудит fairness сегментов.
Итог
Feedback loop превращает политику модели в новую реальность данных.