email/Slack/PagerDuty через callbacks (on_failure_callback), ErrorNotification, внешние мониторы; критичные DAG — page on-call, остальное — ticket channel.
Разбор
- Дедуплируйте шум retries.
- В алерте: dag_id, run, task, log link, owner.
- Отдельно алертьте scheduler heartbeat и queued storm.
- Runbook ссылкой в сообщении.
Итог
Алерты = callback + маршрутизация по критичности + контекст для on-call.