NLI/entailment модели «ответ следует из контекста», цитатные span-match, QA-раундтрип, выборочный human audit, LLM-judge с рубидными критериями и калибровкой на золоте.
Разбор
- Автосудьи смещены — нужен golden set.
- Мультидокументные конфликты.
- Отказ «не знаю» как правильное поведение.
- Срезы по сложности вопросов.
Итог
Groundedness измеряют привязкой к источникам плюс дозированным human gold.