Иерархия: unit-тесты формата/инструментов, автоматические метрики groundedness/safety, рубрики human eval на выборке, редкий gold, онлайн A/B; калибровать автосудью.
Разбор
- Разделить capabilities vs safety.
- Регрессионные промпт-сюиты.
- Согласие аннотаторов.
- Стоимость человеческой оценки.
Итог
LLM eval — пирамида дешёвых автопроверок и дорогих человеческих рубрик.