Опираться на распределение вопросов, тип документов, окно модели, эмпирический Recall@k; overlap сохраняет разрезанные предложения; отдельные стратегии для таблиц/слайдов/кода.
Разбор
- Слишком большие чанки ухудшают dense match.
- Метаданные предков (section path).
- A/B на grounded answers.
- Стоимость индексации.
Итог
Чанкинг настраивают под retrieval-метрики и структуру документов, не «универсальные 512».