Чанкинг режет документы на фрагменты для индексации: слишком мелкие — теряют контекст, слишком крупные — шум и лимит окна. Перекрытия и семантический сплит улучшают recall.
Разбор
- Метаданные чанка (title, url) сохраняют.
- Выравнивание с токенизатором модели.
- Таблицы/код требуют особых правил.
- Оценка retrieval на вопросах.
Итог
Чанки — единица поиска; их размер — компромисс контекста и точности.