Dense retrieval кодирует запрос и пассаж энкодерами в векторы и ищет nearest neighbors (cosine/IP) в ANN-индексе. Ловит paraphrases лучше лексики, но ошибается на редких точных токенах.
Разбор
- Двойной энкодер (bi-encoder) vs cross-encoder rerank.
- Обучение contrastive на парах.
- Доменный fine-tune энкодера.
- Размер чанка влияет на вектор.
Итог
Dense retrieval — поиск по семантическим векторам, не по точным словам.