Кластеризация группирует объекты по сходству без меток: сегменты клиентов, темы, дедупликация. Качество зависит от метрики расстояния и масштаба признаков.
Разбор
- K-means, иерархическая, DBSCAN — разные индуктивные bias.
- Число кластеров часто неизвестно.
- Оценка — silhouette, бизнес-интерпретация, стабильность.
- Не путать кластеры с истинными классами.
Итог
Кластеризация — структура в данных без учителя, требующая проверки смысла.