При записи Hive-совместимых таблиц bucketBy хэширует строки по ключу в фиксированное число buckets — ускоряет joins/aggregations smark (bucket join) при совместимых bucket spec.
Разбор
- Число buckets согласовывают между таблицами.
- В чистом parquet-на-S3 без metastore польза ограничена.
- Перебукетизация дорога.
- Современные форматы часто предпочитают clustering иных видов.
Итог
Bucketing — заранее хэш-разбиение для ускорения join при поддержке каталогом.