Столбцовые Parquet/ORC с сжатием (snappy/zstd): predicate/column projection pushdown, меньше I/O. JSON/CSV — для обмена, не для больших mart'ов.
Разбор
- Схема в футере Parquet помогает.
- Избегайте миллионов крошечных файлов.
- Delta/Iceberg/Hudi добавляют транзакции поверх файлов.
- Сортировка/кластеризация ускоряет фильтры.
Итог
Для аналитики — Parquet/ORC (или lakehouse-таблицы); CSV/JSON — вход сырых данных.