Перейти к содержимому

Parquet

Apache Parquet — открытый бинарный формат табличных данных. Для Pitlord он рабочий, приложение в нём и читает, и пишет.

  • Колоночное хранение — читаются только нужные колонки, а не файл целиком
  • Сжатие — на диске в разы компактнее CSV
  • Типы колонок хранятся в файле — их не нужно угадывать при открытии
  • Служебные метаданные — рядом с данными можно хранить произвольное описание файла

Последнее и делает Parquet рабочим форматом приложения. Вместе с данными Pitlord хранит в файле параметры прототипа блочной модели. Такой файл называется нативным, и по нему доступны оптимизация, 3D и отчёты.

Parquet без этих метаданных — например, из стороннего софта — откроется обычной таблицей: просмотр, статистика, редактирование.

Подробно — Нативный формат Pitlord.

Редактирование и оптимизация пишут результат в новый Parquet, исходный файл не меняется. Что при этом происходит с метаданными — Нативный формат Pitlord.

Это стандартный Parquet: читается в Python (pandas, pyarrow, polars), DuckDB, Spark, Power BI. Для простого просмотра подойдут бесплатные Tad и ParquetViewer (только Windows).