Iceberg

Apache Iceberg — открытый табличный формат для аналитических данных, который решает классические проблемы data lake: надёжность, производительность и эволюцию схемы. В отличие от привычных подходов, Iceberg хранит метаданные о состоянии таблицы — снапшоты и манифесты — и умеет выполнять ACID-транзакции поверх файлов в S3 или HDFS.

На этом теге собраны статьи и уроки курса о том, как устроен Iceberg изнутри: архитектура и понятия, каталоги, партиционирование, time travel, ветвление и тегирование снапшотов, обслуживание таблиц и метатаблицы. Материалы подойдут и новичкам, которые впервые слышат про табличные форматы, и инженерам, уже внедряющим Iceberg в продакшене.

Мы разбираем практические сценарии: как выполнять запросы через Trino, Spark и DuckDB, как ускорить выборки, как строить лейкхаус и зачем переходить с устаревших табличных форматов. Все примеры сопровождаются кодом и командами, которые можно повторить у себя.

Если вы строите современный data lake или лейкхаус на объектном хранилище — Apache Iceberg сегодня де-факто стандарт, и этот тег станет вашей шпаргалкой по нему.

Читайте также