Spark

Apache Spark — фреймворк для распределённой обработки больших данных, который умеет считать петабайты на кластере из десятков машин. Одна из главных рабочих лошадей в мире Big Data.

На этом теге мы рассматриваем Spark в контексте современных форматов: как Spark работает с Iceberg, где его место рядом с Trino и DuckDB и когда Spark — правильный выбор.

Хотя для многих задач хватает SQL-движков, Spark незаменим там, где нужны сложные ETL-процессы, машинное обучение и потоковая обработка. Материалы помогут расставить инструменты по местам.

Подойдёт всем, кто строит пайплайны на кластерах и хочет понимать, какие задачи решать Spark, а какие — более лёгкими инструментами.