Spark
Apache Spark — фреймворк для распределённой обработки больших данных, который умеет считать петабайты на кластере из десятков машин. Одна из главных рабочих лошадей в мире Big Data.
На этом теге мы рассматриваем Spark в контексте современных форматов: как Spark работает с Iceberg, где его место рядом с Trino и DuckDB и когда Spark — правильный выбор.
Хотя для многих задач хватает SQL-движков, Spark незаменим там, где нужны сложные ETL-процессы, машинное обучение и потоковая обработка. Материалы помогут расставить инструменты по местам.
Подойдёт всем, кто строит пайплайны на кластерах и хочет понимать, какие задачи решать Spark, а какие — более лёгкими инструментами.
