Публикация была переведена автоматически. Исходный язык: Русский
Хорошие вопросы для собеседований разработчиков под Spark:
1️⃣ Spark DataFrames очень похожи на pandas DataFrames. Существуют ли inplace методы для обновления датасета?
// подсказка
2️⃣ Каким образом, пользуясь PySpark вызывать методы, реализованные в Java или которые можно векторизовать в Spark?
База производительности PySpark DataFrames: построение плана выполнения с помощью Catalyst, его оптимизация с помощью CBO и исполнение в JVM. Это знает даже начинающий разработчик Big Data.
Но помимо базы есть масса интересных возможностей, например, оконные функции. И что еще интереснее — возможность расширения функциональности PySpark (и его производительности) с помощью вызова функций на Java или Scala, без необходимости уметь на них программировать.


🗓 Если вы хотите этому научиться, то Практический курс по Big Data начинается 23 марта 2026
Модуль 6. "Модель вычислений Spark: RDD" содержит следующие темы:
— Введение в Spark DataFrames, Spark SQL
— Чтение и запись данных
— Работа с пропущенными значениями (NA)
— Группировки, соединения, оконные функции
— Функции pyspark.sql.functions
— А также много интересных инсайтов и практики
Если вы уже знакомы с HDFS, MapReduce, Hive, то эти знания и навыки можно получить в рамках 3х-недельного crash-course:
Полезная информация
Читать сначала: ч.1 гарантии в IT проектах
Предыдущий выпуск: ч.5 Spark, RDD, типы кешей и оптимизации
В скриншотах пасхалка с тезисами про Spark DataFrame API
Сохраните и подпишитесь, если хотите быть востребованным в IT
BigData Team: the way you learn best
Хорошие вопросы для собеседований разработчиков под Spark:
1️⃣ Spark DataFrames очень похожи на pandas DataFrames. Существуют ли inplace методы для обновления датасета?
// подсказка
2️⃣ Каким образом, пользуясь PySpark вызывать методы, реализованные в Java или которые можно векторизовать в Spark?
База производительности PySpark DataFrames: построение плана выполнения с помощью Catalyst, его оптимизация с помощью CBO и исполнение в JVM. Это знает даже начинающий разработчик Big Data.
Но помимо базы есть масса интересных возможностей, например, оконные функции. И что еще интереснее — возможность расширения функциональности PySpark (и его производительности) с помощью вызова функций на Java или Scala, без необходимости уметь на них программировать.


🗓 Если вы хотите этому научиться, то Практический курс по Big Data начинается 23 марта 2026
Модуль 6. "Модель вычислений Spark: RDD" содержит следующие темы:
— Введение в Spark DataFrames, Spark SQL
— Чтение и запись данных
— Работа с пропущенными значениями (NA)
— Группировки, соединения, оконные функции
— Функции pyspark.sql.functions
— А также много интересных инсайтов и практики
Если вы уже знакомы с HDFS, MapReduce, Hive, то эти знания и навыки можно получить в рамках 3х-недельного crash-course:
Полезная информация
Читать сначала: ч.1 гарантии в IT проектах
Предыдущий выпуск: ч.5 Spark, RDD, типы кешей и оптимизации
В скриншотах пасхалка с тезисами про Spark DataFrame API
Сохраните и подпишитесь, если хотите быть востребованным в IT
BigData Team: the way you learn best