Публикация была переведена автоматически. Исходный язык: Русский
Что выделяет Middle+ специалиста? Однозначно, умение работать с реальными данными.
В реальных данных, большой сегмент посетителей e-commerce сайта - роботы или неавторизованные пользователи. Если мы захотим построить гистограмму количества заходов пользователей и сделаем базовую группировку, то на большом датасете мы не дождемся результата даже на вычислительном кластере с помощью Map Reduce. Такие данные называются "перекошенные".
Проверить себя:
1️⃣ Какие техники вы знаете, чтобы производить расчеты при работе с такими данными?
2️⃣ Каким образом получить план выполнения Spark задачи и понять, что именно можно оптимизировать?
3️⃣ Какие типы Join'ов существуют в Spark и какие оптимизации применяются в оптимизаторе запросов?
Если эти вопросы вызывают сложности, то смело приходите на Практический курс по Big Data, где мы расскажем обо всем этом доступным и понятным языком, а также поделимся, где встречались с такими проблемами на практике.
Практический курс по Big Data начинается 23 марта 2026
Модуль 7. "Оптимизация Spark вычислений" содержит:
— Использование "соли" для устранения перекосов данных
— Как оптимизировать кэширование
— Как читать план выполнения задач и его оптимизировать
— Оптимизация объединений и группировок
— Снижение количества shuffle
— Управление схемой данных
— Оптимизация запросов Catalyst
— И, конечно, много интересных инсайтов и практики
Если вы уже знакомы с HDFS, MapReduce, Hive, то эти знания и навыки можно получить в рамках 3х-недельного crash-course:
Полезная информация
Читать сначала: ч.1 гарантии в IT проектах
Предыдущий выпуск: ч.6 Spark vs pandas, SQL, DataFrames и PySpark оптимизации
✍️ сохраните и подпишитесь, если хотите быть востребованным в IT
BigData Team: the way you learn best
Что выделяет Middle+ специалиста? Однозначно, умение работать с реальными данными.
В реальных данных, большой сегмент посетителей e-commerce сайта - роботы или неавторизованные пользователи. Если мы захотим построить гистограмму количества заходов пользователей и сделаем базовую группировку, то на большом датасете мы не дождемся результата даже на вычислительном кластере с помощью Map Reduce. Такие данные называются "перекошенные".
Проверить себя:
1️⃣ Какие техники вы знаете, чтобы производить расчеты при работе с такими данными?
2️⃣ Каким образом получить план выполнения Spark задачи и понять, что именно можно оптимизировать?
3️⃣ Какие типы Join'ов существуют в Spark и какие оптимизации применяются в оптимизаторе запросов?
Если эти вопросы вызывают сложности, то смело приходите на Практический курс по Big Data, где мы расскажем обо всем этом доступным и понятным языком, а также поделимся, где встречались с такими проблемами на практике.
Практический курс по Big Data начинается 23 марта 2026
Модуль 7. "Оптимизация Spark вычислений" содержит:
— Использование "соли" для устранения перекосов данных
— Как оптимизировать кэширование
— Как читать план выполнения задач и его оптимизировать
— Оптимизация объединений и группировок
— Снижение количества shuffle
— Управление схемой данных
— Оптимизация запросов Catalyst
— И, конечно, много интересных инсайтов и практики
Если вы уже знакомы с HDFS, MapReduce, Hive, то эти знания и навыки можно получить в рамках 3х-недельного crash-course:
Полезная информация
Читать сначала: ч.1 гарантии в IT проектах
Предыдущий выпуск: ч.6 Spark vs pandas, SQL, DataFrames и PySpark оптимизации
✍️ сохраните и подпишитесь, если хотите быть востребованным в IT
BigData Team: the way you learn best