This intermediate course builds on Spark fundamentals to equip data engineers with advanced techniques for optimizing Spark 3.X applications. Participants will deepen their understanding of RDD and DataFrame internals, master performance tuning, explore advanced SQL operations, and implement complex data processing patterns. Through practical labs and real-world scenarios, attendees will gain expertise in building production-grade Spark solutions that scale efficiently across distributed clusters.
Duration:
2 Days
Course Code: BDT168
Learning Objectives:
After this course, you will be able to:
Day 1: Spark 3.X Architecture & Advanced RDDs
Module 1: Spark 3.X Architecture Deep Dive
Module 2: RDD Internals & Advanced Operations
Day 2: DataFrames/Datasets & Advanced SQL
Module 3: DataFrame & Dataset APIs Mastery
Module 4: Advanced Spark SQL & Query Optimization