In this session we cover ways to optimize PySpark code. This includes descriptions of situations where slowness may occur, for example, uneven partitions and skewed joins. To combat these issues I explain repartitioning/coalescing and broadcast joins. I also explain how to place your data in memory or on disk to cache commonly used data sets. Finally, I show the interface where you can monitor memory and CPU usage to make sure you are using the optimal cluster size.
Lastly, I show how to use multiple languages inside of one Databricks notebooks including SQL and R code.
To gain access to code, data, and course materials visit https://kelseyemnett.com/2021/05/30/o....
Auf dieser Seite können Sie das Online-Video Optimizing PySpark Code mit der Dauer stunde minuten sekunde in guter Qualität ansehen, das der Benutzer Data Analysis Lab 30 Mai 2021 hochgeladen hat, den Link mit Freunden und Bekannten teilen, dieses Video wurde auf Youtube bereits 1,180 Mal angesehen und es wurde von like den Zuschauern gefallen. Viel Spaß beim Betrachtenden Zuschauern gefallen!