Optimizing PySpark Code

Pubblicato il: 30 maggio 2021
sul canale di: Data Analysis Lab
1,180
like

In this session we cover ways to optimize PySpark code. This includes descriptions of situations where slowness may occur, for example, uneven partitions and skewed joins. To combat these issues I explain repartitioning/coalescing and broadcast joins. I also explain how to place your data in memory or on disk to cache commonly used data sets. Finally, I show the interface where you can monitor memory and CPU usage to make sure you are using the optimal cluster size.

Lastly, I show how to use multiple languages inside of one Databricks notebooks including SQL and R code.

To gain access to code, data, and course materials visit https://kelseyemnett.com/2021/05/30/o....


In questa pagina del sito puoi guardare il video online Optimizing PySpark Code della durata di ore minuti seconda in buona qualità , che l'utente ha caricato Data Analysis Lab 30 maggio 2021, condividi il link con amici e conoscenti, su youtube questo video è già stato visto 1,180 volte e gli è piaciuto like spettatori. Buona visione!