Ez a háromnapos gyakorlati tanfolyam a PySpark, Pandas és Polars használatára fókuszál a Kubernetes-alapú környezetekben történő hatékony adatfeldolgozó munkafolyamatok létrehozásában és optimalizálásában.
A résztvevők gyakorlati betekintést nyernek abba, hogyan futnak a Spark alkalmazások a Kubernetesben, és hogyan befolyásolják az alkalmazásszintű konfigurációs döntések a teljesítményt, a méretezhetőséget, az erőforrás-igényt és a költségeket. A kurzus a kulcsfontosságú optimalizálási területeket is áttekinti, köztük az executor méretezést, a memória-allokációt, a dinamikus allokációt, a partícionálási stratégiákat, a shuffle viselkedést, a kisfájlok problémáját és a hatékony Parquet feldolgozást.
A tanfolyam emellett foglalkozik a Pandas használatával járó gyakori kihívásokkal, például a memória-korlátokkal és az OOM (out-of-memory) hibákkal, valamint bevezeti a Polars-t, mint magas teljesítményű alternatívát a kijelölt adatfeldolgozási feladatokra. A gyakorlati feladatok során a résztvevők diagnosztizálják a teljesítmény- és memória-problémákat, összehasonlítják a különböző konfigurációs stratégiákat, és alkalmazzák az optimalizálási technikákat realisztikus ETL és gépi tanulási jelenetekben.
A tanfolyam fókusa végig a gyakorlati döntéshozatalon van: az üüklakók azonosításának megértése, a megfelelő eszköz kiválasztása, a Spark hatékony konfigurálása, valamint a teljesítmény és az infrastruktúra-erőforrás-felhasználás költségeinek kiegyensúlyozása.
Olvass tovább...