Kurzusleírás
Databricks Platform és Lakehouse alapjai
- A Databricks Lakehouse architektúrája és komponensei
- Munkaterek és katalógusok szervezése
Databricks Workspace és Notebookok
- Munkatér navigációja és notebook alapú fejlesztés
- Kód struktúrája újra felhasználható notebookokban
Apache Spark Architektúra és Végrehajtás
- Spark futtató környezet architektúrája és végrehajtási modellje
- Létrehozott (lazy) értékelés és a feladat DAG (Directed Acyclic Graph)
PySpark DataFrameek és a DataFrame API
- DataFrame absztrakciók és séma definíciók
- A core DataFrame műveletek és oszlop kifejezések
SQL konvertálása PySpark DataFrameekké
- Az SQL alapú főbb utasítások transzlációja DataFrame műveletekké
- Ablakfüggvények (Window functions) és aggregációk PySparkban
Adatok olvasása és írása Databricksen
- Olvasás gyakori fájl- és adatbázisforrásokból
- Adatok írása partícionálással a Lakehouse-ba
Delta Lake és Tábla Kezelés
- Delta táblák és ACID tranzakciók
- Időutazás (Time travel) és sémaváltozás (schema evolution)
Adattisztítási és transzformációs minták
- Adattisztítás és típuskonverzió
- Újra felhasználható transzformációs logika építése
Felhasználó által definiált függvények (UDF) és Moduláris kód
- Python UDF-k és pandas UDF-k
- A procedurális logika modulárrá tétele függvényekkel
Performancia hangolás és optimalizálás
- Partícionálási és cache stratégiai lehetőségek
- Gátak (bottleneck) diagnosztizálása a Spark UI segítségével
A Structured Streaming alapjai
- Batch versus stream feldolgozási modellek
- Stream DataFrames és alap aggregációk
Databricks Feladatok és Munkafolyamat orchestration
- Notebookok ütemezése feladatként és task-ként
- Többlépcsős munkafolyamatok építése függőségekkel
Unity Catalog és Adat Governance
- A Unity Catalog architektúrája és namespace definíciói
- Hozzáférés kontrol és adatvonalalak (data lineage)
Tesztelés, Debugging és Gyártási gyakorlatok
- Egységtesztelés PySpark logikára
- Debuggolás és kód minőségi szabványok
Vég végig futó pénzügyi szektorbeli esetek
- Egy vég végig futó banki ETL pipeline építése
- Meglévő SQL folyamatok konvertálása PySparkra
SQL terhek migrálása PySparkra
- Migrációs stratégia és tervezési minták
- SQL munkafolyamatok fokozatos konvertálása PySparkra
Követelmények
- Tapasztalat Python programozással, beleértve a függvényeket és adattípusokat is
- SQL ismeretek, beleértve az joinsokat (összekapcsolásokat), aggregációkat és allekérdezéseket (subqueries)
- Nincs szükség előzetes Databricks vagy PySpark tapasztalatra
Célcsoport
- Adatmérnökök, adatanalitikusok és egyéb adat szakemberek
- Személyek vagy csapatok, akik meglévő SQL-alapú munkafolyamataikat kívánják áthelyezni (migrálni) a Databricksre és PySparkra
Vélemények (1)
Szerettek, hogy gyakorlati volt. Örültem annak, hogy a teóriai ismereteket gyakorlati példákkal alkalmazhattam.
Aurelia-Adriana - Allianz Services Romania
Kurzus - Python and Spark for Big Data (PySpark)
Gépi fordítás