Lépjen kapcsolatba velünk

Kurzusleírás

Databricks Platform és Lakehouse alapjai

  • A Databricks Lakehouse architektúrája és komponensei
  • Munkaterek és katalógusok szervezése

Databricks Workspace és Notebookok

  • Munkatér navigációja és notebook alapú fejlesztés
  • Kód struktúrája újra felhasználható notebookokban

Apache Spark Architektúra és Végrehajtás

  • Spark futtató környezet architektúrája és végrehajtási modellje
  • Létrehozott (lazy) értékelés és a feladat DAG (Directed Acyclic Graph)

PySpark DataFrameek és a DataFrame API

  • DataFrame absztrakciók és séma definíciók
  • A core DataFrame műveletek és oszlop kifejezések

SQL konvertálása PySpark DataFrameekké

  • Az SQL alapú főbb utasítások transzlációja DataFrame műveletekké
  • Ablakfüggvények (Window functions) és aggregációk PySparkban

Adatok olvasása és írása Databricksen

  • Olvasás gyakori fájl- és adatbázisforrásokból
  • Adatok írása partícionálással a Lakehouse-ba

Delta Lake és Tábla Kezelés

  • Delta táblák és ACID tranzakciók
  • Időutazás (Time travel) és sémaváltozás (schema evolution)

Adattisztítási és transzformációs minták

  • Adattisztítás és típuskonverzió
  • Újra felhasználható transzformációs logika építése

Felhasználó által definiált függvények (UDF) és Moduláris kód

  • Python UDF-k és pandas UDF-k
  • A procedurális logika modulárrá tétele függvényekkel

Performancia hangolás és optimalizálás

  • Partícionálási és cache stratégiai lehetőségek
  • Gátak (bottleneck) diagnosztizálása a Spark UI segítségével

A Structured Streaming alapjai

  • Batch versus stream feldolgozási modellek
  • Stream DataFrames és alap aggregációk

Databricks Feladatok és Munkafolyamat orchestration

  • Notebookok ütemezése feladatként és task-ként
  • Többlépcsős munkafolyamatok építése függőségekkel

Unity Catalog és Adat Governance

  • A Unity Catalog architektúrája és namespace definíciói
  • Hozzáférés kontrol és adatvonalalak (data lineage)

Tesztelés, Debugging és Gyártási gyakorlatok

  • Egységtesztelés PySpark logikára
  • Debuggolás és kód minőségi szabványok

Vég végig futó pénzügyi szektorbeli esetek

  • Egy vég végig futó banki ETL pipeline építése
  • Meglévő SQL folyamatok konvertálása PySparkra

SQL terhek migrálása PySparkra

  • Migrációs stratégia és tervezési minták
  • SQL munkafolyamatok fokozatos konvertálása PySparkra

Követelmények

  • Tapasztalat Python programozással, beleértve a függvényeket és adattípusokat is
  • SQL ismeretek, beleértve az joinsokat (összekapcsolásokat), aggregációkat és allekérdezéseket (subqueries)
  • Nincs szükség előzetes Databricks vagy PySpark tapasztalatra

Célcsoport

  • Adatmérnökök, adatanalitikusok és egyéb adat szakemberek
  • Személyek vagy csapatok, akik meglévő SQL-alapú munkafolyamataikat kívánják áthelyezni (migrálni) a Databricksre és PySparkra
 35 Órák

Résztvevők száma


Ár per résztvevő

Vélemények (1)

Közelgő kurzusok

Rokon kategóriák