Lépjen kapcsolatba velünk
 Időtartalma 35 órák

Kurzusleírás

Bevezetés, célkitűzések és migrációs stratégia

  • A képzés céljai, a résztvevői profilok összehangolása és a siker kritériumai
  • Magas szintű migrációs megközelítések és kockázati megfontolások
  • Munkaterületek, adattárak és laboradatkészletek beállítása

1. nap — A migráció alapjai és architektúra

  • Lakehouse fogalmak, Delta Lake áttekintés és Databricks architektúra
  • SMP és MPP közötti különbségek és ezek hatása a migrációra
  • Medallion (Bronze→Silver→Gold) tervezés és Unity Catalog áttekintés

1. napi labor — Tárolt eljárás átültetése

  • Egy minta tárolt eljárás gyakorlati migrálása notebookba
  • Ideiglenes táblák és kurzorok leképezése DataFrame transzformációkra
  • Ellenőrzés és összehasonlítás az eredeti kimenettel

2. nap — Haladó Delta Lake és növekményes betöltés

  • ACID tranzakciók, commit naplók, verziókezelés és időutazás
  • Auto Loader, MERGE INTO minták, upsert műveletek és sémaevolúció
  • OPTIMIZE, VACUUM, Z-ORDER, particionálás és tárolási hangolás

2. napi labor — Növekményes betöltés és optimalizálás

  • Auto Loader betöltés és MERGE munkafolyamatok megvalósítása
  • OPTIMIZE, Z-ORDER és VACUUM alkalmazása; az eredmények ellenőrzése
  • Olvasási/írási teljesítményjavulás mérése

3. nap — SQL a Databricksben, teljesítmény és hibakeresés

  • Analitikus SQL funkciók: ablakfüggvények, magasabb rendű függvények, JSON/tömb kezelés
  • A Spark UI, DAG-ok, shuffle műveletek, stage-ek, taskok és szűk keresztmetszetek elemzése
  • Lekérdezés-hangolási minták: broadcast joinok, hint-ek, gyorsítótárazás és spill csökkentés

3. napi labor — SQL refaktorálás és teljesítményhangolás

  • Egy nehéz SQL folyamat refaktorálása optimalizált Spark SQL-lé
  • Spark UI nyomkövetések használata a skew és shuffle problémák azonosítására és javítására
  • Előtte/utána teljesítménymérés és a hangolási lépések dokumentálása

4. nap — Gyakorlati PySpark: a procedurális logika kiváltása

  • Spark végrehajtási modell: driver, executorok, lusta kiértékelés és particionálási stratégiák
  • Ciklusok és kurzorok átalakítása vektorizált DataFrame műveletekké
  • Modularizáció, UDF-ek/pandas UDF-ek, widgetek és újrafelhasználható könyvtárak

4. napi labor — Procedurális szkriptek refaktorálása

  • Egy procedurális ETL szkript refaktorálása moduláris PySpark notebookokká
  • Paraméterezés, egységszintű tesztek és újrafelhasználható függvények bevezetése
  • Kódellenőrzés és bevált gyakorlatok ellenőrzőlistájának alkalmazása

5. nap — Hangszerelés, teljes körű folyamat és bevált gyakorlatok

  • Databricks Workflows: feladattervezés, feladatfüggőségek, triggerek és hibakezelés
  • Növekményes Medallion folyamatok tervezése minőségi szabályokkal és sémaellenőrzéssel
  • Integráció Git-tel (GitHub/Azure DevOps), CI-vel és tesztelési stratégiákkal a PySpark logikához

5. napi labor — Teljes körű folyamat felépítése

  • Bronze→Silver→Gold folyamat összeállítása Workflows hangszereléssel
  • Naplózás, auditálás, újrapróbálkozások és automatizált ellenőrzések megvalósítása
  • A teljes folyamat futtatása, a kimenetek ellenőrzése és telepítési jegyzetek elkészítése

Üzemeltetés, adatkormányzás és gyártási felkészültség

  • Unity Catalog adatkormányzás, származási adatok és hozzáférés-vezérlési bevált gyakorlatok
  • Költség, fürtméretezés, automatikus skálázás és feladat-párhuzamossági minták
  • Telepítési ellenőrzőlisták, visszagördítési stratégiák és runbook készítés

Záró áttekintés, tudásátadás és következő lépések

  • A résztvevők bemutatják a migrációs munkát és a levont tanulságokat
  • Hiányelemzés, javasolt nyomonkövetési tevékenységek és képzési anyagok átadása
  • Hivatkozások, további tanulási útvonalak és támogatási lehetőségek

Követelmények

  • Adatfeldolgozási alapfogalmak ismerete
  • SQL és tárolt eljárások (Synapse / SQL Server) terén szerzett tapasztalat
  • ETL hangszerelési fogalmak ismerete (ADF vagy hasonló)

Célközönség

  • Adatfeldolgozási háttérrel rendelkező technológiai vezetők
  • Adatmérnökök, akik procedurális OLAP logikát Lakehouse mintákra migrálnak
  • Platformmérnökök, akik a Databricks bevezetéséért felelősek

Résztvevők száma


Ár per résztvevő

Közelgő kurzusok

Rokon kategóriák