Köszönjük, hogy elküldte érdeklődését! Csapatunk egyik tagja hamarosan felveszi Önnel a kapcsolatot.
Köszönjük, hogy elküldte foglalását! Csapatunk egyik tagja hamarosan felveszi Önnel a kapcsolatot.
Időtartalma 35 órák
Kurzusleírás
Bevezetés, célkitűzések és migrációs stratégia
- A képzés céljai, a résztvevői profilok összehangolása és a siker kritériumai
- Magas szintű migrációs megközelítések és kockázati megfontolások
- Munkaterületek, adattárak és laboradatkészletek beállítása
1. nap — A migráció alapjai és architektúra
- Lakehouse fogalmak, Delta Lake áttekintés és Databricks architektúra
- SMP és MPP közötti különbségek és ezek hatása a migrációra
- Medallion (Bronze→Silver→Gold) tervezés és Unity Catalog áttekintés
1. napi labor — Tárolt eljárás átültetése
- Egy minta tárolt eljárás gyakorlati migrálása notebookba
- Ideiglenes táblák és kurzorok leképezése DataFrame transzformációkra
- Ellenőrzés és összehasonlítás az eredeti kimenettel
2. nap — Haladó Delta Lake és növekményes betöltés
- ACID tranzakciók, commit naplók, verziókezelés és időutazás
- Auto Loader, MERGE INTO minták, upsert műveletek és sémaevolúció
- OPTIMIZE, VACUUM, Z-ORDER, particionálás és tárolási hangolás
2. napi labor — Növekményes betöltés és optimalizálás
- Auto Loader betöltés és MERGE munkafolyamatok megvalósítása
- OPTIMIZE, Z-ORDER és VACUUM alkalmazása; az eredmények ellenőrzése
- Olvasási/írási teljesítményjavulás mérése
3. nap — SQL a Databricksben, teljesítmény és hibakeresés
- Analitikus SQL funkciók: ablakfüggvények, magasabb rendű függvények, JSON/tömb kezelés
- A Spark UI, DAG-ok, shuffle műveletek, stage-ek, taskok és szűk keresztmetszetek elemzése
- Lekérdezés-hangolási minták: broadcast joinok, hint-ek, gyorsítótárazás és spill csökkentés
3. napi labor — SQL refaktorálás és teljesítményhangolás
- Egy nehéz SQL folyamat refaktorálása optimalizált Spark SQL-lé
- Spark UI nyomkövetések használata a skew és shuffle problémák azonosítására és javítására
- Előtte/utána teljesítménymérés és a hangolási lépések dokumentálása
4. nap — Gyakorlati PySpark: a procedurális logika kiváltása
- Spark végrehajtási modell: driver, executorok, lusta kiértékelés és particionálási stratégiák
- Ciklusok és kurzorok átalakítása vektorizált DataFrame műveletekké
- Modularizáció, UDF-ek/pandas UDF-ek, widgetek és újrafelhasználható könyvtárak
4. napi labor — Procedurális szkriptek refaktorálása
- Egy procedurális ETL szkript refaktorálása moduláris PySpark notebookokká
- Paraméterezés, egységszintű tesztek és újrafelhasználható függvények bevezetése
- Kódellenőrzés és bevált gyakorlatok ellenőrzőlistájának alkalmazása
5. nap — Hangszerelés, teljes körű folyamat és bevált gyakorlatok
- Databricks Workflows: feladattervezés, feladatfüggőségek, triggerek és hibakezelés
- Növekményes Medallion folyamatok tervezése minőségi szabályokkal és sémaellenőrzéssel
- Integráció Git-tel (GitHub/Azure DevOps), CI-vel és tesztelési stratégiákkal a PySpark logikához
5. napi labor — Teljes körű folyamat felépítése
- Bronze→Silver→Gold folyamat összeállítása Workflows hangszereléssel
- Naplózás, auditálás, újrapróbálkozások és automatizált ellenőrzések megvalósítása
- A teljes folyamat futtatása, a kimenetek ellenőrzése és telepítési jegyzetek elkészítése
Üzemeltetés, adatkormányzás és gyártási felkészültség
- Unity Catalog adatkormányzás, származási adatok és hozzáférés-vezérlési bevált gyakorlatok
- Költség, fürtméretezés, automatikus skálázás és feladat-párhuzamossági minták
- Telepítési ellenőrzőlisták, visszagördítési stratégiák és runbook készítés
Záró áttekintés, tudásátadás és következő lépések
- A résztvevők bemutatják a migrációs munkát és a levont tanulságokat
- Hiányelemzés, javasolt nyomonkövetési tevékenységek és képzési anyagok átadása
- Hivatkozások, további tanulási útvonalak és támogatási lehetőségek
Követelmények
- Adatfeldolgozási alapfogalmak ismerete
- SQL és tárolt eljárások (Synapse / SQL Server) terén szerzett tapasztalat
- ETL hangszerelési fogalmak ismerete (ADF vagy hasonló)
Célközönség
- Adatfeldolgozási háttérrel rendelkező technológiai vezetők
- Adatmérnökök, akik procedurális OLAP logikát Lakehouse mintákra migrálnak
- Platformmérnökök, akik a Databricks bevezetéséért felelősek