Köszönjük, hogy elküldte érdeklődését! Csapatunk egyik tagja hamarosan felveszi Önnel a kapcsolatot.
Köszönjük, hogy elküldte foglalását! Csapatunk egyik tagja hamarosan felveszi Önnel a kapcsolatot.
Kurzusleírás
Bevezetés, célkitűzések és migrációs stratégia
- Kurzuscélok, résztvevői profil egyeztetése és sikermérő számok
- Felszíni szintű migrációs megközelítések és kockázati szempontok
- Munkaterületek, repozitóriumok és labor adatkészletek beállítása
1. nap — Migrációs alapok és architektúra
- Lakehouse fogalmak, Delta Lake áttekintés és Databricks architektúra
- SMP és MPP különbségek, valamint a migrációra gyakorolt hatásuk
- Medallion (Bronze→Silver→Gold) tervezés és az Unity Catalog áttekintése
1. napi labor — Egy tárolt eljárás átdolgozása
- Minta tárolt eljárás gyakorlati migrálása notebookba
- Időbeli táblák és kurzorok DataFrame-transzformációkká történő áthangolása
- Érvényesítés és összehasonlítás az eredeti kimenettel
2. nap — Haladó Delta Lake & inkrementális betöltés
- ACID tranzakciók, commit naplók, verziókezelés és time travel
- Auto Loader, MERGE INTO minták, upsertek és séma-evolúció
- OPTIMIZE, VACUUM, Z-ORDER, partícionálás és tároló optimalizálás
2. napi labor — Inkrementális befogadás & optimalizálás
- Auto Loader befogadás és MERGE workflowok implementálása
- OPTIMIZE, Z-ORDER és VACUUM alkalmazása; eredmények validálása
- Olvashatás/írás teljesítményjavulásának mérése
3. nap — SQL a Databricksben, teljesítmény & hibakeresés
- Analitikai SQL funkciók: ablakfüggvények, magasabb rendű függvények, JSON/tömbkezelés
- Spark UI olvasása, DAG-ok, shuffle-ok, szakaszok, feladatok és palacknyak-diagnosztika
- Leérdezés-optimalizálási minták: broadcast joinok, utasítások (hints), cache-ek és spill csökkentés
3. napi labor — SQL refaktorálás & teljesítményhangolás
- Neheze SQL folyamat átírása optimalizált Spark SQL-re
- Spark UI nyomkövetés használatának a torlódások és shuffle-problémák azonosítására és javítására
- Benchmarkelés (előtt/utána) és optimalizálási lépések dokumentálása
4. nap — Taktikai PySpark: Eljárásszerű logika helyettesítése
- Spark futtatómodell: driver, executorok, lazai értékelés és partícionálási stratégiák
- Lövegek és kurzorok vektorizált DataFrame műveletekké alakítása
- Moduláris felépítés, UDF-k/pandas UDF-k, widgetek és újrafelhasználható könyvtárak
4. napi labor — Eljárásszerű szkriptek refaktorálása
- Eljárásszerű ETL szkript átírása moduláris PySpark notebookokba
- Paraméterezés, egységtesztek és újrafelhasználható függvények bevezetése
- Kódbemutató és best-practice ellenőrzőlista alkalmazása
5. nap — Orchestráció, végleges pipeline & best-practice-ek
- Databricks Workflows: feladattervezés, függőségek, trigger-ek és hiba kezelése
- Inkrementális Medallion pipelineok tervezése minőségellenőrzési szabályokkal és séma-validálással
- Integráció Git (GitHub/Azure DevOps), CI és PySpark logika tesztelési stratégiákkal
5. napi labor — Teljes körű, végleges pipeline építése
- Bronze→Silver→Gold pipeline összeállítása Workflows-szal történő orchestrálással
- Naplózás, auditálás, újrapróbálkozás és automatizált validációk implementálása
- Teljes pipeline futtatása, kimenetek validálása és telepítési megjegyzések elkészítése
Műveletessé tétel, governance és produkció-készület
- Unity Catalog governance, lineázs és hozzáférés-vezérlés best-practice-ek
- Költségek, kláster-méretezés, autoscaling és feladat-konkurensia minták
- Telepítési ellenőrzőlisták, visszavonási stratégiák és runbookok létrehozása
Végső áttekintés, tudásátadás és következő lépések
- Resztvevői prezentációk a migrációs munkáról és a tanulságokról
- Hiányosság-elemzés, javasolt utókövető tevékenységek és képzési anyagok átadása
- Irodalmi források, továbbképzési utak és támogatási lehetőségek
Követelmények
- Adatmérnöki fogalmak megértése
- Tapasztalat SQL-ben és tárolt eljárásokban (Synapse / SQL Server)
- Ismeretség az ETL-orchestráció fogalmaival (ADF vagy hasonló)
Célcsoport
- Adatmérnöki háttérrel rendelkező technológiai menedzserek
- Adatmérnökök, akik eljárásszerű OLAP-logikát kívánnak Lakehouse-mintákra átállítani
- Platformmérnökök, akik felelősek a Databricks bevezetéséért
35 Órák