Lépjen kapcsolatba velünk

Kurzusleírás

1. Bevezetés a mély megerősítéses tanulásba

  • Mi a megerősítéses tanulás?
  • Különbség a felügyelt, a felügyelet nélküli és a megerősítéses tanulás között
  • A DRL alkalmazásai 2025-ben (robotika, egészségügy, pénzügy, logisztika)
  • Az ágens-környezet interakciós hurok megértése

2. A megerősítéses tanulás alapjai

  • Markov-döntési folyamatok (MDP)
  • Állapot, cselekvés, jutalom, politika és értékfüggvények
  • Felfedezés kontra kiaknázás kompromisszum
  • Monte Carlo-módszerek és időbeli-különbség (TD) tanulás

3. Alapvető RL-algoritmusok megvalósítása

  • Táblázatos módszerek: dinamikus programozás, politikaértékelés és iteráció
  • Q-tanulás és SARSA
  • Epszilon-mohó felfedezés és csökkenő stratégiák
  • RL-környezetek megvalósítása az OpenAI Gymnasium segítségével

4. Átmenet a mély megerősítéses tanulásba

  • A táblázatos módszerek korlátai
  • Neurális hálózatok használata függvényközelítésre
  • A Deep Q-Network (DQN) architektúrája és munkafolyamata
  • Tapasztalat-visszajátszás és célhálózatok

5. Fejlett DRL-algoritmusok

  • Dupla DQN, párbaj DQN és priorizált tapasztalat-visszajátszás
  • Politika-gradiens módszerek: REINFORCE algoritmus
  • Actor-Critic architektúrák (A2C, A3C)
  • Proximális politikaoptimalizálás (PPO)
  • Soft Actor-Critic (SAC)

6. Munka folytonos cselekvési terekkel

  • Kihívások a folytonos vezérlésben
  • A DDPG (Deep Deterministic Policy Gradient) használata
  • Twin Delayed DDPG (TD3)

7. Gyakorlati eszközök és keretrendszerek

  • A Stable-Baselines3 és a Ray RLlib használata
  • Naplózás és monitorozás a TensorBoard segítségével
  • Hiperparaméter-hangolás DRL-modellekhez

8. Jutalomtervezés és környezettervezés

  • Jutalomformálás és büntetés-kiegyensúlyozás
  • Szimulációból valóságba átviteli tanulási koncepciók
  • Egyedi környezet létrehozása a Gymnasiumban

9. Részben megfigyelhető környezetek és általánosítás

  • Hiányos állapotinformációk kezelése (POMDP-k)
  • Memóriaalapú megközelítések LSTM-ek és RNN-ek használatával
  • Az ágens robusztusságának és általánosításának javítása

10. Játékelmélet és többágenses megerősítéses tanulás

  • Bevezetés a többágenses környezetekbe
  • Együttműködés kontra versengés
  • Alkalmazások az ellenséges tanításban és a stratégiaoptimalizálásban

11. Esettanulmányok és valós alkalmazások

  • Autonóm vezetési szimulációk
  • Dinamikus árazási és pénzügyi kereskedési stratégiák
  • Robotika és ipari automatizálás

12. Hibaelhárítás és optimalizálás

  • Instabil tanítás diagnosztizálása
  • Jutalomritkaság és túlillesztés kezelése
  • DRL-modellek skálázása GPU-kon és elosztott rendszereken

13. Összefoglalás és következő lépések

  • A DRL-architektúra és a kulcsalgoritmusok áttekintése
  • Ipari trendek és kutatási irányok (pl. RLHF, hibrid modellek)
  • További források és olvasnivalók

Követelmények

  • Jártasság a Python programozásban
  • A kalkulus és a lineáris algebra megértése
  • Alapvető valószínűségszámítási és statisztikai ismeretek
  • Tapasztalat gépi tanulási modellek építésében Python és NumPy vagy TensorFlow/PyTorch használatával

Célközönség

  • Fejlesztők, akik érdeklődnek a mesterséges intelligencia és az intelligens rendszerek iránt
  • Adatkutatók, akik a megerősítéses tanulási keretrendszereket fedezik fel
  • Gépi tanulási mérnökök, akik autonóm rendszerekkel dolgoznak
 21 Órák

Résztvevők száma


Ár per résztvevő

Vélemények (3)

Közelgő kurzusok

Rokon kategóriák