Lépjen kapcsolatba velünk
 Időtartalma 14 órák

Kurzusleírás

Bevezetés az erősítéses tanulásba

  • Erősítéses tanulás áttekintése és alkalmazásai
  • Különbségek az irányított, irányítatlan és erősítéses tanulás között
  • Fő fogalmak: ügynök, környezet, jutalmak és stratégia

Markov-decidens folyamatok (MDP)

  • Állapotok, akciók, jutalmak és állapotátalakítások megértése
  • Értékek függvényei és a Bellman-egyenlet
  • Dinamikus programozás az MDP-k megoldására

Alapvető RL algoritmusok

  • Táblázatos módszerek: Q-Learning és SARSA
  • Sztratégia-alapú módszerek: REINFORCE algoritmus
  • Actor-Critic keretrendszerek és alkalmazásai

Mély erősítéses tanulás

  • Bevezetés a mély Q-hálózatokba (DQN)
  • Tapasztalat-visszatérés és céphálózatok
  • Sztratégiagradientekek és haladó mély RL módszerek

RL keretrendszerek és eszközök

  • Bevezetés az OpenAI Gym-hoz és más RL környezetekhez
  • PyTorch vagy TensorFlow használata RL modellek fejlesztéséhez
  • RL ügynökök oktatása, tesztelése és benchmarkolása

RL kihívások

  • Felfedezés és kizsákmányolás kiegyensúlyozása az oktatásban
  • Híg jutalmak és a hitelszerződés problémák kezelése
  • Méretezhetőség és számítási kihívások az RL-ben

Kezügyes tevékenységek

  • Q-Learning és SARSA algoritmusok megvalósítása nulláról
  • DQN-alapú ügynök oktatása, hogy játszanak egy egyszerű játékot OpenAI Gym-ban
  • RL modellek finomhangolása a teljesítmény javítása érdekében egyedi környezetekben

Összefoglalás és következő lépések

Követelmények

  • Erősítéses tanulás alapelveinek és algoritmusainak mély megértése
  • Python programozási készség
  • Közelítés a neurális hálózatokhoz és a mély tanulás keretrendszereihez

Körkép

  • MI mérnökök
  • MI szakértők

Résztvevők száma


Ár per résztvevő

Közelgő kurzusok

Rokon kategóriák