Köszönjük, hogy elküldte érdeklődését! Csapatunk egyik tagja hamarosan felveszi Önnel a kapcsolatot.
Köszönjük, hogy elküldte foglalását! Csapatunk egyik tagja hamarosan felveszi Önnel a kapcsolatot.
Időtartalma 14 órák
Kurzusleírás
Bevezetés az erősítéses tanulásba
- Erősítéses tanulás áttekintése és alkalmazásai
- Különbségek az irányított, irányítatlan és erősítéses tanulás között
- Fő fogalmak: ügynök, környezet, jutalmak és stratégia
Markov-decidens folyamatok (MDP)
- Állapotok, akciók, jutalmak és állapotátalakítások megértése
- Értékek függvényei és a Bellman-egyenlet
- Dinamikus programozás az MDP-k megoldására
Alapvető RL algoritmusok
- Táblázatos módszerek: Q-Learning és SARSA
- Sztratégia-alapú módszerek: REINFORCE algoritmus
- Actor-Critic keretrendszerek és alkalmazásai
Mély erősítéses tanulás
- Bevezetés a mély Q-hálózatokba (DQN)
- Tapasztalat-visszatérés és céphálózatok
- Sztratégiagradientekek és haladó mély RL módszerek
RL keretrendszerek és eszközök
- Bevezetés az OpenAI Gym-hoz és más RL környezetekhez
- PyTorch vagy TensorFlow használata RL modellek fejlesztéséhez
- RL ügynökök oktatása, tesztelése és benchmarkolása
RL kihívások
- Felfedezés és kizsákmányolás kiegyensúlyozása az oktatásban
- Híg jutalmak és a hitelszerződés problémák kezelése
- Méretezhetőség és számítási kihívások az RL-ben
Kezügyes tevékenységek
- Q-Learning és SARSA algoritmusok megvalósítása nulláról
- DQN-alapú ügynök oktatása, hogy játszanak egy egyszerű játékot OpenAI Gym-ban
- RL modellek finomhangolása a teljesítmény javítása érdekében egyedi környezetekben
Összefoglalás és következő lépések
Követelmények
- Erősítéses tanulás alapelveinek és algoritmusainak mély megértése
- Python programozási készség
- Közelítés a neurális hálózatokhoz és a mély tanulás keretrendszereihez
Körkép
- MI mérnökök
- MI szakértők