Kurzusleírás
1. Bevezetés a mély megerősítéses tanulásba
- Mi a megerősítéses tanulás?
- Különbség a felügyelt, a felügyelet nélküli és a megerősítéses tanulás között
- A DRL alkalmazásai 2025-ben (robotika, egészségügy, pénzügy, logisztika)
- Az ágens-környezet interakciós hurok megértése
2. A megerősítéses tanulás alapjai
- Markov-döntési folyamatok (MDP)
- Állapot, cselekvés, jutalom, politika és értékfüggvények
- Felfedezés kontra kiaknázás kompromisszum
- Monte Carlo-módszerek és időbeli-különbség (TD) tanulás
3. Alapvető RL-algoritmusok megvalósítása
- Táblázatos módszerek: dinamikus programozás, politikaértékelés és iteráció
- Q-tanulás és SARSA
- Epszilon-mohó felfedezés és csökkenő stratégiák
- RL-környezetek megvalósítása az OpenAI Gymnasium segítségével
4. Átmenet a mély megerősítéses tanulásba
- A táblázatos módszerek korlátai
- Neurális hálózatok használata függvényközelítésre
- A Deep Q-Network (DQN) architektúrája és munkafolyamata
- Tapasztalat-visszajátszás és célhálózatok
5. Fejlett DRL-algoritmusok
- Dupla DQN, párbaj DQN és priorizált tapasztalat-visszajátszás
- Politika-gradiens módszerek: REINFORCE algoritmus
- Actor-Critic architektúrák (A2C, A3C)
- Proximális politikaoptimalizálás (PPO)
- Soft Actor-Critic (SAC)
6. Munka folytonos cselekvési terekkel
- Kihívások a folytonos vezérlésben
- A DDPG (Deep Deterministic Policy Gradient) használata
- Twin Delayed DDPG (TD3)
7. Gyakorlati eszközök és keretrendszerek
- A Stable-Baselines3 és a Ray RLlib használata
- Naplózás és monitorozás a TensorBoard segítségével
- Hiperparaméter-hangolás DRL-modellekhez
8. Jutalomtervezés és környezettervezés
- Jutalomformálás és büntetés-kiegyensúlyozás
- Szimulációból valóságba átviteli tanulási koncepciók
- Egyedi környezet létrehozása a Gymnasiumban
9. Részben megfigyelhető környezetek és általánosítás
- Hiányos állapotinformációk kezelése (POMDP-k)
- Memóriaalapú megközelítések LSTM-ek és RNN-ek használatával
- Az ágens robusztusságának és általánosításának javítása
10. Játékelmélet és többágenses megerősítéses tanulás
- Bevezetés a többágenses környezetekbe
- Együttműködés kontra versengés
- Alkalmazások az ellenséges tanításban és a stratégiaoptimalizálásban
11. Esettanulmányok és valós alkalmazások
- Autonóm vezetési szimulációk
- Dinamikus árazási és pénzügyi kereskedési stratégiák
- Robotika és ipari automatizálás
12. Hibaelhárítás és optimalizálás
- Instabil tanítás diagnosztizálása
- Jutalomritkaság és túlillesztés kezelése
- DRL-modellek skálázása GPU-kon és elosztott rendszereken
13. Összefoglalás és következő lépések
- A DRL-architektúra és a kulcsalgoritmusok áttekintése
- Ipari trendek és kutatási irányok (pl. RLHF, hibrid modellek)
- További források és olvasnivalók
Követelmények
- Jártasság a Python programozásban
- A kalkulus és a lineáris algebra megértése
- Alapvető valószínűségszámítási és statisztikai ismeretek
- Tapasztalat gépi tanulási modellek építésében Python és NumPy vagy TensorFlow/PyTorch használatával
Célközönség
- Fejlesztők, akik érdeklődnek a mesterséges intelligencia és az intelligens rendszerek iránt
- Adatkutatók, akik a megerősítéses tanulási keretrendszereket fedezik fel
- Gépi tanulási mérnökök, akik autonóm rendszerekkel dolgoznak
Vélemények (3)
Nagyon tetszett, hogy időt szántunk a CHAT GPT-vel való játszozgatásra. A terem ebben az esetben nem volt a legmegfelelőbb - helyette egy nagy asztalra több kisebb asztalt kellett volna beállítani, így csoportokban lehettünk volna, és ötletekkel gondolkodhattunk volna.
Nola - Laramie County Community College
Kurzus - Artificial Intelligence (AI) Overview
Gépi fordítás
Fókuszált munka az első elvekből indulva, majd ugyanabból a naptól esettanulmányok alkalmazásához való átmenet
Maggie Webb - Department of Jobs, Regions, and Precincts
Kurzus - Artificial Neural Networks, Machine Learning, Deep Thinking
Gépi fordítás
Annak ellenére, hogy valódi céges adatokat használt. A tanár nagyon jó megközelítést alkalmazott a tanulók részvételének és versengésének elősegítésével
Jimena Esquivel - Zaklad Uslugowy Hakoman Andrzej Cybulski
Kurzus - Applied AI from Scratch in Python
Gépi fordítás