Lépjen kapcsolatba velünk

Kurzusleírás

Bevezetés a megerősítésalapú tanulásba és az agens-alapú MI-be

  • Döntéshozatal bizonytalanság esetén és szekvenciális tervezés
  • Az RL fő komponensei: agentek, környezetek, állapotok és jutalmak
  • Az RL szerepe az adaptív és agens-alapú MI rendszerekben

Markov-döntési folyamatok (MDP-k)

  • MDP-k formális definíciója és tulajdonságai
  • Értékfüggvények, Bellman-egyenletek és dinamikus programozás
  • Stratégiaértékelés, -javítás és iteráció

Modellmentes megerősítésalapú tanulás

  • Monte Carlo és Időbeli Különbség (TD) tanulás
  • Q-tanulás és SARSA
  • Gyakorlat: táblás RL módszerek implementálása Pythonban

Mély megerősítésalapú tanulás

  • Neurális hálózatok és RL ötvözése függvényközelítéshez
  • Mély Q-hálózatok (DQN) és tapasztalat-visszajátszás
  • Actor-Critic architektúrák és stratégia-gradiens
  • Gyakorlat: agent edzése DQN és PPO segítségével Stable-Baselines3 keretrendszerben

Felfedezési stratégiák és jutalomformázás

  • A felfedezés és a kihasználás közötti egyensúly (ε-greedy, UCB, entrópiamódszerek)
  • Jutalomfüggvények tervezése és a szándékolatlan viselkedések elkerülése
  • Jutalomformázás és kurzusalapú tanulás

Haladó témák az RL és a döntéshozatal területén

  • Több agentes megerősítésalapú tanulás és kooperatív stratégiák
  • Hierarchikus megerősítésalapú tanulás és opciók kerete
  • Offline RL és imitációs tanulás a biztonságosabb üzembe helyezés érdekében

Szimulációs környezetek és értékelés

  • OpenAI Gym és egyedi környezetek használata
  • Folyamatos vs. diszkrét akcióterek
  • Mutatók az agent teljesítményére, stabilitására és minta-hatékonyságára

RL integrálása agens-alapú MI rendszerekbe

  • Következtetés és RL ötvözése hibrid agent architektúrákban
  • Megerősítésalapú tanulás integrálása eszköz-használó agentekkel
  • Üzemeltetési szempontok a méretezéshez és az üzembe helyezéshez

Záróprojekt

  • Egy megerősítésalapú tanulási agent tervezése és megvalósítása egy szimulált feladathoz
  • Edzési teljesítmény elemzése és hiperparaméterek optimalizálása
  • Adaptív viselkedés és döntéshozatal bemutatása egy agens kontextusban

Összefoglalás és következő lépések

Követelmények

  • Röviden és alaposan: Python programozási ismeretek
  • Mélyreható megértése a gépi tanulási és mélytanulási fogalmaknak
  • Ismertető szöveg a lineáris algebráról, valószínűségszámításról és az alapvető optimalizálási módszerekről

Célcsoport

  • Megerősítésalapú tanuló mérnökök és alkalmazott MI kutatók
  • Robotikai és automatizálási fejlesztők
  • Mérnöki csapatok, amelyek adaptív és agens-alapú MI rendszereken dolgoznak
 28 Órák

Résztvevők száma


Ár per résztvevő

Vélemények (3)

Közelgő kurzusok

Rokon kategóriák