Kurzusleírás
Bevezetés a megerősítésalapú tanulásba és az agens-alapú MI-be
- Döntéshozatal bizonytalanság esetén és szekvenciális tervezés
- Az RL fő komponensei: agentek, környezetek, állapotok és jutalmak
- Az RL szerepe az adaptív és agens-alapú MI rendszerekben
Markov-döntési folyamatok (MDP-k)
- MDP-k formális definíciója és tulajdonságai
- Értékfüggvények, Bellman-egyenletek és dinamikus programozás
- Stratégiaértékelés, -javítás és iteráció
Modellmentes megerősítésalapú tanulás
- Monte Carlo és Időbeli Különbség (TD) tanulás
- Q-tanulás és SARSA
- Gyakorlat: táblás RL módszerek implementálása Pythonban
Mély megerősítésalapú tanulás
- Neurális hálózatok és RL ötvözése függvényközelítéshez
- Mély Q-hálózatok (DQN) és tapasztalat-visszajátszás
- Actor-Critic architektúrák és stratégia-gradiens
- Gyakorlat: agent edzése DQN és PPO segítségével Stable-Baselines3 keretrendszerben
Felfedezési stratégiák és jutalomformázás
- A felfedezés és a kihasználás közötti egyensúly (ε-greedy, UCB, entrópiamódszerek)
- Jutalomfüggvények tervezése és a szándékolatlan viselkedések elkerülése
- Jutalomformázás és kurzusalapú tanulás
Haladó témák az RL és a döntéshozatal területén
- Több agentes megerősítésalapú tanulás és kooperatív stratégiák
- Hierarchikus megerősítésalapú tanulás és opciók kerete
- Offline RL és imitációs tanulás a biztonságosabb üzembe helyezés érdekében
Szimulációs környezetek és értékelés
- OpenAI Gym és egyedi környezetek használata
- Folyamatos vs. diszkrét akcióterek
- Mutatók az agent teljesítményére, stabilitására és minta-hatékonyságára
RL integrálása agens-alapú MI rendszerekbe
- Következtetés és RL ötvözése hibrid agent architektúrákban
- Megerősítésalapú tanulás integrálása eszköz-használó agentekkel
- Üzemeltetési szempontok a méretezéshez és az üzembe helyezéshez
Záróprojekt
- Egy megerősítésalapú tanulási agent tervezése és megvalósítása egy szimulált feladathoz
- Edzési teljesítmény elemzése és hiperparaméterek optimalizálása
- Adaptív viselkedés és döntéshozatal bemutatása egy agens kontextusban
Összefoglalás és következő lépések
Követelmények
- Röviden és alaposan: Python programozási ismeretek
- Mélyreható megértése a gépi tanulási és mélytanulási fogalmaknak
- Ismertető szöveg a lineáris algebráról, valószínűségszámításról és az alapvető optimalizálási módszerekről
Célcsoport
- Megerősítésalapú tanuló mérnökök és alkalmazott MI kutatók
- Robotikai és automatizálási fejlesztők
- Mérnöki csapatok, amelyek adaptív és agens-alapú MI rendszereken dolgoznak
Vélemények (3)
Az oktató türelmes és nagyon segítőkész. Jól ismeri a témát.
CLIFFORD TABARES - Universal Leaf Philippines, Inc.
Kurzus - Agentic AI for Business Automation: Use Cases & Integration
Gépi fordítás
Jó ismeret- és gyakorlati keverék
Ion Mironescu - Facultatea S.A.I.A.P.M.
Kurzus - Agentic AI for Enterprise Applications
Gépi fordítás
A számítástudomány elméleti és gyakorlati, valamint magasabb és alacsonyabb szintű perspektívák keverékének bemutatása
Ion Mironescu - Facultatea S.A.I.A.P.M.
Kurzus - Autonomous Decision-Making with Agentic AI
Gépi fordítás