Köszönjük, hogy elküldte érdeklődését! Csapatunk egyik tagja hamarosan felveszi Önnel a kapcsolatot.
Köszönjük, hogy elküldte foglalását! Csapatunk egyik tagja hamarosan felveszi Önnel a kapcsolatot.
Időtartalma 14 órák
Kurzusleírás
Bevezetés a Gemini 3 multimodalitásába
- Képességek szövegek, képek, hangok és videók terén
- Modellválasztás és a végpontok áttekintése
- A multimodális érvelés kulcsfogalmai
Munka szöveges és strukturált bemenetekkel
- Promptolási stratégiák szöveggeneráláshoz
- Metaadatok, kontextusablakok és beágyazások
- Multimodális feladatok szövegalapú irányítása
Képértelmezés és vizuális munkafolyamatok
- Képelemzés és -értelmezés a Gemini 3-mal
- Vizuális kereső- és címkézőeszközök létrehozása
- Kép-szöveg és szöveg-kép interakciók építése
Hangbemenetek feldolgozása
- Beszédfelismerési és átírási munkafolyamatok
- Hangesemények észlelése és értelmezése
- Hang integrálása szöveges és vizuális bemenetekkel
Videóintelligencia és jelenetelemzés
- Képkockánkénti és folyamatos videóértelmezés
- Összefoglaló és kiemeléskinyerő eszközök építése
- Videóalapú automatizálási és tartalmi munkafolyamatok
Multimodális alkalmazásarchitektúrák tervezése
- Több bemeneti típus kombinálása egyetlen folyamatban
- Késleltetési, költség- és számítási szempontok
- Bevált gyakorlatok skálázható multimodális rendszerekhez
Multimodális alkalmazások prototipizálása
- Multimodális prototípusok gyakorlati létrehozása
- Gyors iteráció promptmérnökséggel
- Felhasználói élmény folyamatainak tesztelése és finomítása
Multimodális megoldások telepítése
- Telepítési stratégiák és környezetbeállítás
- Valós teljesítmény nyomon követése
- Biztonsági és megfelelőségi szempontok
Összefoglalás és következő lépések
Követelmények
- A modern MI-fogalmak ismerete
- Python- vagy JavaScript-tapasztalat
- REST API-k ismerete
Célközönség
- Tervezők
- Tartalomkészítők
- Műszaki termékcsapatok
Vélemények (1)
Folyam, hangulat és téma a bemutatón
Lukasz Kowalczyk - Allegro Sp. z o.o.
Kurzus - Google Gemini AI for Data Analysis
Gépi fordítás