Lépjen kapcsolatba velünk
 Időtartalma 14 órák

Kurzusleírás

Bevezetés a Gemini 3 multimodalitásába

  • Képességek szövegek, képek, hangok és videók terén
  • Modellválasztás és a végpontok áttekintése
  • A multimodális érvelés kulcsfogalmai

Munka szöveges és strukturált bemenetekkel

  • Promptolási stratégiák szöveggeneráláshoz
  • Metaadatok, kontextusablakok és beágyazások
  • Multimodális feladatok szövegalapú irányítása

Képértelmezés és vizuális munkafolyamatok

  • Képelemzés és -értelmezés a Gemini 3-mal
  • Vizuális kereső- és címkézőeszközök létrehozása
  • Kép-szöveg és szöveg-kép interakciók építése

Hangbemenetek feldolgozása

  • Beszédfelismerési és átírási munkafolyamatok
  • Hangesemények észlelése és értelmezése
  • Hang integrálása szöveges és vizuális bemenetekkel

Videóintelligencia és jelenetelemzés

  • Képkockánkénti és folyamatos videóértelmezés
  • Összefoglaló és kiemeléskinyerő eszközök építése
  • Videóalapú automatizálási és tartalmi munkafolyamatok

Multimodális alkalmazásarchitektúrák tervezése

  • Több bemeneti típus kombinálása egyetlen folyamatban
  • Késleltetési, költség- és számítási szempontok
  • Bevált gyakorlatok skálázható multimodális rendszerekhez

Multimodális alkalmazások prototipizálása

  • Multimodális prototípusok gyakorlati létrehozása
  • Gyors iteráció promptmérnökséggel
  • Felhasználói élmény folyamatainak tesztelése és finomítása

Multimodális megoldások telepítése

  • Telepítési stratégiák és környezetbeállítás
  • Valós teljesítmény nyomon követése
  • Biztonsági és megfelelőségi szempontok

Összefoglalás és következő lépések

Követelmények

  • A modern MI-fogalmak ismerete
  • Python- vagy JavaScript-tapasztalat
  • REST API-k ismerete

Célközönség

  • Tervezők
  • Tartalomkészítők
  • Műszaki termékcsapatok

Résztvevők száma


Ár per résztvevő

Vélemények (1)

Közelgő kurzusok

Rokon kategóriák