Lépjen kapcsolatba velünk
 Időtartalma 21 órák

Kurzusleírás

Bevezetés a multimodális MI-be és az Ollama használatába

  • A multimodális tanulás áttekintése
  • A vizuális-nyelvi integráció fő kihívásai
  • Az Ollama képességei és architektúrája

Az Ollama környezet beállítása

  • Az Ollama telepítése és konfigurálása
  • Helyi modelltelepítéssel való munka
  • Az Ollama integrálása Pythonnal és Jupyterrel

Munka multimodális bemenetekkel

  • Szöveg és kép integrációja
  • Hang- és strukturált adatok beépítése
  • Előfeldolgozási folyamatok tervezése

Dokumentumértelmező alkalmazások

  • Strukturált információk kinyerése PDF-ekből és képekből
  • Az OCR kombinálása nyelvi modellekkel
  • Intelligens dokumentumelemzési munkafolyamatok építése

Vizuális kérdésmegválaszolás (VQA)

  • VQA adatkészletek és benchmarkok beállítása
  • Multimodális modellek tanítása és értékelése
  • Interaktív VQA alkalmazások építése

Multimodális ágensek tervezése

  • Az ágenstervezés alapelvei multimodális következtetéssel
  • Az észlelés, a nyelv és a cselekvés ötvözése
  • Ágensek üzembe helyezése valós felhasználási esetekre

Haladó integráció és optimalizálás

  • Multimodális modellek finomhangolása az Ollama segítségével
  • A következtetési teljesítmény optimalizálása
  • Skálázhatósági és üzembe helyezési szempontok

Összefoglalás és a következő lépések

Követelmények

  • A gépi tanulási fogalmak alapos ismerete
  • Tapasztalat mélytanulási keretrendszerekkel, például a PyTorch vagy a TensorFlow használatával
  • A természetes nyelvi feldolgozás és a számítógépes látás ismerete

Célközönség

  • Gépi tanulási mérnökök
  • MI-kutatók
  • Vizuális és szöveges munkafolyamatokat integráló termékfejlesztők

Résztvevők száma


Ár per résztvevő

Közelgő kurzusok

Rokon kategóriák