Köszönjük, hogy elküldte érdeklődését! Csapatunk egyik tagja hamarosan felveszi Önnel a kapcsolatot.
Köszönjük, hogy elküldte foglalását! Csapatunk egyik tagja hamarosan felveszi Önnel a kapcsolatot.
Időtartalma 21 órák
Kurzusleírás
Bevezetés a multimodális MI-be és az Ollama használatába
- A multimodális tanulás áttekintése
- A vizuális-nyelvi integráció fő kihívásai
- Az Ollama képességei és architektúrája
Az Ollama környezet beállítása
- Az Ollama telepítése és konfigurálása
- Helyi modelltelepítéssel való munka
- Az Ollama integrálása Pythonnal és Jupyterrel
Munka multimodális bemenetekkel
- Szöveg és kép integrációja
- Hang- és strukturált adatok beépítése
- Előfeldolgozási folyamatok tervezése
Dokumentumértelmező alkalmazások
- Strukturált információk kinyerése PDF-ekből és képekből
- Az OCR kombinálása nyelvi modellekkel
- Intelligens dokumentumelemzési munkafolyamatok építése
Vizuális kérdésmegválaszolás (VQA)
- VQA adatkészletek és benchmarkok beállítása
- Multimodális modellek tanítása és értékelése
- Interaktív VQA alkalmazások építése
Multimodális ágensek tervezése
- Az ágenstervezés alapelvei multimodális következtetéssel
- Az észlelés, a nyelv és a cselekvés ötvözése
- Ágensek üzembe helyezése valós felhasználási esetekre
Haladó integráció és optimalizálás
- Multimodális modellek finomhangolása az Ollama segítségével
- A következtetési teljesítmény optimalizálása
- Skálázhatósági és üzembe helyezési szempontok
Összefoglalás és a következő lépések
Követelmények
- A gépi tanulási fogalmak alapos ismerete
- Tapasztalat mélytanulási keretrendszerekkel, például a PyTorch vagy a TensorFlow használatával
- A természetes nyelvi feldolgozás és a számítógépes látás ismerete
Célközönség
- Gépi tanulási mérnökök
- MI-kutatók
- Vizuális és szöveges munkafolyamatokat integráló termékfejlesztők