Lépjen kapcsolatba velünk
 Időtartalma 21 órák

Kurzusleírás

Bevezetés az Ollama skálázásába

  • Az Ollama architektúrája és skálázási szempontjai
  • Gyakori szűk keresztmetszetek többfelhasználós telepítéseknél
  • Bevált gyakorlatok az infrastruktúra felkészítéséhez

Erőforrás-kiosztás és GPU-optimalizálás

  • Hatékony CPU/GPU kihasználási stratégiák
  • Memória- és sávszélesség-szempontok
  • Konténerszintű erőforrás-korlátozások

Telepítés konténerekkel és Kubernetesszel

  • Az Ollama konténerizálása Dockerrel
  • Az Ollama futtatása Kubernetes klaszterekben
  • Terheléselosztás és szolgáltatásfelderítés

Automatikus skálázás és kötegelés

  • Automatikus skálázási szabályzatok tervezése az Ollamához
  • Kötegelt következtetési technikák az áteresztőképesség optimalizálásához
  • Késleltetés és áteresztőképesség közötti kompromisszumok

Késleltetés-optimalizálás

  • Következtetési teljesítmény profilozása
  • Gyorsítótárazási stratégiák és modell-bemelegítés
  • I/O és kommunikációs többletterhelés csökkentése

Monitorozás és megfigyelhetőség

  • Prometheus integrálása metrikákhoz
  • Műszerfalak építése Grafanával
  • Riasztás és incidenskezelés az Ollama infrastruktúrához

Költséggazdálkodás és skálázási stratégiák

  • Költségtudatos GPU-kiosztás
  • Felhő és helyszíni telepítési szempontok
  • Stratégiák a fenntartható skálázáshoz

Összefoglalás és következő lépések

Követelmények

  • Linux rendszeradminisztrációs tapasztalat
  • A konténerizáció és az orkesztráció ismerete
  • Gépi tanulási modellek telepítésének ismerete

Célközönség

  • DevOps mérnökök
  • ML infrastruktúra csapatok
  • Site Reliability mérnökök

Résztvevők száma


Ár per résztvevő

Közelgő kurzusok

Rokon kategóriák