Lépjen kapcsolatba velünk

Kurzusleírás

Tencent Hunyuan gyártási alapjai

  • A Tencent Hunyuan modellek kiszolgálási forgatókönyveinek áttekintése
  • Nagy modellek és MoE architektúrák gyártási jellemzői
  • Gyakori késleltetési, throughput- és költségbeli szűk keresztmetszetek
  • Szolgáltatási szintcélok (SLO) meghatározása az inference terhelésekhez

Üzemeltetési architektúra és kiszolgálási folyamat

  • Egy gyártási inference stack fő összetevői
  • Konténeres, saját adatközponti és felhős üzemeltetési modellek választása
  • Modellek betöltése, kérések továbbítása és GPU-allokáció alapjai
  • Robberség és műveletbeli egyszerűség tervezése

Gyakorlati késleltetés-optimalizálás

  • Optimalizált inference motorok használata, például a TensorRT ott ahol alkalmazható
  • KV-cache fogalmak és gyakorlati cache hangolás
  • Indulási, „warmup” és válaszidő csökkentése
  • Első token érkezési idejének és token-generálási sebességének mérése

Throughput, batching és GPU-hatékonyság

  • Folyamatos batching és kérés-szintű batching stratégiák
  • Parrelitás és sorviselkedés kezelése
  • GPU-használat javítása anélkül, hogy rontanánk a felhasználói élményen
  • Hosszú kontextusú és vegyes terhelésű kérések kezelése

Kvantizálás és költségkontroll

  • A kvantizálás jelentősége a gyártási kiszolgálásban
  • Gyakorlati kompromisszumok az FP16, INT8 és egyéb gyakori precizitású opciók között
  • Modellminőség, késleltetés és infrastruktúra-költség egyensúlyba hozása
  • Egyszerű költségoptimalizálási ellenőrzőlista összeállítása

Műveletek, monitorozás és készletellenőrzés

  • Automatikus skálázási kiváltók inference szolgáltatásokhoz
  • Késleltetés, throughput, cache-használat és GPU-állapot monitorozása
  • Naplózás, riasztás és incidenskezelés alapjai
  • Egy referenciavállalkozás áttekintése és egy fejlesztési terv készítése

Követelmények

  • A nagy nyelvi modellek üzemeltetésének és inference munkafolyamatainak alapvető megértése
  • Tapasztalatok konténerekkel, felhős vagy saját adatközponti infrastruktúrával, valamint API-alapú szolgáltatásokkal
  • Python vagy rendszermérnöki feladatok gyakorlott ismerete

Célcsoport:

  • ML mérnökök, akik LLM-ket helyeznek üzembe a gyártási környezetben
  • Platformmérnökök, akik GPU-alapú inference szolgáltatásokért felelősek
  • Megoldásépítészek, akik skálázható AI kiszolgáló platformokat terveznek
 14 Órák

Résztvevők száma


Ár per résztvevő

Közelgő kurzusok

Rokon kategóriák