Lépjen kapcsolatba velünk
 Időtartalma 14 órák

Kurzusleírás

A beszédfelismerési technológiák áttekintése

  • A beszédfelismerés története és fejlődése
  • Akusztikus modellek, nyelvi modellek és dekódolás
  • Modern architektúrák: RNN-ek, transzformerek és Whisper

Hang előfeldolgozás és az átírás alapjai

  • Hangformátumok és mintavételi frekvenciák kezelése
  • Hang tisztítása, vágása és szegmentálása
  • Szöveg előállítása hangból: valós idejű vs. kötegelt

Gyakorlat a Whisperrel és más API-kkal

  • Az OpenAI Whisper telepítése és használata
  • Felhő API-k (Google, Azure) hívása átíráshoz
  • Teljesítmény, késleltetés és költség összehasonlítása

Nyelv, akcentusok és domain-adaptáció

  • Több nyelvvel és akcentussal való munka
  • Egyéni szókincsek és zajtűrés
  • Jogi, orvosi vagy műszaki nyelvezet kezelése

Kimenet formázása és integráció

  • Időbélyegek, írásjelek és beszélőcímkék hozzáadása
  • Exportálás szöveg, SRT vagy JSON formátumba
  • Átiratok integrálása alkalmazásokba vagy adatbázisokba

Felhasználási eset megvalósítási laborok

  • Értekezletek, interjúk vagy podcastok átírása
  • Hang-szöveg parancsrendszerek
  • Valós idejű feliratok video-/hangfolyamokhoz

Értékelés, korlátok és etika

  • Pontossági mérőszámok és modell-összehasonlítás
  • Torzítás és méltányosság a beszédmodellekben
  • Adatvédelmi és megfelelőségi szempontok

Összefoglalás és következő lépések

Követelmények

  • Általános mesterséges intelligencia és gépi tanulási fogalmak ismerete
  • Hang- vagy médiafájl-formátumok és eszközök ismerete

Célközönség

  • Hangadatokkal dolgozó adattudósok és mesterséges intelligencia mérnökök
  • Átíráson alapuló alkalmazásokat fejlesztő szoftverfejlesztők
  • Automatizáláshoz beszédfelismerést vizsgáló szervezetek

Résztvevők száma


Ár per résztvevő

Közelgő kurzusok

Rokon kategóriák