Köszönjük, hogy elküldte érdeklődését! Csapatunk egyik tagja hamarosan felveszi Önnel a kapcsolatot.
Köszönjük, hogy elküldte foglalását! Csapatunk egyik tagja hamarosan felveszi Önnel a kapcsolatot.
Időtartalma 14 órák
Kurzusleírás
A beszédfelismerési technológiák áttekintése
- A beszédfelismerés története és fejlődése
- Akusztikus modellek, nyelvi modellek és dekódolás
- Modern architektúrák: RNN-ek, transzformerek és Whisper
Hang előfeldolgozás és az átírás alapjai
- Hangformátumok és mintavételi frekvenciák kezelése
- Hang tisztítása, vágása és szegmentálása
- Szöveg előállítása hangból: valós idejű vs. kötegelt
Gyakorlat a Whisperrel és más API-kkal
- Az OpenAI Whisper telepítése és használata
- Felhő API-k (Google, Azure) hívása átíráshoz
- Teljesítmény, késleltetés és költség összehasonlítása
Nyelv, akcentusok és domain-adaptáció
- Több nyelvvel és akcentussal való munka
- Egyéni szókincsek és zajtűrés
- Jogi, orvosi vagy műszaki nyelvezet kezelése
Kimenet formázása és integráció
- Időbélyegek, írásjelek és beszélőcímkék hozzáadása
- Exportálás szöveg, SRT vagy JSON formátumba
- Átiratok integrálása alkalmazásokba vagy adatbázisokba
Felhasználási eset megvalósítási laborok
- Értekezletek, interjúk vagy podcastok átírása
- Hang-szöveg parancsrendszerek
- Valós idejű feliratok video-/hangfolyamokhoz
Értékelés, korlátok és etika
- Pontossági mérőszámok és modell-összehasonlítás
- Torzítás és méltányosság a beszédmodellekben
- Adatvédelmi és megfelelőségi szempontok
Összefoglalás és következő lépések
Követelmények
- Általános mesterséges intelligencia és gépi tanulási fogalmak ismerete
- Hang- vagy médiafájl-formátumok és eszközök ismerete
Célközönség
- Hangadatokkal dolgozó adattudósok és mesterséges intelligencia mérnökök
- Átíráson alapuló alkalmazásokat fejlesztő szoftverfejlesztők
- Automatizáláshoz beszédfelismerést vizsgáló szervezetek