Köszönjük, hogy elküldte érdeklődését! Csapatunk egyik tagja hamarosan felveszi Önnel a kapcsolatot.
Köszönjük, hogy elküldte foglalását! Csapatunk egyik tagja hamarosan felveszi Önnel a kapcsolatot.
Kurzusleírás
Minden foglalkozás 2 órás
1. nap – 1. foglalkozás: Üzleti áttekintés – Miért fontos a Big Data üzleti intelligencia a kormányzatban?
- Esettanulmányok az NIH-tól és a DoE-tól
- A Big Data adaptációs üteme a kormányzati szerveknél, és hogyan igazítják jövőbeli működésüket a Big Data-alapú prediktív analitikához
- Széles körű alkalmazási területek a DoD, NSA, IRS, USDA stb. esetében
- A Big Data összekapcsolása a hagyományos (legacy) adatokkal
- A prediktív analitikát támogató technológiák alapvető ismerete
- Adatintegráció és irányítópult-vizualizáció
- Csaláskezelés
- Üzleti szabályok/csalásfelderítési szabályok létrehozása
- Fenyegetésészlelés és profilalkotás
- Költség-haszon elemzés a Big Data bevezetéséhez
1. nap – 2. foglalkozás: Bevezetés a Big Datába – 1.
- A Big Data fő jellemzői – mennyiség, változatosság, sebesség és megbízhatóság. MPP-architektúra a mennyiség kezelésére.
- Adattárházak – statikus séma, lassan fejlődő adatkészlet
- MPP-adatbázisok, például Greenplum, Exadata, Teradata, Netezza, Vertica stb.
- Hadoop-alapú megoldások – nincsenek megkötések az adatkészlet szerkezetére vonatkozóan.
- Tipikus minta: HDFS, MapReduce (feldolgozás), lekérés a HDFS-ből
- Kötegelt feldolgozás – analitikai/nem interaktív célokra alkalmas
- Mennyiség: CEP-adatfolyamok
- Tipikus választások – CEP-termékek (pl. Infostreams, Apama, MarkLogic stb.)
- Kevésbé termelésre kész – Storm/S4
- NoSQL-adatbázisok – (oszlopalapú és kulcs-érték alapú): leginkább az adattárház/adatbázis analitikai kiegészítőjeként alkalmasak
1. nap – 3. foglalkozás: Bevezetés a Big Datába – 2.
NoSQL-megoldások
- Kulcs-érték tároló – Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB)
- Kulcs-érték tároló – Dynamo, Voldemort, Dynomite, SubRecord, Mo8onDb, DovetailDB
- Kulcs-érték tároló (hierarchikus) – GT.m, Cache
- Kulcs-érték tároló (rendezett) – TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord
- Kulcs-érték gyorsítótár – Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity, Terracoqua
- Tuple Store – Gigaspaces, Coord, Apache River
- Objektum-adatbázis – ZopeDB, DB40, Shoal
- Dokumentumtár – CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, XML-adatbázisok, ThruDB, CloudKit, Prsevere, Riak-Basho, Scalaris
- Széles oszlopalapú tároló – BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI
Az adatok változatossága: Bevezetés a Big Data adattisztítási problémáiba
- RDBMS – statikus szerkezet/séma, nem támogatja az agilis, felfedező környezetet.
- NoSQL – félig strukturált, elegendő struktúrával az adatok tárolásához pontos séma előzetes meghatározása nélkül
- Adattisztítási problémák
1. nap – 4. foglalkozás: Bevezetés a Big Datába – 3.: Hadoop
- Mikor válasszunk Hadoopot?
- STRUKTURÁLT – A vállalati adattárházak/adatbázisok hatalmas adatokat tudnak tárolni (költséggel), de struktúrát kényszerítenek ki (nem ideálisak az aktív felfedezéshez)
- FÉLIG STRUKTURÁLT adatok – nehéz hagyományos megoldásokkal kezelni (adattárház/adatbázis)
- Adattárházba szervezés = hatalmas erőfeszítés és a bevezetés után is statikus
- A változatos és nagy mennyiségű adatok egyszerű hardveren történő feldolgozásához – HADOOP
- Általános célú hardver szükséges a Hadoop-klaszter létrehozásához
Bevezetés a MapReduce/HDFS-be
- MapReduce – elosztott számítás több szerveren
- HDFS – az adatok helyileg elérhetővé tétele a számítási folyamat számára (redundanciával)
- Az adatok lehetnek strukturálatlanok/séma nélküliek (az RDBMS-től eltérően)
- A fejlesztő felelőssége az adatok értelmezése
- MapReduce-programozás = Java használata (előnyök/hátrányok), adatok kézi betöltése a HDFS-be
2. nap – 1. foglalkozás: Big Data ökoszisztéma – Big Data ETL építése: a Big Data-eszközök világa – melyiket mikor érdemes használni?
- Hadoop vs. más NoSQL-megoldások
- Interaktív, véletlenszerű adathozzáféréshez
- Hbase (oszlopalapú adatbázis) a Hadoop tetején
- Véletlenszerű hozzáférés az adatokhoz, de korlátozásokkal (maximum 1 PB)
- Nem alkalmas alkalmi (ad-hoc) elemzésre, jó naplózáshoz, számláláshoz, idősorokhoz
- Sqoop – importálás adatbázisokból Hive-ba vagy HDFS-be (JDBC/ODBC-hozzáférés)
- Flume – adatfolyamok (pl. naplóadatok) továbbítása a HDFS-be
2. nap – 2. foglalkozás: Big Data felügyeleti rendszer
- Mozgó alkatrészek, számítási csomópontok indulása/meghibásodása: ZooKeeper – konfigurációhoz/koordinációhoz/elnevezési szolgáltatásokhoz
- Összetett folyamatok/munkafolyamatok: Oozie – munkafolyamatok, függőségek, láncolt végrehajtás kezelése
- Telepítés, konfiguráció, klaszterkezelés, frissítés stb. (rendszeradminisztráció): Ambari
- Felhőben: Whirr
2. nap – 3. foglalkozás: Prediktív analitika az üzleti intelligenciában – 1.: Alapvető technikák és gépi tanuláson alapuló BI:
- Bevezetés a gépi tanulásba
- Osztályozási technikák elsajátítása
- Bayes-i előrejelzés – tanítófájl készítése
- Szupport vektor gép (Support Vector Machine)
- KNN p-Tree algebra és vertikális bányászat
- Neurális hálózat
- Big Data nagy változószámú probléma – Véletlen erdő (Random Forest, RF)
- Big Data automatizálási probléma – többmodelles együttes RF
- Automatizálás Soft10-M segítségével
- Szövegelemző eszköz – Treeminer
- Agilis tanulás
- Ágens alapú tanulás
- Elosztott tanulás
- Bevezetés a nyílt forráskódú prediktív analitikai eszközökbe: R, Rapidminer, Mahut
2. nap – 4. foglalkozás: Prediktív analitikai ökoszisztéma – 2.: Gyakori prediktív analitikai problémák a kormányzatban
- Betekintő analitika
- Vizualizációs analitika
- Strukturált prediktív analitika
- Strukturálatlan prediktív analitika
- Fenyegetés/csalárd szereplő/szállítói profilalkotás
- Ajánlómotor
- Mintázatfelismerés
- Szabály/forgatókönyv-feltárás – hiba, csalás, optimalizálás
- Kiváltó okok feltárása
- Hangulatelemzés
- CRM-analitika
- Hálózatelemzés
- Szöveganalitika
- Technológiával támogatott átvizsgálás
- Csaláselemzés
- Valós idejű analitika
3. nap – 1. foglalkozás: Valós idejű és skálázható analitika Hadoop környezetben
- Miért vallanak kudarcot a gyakori analitikai algoritmusok Hadoop/HDFS környezetben
- Apache Hama – tömeges szinkron elosztott számításhoz
- Apache SPARK – klaszterszámításhoz valós idejű analitikához
- CMU Graphics Lab2 – gráfalapú aszinkron megközelítés az elosztott számításhoz
- A Treeminer KNN p-algebra alapú megközelítése a működési hardverköltségek csökkentésére
3. nap – 2. foglalkozás: Eszközök az elektronikus bizonyítékfeltáráshoz (eDiscovery) és a digitális nyomozáshoz
- eDiscovery Big Data és hagyományos (legacy) adatok felett – költség- és teljesítmény-összehasonlítás
- Prediktív kódolás és technológiával támogatott átvizsgálás (TAR)
- Egy TAR-termék (vMiner) élő bemutatója annak megértéséhez, hogyan gyorsítja a TAR a feltárást
- Gyorsabb indexelés HDFS segítségével – az adatok sebessége
- NLP, azaz természetesnyelv-feldolgozás – különböző technikák és nyílt forráskódú termékek
- eDiscovery idegen nyelveken – technológia az idegen nyelvű feldolgozáshoz
3. nap – 3. foglalkozás: Big Data BI a kiberbiztonságért – A gyors adatgyűjtéstől a fenyegetésazonosításig terjedő teljes, 360 fokos kép megértése
- A biztonsági analitika alapjai – támadási felület, biztonsági konfigurációs hibák, gazdagép-védelem
- Hálózati infrastruktúra/nagy adatcsatorna/válasz-ETL valós idejű elemzéshez
- Előíró vs. prediktív – rögzített szabályalapú vs. fenyegetési szabályok automatikus feltárása metaadatokból
3. nap – 4. foglalkozás: Big Data az USDA-ban: Alkalmazás a mezőgazdaságban
- Bevezetés az IoT-ba (dolgok internete) a mezőgazdaságban – érzékelőalapú Big Data és vezérlés
- Bevezetés a műholdas képalkotásba és mezőgazdasági alkalmazásába
- Érzékelő- és képadatok integrálása a talaj termékenységének vizsgálatához, termesztési ajánlásokhoz és előrejelzéshez
- Mezőgazdasági biztosítás és Big Data
- Terméskiesés-előrejelzés
4. nap – 1. foglalkozás: Csalásmegelőzési BI a kormányzati Big Datából – Csaláselemzés:
- A csaláselemzés alapvető osztályozása – szabályalapú vs. prediktív analitika
- Felügyelt vs. felügyelet nélküli gépi tanulás a csalási mintázatok felderítéséhez
- Szállítói csalás/túlszámlázás projekteken
- Medicare- és Medicaid-csalás – csalásfelderítési technikák a kérelmek feldolgozásához
- Utazási költségtérítési csalások
- IRS-adóvisszatérítési csalások
- Esettanulmányok és élő bemutatók, ahol rendelkezésre állnak adatok.
4. nap – 2. foglalkozás: Közösségimédia-analitika – Információgyűjtés és -elemzés
- Big Data ETL API közösségimédia-adatok kinyeréséhez
- Szöveg, kép, metaadatok és videó
- Hangulatelemzés közösségimédia-folyamokból
- Közösségimédia-folyamok kontextuális és nem kontextuális szűrése
- Közösségimédia-irányítópult különböző platformok integrálásához
- Közösségimédia-profilok automatizált profilalkotása
- Minden elemzésről élő bemutató a Treeminer eszközzel.
4. nap – 3. foglalkozás: Big Data analitika a képfeldolgozásban és a videófolyamokban
- Képtárolási technikák a Big Datában – tárolási megoldás petabájtot meghaladó adatokhoz
- LTFS és LTO
- GPFS-LTFS (rétegzett tárolási megoldás nagy képadatokhoz)
- A képelemzés alapjai
- Objektumfelismerés
- Képszegmentálás
- Mozgáskövetés
- 3D-s kép-rekonstrukció
4. nap – 4. foglalkozás: Big Data alkalmazások az NIH-ban:
- A bioinformatika feltörekvő területei
- Meta-genomika és Big Data bányászati kérdések
- Big Data prediktív analitika a farmakogenomikában, metabolomikában és proteomikában
- Big Data a genomikai folyamatok későbbi szakaszaiban
- Big Data prediktív analitika alkalmazása a közegészségügyben
Big Data irányítópult a különböző adatok gyors eléréséhez és megjelenítéséhez:
- A meglévő alkalmazásplatform integrálása a Big Data irányítópulttal
- Big Data kezelés
- Esettanulmány Big Data irányítópultokról: Tableau és Pentaho
- Big Data alkalmazás használata helyalapú szolgáltatások indításához a kormányzatban
- Nyomkövető rendszer és kezelés
5. nap – 1. foglalkozás: Hogyan indokoljuk a Big Data BI bevezetését egy szervezeten belül:
- A Big Data bevezetés megtérülésének (ROI) meghatározása
- Esettanulmányok az elemzői idő megtakarításáról az adatgyűjtés és -előkészítés során – termelékenységnövekedés
- Esettanulmányok a licencelt adatbázis-költségek megtakarításából származó bevételnövekedésről
- Bevételnövekedés helyalapú szolgáltatásokból
- Megtakarítás a csalásmegelőzésből
- Integrált táblázatkezelői megközelítés a hozzávetőleges kiadások és a bevételnövekedés/megtakarítások kiszámításához a Big Data bevezetéséből.
5. nap – 2. foglalkozás: Lépésről lépésre történő eljárás a hagyományos (legacy) adatrendszer Big Data rendszerre cseréléséhez:
- A gyakorlati Big Data migrációs ütemterv megértése
- Milyen fontos információkra van szükség a Big Data bevezetés megtervezése előtt
- Milyen különböző módjai vannak az adatok mennyiségének, sebességének, változatosságának és megbízhatóságának kiszámítására
- Hogyan becsüljük meg az adatnövekedést
- Esettanulmányok
5. nap – 4. foglalkozás: Big Data-szállítók és termékeik áttekintése. Kérdések és válaszok:
- Accenture
- APTEAN (korábban CDC Software)
- Cisco Systems
- Cloudera
- Dell
- EMC
- GoodData Corporation
- Guavus
- Hitachi Data Systems
- Hortonworks
- HP
- IBM
- Informatica
- Intel
- Jaspersoft
- Microsoft
- MongoDB (korábban 10Gen)
- MU Sigma
- Netapp
- Opera Solutions
- Oracle
- Pentaho
- Platfora
- Qliktech
- Quantum
- Rackspace
- Revolution Analytics
- Salesforce
- SAP
- SAS Institute
- Sisense
- Software AG/Terracotta
- Soft10 Automation
- Splunk
- Sqrrl
- Supermicro
- Tableau Software
- Teradata
- Think Big Analytics
- Tidemark Systems
- Treeminer
- VMware (az EMC része)
Követelmények
- Alapvető ismeretek az üzleti működésről és az adatrendszerekről a kormányzati szektor saját területén
- Alapvető SQL/Oracle vagy relációs adatbázis-ismeretek
- Alapvető statisztikai ismeretek (táblázatkezelői szinten)
35 Órák
Vélemények (1)
A képző képessége az organzácció igényeinek megfelelően igazítani a kurzust, és nem csak a személyes eljárás részeként tartalmat szolgáltatni.
Masilonyane - Revenue Services Lesotho
Kurzus - Big Data Business Intelligence for Govt. Agencies
Gépi fordítás