Lépjen kapcsolatba velünk

Kurzusleírás

Minden foglalkozás 2 órás

1. nap – 1. foglalkozás: Üzleti áttekintés – Miért fontos a Big Data üzleti intelligencia a kormányzatban?

  • Esettanulmányok az NIH-tól és a DoE-tól
  • A Big Data adaptációs üteme a kormányzati szerveknél, és hogyan igazítják jövőbeli működésüket a Big Data-alapú prediktív analitikához
  • Széles körű alkalmazási területek a DoD, NSA, IRS, USDA stb. esetében
  • A Big Data összekapcsolása a hagyományos (legacy) adatokkal
  • A prediktív analitikát támogató technológiák alapvető ismerete
  • Adatintegráció és irányítópult-vizualizáció
  • Csaláskezelés
  • Üzleti szabályok/csalásfelderítési szabályok létrehozása
  • Fenyegetésészlelés és profilalkotás
  • Költség-haszon elemzés a Big Data bevezetéséhez

1. nap – 2. foglalkozás: Bevezetés a Big Datába – 1.

  • A Big Data fő jellemzői – mennyiség, változatosság, sebesség és megbízhatóság. MPP-architektúra a mennyiség kezelésére.
  • Adattárházak – statikus séma, lassan fejlődő adatkészlet
  • MPP-adatbázisok, például Greenplum, Exadata, Teradata, Netezza, Vertica stb.
  • Hadoop-alapú megoldások – nincsenek megkötések az adatkészlet szerkezetére vonatkozóan.
  • Tipikus minta: HDFS, MapReduce (feldolgozás), lekérés a HDFS-ből
  • Kötegelt feldolgozás – analitikai/nem interaktív célokra alkalmas
  • Mennyiség: CEP-adatfolyamok
  • Tipikus választások – CEP-termékek (pl. Infostreams, Apama, MarkLogic stb.)
  • Kevésbé termelésre kész – Storm/S4
  • NoSQL-adatbázisok – (oszlopalapú és kulcs-érték alapú): leginkább az adattárház/adatbázis analitikai kiegészítőjeként alkalmasak

1. nap – 3. foglalkozás: Bevezetés a Big Datába – 2.

NoSQL-megoldások

  • Kulcs-érték tároló – Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB)
  • Kulcs-érték tároló – Dynamo, Voldemort, Dynomite, SubRecord, Mo8onDb, DovetailDB
  • Kulcs-érték tároló (hierarchikus) – GT.m, Cache
  • Kulcs-érték tároló (rendezett) – TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord
  • Kulcs-érték gyorsítótár – Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity, Terracoqua
  • Tuple Store – Gigaspaces, Coord, Apache River
  • Objektum-adatbázis – ZopeDB, DB40, Shoal
  • Dokumentumtár – CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, XML-adatbázisok, ThruDB, CloudKit, Prsevere, Riak-Basho, Scalaris
  • Széles oszlopalapú tároló – BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI

Az adatok változatossága: Bevezetés a Big Data adattisztítási problémáiba

  • RDBMS – statikus szerkezet/séma, nem támogatja az agilis, felfedező környezetet.
  • NoSQL – félig strukturált, elegendő struktúrával az adatok tárolásához pontos séma előzetes meghatározása nélkül
  • Adattisztítási problémák

1. nap – 4. foglalkozás: Bevezetés a Big Datába – 3.: Hadoop

  • Mikor válasszunk Hadoopot?
  • STRUKTURÁLT – A vállalati adattárházak/adatbázisok hatalmas adatokat tudnak tárolni (költséggel), de struktúrát kényszerítenek ki (nem ideálisak az aktív felfedezéshez)
  • FÉLIG STRUKTURÁLT adatok – nehéz hagyományos megoldásokkal kezelni (adattárház/adatbázis)
  • Adattárházba szervezés = hatalmas erőfeszítés és a bevezetés után is statikus
  • A változatos és nagy mennyiségű adatok egyszerű hardveren történő feldolgozásához – HADOOP
  • Általános célú hardver szükséges a Hadoop-klaszter létrehozásához

Bevezetés a MapReduce/HDFS-be

  • MapReduce – elosztott számítás több szerveren
  • HDFS – az adatok helyileg elérhetővé tétele a számítási folyamat számára (redundanciával)
  • Az adatok lehetnek strukturálatlanok/séma nélküliek (az RDBMS-től eltérően)
  • A fejlesztő felelőssége az adatok értelmezése
  • MapReduce-programozás = Java használata (előnyök/hátrányok), adatok kézi betöltése a HDFS-be

2. nap – 1. foglalkozás: Big Data ökoszisztéma – Big Data ETL építése: a Big Data-eszközök világa – melyiket mikor érdemes használni?

  • Hadoop vs. más NoSQL-megoldások
  • Interaktív, véletlenszerű adathozzáféréshez
  • Hbase (oszlopalapú adatbázis) a Hadoop tetején
  • Véletlenszerű hozzáférés az adatokhoz, de korlátozásokkal (maximum 1 PB)
  • Nem alkalmas alkalmi (ad-hoc) elemzésre, jó naplózáshoz, számláláshoz, idősorokhoz
  • Sqoop – importálás adatbázisokból Hive-ba vagy HDFS-be (JDBC/ODBC-hozzáférés)
  • Flume – adatfolyamok (pl. naplóadatok) továbbítása a HDFS-be

2. nap – 2. foglalkozás: Big Data felügyeleti rendszer

  • Mozgó alkatrészek, számítási csomópontok indulása/meghibásodása: ZooKeeper – konfigurációhoz/koordinációhoz/elnevezési szolgáltatásokhoz
  • Összetett folyamatok/munkafolyamatok: Oozie – munkafolyamatok, függőségek, láncolt végrehajtás kezelése
  • Telepítés, konfiguráció, klaszterkezelés, frissítés stb. (rendszeradminisztráció): Ambari
  • Felhőben: Whirr

2. nap – 3. foglalkozás: Prediktív analitika az üzleti intelligenciában – 1.: Alapvető technikák és gépi tanuláson alapuló BI:

  • Bevezetés a gépi tanulásba
  • Osztályozási technikák elsajátítása
  • Bayes-i előrejelzés – tanítófájl készítése
  • Szupport vektor gép (Support Vector Machine)
  • KNN p-Tree algebra és vertikális bányászat
  • Neurális hálózat
  • Big Data nagy változószámú probléma – Véletlen erdő (Random Forest, RF)
  • Big Data automatizálási probléma – többmodelles együttes RF
  • Automatizálás Soft10-M segítségével
  • Szövegelemző eszköz – Treeminer
  • Agilis tanulás
  • Ágens alapú tanulás
  • Elosztott tanulás
  • Bevezetés a nyílt forráskódú prediktív analitikai eszközökbe: R, Rapidminer, Mahut

2. nap – 4. foglalkozás: Prediktív analitikai ökoszisztéma – 2.: Gyakori prediktív analitikai problémák a kormányzatban

  • Betekintő analitika
  • Vizualizációs analitika
  • Strukturált prediktív analitika
  • Strukturálatlan prediktív analitika
  • Fenyegetés/csalárd szereplő/szállítói profilalkotás
  • Ajánlómotor
  • Mintázatfelismerés
  • Szabály/forgatókönyv-feltárás – hiba, csalás, optimalizálás
  • Kiváltó okok feltárása
  • Hangulatelemzés
  • CRM-analitika
  • Hálózatelemzés
  • Szöveganalitika
  • Technológiával támogatott átvizsgálás
  • Csaláselemzés
  • Valós idejű analitika

3. nap – 1. foglalkozás: Valós idejű és skálázható analitika Hadoop környezetben

  • Miért vallanak kudarcot a gyakori analitikai algoritmusok Hadoop/HDFS környezetben
  • Apache Hama – tömeges szinkron elosztott számításhoz
  • Apache SPARK – klaszterszámításhoz valós idejű analitikához
  • CMU Graphics Lab2 – gráfalapú aszinkron megközelítés az elosztott számításhoz
  • A Treeminer KNN p-algebra alapú megközelítése a működési hardverköltségek csökkentésére

3. nap – 2. foglalkozás: Eszközök az elektronikus bizonyítékfeltáráshoz (eDiscovery) és a digitális nyomozáshoz

  • eDiscovery Big Data és hagyományos (legacy) adatok felett – költség- és teljesítmény-összehasonlítás
  • Prediktív kódolás és technológiával támogatott átvizsgálás (TAR)
  • Egy TAR-termék (vMiner) élő bemutatója annak megértéséhez, hogyan gyorsítja a TAR a feltárást
  • Gyorsabb indexelés HDFS segítségével – az adatok sebessége
  • NLP, azaz természetesnyelv-feldolgozás – különböző technikák és nyílt forráskódú termékek
  • eDiscovery idegen nyelveken – technológia az idegen nyelvű feldolgozáshoz

3. nap – 3. foglalkozás: Big Data BI a kiberbiztonságért – A gyors adatgyűjtéstől a fenyegetésazonosításig terjedő teljes, 360 fokos kép megértése

  • A biztonsági analitika alapjai – támadási felület, biztonsági konfigurációs hibák, gazdagép-védelem
  • Hálózati infrastruktúra/nagy adatcsatorna/válasz-ETL valós idejű elemzéshez
  • Előíró vs. prediktív – rögzített szabályalapú vs. fenyegetési szabályok automatikus feltárása metaadatokból

3. nap – 4. foglalkozás: Big Data az USDA-ban: Alkalmazás a mezőgazdaságban

  • Bevezetés az IoT-ba (dolgok internete) a mezőgazdaságban – érzékelőalapú Big Data és vezérlés
  • Bevezetés a műholdas képalkotásba és mezőgazdasági alkalmazásába
  • Érzékelő- és képadatok integrálása a talaj termékenységének vizsgálatához, termesztési ajánlásokhoz és előrejelzéshez
  • Mezőgazdasági biztosítás és Big Data
  • Terméskiesés-előrejelzés

4. nap – 1. foglalkozás: Csalásmegelőzési BI a kormányzati Big Datából – Csaláselemzés:

  • A csaláselemzés alapvető osztályozása – szabályalapú vs. prediktív analitika
  • Felügyelt vs. felügyelet nélküli gépi tanulás a csalási mintázatok felderítéséhez
  • Szállítói csalás/túlszámlázás projekteken
  • Medicare- és Medicaid-csalás – csalásfelderítési technikák a kérelmek feldolgozásához
  • Utazási költségtérítési csalások
  • IRS-adóvisszatérítési csalások
  • Esettanulmányok és élő bemutatók, ahol rendelkezésre állnak adatok.

4. nap – 2. foglalkozás: Közösségimédia-analitika – Információgyűjtés és -elemzés

  • Big Data ETL API közösségimédia-adatok kinyeréséhez
  • Szöveg, kép, metaadatok és videó
  • Hangulatelemzés közösségimédia-folyamokból
  • Közösségimédia-folyamok kontextuális és nem kontextuális szűrése
  • Közösségimédia-irányítópult különböző platformok integrálásához
  • Közösségimédia-profilok automatizált profilalkotása
  • Minden elemzésről élő bemutató a Treeminer eszközzel.

4. nap – 3. foglalkozás: Big Data analitika a képfeldolgozásban és a videófolyamokban

  • Képtárolási technikák a Big Datában – tárolási megoldás petabájtot meghaladó adatokhoz
  • LTFS és LTO
  • GPFS-LTFS (rétegzett tárolási megoldás nagy képadatokhoz)
  • A képelemzés alapjai
  • Objektumfelismerés
  • Képszegmentálás
  • Mozgáskövetés
  • 3D-s kép-rekonstrukció

4. nap – 4. foglalkozás: Big Data alkalmazások az NIH-ban:

  • A bioinformatika feltörekvő területei
  • Meta-genomika és Big Data bányászati kérdések
  • Big Data prediktív analitika a farmakogenomikában, metabolomikában és proteomikában
  • Big Data a genomikai folyamatok későbbi szakaszaiban
  • Big Data prediktív analitika alkalmazása a közegészségügyben

Big Data irányítópult a különböző adatok gyors eléréséhez és megjelenítéséhez:

  • A meglévő alkalmazásplatform integrálása a Big Data irányítópulttal
  • Big Data kezelés
  • Esettanulmány Big Data irányítópultokról: Tableau és Pentaho
  • Big Data alkalmazás használata helyalapú szolgáltatások indításához a kormányzatban
  • Nyomkövető rendszer és kezelés

5. nap – 1. foglalkozás: Hogyan indokoljuk a Big Data BI bevezetését egy szervezeten belül:

  • A Big Data bevezetés megtérülésének (ROI) meghatározása
  • Esettanulmányok az elemzői idő megtakarításáról az adatgyűjtés és -előkészítés során – termelékenységnövekedés
  • Esettanulmányok a licencelt adatbázis-költségek megtakarításából származó bevételnövekedésről
  • Bevételnövekedés helyalapú szolgáltatásokból
  • Megtakarítás a csalásmegelőzésből
  • Integrált táblázatkezelői megközelítés a hozzávetőleges kiadások és a bevételnövekedés/megtakarítások kiszámításához a Big Data bevezetéséből.

5. nap – 2. foglalkozás: Lépésről lépésre történő eljárás a hagyományos (legacy) adatrendszer Big Data rendszerre cseréléséhez:

  • A gyakorlati Big Data migrációs ütemterv megértése
  • Milyen fontos információkra van szükség a Big Data bevezetés megtervezése előtt
  • Milyen különböző módjai vannak az adatok mennyiségének, sebességének, változatosságának és megbízhatóságának kiszámítására
  • Hogyan becsüljük meg az adatnövekedést
  • Esettanulmányok

5. nap – 4. foglalkozás: Big Data-szállítók és termékeik áttekintése. Kérdések és válaszok:

  • Accenture
  • APTEAN (korábban CDC Software)
  • Cisco Systems
  • Cloudera
  • Dell
  • EMC
  • GoodData Corporation
  • Guavus
  • Hitachi Data Systems
  • Hortonworks
  • HP
  • IBM
  • Informatica
  • Intel
  • Jaspersoft
  • Microsoft
  • MongoDB (korábban 10Gen)
  • MU Sigma
  • Netapp
  • Opera Solutions
  • Oracle
  • Pentaho
  • Platfora
  • Qliktech
  • Quantum
  • Rackspace
  • Revolution Analytics
  • Salesforce
  • SAP
  • SAS Institute
  • Sisense
  • Software AG/Terracotta
  • Soft10 Automation
  • Splunk
  • Sqrrl
  • Supermicro
  • Tableau Software
  • Teradata
  • Think Big Analytics
  • Tidemark Systems
  • Treeminer
  • VMware (az EMC része)

Követelmények

  • Alapvető ismeretek az üzleti működésről és az adatrendszerekről a kormányzati szektor saját területén
  • Alapvető SQL/Oracle vagy relációs adatbázis-ismeretek
  • Alapvető statisztikai ismeretek (táblázatkezelői szinten)
 35 Órák

Résztvevők száma


Ár per résztvevő

Vélemények (1)

Közelgő kurzusok

Rokon kategóriák