Akadémia obsahuje 16 lekcií plus záverečnú certifikáciu. Každá lekcia stavia na predchádzajúcej, takže veci do seba postupne zapadajú. Tu je detailný obsah.
Príprava prostredia
Spolu si všetko nainštalujeme a nastavíme
Než začneme, prejdeme si prípravu počítača krok za krokom, osobitne pre Windows aj pre Mac. Nikto nezostane visieť.
- Inštalácia Anacondy (hotový balík Pythonu so všetkým, čo pre prácu s dátami potrebuješ)
- Vlastné Python prostredie pre akadémiu: čo to je, prečo sa to používa a ako si ho vytvoríš, zálohuješ aj zmažeš, keby bolo treba začať odznova
-
Terminál bez strachu: každý príkaz si najprv urobíš myšou a hneď nato to isté napíšeš príkazom
- Dôkladný úvod do JupyterLabu, prostredia, v ktorom budeš celú akadémiu pracovať
- Ako sa v akadémii najlepšie učiť, ako fungujú domáce úlohy a kde nás nájdeš, keď budeš potrebovať pomoc
Základná orientácia v AI svete
Najprv si urobíme poriadok v pojmoch, aby si sa v IT svete nestratila
- Ako sa zorientovať v buzzwordoch umelej inteligencie (čo znamenajú ML / AI / Deep Learning / Generative AI a ako to do seba zapadá)
- Štruktúra algoritmov podľa spôsobu učenia (supervised / unsupervised / reinforcement learning - vysvetlíme, čo tieto pojmy znamenajú)
- Ako delíme modely podľa cieľa: klasifikačné / regresné / clusteringové
- Prečo sa aj dnes používajú klasické modely a nie na všetko neurónové siete - napríklad prečo banka nemôže zamietnuť úver modelom, ktorý sa nedá vysvetliť
- Aké sú najpoužívanejšie ML knižnice ako scikit-learn, xgboost, keras, tensorflow (to sú hotové nástroje, ktoré ti veľmi uľahčia prácu)
- Ako sa AI z histórie dopracovala k dnešnej podobe - od Turinga cez Deep Blue a AlphaGo až po ChatGPT
Práca s dátami a praktický postup pri vývoji ML modelov
Žiaden model nefunguje bez kvalitných dát
- Zber a príprava dát na modelovanie
-
EDA (Exploratory Data Analysis - prvé prieskumné skúmanie dát, aby si pochopila, čo v nich je), ručne aj automatizovane
- Konverzia rôznych dátových typov na čísla (počítač rozumie len číslam, preto treba všetko previesť: dátumy, časy, kategórie aj chýbajúce hodnoty)
- Trénovacie a testovacie dáta (na čo slúžia a ako ich správne rozdeliť - trénovacie dáta sú na učenie modelu, testovacie na overenie jeho správnosti)
- Výber, tréning, ladenie a vyhodnotenie modelu
-
Celý postup vývoja ML modelu v desiatich krokoch - od definície cieľa až po nasadenie a sledovanie v prevádzke. Vrátane toho, koľko práce zaberie ktorý krok. Prekvapenie pre väčšinu ľudí: zhruba 70 % projektu je práca s dátami, nie samotné modelovanie
Konkrétne ML modely a ich praktické použitie
Prejdeme si hlavné typy úloh, ktoré AI rieši, a naučíš sa používať konkrétne algoritmy
-
Modely lineárnej a logistickej regresie - vysvetlenie a praktické použitie (regresia predpovedá konkrétne čísla ako cenu bytu, logistická regresia zaraďuje do kategórií ako kúpi/nekúpi)
- Prečo sa lineárne modely v bankách a poisťovniach používajú aj dnes: sú vysvetliteľné, veľmi rýchle a nepotrebujú veľa dát
-
Rozhodovacie stromy (Decision Trees) - vysvetlenie a praktické použitie. Strom si vykreslíš ako farebný obrázok a naučíš sa ho čítať uzol po uzle
-
RandomForest modely (les náhodných stromov) - vysvetlenie a praktické použitie
-
Dôležitosť prediktorov - ako z modelu zistiť, ktoré faktory naozaj rozhodujú o výsledku. To je užitočný analytický nástroj sám o sebe, aj mimo predikcií
-
XGBoost - jeden z najpresnejších bežne dostupných modelov a častý víťaz dátových súťaží
Profesionálne techniky na hodnotenie a zlepšovanie modelov
Nestačí model len vytvoriť, musí byť aj presný a spoľahlivý
-
Metriky - ako vyhodnocovať presnosť modelov, osobitne pre klasifikáciu aj pre regresiu. A prečo obyčajná „presnosť" pri nevyvážených dátach klame
- Prečo je voľba metriky obchodné rozhodnutie, nie technický detail: rozhoduješ sa, či radšej prehliadneš chorého, alebo radšej vystrašíš zdravého
-
Cross-validation - ako spoľahlivejší spôsob odhadovania spoľahlivosti modelu. Uvidíš na vlastných dátach, ako sa výsledok hýbe len kvôli náhode a čo s tým
-
Pretrénovanie a podtrénovanie modelu - najčastejšia a najnebezpečnejšia chyba. Model so 100 % presnosťou na tréningu vyzerá ako úspech a v prevádzke zlyhá. Naučíš sa to odhaliť jednoduchým testom
-
Ladenie modelov - ako nájsť optimálne nastavenia modelu, a to automaticky namiesto ručného skúšania
-
Pipelines - moderný spôsob, ako aplikovať transformácie na dáta pred vstupom do modelu. Celý projekt urobíš najprv klasicky a potom cez pipelines, takže sám uvidíš rozdiel
-
Test Data Leakage - tichá chyba, pre ktorú model vyzerá výborne a v prevádzke zlyhá. Naučíš sa jednoduché pravidlo, ako sa jej vyhnúť. Presne toto odlišuje profesionálku od začiatočníčky
-
Feature Engineering - kreatívny prístup k zvýšeniu počtu prediktorov a presnosti modelu. Uvidíš, že tvoje vlastné vymyslené premenné sa dostanú medzi najsilnejšie faktory modelu
Clustering - zhlukovanie dát
Prvý typ modelu, ktorý si skupiny v dátach nájde sám
- Čo je clustering, ako funguje a aké sú najpoužívanejšie modely
-
Model K-Means - vysvetlenie a praktické použitie
- Ako určiť, na koľko skupín dáta rozdeliť (Elbow metóda), a prečo sa dáta pred clusteringom musia škálovať
- Metriky pre clustering
-
Profilovanie segmentov - ako z čísel spraviť pomenované skupiny, ktorým rozumie aj marketing
- Ďalšie algoritmy využívané v clusteringu (napríklad DBSCAN) a názorná ukážka dát, na ktorých K-Means zlyhá. Naučíš sa aj to, kedy ktorý nástroj nepoužiť
Komplexné praktické projekty
Všetko si vyskúšaš na reálnych projektoch a uvidíš celý proces od A po Z
-
Veľký projekt pre regresiu - oceňovanie nehnuteľností na datasete s 1 460 záznamami a 81 stĺpcami, vrátane tvorby vlastných premenných, ladenia modelu a porovnania viacerých modelov
-
Veľký projekt pre klasifikáciu - predikcia meškania zásielok pre medzinárodný eshop na 11 000 objednávkach
-
Veľký projekt pre clustering - segmentácia zákazníkov. Takmer 9 000 klientov banky s kreditnou kartou, od výberu premenných cez profilovanie až po pomenované segmenty a konkrétne obchodné odporúčania
-
Nasadenie modelu v praxi - štyri spôsoby, ktoré pokryjú prakticky všetky bežné situácie: spracovanie na požiadanie z Excelu, pravidelne naplánované spúšťanie, webová aplikácia s formulárom a služba pre iné systémy (REST API)
- Kde končí práca dátovej vedkyne a kde začína práca DevOps tímu, aby si vedela, čo sa od teba vo firme reálne očakáva
Záver a ďalší rozvoj
Zhrnutie a smerovanie ďalej
- Zhrnutie celého kurzu
- Témy na horizonte - čo študovať ďalej
- Záverečná certifikácia v poslednom týždni akadémie
Potrebné základné znalosti
Pre úspešné zvládnutie akadémie potrebuješ mať základné skúsenosti s:
- Programovaním v Pythone (Python je programovací jazyk, ktorý sa najviac používa v AI a dátovej analytike)
- Základmi dátovej analytiky pomocou knižnice pandas (pandas je nástroj v Pythone na prácu s tabuľkovými dátami, podobne ako Excel)
Predchádzajúce skúsenosti so strojovým učením ani umelou inteligenciou nepotrebuješ. Celú túto oblasť ti vysvetlíme úplne od začiatku a postupne, tému po téme.
Ak základy Pythonu a práce s dátami ešte nemáš, odporúčame ti najskôr absolvovať našu Women Data Academy - je to presne ten predchádzajúci krok.
Čo budeš potrebovať?
Technické vybavenie
- Vlastný notebook (externý monitor je veľkou výhodou pre pohodlnejšiu prácu)
- Dôležité upozornenie: Ak používaš notebook od firmy, v ktorej pracuješ, uisti sa, že máš právo inštalovať si vlastné programy. Niektoré firmy (napríklad banky) neumožňujú užívateľom inštalovať vlastný softvér. Na začiatku akadémie si totiž spolu nainštalujeme Python a všetky potrebné knižnice
- Špeciálne výkonný počítač nepotrebuješ. Datasety a príklady sme pripravili tak, aby zbehli na bežnom notebooku
- Stabilné internetové pripojenie
Jazykové znalosti
- Efektívna znalosť angličtiny (minimálne pasívne na úrovni čítania textu)
- Všetko dôležité na kurze je vysvetlené v slovenčine (detailné vysvetlenie tém, videá aj podpora na Discorde)
- Doplňujúce textové materiály, domáce úlohy a záverečná certifikácia sú v jednoduchej angličtine, ktorá je základným jazykom vo svete IT
- Všetky odborné pojmy ti vždy vysvetlíme po slovensky, skôr než ich začneme používať
Časová náročnosť
- Dostatok času na štúdium jednotlivých lekcií aj domácich úloh
- Priemerný odhadovaný čas: 10 - 12 hodín týždenne
- Je to náročnejšia akadémia. Odporúčame si k lekciám aj vracať a kód si aspoň raz napísať vlastnými rukami - je to najviac podceňovaný a zároveň najužitočnejší krok
Podmienky certifikácie
Súčasťou akadémie je finálna certifikácia, ktorá preverí nadobudnuté zručnosti formou praktického testu. Prebieha počas posledného týždňa kurzu.
V certifikačnom týždni si zvolíš konkrétny deň a čas. Dostaneš zadanie s praktickými úlohami a riešenia odovzdáš v stanovenom časovom limite (zvyčajne 12 hodín).
Nič sa nemusíš učiť naspamäť. Riešiš praktické úlohy presne toho typu, aké sme robili počas akadémie - a presne tak, ako sa to robí aj v bežnej praxi, teda s dokumentáciou po ruke.
Tvoje riešenie vyhodnotíme na stupnici od 0 do 100 %. Na získanie certifikátu Aj Ty v IT musíš dosiahnuť aspoň 80 % úspešnosť. Certifikát obsahuje aj tvoju percentuálnu úspešnosť - je to teda doklad, že si akadémiu nielen absolvovala, ale obsah aj prakticky zvládla. Práve preto má váhu aj u zamestnávateľa.