Modul 02: Supervised Learning

Učení s učitelem

Metoda strojového učení založená na trénování modelu pomocí anotovaných datových sad. Algoritmus analyzuje vztahy mezi vstupními proměnnými a známými výstupy, aby mohl predikovat hodnoty u nových, dosud neviděných dat.

Mechanismus přenosu znalostí

Základním principem učení s učitelem (Supervised Learning) je existence tzv. "ground truth" – tedy sady správných odpovědí, které slouží jako reference během trénovacího procesu. V praxi to znamená, že každý datový bod ve vstupní sadě je opatřen štítkem (label). Algoritmus se snaží minimalizovat chybovou funkci (loss function), která vyjadřuje rozdíl mezi predikcí modelu a skutečnou hodnotou uvedenou v datech.

V průběhu iterativního procesu dochází k úpravě vnitřních parametrů modelu (vah). Tento proces je často realizován pomocí optimalizačních algoritmů, jako je gradientní sestup. Je důležité si uvědomit, že kvalita výsledného modelu je přímo závislá na kvalitě a reprezentativnosti trénovacích dat. Pokud jsou data zkreslená nebo obsahují příliš mnoho šumu, model nebude schopen správně generalizovat na reálné případy.

Důležitým aspektem je rozdělení dat na trénovací, validační a testovací sadu. Zatímco trénovací sada slouží k přímému učení, validační sada pomáhá ladit hyperparametry a předcházet problému zvanému overfitting (přeučení). Testovací sada pak poskytuje finální, nezaujaté hodnocení výkonnosti algoritmu. Pro hlubší pochopení struktury dat doporučujeme sekci Příprava dat.

Klíčové komponenty procesu:

  • Vstupní vektory (Features): Numerické reprezentace vlastností objektů.
  • Cílové proměnné (Labels): Hodnoty, které se model snaží naučit predikovat.
  • Chybová funkce: Matematický vzorec pro měření přesnosti predikce.

Dvě hlavní disciplíny

Regrese

Používá se v případech, kdy cílová proměnná nabývá spojitých hodnot. Typickým příkladem je predikce ceny nemovitosti na základě její rozlohy a lokality nebo odhad budoucí teploty.

Metriky regrese →

Klasifikace

Cílem je přiřadit vstupní data do jedné z předem definovaných kategorií (tříd). Příkladem může být rozpoznávání spamu v e-mailech nebo diagnostika onemocnění z lékařských snímků.

Klasifikace s NN →
85%

průmyslových aplikací AI dnes využívá právě principy učení s učitelem pro svou vysokou spolehlivost a interpretovatelnost.

Standardní algoritmy

Lineární regrese

Nejjednodušší model pro hledání lineárních závislostí mezi proměnnými.

Support Vector Machines (SVM)

Efektivní pro vysocerozměrná data a binární klasifikaci.

Rozhodovací stromy

Intuitivní modely založené na hierarchickém větvení podmínek.

K-Nearest Neighbors (k-NN)

Klasifikace na základě podobnosti s nejbližšími sousedy v prostoru.

A technical schematic visualization of a machine learning tr
Zdroj: Bourreeco Technical Documentation - Supervised Pipeline