Min-Max Scaling
Tato technika lineárně transformuje data do specifického rozsahu, obvykle mezi 0 a 1. Je nezbytná pro algoritmy citlivé na rozsah hodnot, jako jsou Neurální sítě, kde velké rozdíly v měřítku mohou zpomalit konvergenci.
Kvalita výstupu jakéhokoli algoritmu je přímo úměrná čistotě vstupních informací. Proces "Data Preprocessing" transformuje surová data do formátu, který je srozumitelný pro matematické modely a minimalizuje šum v predikcích.
Tato technika lineárně transformuje data do specifického rozsahu, obvykle mezi 0 a 1. Je nezbytná pro algoritmy citlivé na rozsah hodnot, jako jsou Neurální sítě, kde velké rozdíly v měřítku mohou zpomalit konvergenci.
Centrování dat kolem nuly s jednotkovou směrodatnou odchylkou. Tato metoda je robustnější vůči odlehlým hodnotám (outliers) a je klíčová pro lineární modely a algoritmy založené na vzdálenosti.
Využívá medián a interkvartilní rozsah místo průměru. Je ideální pro datasety s extrémními hodnotami, které by standardní normalizaci mohly zkreslit a negativně ovlivnit Učení s učitelem.
Feature engineering je proces využívání doménových znalostí k vytvoření nových příznaků (features) ze surových dat. Cílem je zvýšit predikční schopnost algoritmů strojového učení. V praxi to znamená, že místo pouhého vkládání dat do modelu se snažíme najít vztahy, které nejsou na první pohled zřejmé.
Důležitým aspektem je také redukce dimenzionality. Příliš mnoho irelevantních příznaků může vést k takzvanému "prokletí dimenzionality", kdy se model začne učit náhodný šum místo skutečných vzorců. Správný výběr příznaků zjednodušuje model, zrychluje trénování a zlepšuje interpretovatelnost výsledků.
času projektu zabere příprava dat
zvýšení přesnosti díky feature engineeringu
Chybějící data jsou v reálném světě nevyhnutelná. Způsob, jakým s nimi naložíme, definuje integritu celého modelu.
Nejjednodušší metoda, kdy odstraníme celé řádky nebo sloupce s chybějícími údaji. Je vhodná pouze v případě, že objem chybějících dat je zanedbatelný a náhodný.
Nahrazení prázdných míst statistickým středem. Rychlá metoda, která však může snížit variabilitu dat a zkreslit vztahy mezi proměnnými.
Použití jiných algoritmů (např. K-Nearest Neighbors) k odhadu chybějící hodnoty na základě ostatních dostupných údajů. Tato metoda je nejpřesnější, ale výpočetně náročná.
Jakmile jsou data vyčištěna a transformována, dalším krokem je ověření, zda se model učí správně a není přetrénovaný. Přečtěte si o strategiích validace a testování.