Z-Score Metoda
Statistická technika měřící vzdálenost bodu od průměru v jednotkách směrodatné odchylky. Body s absolutní hodnotou Z-score vyšší než 3 jsou obvykle považovány za anomálie.
Diagnostika chybKritická fáze datového inženýrství zaměřená na eliminaci šumu, opravu nekonzistencí a strukturální transformaci surových vstupů před procesem trénování modelů.
Času projektu
Průměrná doba dedikovaná čištění a transformaci dat v enterprise AI projektech.
Zvýšení přesnosti
Průměrný nárůst preciznosti modelu po aplikaci pokročilé detekce odlehlých hodnot.
Rychlost konvergence
Zrychlení trénovacího procesu při správné aplikaci normalizačních parametrů.
Proces čištění dat není jednorázový úkon, ale iterativní technický postup vyžadující absolutní preciznost. Cílem je převést neuspořádané sady z fáze sběru do formátu, který minimalizuje zkreslení (bias) algoritmu. Každý chybný záznam, který pronikne do trénovací sady, přímo degraduje predikční schopnosti výsledného modelu.
Prvním úkolem je detekce polí s hodnotou NULL nebo NaN. V závislosti na rozsahu chybějících dat volíme mezi odstraněním řádků (deletion) nebo imputací (imputation). U kritických parametrů doporučujeme použití mediánu nebo prediktivní imputace pomocí K-NN algoritmu.
Duplicitní záznamy uměle zvyšují váhu určitých příznaků, což vede k přetrénování (overfitting). Je nutné provést deduplikaci na základě primárních klíčů nebo fuzzy matching algoritmů pro textová pole. Nekonzistence v jednotkách (např. metry vs. stopy) musí být sjednoceny v celém datasetu.
Statistická technika měřící vzdálenost bodu od průměru v jednotkách směrodatné odchylky. Body s absolutní hodnotou Z-score vyšší než 3 jsou obvykle považovány za anomálie.
Diagnostika chybMetoda založená na kvartilech, která je robustní vůči extrémním hodnotám. Definuje hranice jako Q1 - 1.5*IQR a Q3 + 1.5*IQR. Ideální pro data, která nemají normální rozdělení.
Vliv na modelyAlgoritmus strojového učení určený přímo pro detekci anomálií. Funguje na principu izolace bodů v náhodných stromech; anomálie jsou izolovány dříve než běžné body.
Interpretace datPokud mají různé příznaky (features) dramaticky odlišná měřítka (např. věk 0-100 a roční příjem 0-1 000 000), algoritmy založené na vzdálenosti (jako SVM nebo K-Means) budou dominovány příznaky s vyššími hodnotami. Proto je nezbytné provést škálování.
| Metoda | Vzorec / Princip | Kdy použít |
|---|---|---|
| Min-Max Scaling | (x - min) / (max - min) | Když potřebujeme pevný rozsah [0, 1]. |
| Standardizace | (x - mean) / std_dev | Pro algoritmy předpokládající Gaussovo rozdělení. |
| Robust Scaling | (x - Q2) / IQR | Pokud dataset obsahuje mnoho neodstranitelných outlierů. |
Parametry pro normalizaci (průměr, odchylka) musí být vypočteny POUZE na trénovací sadě a následně aplikovány na testovací sadu. Výpočet na celém datasetu před rozdělením vede k nereálně optimistickým výsledkům validace.
Ověřte, že všechny sloupce mají správné datové typy (int, float, datetime) a žádné textové řetězce neobsahují skryté netisknutelné znaky.
Zkontrolujte, zda se hodnoty nacházejí v logických mezích (např. věk nesmí být záporný, teplota v Kelvinech nesmí být pod nulou).
Ujistěte se, že One-Hot Encoding nebo Label Encoding byl aplikován správně bez vzniku "dummy variable trap".
Prověřte distribuci cílové třídy. V případě výrazné nerovnováhy aplikujte techniky SMOTE nebo undersampling.
Po dokončení čištění a validace je dalším krokem definice architektury modelu a nastavení hyperparametrů pro trénování.