Dáta ako palivo systému
Strojové učenie nie je o programovaní explicitných pravidiel, ale o extrakcii vzorcov z dostupných informácií. Kvalita a štruktúra vstupných dát priamo určujú presnosť finálneho modelu. V praxi rozlišujeme medzi štruktúrovanými dátami, ktoré nájdeme v tabuľkách, a neštruktúrovanými formátmi, ako sú obrázky, zvukové záznamy alebo voľný text.
Proces prípravy dát zahŕňa čistenie od šumu, normalizáciu hodnôt a riešenie chýbajúcich atribútov. Bez tejto fázy by algoritmus trpel problémom "garbage in, garbage out", kde nekvalitný vstup vedie k nepoužiteľnému výsledku. Pochopenie matematického aparátu za týmito procesmi je kľúčové pre každého inžiniera.
Okrem typu dát je dôležitý aj ich objem. Zatiaľ čo jednoduché lineárne modely si vystačia so stovkami záznamov, moderné neurónové siete vyžadujú milióny príkladov na dosiahnutie nadľudskej presnosti v úlohách rozpoznávania reči alebo obrazu.