Abstract high-tech visualization of labeled data points conn
Metodológia ML

Učenie s učiteľom.

Proces trénovania algoritmov na vopred označených dátach. Systém sa učí predpovedať výsledky na základe historických príkladov, kde je správna odpoveď známa.

Základný princíp supervízie

Učenie s učiteľom (Supervised Learning) predstavuje najpoužívanejší typ strojového učenia v súčasnej praxi. Jeho podstata spočíva v existencii trénovacej množiny, ktorá obsahuje vstupné vektory a im prislúchajúce cieľové hodnoty, takzvané labely. Algoritmus sa snaží nájsť matematickú funkciu, ktorá čo najpresnejšie mapuje vstup na výstup. Tento prístup je kľúčový pre pochopenie základov a terminológie v oblasti umelej inteligencie.

V praxi to znamená, že ak chceme model naučiť rozpoznávať spam v e-mailoch, musíme mu predložiť tisíce správ, ktoré sú manuálne označené ako „spam“ alebo „nie spam“. Model analyzuje frekvenciu slov, štruktúru viet a metaúdaje, aby si vytvoril vnútorný model rozhodovania. Pri nasadení potom tento model aplikuje získané poznatky na nové, doteraz nevidené e-maily s cieľom správne ich kategorizovať.

Tento proces vyžaduje vysokú kvalitu dát, pretože akékoľvek chyby v označení (noise) priamo ovplyvňujú presnosť finálneho modelu. Efektivita algoritmu sa následne meria pomocou chybovej funkcie, ktorá kvantifikuje rozdiel medzi predpoveďou modelu a skutočnou hodnotou. Cieľom tréningu je minimalizovať túto chybu pomocou optimalizačných techník, ako je napríklad gradientný zostup.

01

Regresná analýza

Predpovedanie spojitých číselných hodnôt

Regresia sa používa v prípadoch, keď je cieľová premenná spojitá. Typickým príkladom je predpoveď ceny nehnuteľnosti na základe jej rozlohy, lokality a veku. Algoritmus nehľadá kategóriu, ale konkrétne číslo na číselnej osi. Tento prístup je nevyhnutný pre finančné plánovanie, predpoveď dopytu alebo analýzu trendov v priemysle.

  • / Lineárna regresia: Najjednoduchší model predpokladajúci priamu úmeru medzi vstupom a výstupom.
  • / Polynomická regresia: Využíva sa pri nelineárnych vzťahoch, kde dáta tvoria krivky.
  • / Logistická regresia: Napriek názvu sa používa na klasifikáciu, určuje pravdepodobnosť výskytu javu.

Príklad z praxe: Odhad spotreby

Analýza energetických systémov budov

Pri správe inteligentných budov regresné modely analyzujú vonkajšiu teplotu, vlhkosť a obsadenosť miestností. Výsledkom je predpoveď spotreby elektriny v kilowatthodinách na nasledujúcich 24 hodín, čo umožňuje optimalizáciu nákupu energie na burze.

94.2%

Priemerná presnosť moderných regresných modelov

Klasifikačné metódy

Rozhodovacie stromy

Hierarchická štruktúra otázok a odpovedí. Model rozdeľuje dáta do skupín na základe kritérií, až kým nedosiahne finálne rozhodnutie (list stromu).

Support Vector Machines

Algoritmus hľadá optimálnu hranicu (hyperrovinu), ktorá najlepšie oddeľuje dve alebo viac tried v multidimenzionálnom priestore.

K-Nearest Neighbors

Klasifikácia na základe podobnosti. Nový dátový bod je priradený k triede, ktorá prevláda medzi jeho najbližšími susedmi v priestore.

Visualization of data points separated by a clean mathematic

Binárna vs. Multitriedna klasifikácia

Zatiaľ čo binárna klasifikácia rieši otázky typu "Áno/Nie" (napr. identifikácia podvodnej transakcie), multitriedna klasifikácia priraďuje objekty do jednej z mnohých kategórií (napr. rozpoznávanie rukou písaných číslic 0-9). Pre komplexnejšie úlohy, ako je spracovanie obrazu, sa často využívajú neurónové siete.

Kľúčovým parametrom pri klasifikácii je tzv. Confusion Matrix, ktorá ukazuje pomer správne a nesprávne predpovedaných tried. Pomáha inžinierom pochopiť, či model nemá tendenciu zamieňať si konkrétne dve kategórie.

"Kvalita modelu v učení s učiteľom nikdy neprekročí kvalitu dát, na ktorých bol vytrénovaný. Garbage in, garbage out zostáva zlatým pravidlom inžinierstva."

— Technický princíp Kilnbrick

Logika anotácie dát

Anotácia alebo labelovanie je proces priraďovania významu surovým dátam. Bez tohto kroku je učenie s učiteľom nemožné. Ide o časovo najnáročnejšiu fázu vývoja AI, ktorá často vyžaduje expertné znalosti v danej doméne (napríklad rádiológ musí označiť nádory na RTG snímkach).

Dáta sa zvyčajne delia do troch skupín:

  1. Trénovacia množina (70-80%): Používa sa na samotné učenie modelu a úpravu jeho váh.
  2. Validačná množina (10-15%): Slúži na ladenie hyperparametrov a predchádzanie overfittingu (preučeniu).
  3. Testovacia množina (10-15%): Finálna kontrola na dátach, ktoré model nikdy nevidel, aby sa overila jeho schopnosť generalizácie.

Pre efektívne spracovanie týchto objemov sú kritické hardvérové požiadavky, najmä výkonné grafické procesory (GPU), ktoré dokážu paralelne spracovávať tisíce operácií za sekundu.

80%

Času projektu zaberá príprava dát

10M+

Parametrov v bežných modeloch

1:10

Pomer experta k dátam

<1ms

Rýchlosť inferencie modelu

Časté otázky

Aký je rozdiel medzi regresiou a klasifikáciou?

Regresia predpovedá spojité množstvo (napr. teplota, cena, čas). Klasifikácia priraďuje dáta do diskrétnych kategórií (napr. mačka/pes, chorý/zdravý). Výber závisí od charakteru cieľovej premennej.

Čo je to overfitting (preučenie)?

Stav, kedy sa model naučil trénovacie dáta naspamäť vrátane ich šumu. Takýto model exceluje na trénovacej množine, ale úplne zlyháva pri reálnych dátach v praxi. Riešením je regularizácia alebo viac dát.

Koľko dát potrebujem na tréning?

Neexistuje univerzálne číslo. Pre jednoduché regresie stačia stovky záznamov. Pre komplexné videnie alebo spracovanie jazyka sú potrebné milióny príkladov. Viac o náročnosti nájdete v sekcii matematický aparát.

Chcete vedieť, ako funguje učenie bez učiteľa?

Zistite, ako algoritmy hľadajú skryté vzorce v dátach, ktoré nemajú žiadne označenie ani vopred definované výsledky.

Prejsť na Učenie bez učiteľa