Alle fag › Maskinlæring og dataanalyse
Maskinlæring og dataanalyse (ML): gratis øving, teori og oppgaver
Maskinlæring er å la datamaskinen finne mønstre i data i stedet for at vi skriver reglene selv. Du gir modellen mange eksempler, og den lærer seg en sammenheng den kan bruke på nye tilfeller: gjenkjenne feil i en produksjonslinje, anslå strømforbruk i morgen eller sortere e-post.
Innhold
1. Data og grunnbegreper
Hva handler det om?
Maskinlæring er å la datamaskinen finne mønstre i data i stedet for at vi skriver reglene selv. Du gir modellen mange eksempler, og den lærer seg en sammenheng den kan bruke på nye tilfeller: gjenkjenne feil i en produksjonslinje, anslå strømforbruk i morgen eller sortere e-post.
Begreper og formler
- Egenskaper (features) er det modellen får inn. Merkelapp (label) er svaret vi vil at den skal gi.
- Veiledet læring: eksemplene har fasit . Regresjon gir et tall, klassifisering gir en kategori.
- Ikke-veiledet læring: ingen fasit. For eksempel klynging (clustering) som finner grupper.
- Trenings- og testsett: modellen lærer på treningsdata og måles på testdata den aldri har sett, ofte fordelt 80/20.
- Overtilpasning (overfitting): modellen pugger treningsdataene, også støyen, og gjør det dårlig på nye data.
- Min–maks-normalisering: gir verdier mellom 0 og 1.
- Standardisering: gir gjennomsnitt 0 og standardavvik 1.
- Middelkvadratfeil: .
Slik løser du oppgavene
- Finn ut hva som er og hva som er , og om svaret er et tall eller en kategori.
- For normalisering: finn min og maks (eller og ) og sett inn.
- For feilmål: regn ut feilen for hvert punkt, kvadrer, og ta gjennomsnittet.
Eksempel
Temperaturene 10, 15 og 30 °C skal min–maks-normaliseres. Hva blir 15?
- , .
- .
Vanlige feil
- Å teste modellen på de samme dataene den ble trent på. Da ser den mye bedre ut enn den er.
- Å normalisere med min og maks fra hele datasettet, inkludert testdata. Det lekker informasjon.
- Å tro at en mer komplisert modell alltid er bedre. Den kan lett overtilpasse.
Begreper i denne delen
2. Lineær regresjon og gradientnedstigning
Hva handler det om?
Den enkleste modellen som lærer av data, er en rett linje: . Modellen justerer vekten og konstantleddet slik at linja treffer punktene best mulig. Nøyaktig samme idé, bare med mange flere vekter, ligger bak store nevrale nett.
Begreper og formler
- Modell: . er stigningstallet, er skjæringen med -aksen.
- Tapsfunksjon: . Målet er å gjøre så liten som mulig.
- Minste kvadraters metode gir svaret direkte:
- Gradientnedstigning: gå litt i motsatt retning av gradienten, om og om igjen:
der er læringsraten.
- For MSE er .
- Forklaringsgrad mellom 0 og 1: hvor stor del av variasjonen i modellen forklarer.
Slik løser du oppgavene
- Regn ut gjennomsnittene og .
- Regn ut avvikene fra gjennomsnittet og sett inn i formelen for , deretter .
- For ett gradientsteg: regn ut gradienten, gang med og trekk fra.
Eksempel
Punktene , og . Finn .
- , .
- og .
- , og .
Vanlige feil
- For stor læringsrate: tapet hopper fram og tilbake og kan eksplodere. For liten: det tar evigheter.
- Å glemme minustegnet i oppdateringen. Vi går nedover, mot lavere tap.
- Å tolke en god tilpasning som årsakssammenheng.
Begreper i denne delen
3. Klassifisering og evaluering
Hva handler det om?
En klassifiseringsmodell sier «ja» eller «nei»: er delen defekt, er svulsten ondartet, er transaksjonen svindel? For å vite om modellen er god, må vi telle opp hvor den treffer og hvor den bommer. Og vi må velge hvor streng den skal være.
Begreper og formler
- Forvekslingsmatrisen (confusion matrix) teller fire utfall:
sant positiv (TP), falsk positiv (FP), sant negativ (TN) og falsk negativ (FN).
- Treffsikkerhet (accuracy): .
- Presisjon: . Av dem modellen sa ja til, hvor mange var riktige?
- Gjenkalling (recall): . Av alle de ekte positive, hvor mange fant modellen?
- F1-mål: , et kompromiss mellom presisjon og gjenkalling .
- Logistisk regresjon gir en sannsynlighet med sigmoidfunksjonen . Over en terskel (ofte 0,5) sier modellen ja.
- k nærmeste naboer (k-NN): et nytt punkt får samme klasse som flertallet av de nærmeste punktene.
Slik løser du oppgavene
- Sett opp de fire tallene TP, FP, TN og FN.
- Velg riktig formel: presisjon ser på de positive svarene, gjenkalling på de positive tilfellene.
- Tenk på hva som er verst: en falsk alarm eller et tilfelle som blir oversett?
Eksempel
En modell finner 40 av 50 defekte deler, og slår falsk alarm på 10 fine deler. Presisjon og gjenkalling?
- , , .
- Presisjon . Gjenkalling .
Vanlige feil
- Å stole på treffsikkerhet når klassene er skjeve. Er bare 1 % svindel, får en modell som alltid sier «nei», 99 %.
- Å bytte om presisjon og gjenkalling.
- Å tro at terskelen må være 0,5. Lavere terskel gir høyere gjenkalling, men lavere presisjon.
Begreper i denne delen
Eksempeloppgaver med løsning
Her er noen av oppgavene i maskinlæring og dataanalyse. I appen får regneoppgavene nye tall hver gang, så du kan øve til det sitter – og ta en prøveeksamen med karakter før eksamen.
Data og grunnbegreper: Temperaturene 10, 15 og 30 °C min–maks-normaliseres. Hva blir 15?
Svar: 0,25
.
Lineær regresjon og gradientnedstigning: Punktene , og . Hva er stigningstallet med minste kvadraters metode?
Svar: 1,5
, . , , så .
Klassifisering og evaluering: TP = 40, FP = 10, FN = 20. Hva er presisjonen?
Svar: 0,8
.
Data og grunnbegreper: En modell skal anslå prisen på en bolig i kroner. Hva slags oppgave er det?
Svar: Regresjon
Svaret er et tall (en pris), og vi har eksempler med fasit. Det er veiledet regresjon.
Passer for disse emnene
Innholdet dekker pensum som går igjen i ingeniørutdanningene, blant annet:
- TDT4172 (NTNU)