18. ANOVA
ANOVA
ANOVA testet benyttes til test af gennemsnit for flere end 2 kvantitative
variable, populationerne skal have samme varians.
Eksempler på stikprøver, hvor middelværdierne kan testes vha. ANOVA
testet kunne være:
For 4 stikprøver med højder for CBS, KU, CPH Business og SDU studerende,
kan man teste om middelhøjden er ens med ANOVA testet.
For 6 stikprøver med salgspriser for ejendomme i 6 byer, kan man
teste om middelværdierne er ens med ANOVA testet.
ANOVA testet er en udvidelse af pooled t-test, hypoteserne kan generisk
skrives som:
H0: Alle middelværdier er ens
H1: Ikke alle middelværdier er ens
Klik her for at
lære mere om ANOVA! er en metode til at sammenligne middelværdierne for
mere end 2 kvantitative variable. Skal man sammenligne to middelværdier med varianshomogenitetVarianshomogenitet betyder der er ens varianser for populationerne.
Hvis fx. vi har 2 stikprøver med højder for CBS og Cphbusiness
studerende, vil varianshomogenitet betyde, at der er samme variation i
de 2 populationer.
Testet kunne se ud som nedenfor, bemærk er der varianshomogenitet, er
standardafvigelserne også altid ens.
H0: σCBS=σCph (Der er
Varianshomogenitet)
H1: σCBS≠σCph (Der er ikke
varianshomogenitet)
Klik her
for
at lære mere om varianshomogenitet!, benytter
man pooled t-test. Er der mere end 2
middelværdier, benyttes ANOVA
ANOVA testet benyttes til test af gennemsnit for flere end 2 kvantitative
variable, populationerne skal have samme varians.
Eksempler på stikprøver, hvor middelværdierne kan testes vha. ANOVA
testet kunne være:
For 4 stikprøver med højder for CBS, KU, CPH Business og SDU studerende,
kan man teste om middelhøjden er ens med ANOVA testet.
For 6 stikprøver med salgspriser for ejendomme i 6 byer, kan man
teste om middelværdierne er ens med ANOVA testet.
ANOVA testet er en udvidelse af pooled t-test, hypoteserne kan generisk
skrives som:
H0: Alle middelværdier er ens
H1: Ikke alle middelværdier er ens
Klik her for at
lære mere om ANOVA! F-test. Forudsætningerne for at benytte testen er
at populationerne er normalfordelte
og har samme varians.
ANOVAANOVA testet benyttes til test af gennemsnit for flere end 2 kvantitative
variable, populationerne skal have samme varians.
Eksempler på stikprøver, hvor middelværdierne kan testes vha. ANOVA
testet kunne være:
For 4 stikprøver med højder for CBS, KU, CPH Business og SDU studerende,
kan man teste om middelhøjden er ens med ANOVA testet.
For 6 stikprøver med med salgspriser for ejendomme i 6 byer, kan man
teste om middelværdierne er ens med ANOVA testet.
ANOVA testet er en udvidelse af pooled t-test, hypoteserne kan generisk
skrives som:
H0: Alle middelværdier er ens
H1: Ikke alle middelværdier er ens
Klik her for at
lære mere om ANOVA testet! kan på samme måde bruges til at sammenligne performance, fx konverteringsrate eller afkast, på
tværs af flere samtidige varianter af en model eller et produkt – fx test af mere end to versioner af en
kreditscoringsmodel eller flere kundesegmenter på én gang.
ANOVA
ANOVA testet benyttes til test af gennemsnit for flere end 2 kvantitative
variable, populationerne skal have samme varians.
Eksempler på stikprøver, hvor middelværdierne kan testes vha. ANOVA
testet kunne være:
For 4 stikprøver med højder for CBS, KU, CPH Business og SDU studerende,
kan man teste om middelhøjden er ens med ANOVA testet.
For 6 stikprøver med salgspriser for ejendomme i 6 byer, kan man
teste om middelværdierne er ens med ANOVA testet.
ANOVA testet er en udvidelse af pooled t-test, hypoteserne kan generisk
skrives som:
H0: Alle middelværdier er ens
H1: Ikke alle middelværdier er ens
Klik her for at
lære mere om ANOVA! er en forkortelse af analysis of variances, man
tester om middelværdierne er ens vha. varianserne. Vi
undersøger
om k populationer har samme middelværdi, hypoteserne bliver:
$$H_0: \mu_1 = \mu_2=...=\mu_k$$
$$H_1: Ikke\ alle\ middelværdier\ er\ ens$$
Den totale variation SST kan opdeles i SSW og SSA, hvor SSW er variationen indenfor de k grupper, og SSA er variationen mellem grupperne.
Hvis variationen indenfor grupperne SSW er lille i forhold til variationen mellem grupperne SSA, er middelværdierne ikke ens.
Herunder er et eksempel, hvor populationernePopulationen er den store mængde, vi ønsker at udtale os om. Fx alle
iphone brugere i København, alle kontohavere i Danske Bank, alle danske
kvinder etc.
Vi bruger som redskab stikprøver som er en lille del af populationen
til at udtale os om populationen, da det er billigere end at undersøge
hele populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde,
kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så
alle danske mænd.
Klik her for at
lære mere om populationen!
er dagsafkast for aktier, variationen indenfor grupperne SSW er lille
i forhold til variationen mellem grupperne SSA, derfor er middelværdierne signifikant forskellige.
Figur 18.1: Tre gruppers dagsafkast med tydeligt adskilte middelværdier — lille variation inden for grupperne (SSW) i forhold til variationen mellem grupperne (SSA), som giver en signifikant ANOVAANOVA testet benyttes til test af gennemsnit for flere end 2 kvantitative
variable, populationerne skal have samme varians.
Eksempler på stikprøver, hvor middelværdierne kan testes vha. ANOVA
testet kunne være:
For 4 stikprøver med højder for CBS, KU, CPH Business og SDU studerende,
kan man teste om middelhøjden er ens med ANOVA testet.
For 6 stikprøver med med salgspriser for ejendomme i 6 byer, kan man
teste om middelværdierne er ens med ANOVA testet.
ANOVA testet er en udvidelse af pooled t-test, hypoteserne kan generisk
skrives som:
H0: Alle middelværdier er ens
H1: Ikke alle middelværdier er ens
Klik her for at
lære mere om ANOVA testet!-test.
Kilde: Egen tilvirkning.
Herunder er en figur med dagsafkast for aktier, hvor variationen indenfor grupperne SSW er stor i forhold til variationen mellem grupperne SSA, derfor er middelværdierne ikke signifikant forskellige.
Figur 18.2: Tre gruppers dagsafkast med overlappende fordelinger — stor variation inden for grupperne (SSW) i forhold til variationen mellem grupperne (SSA), så middelværdierne ikke er signifikant forskellige.
Kilde: Egen tilvirkning.
For at vi må benytte ANOVA
ANOVA testet benyttes til test af gennemsnit for flere end 2 kvantitative
variable, populationerne skal have samme varians.
Eksempler på stikprøver, hvor middelværdierne kan testes vha. ANOVA
testet kunne være:
For 4 stikprøver med højder for CBS, KU, CPH Business og SDU studerende,
kan man teste om middelhøjden er ens med ANOVA testet.
For 6 stikprøver med salgspriser for ejendomme i 6 byer, kan man
teste om middelværdierne er ens med ANOVA testet.
ANOVA testet er en udvidelse af pooled t-test, hypoteserne kan generisk
skrives som:
H0: Alle middelværdier er ens
H1: Ikke alle middelværdier er ens
Klik her for at
lære mere om ANOVA! analysen, er det en forudsætning, at populationerne
vi tester, har samme varians. I figuren
herunder
er et eksempel på 3 fordelinger for aktieafkast, der ikke har samme varians, de tre fordelinger har jo forskellige
standardafvigelser.
Når der ikke er ens varianser, siger vi, at der ikke er varianshomogenitet. Forudsætningen om varianshomogenitet, er
således ikke opfyldt,
hvilket er problematisk mht. til analysens kvalitet.
Figur 18.3: Tre fordelinger med samme middelværdi (μ = 0) men forskellig standardafvigelse (0,5 / 1 / 2) — et eksempel på manglende varianshomogenitetVarianshomogenitet betyder der er ens varianser for populationerne.
Hvis fx. vi har 2 stikprøver med højder for CBS og Cphbusiness
studerende, vil varianshomogenitet betyde, at der er samme variation i
de 2 populationer.
Testet kunne se ud som nedenfor, bemærk er der varianshomogenitet, er
standardafvigelserne også altid ens.
H0: σCBS=σCph (Der er
Varianshomogenitet)
H1: σCBS≠σCph (Der er ikke
varianshomogenitet)
Klik her
for
at lære mere om varianshomogenitet!, som er problematisk for ANOVAANOVA testet benyttes til test af gennemsnit for flere end 2 kvantitative
variable, populationerne skal have samme varians.
Eksempler på stikprøver, hvor middelværdierne kan testes vha. ANOVA
testet kunne være:
For 4 stikprøver med højder for CBS, KU, CPH Business og SDU studerende,
kan man teste om middelhøjden er ens med ANOVA testet.
For 6 stikprøver med med salgspriser for ejendomme i 6 byer, kan man
teste om middelværdierne er ens med ANOVA testet.
ANOVA testet er en udvidelse af pooled t-test, hypoteserne kan generisk
skrives som:
H0: Alle middelværdier er ens
H1: Ikke alle middelværdier er ens
Klik her for at
lære mere om ANOVA testet!-analysens gyldighed.
Kilde: Egen tilvirkning.
Eksempel
Et forsikringsselskab har udviklet 4 forskellige layouts til information om skadesdækning. Brugerne udsættes vilkårligt for et af de 4 layouts, selskabet registrerer tiderne for besøgene på hjemmesiderne for at afgøre hvilket design, der er optimalt mht. brugervenlighed og overskuelighed.
Datasæt Hjemmesidedesigns besøgstider i millisekunder
Vi får en F-teststørrelseTeststørrelsen kan populært forklares, som forskellen mellem observeret i
stikprøven og forventet under nulhypotesen.Teststørrelsen er et udtryk for forskellen mellem fx. gennemsnit, andel eller antal i stikprøven i forhold til påstanden i nulhypotesen H0.
Teststørrelsen korrigerer for stikprøvestørrelse og standardafvigelse, men beregnes forskelligt afhængigt af hvilket test der udføres.
Testes fx. middelværdi μ eller eller hældning i lineær regression β, benyttes t-teststørrelsen
Testes andele kan fx. z-teststørrelsen benyttes
Antag fx. at vi har en stikprøve af 100 mænds højde, med et gennemsnit på 176,32 cm.
Vi ønsker at teste om middel højden i populationen, kan antages at være 210 cm dvs.
H0: μ=210
H1: μ≠210
Vi vil her få en meget negativ teststørrelse, 176,32-210 divideret med standardfejlen for middelværdien SEM
Ønskede at teste om middel højden i populationen, kunne antages at være 150 cm ud fra samme stikprøve ville vi få en meget positiv teststørrelse, 176,32-150 divideret med standardfejlen for middelværdien SEM
Klik her for at lære mere om teststørrelser! på 6,0429, der resulterer i en p-værdip-værdien også kaldet signifikanssandsynligheden er et tal mellem 0 og 1, den angiver sandsynligheden for, hvis nulhypotesen er sand, at få en mere ekstrem teststørrelse, end den vi har fået i testet (teststørrelsen måler forskellen mellem fx. stikprøvegennemsnit og middelværdien antaget i nulhypotesen).
Jo lavere p-værdi, des mindre tror vi på nulhypotesen
Antag fx. at vi har en stikprøve af 100 mænds højde, med et gennemsnit på 176,32 cm.
Vi ønsker at teste om middel højden i populationen, kan antages at være 210 cm dvs.
H0: μ=210
H1: μ≠210
Vi vil her få en meget negativ teststørrelse, hvilket giver en mikroskopisk lille p-værdi.
Det vil være nærmest umuligt at få en mere ekstrem teststørrelse, hvis den sande middelhøjde er 210 cm.
Klik her for at lære mere om p-værdier! på 0,0005, hvilket er under signifikansniveauetSignifikansniveauet α typisk 1%, 5% eller 10%, fastsættes inden et test og sammenlignes med p-værdien.
Er p-værdien mindre end signifikansniveauet forkastes nulhypotesen, ellers ikke.
Signifikansniveauet angiver sandsynligheden for at forkaste en sand nulhypotese (en type 1 fejl også kaldet en falsk positiv)
Medicinal industrien arbejder ofte med 1% signifikansniveau, hvor et test kunne være:
H0: Medicinen har ingen effekt
H1: Medicinen har effekt
Med 1% signifikansniveau, begås en type 1 fejl kun i et ud af 100 tests.
En type 1 fejl vil her betyde, at man fejlagtigt konkluderer at et medicinal produkt uden effekt virker.
Signifikansniveauet kan bruges til at bestemme konfidensniveauet 1-α, der angiver sandsynligheden for korrekt ikke at forkaste en sand nulhypotese
Klik her for at lære mere om signifikansniveauet! på 0,05. Vi forkaster altså nulhypotesenNulhypotesen H0 er vores grundtro i et hypotesetest, vi har altid lighedstegn i nulhypotesen. Der skal stærke beviser til at forkaste nulhypotesen.
Eksempler på nulhypoteser er:
H0: μ=45 (Middelværdien er 45)
H0: μ≤45 (Middelværdien er højst 45)
H0: μ≥45 (Middelværdien er mindst 45)
Klik her for at lære mere om hypotesetests! om ens middelværdier.
Freestat output
Vi skal tjekke forudsætningen om varianshomogenitetVarianshomogenitet betyder der er ens varianser for populationerne.
Hvis fx. vi har 2 stikprøver med højder for CBS og Cphbusiness studerende, vil varianshomogenitet betyde, at der er samme variation i de 2 populationer.
Testet kunne se ud som nedenfor, bemærk er der varianshomogenitet, er standardafvigelserne også altid ens.
H0: σCBS=σCph (Der er Varianshomogenitet)
H1: σCBS≠σCph (Der er ikke varianshomogenitet)
Klik her for at lære mere om varianshomogenitet!
Normalitet
Herunder er 4 normalfraktildiagrammerNormalfraktildiagrammer kan bruges til at afgøre, om en stikprøve kan antages at stamme fra normalfordelt population.
Hvis punkterne ligger pænt omkring den rette linje er normalitetsbetingelsen opfyldt. Ved test af fx. en mindre kvantitativ stikprøve og varianshomogenitet forudsættes at variablene opfylder normalitetsbetingelsen.
Klik her for at lære mere om normalfraktildiagrammer!, for de 4 designs, vi kan godt antage, stikprøverneEn stikprøve, er et udsnit af populationen (den store mængde vi ønsker at udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde, kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så alle danske mænd.
Klik her for at lære mere om stikprøver!
stammer fra normalfordelte populationerPopulationen er den store mængde, vi ønsker at udtale os om. Fx alle iphone brugere i København, alle kontohavere i Danske Bank, alle danske kvinder etc.
Vi bruger som redskab stikprøver som er en lille del af populationen til at udtale os om populationen, da det er billigere end at undersøge hele populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde, kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så alle danske mænd.
Klik her for at lære mere om populationen!
.
Tukey-Kramer
Vi kan undersøge hvilke designs der har de største afvigelser ved at se på forskellene mellem stikprøvegennemsnitteneEn stikprøve, er et udsnit af populationen (den store mængde vi ønsker at udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde, kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så alle danske mænd.
Klik her for at lære mere om stikprøver!
. Der er størst forskel mellem besøgstiderne for design 1 og design 4.
Vi kan grafisk sammenligne middelværdierne i boxplotsEt boxplot viser median, kvartiler og eventuelle outliers i ét diagram.
John Tukey opfandt boxplottet i 1970'erne som en del af eksplorativ dataanalyse — en måde at undersøge data visuelt, før man laver formelle statistiske tests.
Klik her for at lære mere om boxplots!, her ser vi ligeledes forskellen er størst mellem design 1 og design 4. Middelværdierne er markeret med orange prikker.
Figur 18.4: BoxplotsEt boxplot viser median, kvartiler og eventuelle outliers i ét diagram.
John Tukey opfandt boxplottet i 1970'erne som en del af eksplorativ dataanalyse — en måde at undersøge
data visuelt, før man laver formelle statistiske tests.
Klik her for at lære mere om
boxplots! for besøgstider (ms) på 4 hjemmesidedesigns (n ≈ 87–92). Orange prikker markerer middelværdien; sorte punkter er outliers. Design 1 har lavest median; design 4 højest.
Kilde: Egen tilvirkning baseret på datasættet "Hjemmesidedesigns besøgstider i millisekunder".
Quiz
Selvtest
Spørgsmål
$$H_{0}:\mu_{DanskeBank}=\mu_{JyskeBank}=\mu_{Sydbank}$$ $$H_1: Ikke\ alle\ middelværdier\ er\ ens\ for\ de\ 3\ banker$$ Vi får variationen i grupperne SSW til 16574,0317 og variationen mellem grupperne SSA til 4,3394. Dette giver en F-teststørrelse på 0,1536 der resulterer i p-værdi på 0,8577. Vi kan altså ikke forkaste nulhypotesen om ens middelværdier.
Vi kan da se at de absolutte forskelle mellem stikprøvegennemsnittene er relativt små:
| Forskelle mellem Banker | Absolutte forskelle |
|---|---|
| Danske Bank - Jyske Bank | 0,04 |
| Danske Bank - Sydbank | 0,11 |
| Jyske Bank - Sydbank | 0,14 |
Tabel 18.1: Absolutte forskelle mellem stikprøvegennemsnittene for ugentlige afkast for Danske Bank, Jyske Bank og Sydbank — alle forskelle er små, i tråd med at ANOVA-testen ikke kan forkaste nulhypotesen om ens middelværdier.
Kilde: Egen tilvirkning baseret på datasættet "3 Danske Banker Ugeafkast i procent".
$$H_{0}:\sigma_{DanskeBank}=\sigma_{JyskeBank}=\sigma_{Sydbank}$$ $$H_{1}:Ikke\ alle\ varianser\ er\ ens\ for\ de\ 3\ banker.$$ Vi får en teststørrelse på 5,2390755. Chi i anden testet giver os en p-værdi på 0,0728365, hvilket vi skal sammenholde med signifikansniveauet på 0,05.
Normalitet
Vi kan grafisk sammenligne middelværdierne for ugeafkastet for de 3 banker i boxplots, her ser vi der ikke er stor forskel på middelværdierne. Middelværdierne er markeret med orange prikker.
Eksempler på stikprøver, hvor middelværdierne kan testes vha. ANOVA testet kunne være:
For 4 stikprøver med højder for CBS, KU, CPH Business og SDU studerende, kan man teste om middelhøjden er ens med ANOVA testet.
For 6 stikprøver med salgspriser for ejendomme i 6 byer, kan man teste om middelværdierne er ens med ANOVA testet.
ANOVA testet er en udvidelse af pooled t-test, hypoteserne kan generisk skrives som:
H0: Alle middelværdier er ens
H1: Ikke alle middelværdier er ens
Klik her for at lære mere om ANOVA! test
$$H_{0}:\mu_{action}=\mu_{komedie}=\mu_{drama}=\mu_{dokumentar}=\mu_{romance}=\mu_{short}$$ $$H_1: Ikke\ alle\ middelværdier\ er\ ens\ for\ de\ 6\ genrer$$ Vi får en F-teststørrelse på 10.786, der resulterer i en meget lille p-værdi på 0, hvilket er klart under signifikansniveauet på 0,05. Vi kan altså forkaste nulhypotesen om ens middelværdier. Der er altså ikke ens vurderinger af genrerne.
Vi skal tjekke forudsætningen om varianshomogenitet $$H_{0}:\sigma_{action}=\sigma_{komedie}=\sigma_{drama}=\sigma_{dokumentar}=\sigma_{romance}=\sigma_{short}$$ $$H_{1}:Ikke\ alle\ standardafvigelser\ er\ ens\ for\ de\ 6\ genrer.$$ Vi får en teststørrelse på 7,1306596. Chi i anden testet giver os en p-værdi på 0,2111029.
Normalitet
Herunder er 6 normalfraktildiagrammer, for de 6 genrer, dokumentar og short genrerne ser ikke normalfordelte ud. Hvilket kan give problemer med kvaliteten i vor analyse.
Vi kan ud fra boxplots se at dokumentarfilm rates højt i modsætning til actionfilm. Vi kan i tabellen herunder se hvor de største forskelle er mellem genrerne.
| Forskelle gennemsnit genrer | Absolutte forskelle |
|---|---|
| Action - dokumentar | 1,5465517 |
| Action - drama | 0,9324561 |
| Action - komedie | 0,3148402 |
| Action - romance | 0,6735294 |
| Action - short | 0,788806 |
| Dokumentar - drama | 0,6140956 |
| Dokumentar - komedie | 1,2317115 |
| Dokumentar - romance | 0,8730223 |
| Dokumentar - short | 0,7577458 |
| Drama - komedie | 0,617616 |
| Drama - romance | 0,2589267 |
| Drama - short | 0,1436502 |
| Komedie - romance | 0,3586892 |
| Komedie - short | 0,4739658 |
| Romance - short | 0,1152766 |
Tabel 18.2: Absolutte forskelle mellem gennemsnitlige IMDB-vurderinger for filmgenrerne action, dokumentar, drama, komedie, romance og short — de største forskelle findes mellem action og dokumentar.
Kilde: Egen tilvirkning baseret på datasættet "IMDB stikprøve på 759 film".