9. 2 Middelværdier
9. 2 Middelværdier

9. 2 Middelværdier

Konfidensinterval for 2 middelværdier

Pooled og unpooled t-test


Vi kan ofte være interesseret i at sammenligne middelværdier, til dette kan vi benytte en af flere tests. Hvis vi har 2 kvantitative stikprøverEn stikprøve, er et udsnit af populationen (den store mængde vi ønsker at udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde, kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så alle danske mænd.


Klik her for at lære mere om stikprøver!
, kan vi undersøge om forskellen i middelværdierne er signifikant forskellig. Det er muligt at bruge en pooled t-testPooled t-test benyttes til test af gennemsnit for 2 kvantitative variable, når populationerne har samme varians (varianshomogenitet).
Eksempler på stikprøver, hvor middelværdierne kan testes vha. pooled t-test kunne være:
For 2 stikprøver med højder for CBS og SDU studerende, kan man teste om gennemsnitshøjden for CBS og SDU studerende er ens med pooled t-test, hvis der er varianshomogenitet.
For 2 stikprøver med med salgspriser for ejendomme i 2 byer, kan man teste om gennemsnitsprisen er højere for den ene by med pooled t-test, hvis der er varianshomogenitet.
Har de 2 populationer ikke ens varianser, kan man i stedet benytte et unpooled t-test, pooled t-test er dog det mest præcise.

Klik her for at lære mere om pooled t-test!
, hvis vi har ens standardafvigelser og dermed ens varianser for de 2 stikprøverEn stikprøve, er et udsnit af populationen (den store mængde vi ønsker at udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde, kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så alle danske mænd.


Klik her for at lære mere om stikprøver!
. Man bruger en unpooled t-testUnpooled t-test benyttes til test af gennemsnit for 2 kvantitative variable, når populationerne ikke har samme varians (der er ikke varianshomogenitet).
Eksempler på stikprøver, hvor middelværdierne kan testes vha. unpooled t-test kunne være:
For 2 stikprøver med højder for CBS og SDU studerende, kan man teste om gennemsnitshøjden for CBS og SDU studerende er ens med unpooled t-test, hvis der ikke er varianshomogenitet.
For 2 stikprøver med med salgspriser for ejendomme i 2 byer, kan man teste om gennemsnitsprisen er højere for den ene by med unpooled t-test, hvis der ikke er varianshomogenitet.
Har de 2 populationer ens varianser, kan man i stedet benytte et pooled t-test, hvilket er mere præcist.

Klik her for at lære mere om unpooled t-test!
, hvis varianserne ikke er ens. Vi kan teste om varianserne er ens, en sådan test for varianshomogenitetVarianshomogenitet betyder der er ens varianser for populationerne.
Hvis fx. vi har 2 stikprøver med højder for CBS og Cphbusiness studerende, vil varianshomogenitet betyde, at der er samme variation i de 2 populationer.
Testet kunne se ud som nedenfor, bemærk er der varianshomogenitet, er standardafvigelserne også altid ens.
H0: σCBSCph (Der er Varianshomogenitet)
H1: σCBS≠σCph (Der er ikke varianshomogenitet)

Klik her for at lære mere om varianshomogenitet!
, findes i det meste software incl. FREESTAT. Hvis man ikke har mulighed for at teste, kan man bruge tommelfingerreglen: Hvis den største af de 2 stikprøversEn stikprøve, er et udsnit af populationen (den store mængde vi ønsker at udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde, kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så alle danske mænd.


Klik her for at lære mere om stikprøver!
standardafvigelse, er mere end dobbelt så stor, som den lille stikprøvesEn stikprøve, er et udsnit af populationen (den store mængde vi ønsker at udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde, kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så alle danske mænd.


Klik her for at lære mere om stikprøver!
standardafvigelse, benyttes unpooled t-testUnpooled t-test benyttes til test af gennemsnit for 2 kvantitative variable, når populationerne ikke har samme varians (der er ikke varianshomogenitet).
Eksempler på stikprøver, hvor middelværdierne kan testes vha. unpooled t-test kunne være:
For 2 stikprøver med højder for CBS og SDU studerende, kan man teste om gennemsnitshøjden for CBS og SDU studerende er ens med unpooled t-test, hvis der ikke er varianshomogenitet.
For 2 stikprøver med med salgspriser for ejendomme i 2 byer, kan man teste om gennemsnitsprisen er højere for den ene by med unpooled t-test, hvis der ikke er varianshomogenitet.
Har de 2 populationer ens varianser, kan man i stedet benytte et pooled t-test, hvilket er mere præcist.

Klik her for at lære mere om unpooled t-test!
.

Samme metode bruges i praksis til A/B-test i den finansielle sektor, fx når man sammenligner gennemsnitlig responstid eller model-score mellem to versioner af en ML-model.

Vi ser igen på eksemplet med ejendomsmægleren, der undersøgte kundernes afstand til filialerne. Den gennemsnitlige afstand til nærmeste filial var, 748 meter i stikprøvenEn stikprøve, er et udsnit af populationen (den store mængde vi ønsker at udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde, kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så alle danske mænd.


Klik her for at lære mere om stikprøver!
med 200 respondenter. StandardafvigelsenStandardafvigelsen fortæller hvor meget en variabel typisk varierer omkring middelværdien.
Standardafvigelsen også kaldet spredningen, findes som kvadratroden af variansen, i modsætning til variansen er standardafvigelsen i samme enhed som variablen hvilket gør tolkning nemmere.

Kursen for en aktie med middelkurs 100 Kr. og standardafvigelse 1 svinger meget mindre, end en aktie med middelkurs 100 og standardafvigelse 10. Da investorer er risikoaverse vil de foretrække aktien med den mindste standardafvigelse.

Klik her for at lære mere om standardafvigelsen!
er 102 meter.

Mægleren har data fra en tilsvarende undersøgelse hos en konkurrerende kæde, her er den gennemsnitlige afstand 702 meter og standardafvigelsenStandardafvigelsen fortæller hvor meget en variabel typisk varierer omkring middelværdien.
Standardafvigelsen også kaldet spredningen, findes som kvadratroden af variansen, i modsætning til variansen er standardafvigelsen i samme enhed som variablen hvilket gør tolkning nemmere.

Kursen for en aktie med middelkurs 100 Kr. og standardafvigelse 1 svinger meget mindre, end en aktie med middelkurs 100 og standardafvigelse 10. Da investorer er risikoaverse vil de foretrække aktien med den mindste standardafvigelse.

Klik her for at lære mere om standardafvigelsen!
er 89 meter i en stikprøve En stikprøve, er et udsnit af populationen (den store mængde vi ønsker at udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde, kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så alle danske mænd.


Klik her for at lære mere om stikprøver!
af størrelse 40.

I Freestat kan man sætte de 2 stikprøverEn stikprøve, er et udsnit af populationen (den store mængde vi ønsker at udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde, kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så alle danske mænd.


Klik her for at lære mere om stikprøver!
ind i analysen Pooled t-testPooled t-test benyttes til test af gennemsnit for 2 kvantitative variable, når populationerne har samme varians (varianshomogenitet).
Eksempler på stikprøver, hvor middelværdierne kan testes vha. pooled t-test kunne være:
For 2 stikprøver med højder for CBS og SDU studerende, kan man teste om gennemsnitshøjden for CBS og SDU studerende er ens med pooled t-test, hvis der er varianshomogenitet.
For 2 stikprøver med med salgspriser for ejendomme i 2 byer, kan man teste om gennemsnitsprisen er højere for den ene by med pooled t-test, hvis der er varianshomogenitet.
Har de 2 populationer ikke ens varianser, kan man i stedet benytte et unpooled t-test, pooled t-test er dog det mest præcise.

Klik her for at lære mere om pooled t-test!
varianshomogenitetVarianshomogenitet betyder der er ens varianser for populationerne.
Hvis fx. vi har 2 stikprøver med højder for CBS og Cphbusiness studerende, vil varianshomogenitet betyde, at der er samme variation i de 2 populationer.
Testet kunne se ud som nedenfor, bemærk er der varianshomogenitet, er standardafvigelserne også altid ens.
H0: σCBSCph (Der er Varianshomogenitet)
H1: σCBS≠σCph (Der er ikke varianshomogenitet)

Klik her for at lære mere om varianshomogenitet!
i fanen Pooled. Vi får følgende output.

Her har vi som ses af output fra Freestat, valgt mæglerens egen undersøgelse som 1. stikprøveEn stikprøve, er et udsnit af populationen (den store mængde vi ønsker at udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde, kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så alle danske mænd.


Klik her for at lære mere om stikprøver!
, og konkurrentens som 2. stikprøveEn stikprøve, er et udsnit af populationen (den store mængde vi ønsker at udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde, kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så alle danske mænd.


Klik her for at lære mere om stikprøver!
. Vi kan med 95% sikkerhed sige at forskellen mellem mæglerens og konkurrentens kunders gennemsnitlige afstand til filial ligger mellem 11,9 og 80,1 meter (markeret med rødt). Da 0 ikke er indeholdt i konfidensintervalletKonfidensintervallet beregnes ud fra en stikprøve, og angiver nedre og øvre grænser indenfor hvilke populations parameteren, ligger med en vis sandsynlighed.
Er 95% konfidensintervallet for mænds gennemsnitlige højde fx. 172 cm. og 182 cm. kan vi sige:
Vi kan med 95% sandsynlighed sige den gennemsnitlige højde for mænd i populationen, ligger mellem 172 cm. og 182 cm.
Jo større stikprøve og jo lavere sikkerhed (konfidensniveau), jo mere præcist bliver vore konfidensinterval (interval estimatet), dvs intervallet bliver smallere.
Vi kan beregne konfidensintervaller for parametre vi estimerer, fx. gennemsnittet, standardafvigelsen, andelen etc.
I modsætning til et punktestimat for fx. middelværdien, fortæller konfidensintervallet os noget om kvaliteten af vort estimat/gæt, ud fra bredden af konfidensintervallet.


Klik her for at lære mere om konfidensintervallet!
kan vi konstatere at denne forskel er signifikant, der er altså forskel på afstanden til nærmeste filial i de 2 kæder. Vi kan undersøge om vi også er 99% sikre på konklusionen ved at ændre signifikansniveauetSignifikansniveauet α typisk 1%, 5% eller 10%, fastsættes inden et test og sammenlignes med p-værdien.
Er p-værdien mindre end signifikansniveauet forkastes nulhypotesen, ellers ikke.
Signifikansniveauet angiver sandsynligheden for at forkaste en sand nulhypotese (en type 1 fejl også kaldet en falsk positiv)
Medicinal industrien arbejder ofte med 1% signifikansniveau, hvor et test kunne være:
H0: Medicinen har ingen effekt
H1: Medicinen har effekt
Med 1% signifikansniveau, begås en type 1 fejl kun i et ud af 100 tests.
En type 1 fejl vil her betyde, at man fejlagtigt konkluderer at et medicinal produkt uden effekt virker.
Signifikansniveauet kan bruges til at bestemme konfidensniveauet 1-α, der angiver sandsynligheden for korrekt ikke at forkaste en sand nulhypotese


Klik her for at lære mere om signifikansniveauet!
til 1%, jo et bredere konfidensintervalKonfidensintervallet beregnes ud fra en stikprøve, og angiver nedre og øvre grænser indenfor hvilke populations parameteren, ligger med en vis sandsynlighed.
Er 95% konfidensintervallet for mænds gennemsnitlige højde fx. 172 cm. og 182 cm. kan vi sige:
Vi kan med 95% sandsynlighed sige den gennemsnitlige højde for mænd i populationen, ligger mellem 172 cm. og 182 cm.
Jo større stikprøve og jo lavere sikkerhed (konfidensniveau), jo mere præcist bliver vore konfidensinterval (interval estimatet), dvs intervallet bliver smallere.
Vi kan beregne konfidensintervaller for parametre vi estimerer, fx. gennemsnittet, standardafvigelsen, andelen etc.
I modsætning til et punktestimat for fx. middelværdien, fortæller konfidensintervallet os noget om kvaliteten af vort estimat/gæt, ud fra bredden af konfidensintervallet.


Klik her for at lære mere om konfidensintervallet!
, da præcisionen falder, når sikkerheden stiger.

Det er ikke så vigtigt hvilken stikprøveEn stikprøve, er et udsnit af populationen (den store mængde vi ønsker at udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde, kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så alle danske mænd.


Klik her for at lære mere om stikprøver!
, der er 1. og 2. stikprøveEn stikprøve, er et udsnit af populationen (den store mængde vi ønsker at udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde, kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så alle danske mænd.


Klik her for at lære mere om stikprøver!
, men det er væsentligt for tolkningen af konfidensintervalletKonfidensintervallet beregnes ud fra en stikprøve, og angiver nedre og øvre grænser indenfor hvilke populations parameteren, ligger med en vis sandsynlighed.
Er 95% konfidensintervallet for mænds gennemsnitlige højde fx. 172 cm. og 182 cm. kan vi sige:
Vi kan med 95% sandsynlighed sige den gennemsnitlige højde for mænd i populationen, ligger mellem 172 cm. og 182 cm.
Jo større stikprøve og jo lavere sikkerhed (konfidensniveau), jo mere præcist bliver vore konfidensinterval (interval estimatet), dvs intervallet bliver smallere.
Vi kan beregne konfidensintervaller for parametre vi estimerer, fx. gennemsnittet, standardafvigelsen, andelen etc.
I modsætning til et punktestimat for fx. middelværdien, fortæller konfidensintervallet os noget om kvaliteten af vort estimat/gæt, ud fra bredden af konfidensintervallet.


Klik her for at lære mere om konfidensintervallet!
. Bemærk konfidensintervalletsKonfidensintervallet beregnes ud fra en stikprøve, og angiver nedre og øvre grænser indenfor hvilke populations parameteren, ligger med en vis sandsynlighed.
Er 95% konfidensintervallet for mænds gennemsnitlige højde fx. 172 cm. og 182 cm. kan vi sige:
Vi kan med 95% sandsynlighed sige den gennemsnitlige højde for mænd i populationen, ligger mellem 172 cm. og 182 cm.
Jo større stikprøve og jo lavere sikkerhed (konfidensniveau), jo mere præcist bliver vore konfidensinterval (interval estimatet), dvs intervallet bliver smallere.
Vi kan beregne konfidensintervaller for parametre vi estimerer, fx. gennemsnittet, standardafvigelsen, andelen etc.
I modsætning til et punktestimat for fx. middelværdien, fortæller konfidensintervallet os noget om kvaliteten af vort estimat/gæt, ud fra bredden af konfidensintervallet.


Klik her for at lære mere om konfidensintervallet!
øvre grænse, vil hvis man bytter rundt, blive den nedre grænse med fortegnsskift, og tilsvarende for den nedre grænse. Begge grænser i konfidensintervalletKonfidensintervallet beregnes ud fra en stikprøve, og angiver nedre og øvre grænser indenfor hvilke populations parameteren, ligger med en vis sandsynlighed.
Er 95% konfidensintervallet for mænds gennemsnitlige højde fx. 172 cm. og 182 cm. kan vi sige:
Vi kan med 95% sandsynlighed sige den gennemsnitlige højde for mænd i populationen, ligger mellem 172 cm. og 182 cm.
Jo større stikprøve og jo lavere sikkerhed (konfidensniveau), jo mere præcist bliver vore konfidensinterval (interval estimatet), dvs intervallet bliver smallere.
Vi kan beregne konfidensintervaller for parametre vi estimerer, fx. gennemsnittet, standardafvigelsen, andelen etc.
I modsætning til et punktestimat for fx. middelværdien, fortæller konfidensintervallet os noget om kvaliteten af vort estimat/gæt, ud fra bredden af konfidensintervallet.


Klik her for at lære mere om konfidensintervallet!
er positive, forskellen måles altid som 1. stikprøveEn stikprøve, er et udsnit af populationen (den store mængde vi ønsker at udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde, kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så alle danske mænd.


Klik her for at lære mere om stikprøver!
minus 2. stikprøveEn stikprøve, er et udsnit af populationen (den store mængde vi ønsker at udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde, kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så alle danske mænd.


Klik her for at lære mere om stikprøver!
, specielt i dette tilfælde altså kædens egen undersøgelse minus konkurrentens undersøgelse. Det er altid en MEGET god ide, at holde fuldstændig styr på hvilken stikprøveEn stikprøve, er et udsnit af populationen (den store mængde vi ønsker at udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde, kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så alle danske mænd.


Klik her for at lære mere om stikprøver!
, der er 1. og 2., hvilket vi senere vil se i forbindelse med hypotestests med ensidet alternativhypotese.

Vi skal undersøge om varianserne er ens, tommelfingerreglen er overholdt, da standardafvigelsen for den store stikprøve $$\hat{\sigma}_{1}=102$$ ikke er mere end dobbelt så stor, som standardafvigelsen for den lille stikprøve $$\hat{\sigma}_2=89$$ Vi har dog en mere præcis metode, nederst til højre markeret med blåt testes varianshomogenitet automatisk. Vi har endnu ikke gennemgået hvorledes hypotesetests opstilles og aflæses, men vi kan godt forstå sidste del i konklusionen af hypotesetesten, “varianserne er ens”.

Vi kan som nævnt ændre signifikansniveauetSignifikansniveauet α typisk 1%, 5% eller 10%, fastsættes inden et test og sammenlignes med p-værdien.
Er p-værdien mindre end signifikansniveauet forkastes nulhypotesen, ellers ikke.
Signifikansniveauet angiver sandsynligheden for at forkaste en sand nulhypotese (en type 1 fejl også kaldet en falsk positiv)
Medicinal industrien arbejder ofte med 1% signifikansniveau, hvor et test kunne være:
H0: Medicinen har ingen effekt
H1: Medicinen har effekt
Med 1% signifikansniveau, begås en type 1 fejl kun i et ud af 100 tests.
En type 1 fejl vil her betyde, at man fejlagtigt konkluderer at et medicinal produkt uden effekt virker.
Signifikansniveauet kan bruges til at bestemme konfidensniveauet 1-α, der angiver sandsynligheden for korrekt ikke at forkaste en sand nulhypotese


Klik her for at lære mere om signifikansniveauet!
til 1% for at se, om konfidensintervalletKonfidensintervallet beregnes ud fra en stikprøve, og angiver nedre og øvre grænser indenfor hvilke populations parameteren, ligger med en vis sandsynlighed.
Er 95% konfidensintervallet for mænds gennemsnitlige højde fx. 172 cm. og 182 cm. kan vi sige:
Vi kan med 95% sandsynlighed sige den gennemsnitlige højde for mænd i populationen, ligger mellem 172 cm. og 182 cm.
Jo større stikprøve og jo lavere sikkerhed (konfidensniveau), jo mere præcist bliver vore konfidensinterval (interval estimatet), dvs intervallet bliver smallere.
Vi kan beregne konfidensintervaller for parametre vi estimerer, fx. gennemsnittet, standardafvigelsen, andelen etc.
I modsætning til et punktestimat for fx. middelværdien, fortæller konfidensintervallet os noget om kvaliteten af vort estimat/gæt, ud fra bredden af konfidensintervallet.


Klik her for at lære mere om konfidensintervallet!
nu indeholder 0.

Vi kan med 99% sikkerhed sige, at forskellen mellem mæglerens og konkurrentens kunders gennemsnitlige afstand til filial ligger mellem 1,1 og 90,9 meter. Vi er altså relativt sikre på vor konklusion, om forskel i afstande til nærmeste filial for de 2 kæder.

Varianshomogenitet

Forudsætninger

En forudsætning for at benytte pooled t-testPooled t-test benyttes til test af gennemsnit for 2 kvantitative variable, når populationerne har samme varians (varianshomogenitet).
Eksempler på stikprøver, hvor middelværdierne kan testes vha. pooled t-test kunne være:
For 2 stikprøver med højder for CBS og SDU studerende, kan man teste om gennemsnitshøjden for CBS og SDU studerende er ens med pooled t-test, hvis der er varianshomogenitet.
For 2 stikprøver med med salgspriser for ejendomme i 2 byer, kan man teste om gennemsnitsprisen er højere for den ene by med pooled t-test, hvis der er varianshomogenitet.
Har de 2 populationer ikke ens varianser, kan man i stedet benytte et unpooled t-test, pooled t-test er dog det mest præcise.

Klik her for at lære mere om pooled t-test!
, til at undersøge om 2 middelværdier kan antages at være identiske, er at der er varianshomogenitetVarianshomogenitet betyder der er ens varianser for populationerne.
Hvis fx. vi har 2 stikprøver med højder for CBS og Cphbusiness studerende, vil varianshomogenitet betyde, at der er samme variation i de 2 populationer.
Testet kunne se ud som nedenfor, bemærk er der varianshomogenitet, er standardafvigelserne også altid ens.
H0: σCBSCph (Der er Varianshomogenitet)
H1: σCBS≠σCph (Der er ikke varianshomogenitet)

Klik her for at lære mere om varianshomogenitet!
. For at vi kan undersøge om populationsvariansernePopulationen er den store mængde, vi ønsker at udtale os om. Fx alle iphone brugere i København, alle kontohavere i Danske Bank, alle danske kvinder etc.
Vi bruger som redskab stikprøver som er en lille del af populationen til at udtale os om populationen, da det er billigere end at undersøge hele populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde, kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så alle danske mænd.


Klik her for at lære mere om populationen!
er ens, skal vi først undersøge om populationernePopulationen er den store mængde, vi ønsker at udtale os om. Fx alle iphone brugere i København, alle kontohavere i Danske Bank, alle danske kvinder etc.
Vi bruger som redskab stikprøver som er en lille del af populationen til at udtale os om populationen, da det er billigere end at undersøge hele populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde, kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så alle danske mænd.


Klik her for at lære mere om populationen!
kan antages normalfordelte. Det nemmeste er at undersøge forudsætningen om normalfordelte populationerPopulationen er den store mængde, vi ønsker at udtale os om. Fx alle iphone brugere i København, alle kontohavere i Danske Bank, alle danske kvinder etc.
Vi bruger som redskab stikprøver som er en lille del af populationen til at udtale os om populationen, da det er billigere end at undersøge hele populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde, kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så alle danske mænd.


Klik her for at lære mere om populationen!
, ved at se på normalfraktildiagrammerneNormalfraktildiagrammer kan bruges til at afgøre, om en stikprøve kan antages at stamme fra normalfordelt population.
Hvis punkterne ligger pænt omkring den rette linje er normalitetsbetingelsen opfyldt. Ved test af fx. en mindre kvantitativ stikprøve og varianshomogenitet forudsættes at variablene opfylder normalitetsbetingelsen.

Klik her for at lære mere om normalfraktildiagrammer!
for de 2 stikprøverEn stikprøve, er et udsnit af populationen (den store mængde vi ønsker at udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde, kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så alle danske mænd.


Klik her for at lære mere om stikprøver!
.

Hvis vi vil undersøge om der er signifikant forskel i middelværdierne, skal vi tjekke at begge stikprøverEn stikprøve, er et udsnit af populationen (den store mængde vi ønsker at udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde, kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så alle danske mænd.


Klik her for at lære mere om stikprøver!
stammer fra normalfordelingerNormalfordelingen er en symmetrisk, klokkeformet fordeling.
Mange fænomener er normalfordelte fx. nedbørsmængder, højde, stikprøvefordelingen etc.
Normalfordelingen bestemmes entydigt ud fra middelværdien μ og standardafvigelsen σ
Normalfordelte stokastiske variable har mange gode egenskaber, addition af og multiplikation med en faktor giver igen normalfordelte stokastiske variable.
Danskernes højde er fx. normalfordelt med middelværdi μ = 180,2 cm. og standardafvigelse σ = 7,42

Klik her for at lære mere om normalfordelingen!
, da dette er en forudsætning for at vi kan teste korrekt for varianshomogenitetVarianshomogenitet betyder der er ens varianser for populationerne.
Hvis fx. vi har 2 stikprøver med højder for CBS og Cphbusiness studerende, vil varianshomogenitet betyde, at der er samme variation i de 2 populationer.
Testet kunne se ud som nedenfor, bemærk er der varianshomogenitet, er standardafvigelserne også altid ens.
H0: σCBSCph (Der er Varianshomogenitet)
H1: σCBS≠σCph (Der er ikke varianshomogenitet)

Klik her for at lære mere om varianshomogenitet!
. Vi kan til dette benytte normalfraktildiagrammerNormalfraktildiagrammer kan bruges til at afgøre, om en stikprøve kan antages at stamme fra normalfordelt population.
Hvis punkterne ligger pænt omkring den rette linje er normalitetsbetingelsen opfyldt. Ved test af fx. en mindre kvantitativ stikprøve og varianshomogenitet forudsættes at variablene opfylder normalitetsbetingelsen.

Klik her for at lære mere om normalfraktildiagrammer!
for de 2 stikprøverEn stikprøve, er et udsnit af populationen (den store mængde vi ønsker at udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde, kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så alle danske mænd.


Klik her for at lære mere om stikprøver!
vi har indsamlet.

I Freestat genereres normalfraktildiagrammerNormalfraktildiagrammer kan bruges til at afgøre, om en stikprøve kan antages at stamme fra normalfordelt population.
Hvis punkterne ligger pænt omkring den rette linje er normalitetsbetingelsen opfyldt. Ved test af fx. en mindre kvantitativ stikprøve og varianshomogenitet forudsættes at variablene opfylder normalitetsbetingelsen.

Klik her for at lære mere om normalfraktildiagrammer!
direkte for en stikprøveEn stikprøve, er et udsnit af populationen (den store mængde vi ønsker at udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde, kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så alle danske mænd.


Klik her for at lære mere om stikprøver!
, når data indsættes i første fane Middelværdi standardafvigelse. Bemærk vi skal indsætte de 2 stikprøverEn stikprøve, er et udsnit af populationen (den store mængde vi ønsker at udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde, kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så alle danske mænd.


Klik her for at lære mere om stikprøver!
særskilt således vi får 2 normalfraktildiagrammerNormalfraktildiagrammer kan bruges til at afgøre, om en stikprøve kan antages at stamme fra normalfordelt population.
Hvis punkterne ligger pænt omkring den rette linje er normalitetsbetingelsen opfyldt. Ved test af fx. en mindre kvantitativ stikprøve og varianshomogenitet forudsættes at variablene opfylder normalitetsbetingelsen.

Klik her for at lære mere om normalfraktildiagrammer!
, som vist herunder.

Eksempel på normalfraktildiagram dannet i FREESTAT for stikprøve 1

Eksempel på normalfraktildiagram dannet i FREESTAT for stikprøve 2

Her vil det ofte være lidt af en skønssag at vurdere om stikprøverneEn stikprøve, er et udsnit af populationen (den store mængde vi ønsker at udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde, kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så alle danske mænd.


Klik her for at lære mere om stikprøver!
stammer fra normalfordelte populationerPopulationen er den store mængde, vi ønsker at udtale os om. Fx alle iphone brugere i København, alle kontohavere i Danske Bank, alle danske kvinder etc.
Vi bruger som redskab stikprøver som er en lille del af populationen til at udtale os om populationen, da det er billigere end at undersøge hele populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde, kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så alle danske mænd.


Klik her for at lære mere om populationen!
, bemærk små afvigelser fra linjen vil ved mindre stikprøverEn stikprøve, er et udsnit af populationen (den store mængde vi ønsker at udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde, kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så alle danske mænd.


Klik her for at lære mere om stikprøver!
, virke voldsommere end ved større stikprøverEn stikprøve, er et udsnit af populationen (den store mængde vi ønsker at udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde, kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så alle danske mænd.


Klik her for at lære mere om stikprøver!
, da vi jo har “zoomet” ind i normalfraktildiagrammetNormalfraktildiagrammer kan bruges til at afgøre, om en stikprøve kan antages at stamme fra normalfordelt population.
Hvis punkterne ligger pænt omkring den rette linje er normalitetsbetingelsen opfyldt. Ved test af fx. en mindre kvantitativ stikprøve og varianshomogenitet forudsættes at variablene opfylder normalitetsbetingelsen.

Klik her for at lære mere om normalfraktildiagrammer!
. I dette eksempel kan vi godt konkludere, at data i stikprøveEn stikprøve, er et udsnit af populationen (den store mængde vi ønsker at udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde, kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så alle danske mænd.


Klik her for at lære mere om stikprøver!
1 stammer fra en normalfordelt populationPopulationen er den store mængde, vi ønsker at udtale os om. Fx alle iphone brugere i København, alle kontohavere i Danske Bank, alle danske kvinder etc.
Vi bruger som redskab stikprøver som er en lille del af populationen til at udtale os om populationen, da det er billigere end at undersøge hele populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde, kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så alle danske mænd.


Klik her for at lære mere om populationen!
. NormalfraktildiagrammetNormalfraktildiagrammer kan bruges til at afgøre, om en stikprøve kan antages at stamme fra normalfordelt population.
Hvis punkterne ligger pænt omkring den rette linje er normalitetsbetingelsen opfyldt. Ved test af fx. en mindre kvantitativ stikprøve og varianshomogenitet forudsættes at variablene opfylder normalitetsbetingelsen.

Klik her for at lære mere om normalfraktildiagrammer!
for stikprøveEn stikprøve, er et udsnit af populationen (den store mængde vi ønsker at udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde, kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så alle danske mænd.


Klik her for at lære mere om stikprøver!
2 er ikke så pænt; konkluderer man, at fordelingen ikke er normal, gør man opmærksom på, at forudsætningen ikke er opfyldt, samt at dette kan give problemer med kvaliteten af analysen, men gennemfører fortsat analysen med forbeholdet.
Afvigelser i enderne tillades i højere grad end afvigelser omkring midten af diagrammet.

Sammenligning af 2 middelværdier ens varians Pooled t-test

Hvis vi har 2 stikprøverEn stikprøve, er et udsnit af populationen (den store mængde vi ønsker at udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde, kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så alle danske mænd.


Klik her for at lære mere om stikprøver!
og ønsker at sammenligne middelværdierne kan vi benytte en pooled t-testPooled t-test benyttes til test af gennemsnit for 2 kvantitative variable, når populationerne har samme varians (varianshomogenitet).
Eksempler på stikprøver, hvor middelværdierne kan testes vha. pooled t-test kunne være:
For 2 stikprøver med højder for CBS og SDU studerende, kan man teste om gennemsnitshøjden for CBS og SDU studerende er ens med pooled t-test, hvis der er varianshomogenitet.
For 2 stikprøver med med salgspriser for ejendomme i 2 byer, kan man teste om gennemsnitsprisen er højere for den ene by med pooled t-test, hvis der er varianshomogenitet.
Har de 2 populationer ikke ens varianser, kan man i stedet benytte et unpooled t-test, pooled t-test er dog det mest præcise.

Klik her for at lære mere om pooled t-test!
, hvis de 2 populationerPopulationen er den store mængde, vi ønsker at udtale os om. Fx alle iphone brugere i København, alle kontohavere i Danske Bank, alle danske kvinder etc.
Vi bruger som redskab stikprøver som er en lille del af populationen til at udtale os om populationen, da det er billigere end at undersøge hele populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde, kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så alle danske mænd.


Klik her for at lære mere om populationen!
har samme standardafvigelse.

Man kan undersøge om stikprøvernesEn stikprøve, er et udsnit af populationen (den store mængde vi ønsker at udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde, kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så alle danske mænd.


Klik her for at lære mere om stikprøver!
varianser er homogene, dette gøres ved en test af om standardafvigelserne er ens:

$$H_{0}:\sigma_{1}=\sigma_{2}$$ $$H_{1}:\sigma_{1}\neq\sigma_{2}$$

Hvilket er det samme som at teste om varianserne er ens:

$$H_{0}:\sigma_{1}^{2}=\sigma_{2}^{2}$$ $$H_{1}:\sigma_{1}^{2}\neq\sigma_{2}^{2}$$

For at konkludere om nulhypotesenNulhypotesen H0 er vores grundtro i et hypotesetest, vi har altid lighedstegn i nulhypotesen. Der skal stærke beviser til at forkaste nulhypotesen.
Eksempler på nulhypoteser er:
H0: μ=45 (Middelværdien er 45)
H0: μ≤45 (Middelværdien er højst 45)
H0: μ≥45 (Middelværdien er mindst 45)

Klik her for at lære mere om hypotesetests!
skal forkastes, bestemmes signifikanssandsynlighedenSignifikanssandsynligheden også kaldet p-værdien er et tal mellem 0 og 1, den angiver sandsynligheden for, hvis nulhypotesen er sand, at få en mere ekstrem teststørrelse, end den vi har fået i testet (teststørrelsen måler forskellen mellem fx. stikprøvegennemsnit og middelværdien antaget i nulhypotesen).
Jo lavere p-værdi, des mindre tror vi på nulhypotesen

Antag fx. at vi har en stikprøve af 100 mænds højde, med et gennemsnit på 176,32 cm.
Vi ønsker at teste om middel højden i populationen, kan antages at være 210 cm dvs.
H0: μ=210
H1: μ≠210
Vi vil her få en meget negativ teststørrelse, hvilket giver en mikroskopisk lille p-værdi.
Det vil være nærmest umuligt at få en mere ekstrem teststørrelse, hvis den sande middelhøjde er 210 cm.


Klik her for at lære mere om signifikanssandsynligheder!
vha. et F-test. Man kan fx forestille sig en bank ønsker at undersøge om mænd og kvinder, har samme indestående på deres lønkonti. Her kan man, hvis varianserne er ens (de vil normalt ikke være kendte), benytte en pooled t-testPooled t-test benyttes til test af gennemsnit for 2 kvantitative variable, når populationerne har samme varians (varianshomogenitet).
Eksempler på stikprøver, hvor middelværdierne kan testes vha. pooled t-test kunne være:
For 2 stikprøver med højder for CBS og SDU studerende, kan man teste om gennemsnitshøjden for CBS og SDU studerende er ens med pooled t-test, hvis der er varianshomogenitet.
For 2 stikprøver med med salgspriser for ejendomme i 2 byer, kan man teste om gennemsnitsprisen er højere for den ene by med pooled t-test, hvis der er varianshomogenitet.
Har de 2 populationer ikke ens varianser, kan man i stedet benytte et unpooled t-test, pooled t-test er dog det mest præcise.

Klik her for at lære mere om pooled t-test!
. Vi går her ikke i detaljer, med formlerne til beregning af teststørrelsenTeststørrelsen kan populært forklares, som forskellen mellem observeret i stikprøven og forventet under nulhypotesen.

Teststørrelsen er et udtryk for forskellen mellem fx. gennemsnit, andel eller antal i stikprøven i forhold til påstanden i nulhypotesen H0.
Teststørrelsen korrigerer for stikprøvestørrelse og standardafvigelse, men beregnes forskelligt afhængigt af hvilket test der udføres.
Testes fx. middelværdi μ eller eller hældning i lineær regression β, benyttes t-teststørrelsen
Testes andele kan fx. z-teststørrelsen benyttes
Antag fx. at vi har en stikprøve af 100 mænds højde, med et gennemsnit på 176,32 cm.
Vi ønsker at teste om middel højden i populationen, kan antages at være 210 cm dvs.
H0: μ=210
H1: μ≠210
Vi vil her få en meget negativ teststørrelse, 176,32-210 divideret med standardfejlen for middelværdien SEM
Ønskede at teste om middel højden i populationen, kunne antages at være 150 cm ud fra samme stikprøve ville vi få en meget positiv teststørrelse, 176,32-150 divideret med standardfejlen for middelværdien SEM


Klik her for at lære mere om teststørrelser!
, software regner dette ud for os.

Man skal ligesom ved små stikprøverEn stikprøve, er et udsnit af populationen (den store mængde vi ønsker at udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde, kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så alle danske mænd.


Klik her for at lære mere om stikprøver!
i test af en middelværdi, sikre sig normalitet i populationenPopulationen er den store mængde, vi ønsker at udtale os om. Fx alle iphone brugere i København, alle kontohavere i Danske Bank, alle danske kvinder etc.
Vi bruger som redskab stikprøver som er en lille del af populationen til at udtale os om populationen, da det er billigere end at undersøge hele populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde, kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så alle danske mænd.


Klik her for at lære mere om populationen!
. Dette kan på samme måde gøres visuelt i et normalfraktildiagramNormalfraktildiagrammer kan bruges til at afgøre, om en stikprøve kan antages at stamme fra normalfordelt population.
Hvis punkterne ligger pænt omkring den rette linje er normalitetsbetingelsen opfyldt. Ved test af fx. en mindre kvantitativ stikprøve og varianshomogenitet forudsættes at variablene opfylder normalitetsbetingelsen.

Klik her for at lære mere om normalfraktildiagrammer!
for de 2 stikprøverEn stikprøve, er et udsnit af populationen (den store mængde vi ønsker at udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde, kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så alle danske mænd.


Klik her for at lære mere om stikprøver!
.

Eksempel Statistik karakterer


Hent Datasættet statistik karakterer til videoen ovenfor

Vi kunne være interesseret i, at teste om kvinder får højere karakterer end mænd. Der er 29 kvinder og 25 mænd i stikprøvenEn stikprøve, er et udsnit af populationen (den store mængde vi ønsker at udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde, kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så alle danske mænd.


Klik her for at lære mere om stikprøver!
. Da begge stikprøverEn stikprøve, er et udsnit af populationen (den store mængde vi ønsker at udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde, kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så alle danske mænd.


Klik her for at lære mere om stikprøver!
er mindre end 30, skal vi undersøge om stikprøvenEn stikprøve, er et udsnit af populationen (den store mængde vi ønsker at udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde, kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så alle danske mænd.


Klik her for at lære mere om stikprøver!
kan antages at stamme fra en normalfordelt populationPopulationen er den store mængde, vi ønsker at udtale os om. Fx alle iphone brugere i København, alle kontohavere i Danske Bank, alle danske kvinder etc.
Vi bruger som redskab stikprøver som er en lille del af populationen til at udtale os om populationen, da det er billigere end at undersøge hele populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde, kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så alle danske mænd.


Klik her for at lære mere om populationen!
. Dette efterprøves i 2 normalfraktildiagrammerNormalfraktildiagrammer kan bruges til at afgøre, om en stikprøve kan antages at stamme fra normalfordelt population.
Hvis punkterne ligger pænt omkring den rette linje er normalitetsbetingelsen opfyldt. Ved test af fx. en mindre kvantitativ stikprøve og varianshomogenitet forudsættes at variablene opfylder normalitetsbetingelsen.

Klik her for at lære mere om normalfraktildiagrammer!
. I Freestat kan man enkeltvis paste begge fordelinger ind i en kvantitativ stikprøveEn stikprøve, er et udsnit af populationen (den store mængde vi ønsker at udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde, kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så alle danske mænd.


Klik her for at lære mere om stikprøver!
, og indsætte de 2 normalfraktildiagrammerNormalfraktildiagrammer kan bruges til at afgøre, om en stikprøve kan antages at stamme fra normalfordelt population.
Hvis punkterne ligger pænt omkring den rette linje er normalitetsbetingelsen opfyldt. Ved test af fx. en mindre kvantitativ stikprøve og varianshomogenitet forudsættes at variablene opfylder normalitetsbetingelsen.

Klik her for at lære mere om normalfraktildiagrammer!
, nedenfor er indsat Freestat normalfraktildiagrammetNormalfraktildiagrammer kan bruges til at afgøre, om en stikprøve kan antages at stamme fra normalfordelt population.
Hvis punkterne ligger pænt omkring den rette linje er normalitetsbetingelsen opfyldt. Ved test af fx. en mindre kvantitativ stikprøve og varianshomogenitet forudsættes at variablene opfylder normalitetsbetingelsen.

Klik her for at lære mere om normalfraktildiagrammer!
for kvinder.

Herunder er indsat Freestat normalfraktildiagrammetNormalfraktildiagrammer kan bruges til at afgøre, om en stikprøve kan antages at stamme fra normalfordelt population.
Hvis punkterne ligger pænt omkring den rette linje er normalitetsbetingelsen opfyldt. Ved test af fx. en mindre kvantitativ stikprøve og varianshomogenitet forudsættes at variablene opfylder normalitetsbetingelsen.

Klik her for at lære mere om normalfraktildiagrammer!
for mænd.

Vi har nok på forhånd en formodning om, at statistik karakterer generelt følger en bimodal fordeling, enten får man en lav eller høj karakter. Man kan godt ane denne tendens, da vi kan se data ikke ligger helt pænt omkring den rette linje. Bemærk observationerne, illustreret ved punkter, ligger på rette linjer. Dette skyldes, at vi jo har hele karakterer. Vi konstaterer der synes at være problemer med normaliteten af populationernePopulationen er den store mængde, vi ønsker at udtale os om. Fx alle iphone brugere i København, alle kontohavere i Danske Bank, alle danske kvinder etc.
Vi bruger som redskab stikprøver som er en lille del af populationen til at udtale os om populationen, da det er billigere end at undersøge hele populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde, kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så alle danske mænd.


Klik her for at lære mere om populationen!
, og dermed kvaliteten, præcisionen i analysen. Vi går imidlertid her videre med en pooled t-testPooled t-test benyttes til test af gennemsnit for 2 kvantitative variable, når populationerne har samme varians (varianshomogenitet).
Eksempler på stikprøver, hvor middelværdierne kan testes vha. pooled t-test kunne være:
For 2 stikprøver med højder for CBS og SDU studerende, kan man teste om gennemsnitshøjden for CBS og SDU studerende er ens med pooled t-test, hvis der er varianshomogenitet.
For 2 stikprøver med med salgspriser for ejendomme i 2 byer, kan man teste om gennemsnitsprisen er højere for den ene by med pooled t-test, hvis der er varianshomogenitet.
Har de 2 populationer ikke ens varianser, kan man i stedet benytte et unpooled t-test, pooled t-test er dog det mest præcise.

Klik her for at lære mere om pooled t-test!
, hvis varianserne for mænd og kvinder er ens, ellers skal vi benytte en unpooled t-testUnpooled t-test benyttes til test af gennemsnit for 2 kvantitative variable, når populationerne ikke har samme varians (der er ikke varianshomogenitet).
Eksempler på stikprøver, hvor middelværdierne kan testes vha. unpooled t-test kunne være:
For 2 stikprøver med højder for CBS og SDU studerende, kan man teste om gennemsnitshøjden for CBS og SDU studerende er ens med unpooled t-test, hvis der ikke er varianshomogenitet.
For 2 stikprøver med med salgspriser for ejendomme i 2 byer, kan man teste om gennemsnitsprisen er højere for den ene by med unpooled t-test, hvis der ikke er varianshomogenitet.
Har de 2 populationer ens varianser, kan man i stedet benytte et pooled t-test, hvilket er mere præcist.

Klik her for at lære mere om unpooled t-test!
.

$$H_{0}:\sigma_{kvinde}^2=\sigma_{mand}^2$$ $$H_{1}:\sigma_{kvinde}^2\neq\sigma_{mand}^2$$

Vi konstaterer at signifikanssandsynlighedenSignifikanssandsynligheden også kaldet p-værdien er et tal mellem 0 og 1, den angiver sandsynligheden for, hvis nulhypotesen er sand, at få en mere ekstrem teststørrelse, end den vi har fået i testet (teststørrelsen måler forskellen mellem fx. stikprøvegennemsnit og middelværdien antaget i nulhypotesen).
Jo lavere p-værdi, des mindre tror vi på nulhypotesen

Antag fx. at vi har en stikprøve af 100 mænds højde, med et gennemsnit på 176,32 cm.
Vi ønsker at teste om middel højden i populationen, kan antages at være 210 cm dvs.
H0: μ=210
H1: μ≠210
Vi vil her få en meget negativ teststørrelse, hvilket giver en mikroskopisk lille p-værdi.
Det vil være nærmest umuligt at få en mere ekstrem teststørrelse, hvis den sande middelhøjde er 210 cm.


Klik her for at lære mere om signifikanssandsynligheder!
er 0,8656, hvilket direkte kan aflæses i nedenstående Freestat output. Vi kan altså ikke forkaste nulhypotesenNulhypotesen H0 er vores grundtro i et hypotesetest, vi har altid lighedstegn i nulhypotesen. Der skal stærke beviser til at forkaste nulhypotesen.
Eksempler på nulhypoteser er:
H0: μ=45 (Middelværdien er 45)
H0: μ≤45 (Middelværdien er højst 45)
H0: μ≥45 (Middelværdien er mindst 45)

Klik her for at lære mere om hypotesetests!
og konstaterer at varianserne er ens, og det er derfor korrekt at anvende pooled t-testPooled t-test benyttes til test af gennemsnit for 2 kvantitative variable, når populationerne har samme varians (varianshomogenitet).
Eksempler på stikprøver, hvor middelværdierne kan testes vha. pooled t-test kunne være:
For 2 stikprøver med højder for CBS og SDU studerende, kan man teste om gennemsnitshøjden for CBS og SDU studerende er ens med pooled t-test, hvis der er varianshomogenitet.
For 2 stikprøver med med salgspriser for ejendomme i 2 byer, kan man teste om gennemsnitsprisen er højere for den ene by med pooled t-test, hvis der er varianshomogenitet.
Har de 2 populationer ikke ens varianser, kan man i stedet benytte et unpooled t-test, pooled t-test er dog det mest præcise.

Klik her for at lære mere om pooled t-test!
til at undersøge om kvinders karakterer er højere end mænds. Når vi tester to middelværdier undersøger vi, om forskel mellem middelværdierne er forskellig fra 0. Vi får en t-teststørrelseTeststørrelsen kan populært forklares, som forskellen mellem observeret i stikprøven og forventet under nulhypotesen.

Teststørrelsen er et udtryk for forskellen mellem fx. gennemsnit, andel eller antal i stikprøven i forhold til påstanden i nulhypotesen H0.
Teststørrelsen korrigerer for stikprøvestørrelse og standardafvigelse, men beregnes forskelligt afhængigt af hvilket test der udføres.
Testes fx. middelværdi μ eller eller hældning i lineær regression β, benyttes t-teststørrelsen
Testes andele kan fx. z-teststørrelsen benyttes
Antag fx. at vi har en stikprøve af 100 mænds højde, med et gennemsnit på 176,32 cm.
Vi ønsker at teste om middel højden i populationen, kan antages at være 210 cm dvs.
H0: μ=210
H1: μ≠210
Vi vil her få en meget negativ teststørrelse, 176,32-210 divideret med standardfejlen for middelværdien SEM
Ønskede at teste om middel højden i populationen, kunne antages at være 150 cm ud fra samme stikprøve ville vi få en meget positiv teststørrelse, 176,32-150 divideret med standardfejlen for middelværdien SEM


Klik her for at lære mere om teststørrelser!
jo større denne numerisk er jo større er forskellen mellem middelværdierne. En numerisk stor t-teststørrelseTeststørrelsen kan populært forklares, som forskellen mellem observeret i stikprøven og forventet under nulhypotesen.

Teststørrelsen er et udtryk for forskellen mellem fx. gennemsnit, andel eller antal i stikprøven i forhold til påstanden i nulhypotesen H0.
Teststørrelsen korrigerer for stikprøvestørrelse og standardafvigelse, men beregnes forskelligt afhængigt af hvilket test der udføres.
Testes fx. middelværdi μ eller eller hældning i lineær regression β, benyttes t-teststørrelsen
Testes andele kan fx. z-teststørrelsen benyttes
Antag fx. at vi har en stikprøve af 100 mænds højde, med et gennemsnit på 176,32 cm.
Vi ønsker at teste om middel højden i populationen, kan antages at være 210 cm dvs.
H0: μ=210
H1: μ≠210
Vi vil her få en meget negativ teststørrelse, 176,32-210 divideret med standardfejlen for middelværdien SEM
Ønskede at teste om middel højden i populationen, kunne antages at være 150 cm ud fra samme stikprøve ville vi få en meget positiv teststørrelse, 176,32-150 divideret med standardfejlen for middelværdien SEM


Klik her for at lære mere om teststørrelser!
udtrykker altså stor forskel. Hypoteserne bliver:

$$H_{0}:\mu_{kvinder}\leq\mu_{mænd}$$ $$H_{1}:\mu_{kvinder}>\mu_{mænd}$$

Hvilket vi også kan skrive som:

$$H_{0}:\mu_{kvinder}-\mu_{mænd}\leq0$$ $$H_{1}:\mu_{kvinder}-\mu_{mænd}>0$$

Vi får en teststørrelseTeststørrelsen kan populært forklares, som forskellen mellem observeret i stikprøven og forventet under nulhypotesen.

Teststørrelsen er et udtryk for forskellen mellem fx. gennemsnit, andel eller antal i stikprøven i forhold til påstanden i nulhypotesen H0.
Teststørrelsen korrigerer for stikprøvestørrelse og standardafvigelse, men beregnes forskelligt afhængigt af hvilket test der udføres.
Testes fx. middelværdi μ eller eller hældning i lineær regression β, benyttes t-teststørrelsen
Testes andele kan fx. z-teststørrelsen benyttes
Antag fx. at vi har en stikprøve af 100 mænds højde, med et gennemsnit på 176,32 cm.
Vi ønsker at teste om middel højden i populationen, kan antages at være 210 cm dvs.
H0: μ=210
H1: μ≠210
Vi vil her få en meget negativ teststørrelse, 176,32-210 divideret med standardfejlen for middelværdien SEM
Ønskede at teste om middel højden i populationen, kunne antages at være 150 cm ud fra samme stikprøve ville vi få en meget positiv teststørrelse, 176,32-150 divideret med standardfejlen for middelværdien SEM


Klik her for at lære mere om teststørrelser!
på 0.536, denne medfører en p-værdip-værdien også kaldet signifikanssandsynligheden er et tal mellem 0 og 1, den angiver sandsynligheden for, hvis nulhypotesen er sand, at få en mere ekstrem teststørrelse, end den vi har fået i testet (teststørrelsen måler forskellen mellem fx. stikprøvegennemsnit og middelværdien antaget i nulhypotesen).
Jo lavere p-værdi, des mindre tror vi på nulhypotesen
Antag fx. at vi har en stikprøve af 100 mænds højde, med et gennemsnit på 176,32 cm.
Vi ønsker at teste om middel højden i populationen, kan antages at være 210 cm dvs.
H0: μ=210
H1: μ≠210
Vi vil her få en meget negativ teststørrelse, hvilket giver en mikroskopisk lille p-værdi.
Det vil være nærmest umuligt at få en mere ekstrem teststørrelse, hvis den sande middelhøjde er 210 cm.


Klik her for at lære mere om p-værdier!
på 29,71%. Vi kan ikke forkaste nulhypotesenNulhypotesen H0 er vores grundtro i et hypotesetest, vi har altid lighedstegn i nulhypotesen. Der skal stærke beviser til at forkaste nulhypotesen.
Eksempler på nulhypoteser er:
H0: μ=45 (Middelværdien er 45)
H0: μ≤45 (Middelværdien er højst 45)
H0: μ≥45 (Middelværdien er mindst 45)

Klik her for at lære mere om hypotesetests!
.

Vi kan altså ikke konkludere, at kvinder får en højere karakter end mænd.

Bemærk i Freestat, står der D for difference, dette skyldes man kan undersøge om en forskel mellem middelværdier kan være fx. 0,25, ved at sætte D, i det gule felt til 0,25.

Sammenligning af 2 middelværdier uens varians Unpooled t-test

Skal vi undersøge 2 kvantitative stikprøverEn stikprøve, er et udsnit af populationen (den store mængde vi ønsker at udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde, kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så alle danske mænd.


Klik her for at lære mere om stikprøver!
, der stammer fra populationerPopulationen er den store mængde, vi ønsker at udtale os om. Fx alle iphone brugere i København, alle kontohavere i Danske Bank, alle danske kvinder etc.
Vi bruger som redskab stikprøver som er en lille del af populationen til at udtale os om populationen, da det er billigere end at undersøge hele populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde, kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så alle danske mænd.


Klik her for at lære mere om populationen!
med uens varians, benytter vi unpooled t-testUnpooled t-test benyttes til test af gennemsnit for 2 kvantitative variable, når populationerne ikke har samme varians (der er ikke varianshomogenitet).
Eksempler på stikprøver, hvor middelværdierne kan testes vha. unpooled t-test kunne være:
For 2 stikprøver med højder for CBS og SDU studerende, kan man teste om gennemsnitshøjden for CBS og SDU studerende er ens med unpooled t-test, hvis der ikke er varianshomogenitet.
For 2 stikprøver med med salgspriser for ejendomme i 2 byer, kan man teste om gennemsnitsprisen er højere for den ene by med unpooled t-test, hvis der ikke er varianshomogenitet.
Har de 2 populationer ens varianser, kan man i stedet benytte et pooled t-test, hvilket er mere præcist.

Klik her for at lære mere om unpooled t-test!
. Det er samme fremgangsmåde som ved pooled t-testPooled t-test benyttes til test af gennemsnit for 2 kvantitative variable, når populationerne har samme varians (varianshomogenitet).
Eksempler på stikprøver, hvor middelværdierne kan testes vha. pooled t-test kunne være:
For 2 stikprøver med højder for CBS og SDU studerende, kan man teste om gennemsnitshøjden for CBS og SDU studerende er ens med pooled t-test, hvis der er varianshomogenitet.
For 2 stikprøver med med salgspriser for ejendomme i 2 byer, kan man teste om gennemsnitsprisen er højere for den ene by med pooled t-test, hvis der er varianshomogenitet.
Har de 2 populationer ikke ens varianser, kan man i stedet benytte et unpooled t-test, pooled t-test er dog det mest præcise.

Klik her for at lære mere om pooled t-test!
, men unpooled testen er ikke så præcis som pooled. Derfor starter vi i pooled t-testPooled t-test benyttes til test af gennemsnit for 2 kvantitative variable, når populationerne har samme varians (varianshomogenitet).
Eksempler på stikprøver, hvor middelværdierne kan testes vha. pooled t-test kunne være:
For 2 stikprøver med højder for CBS og SDU studerende, kan man teste om gennemsnitshøjden for CBS og SDU studerende er ens med pooled t-test, hvis der er varianshomogenitet.
For 2 stikprøver med med salgspriser for ejendomme i 2 byer, kan man teste om gennemsnitsprisen er højere for den ene by med pooled t-test, hvis der er varianshomogenitet.
Har de 2 populationer ikke ens varianser, kan man i stedet benytte et unpooled t-test, pooled t-test er dog det mest præcise.

Klik her for at lære mere om pooled t-test!
og gennemfører kun unpooled t-testUnpooled t-test benyttes til test af gennemsnit for 2 kvantitative variable, når populationerne ikke har samme varians (der er ikke varianshomogenitet).
Eksempler på stikprøver, hvor middelværdierne kan testes vha. unpooled t-test kunne være:
For 2 stikprøver med højder for CBS og SDU studerende, kan man teste om gennemsnitshøjden for CBS og SDU studerende er ens med unpooled t-test, hvis der ikke er varianshomogenitet.
For 2 stikprøver med med salgspriser for ejendomme i 2 byer, kan man teste om gennemsnitsprisen er højere for den ene by med unpooled t-test, hvis der ikke er varianshomogenitet.
Har de 2 populationer ens varianser, kan man i stedet benytte et pooled t-test, hvilket er mere præcist.

Klik her for at lære mere om unpooled t-test!
hvis varianserne ikke er ens.

Eksempel US Crime


Hent Datasættet US Crime her

I datasættet US Crime er de beregnede rater pr. 100.000 borgere fordelt på stat. arresteret for hhv. mord overfald og voldtægt. Ydermere er angivet graden af urbanisering, højere betyder staten har større arealer med bymæssig bebyggelse. Observationssættet er baseret på en stor 1973 undersøgelse af 100.000 arrestationer. Mordraterne er illustreret på kortet nedenfor.

Lad os groft dele staterne i voldelige og ikke-voldelige stater, hvis der er 150 overfald/assaults eller derunder, betegner vi staten som ikke voldelig. Stater med mere end 150 overfald pr 100000 borgere betegnes som voldelige.

Er det gennemsnitlige antal mord pr. 100000 borgere lavere i ikke-voldelige stater?

For at besvare spørgsmålet er man nødt til at sortere data efter Assault og tage Murder med i sorteringen. Herefter skal man dele Murder i de voldelige og ikke-voldelige grupper. Hvis det driller, kan man se, hvordan sorteringen skal foretages. Vi får følgende hypotesetestEt hypotese test, tester en nulhypotese H0 (grundtroen), mod en alternativ hypotese H1 (det modsatte udsagn af nulhypotesen).
Man tester om nulhypotesen kan forkastes eller ikke forkastes.
Da nulhypotesen er udgangspunktet (grundtroen), skal der en del beviser til, for at vi forkaster/afviser nulhypotesen.
Vi har 3 kategorier af hypotese test, se eksemplerne herunder:
Hypotese test med to-sidet alternativ hypotese:
H0: μ=34
H1: μ≠34
Vi forkaster H0 både hvis μ er signifikant større eller mindre end 34

Hypotese test med et-sidet alternativ hypotese opad:
H0: μ≤34
H1: μ>34
Vi forkaster kun H0 hvis μ er signifikant større end 34

Hypotese test med et-sidet alternativ hypotese nedad:
H0: μ≥34
H1: μ<34
Vi forkaster kun H0 hvis μ er signifikant mindre end 34

Klik her for at lære mere om hypotese tests!
:

$$H_{0}:\mu_{voldelige}-\mu_{ikke-voldelige}\leq0$$ $$H_{1}:\mu_{voldelige}-\mu_{ikke-voldelige}>0$$

Der er 21 ikke voldelige stater, og 27 voldelige stater. Vi skal altså huske at undersøge om stikprøverneEn stikprøve, er et udsnit af populationen (den store mængde vi ønsker at udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde, kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så alle danske mænd.


Klik her for at lære mere om stikprøver!
stammer fra normalfordelte populationerPopulationen er den store mængde, vi ønsker at udtale os om. Fx alle iphone brugere i København, alle kontohavere i Danske Bank, alle danske kvinder etc.
Vi bruger som redskab stikprøver som er en lille del af populationen til at udtale os om populationen, da det er billigere end at undersøge hele populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde, kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så alle danske mænd.


Klik her for at lære mere om populationen!
, normalfraktildiagrammerneNormalfraktildiagrammer kan bruges til at afgøre, om en stikprøve kan antages at stamme fra normalfordelt population.
Hvis punkterne ligger pænt omkring den rette linje er normalitetsbetingelsen opfyldt. Ved test af fx. en mindre kvantitativ stikprøve og varianshomogenitet forudsættes at variablene opfylder normalitetsbetingelsen.

Klik her for at lære mere om normalfraktildiagrammer!
er her udeladt.

Vi skal også undersøge om der er varianshomogenitetVarianshomogenitet betyder der er ens varianser for populationerne.
Hvis fx. vi har 2 stikprøver med højder for CBS og Cphbusiness studerende, vil varianshomogenitet betyde, at der er samme variation i de 2 populationer.
Testet kunne se ud som nedenfor, bemærk er der varianshomogenitet, er standardafvigelserne også altid ens.
H0: σCBSCph (Der er Varianshomogenitet)
H1: σCBS≠σCph (Der er ikke varianshomogenitet)

Klik her for at lære mere om varianshomogenitet!
. Hvis vi tester varianshomogenitetVarianshomogenitet betyder der er ens varianser for populationerne.
Hvis fx. vi har 2 stikprøver med højder for CBS og Cphbusiness studerende, vil varianshomogenitet betyde, at der er samme variation i de 2 populationer.
Testet kunne se ud som nedenfor, bemærk er der varianshomogenitet, er standardafvigelserne også altid ens.
H0: σCBSCph (Der er Varianshomogenitet)
H1: σCBS≠σCph (Der er ikke varianshomogenitet)

Klik her for at lære mere om varianshomogenitet!
:

$$H_{0}:\sigma_{voldelige}=\sigma_{ikke-voldelige}$$ $$H_{1}:\sigma_{voldelige}\neq\sigma_{ikke-voldelige}$$

Konstaterer vi at på 5% signifikansniveauSignifikansniveauet α typisk 1%, 5% eller 10%, fastsættes inden et test og sammenlignes med p-værdien.
Er p-værdien mindre end signifikansniveauet forkastes nulhypotesen, ellers ikke.
Signifikansniveauet angiver sandsynligheden for at forkaste en sand nulhypotese (en type 1 fejl også kaldet en falsk positiv)
Medicinal industrien arbejder ofte med 1% signifikansniveau, hvor et test kunne være:
H0: Medicinen har ingen effekt
H1: Medicinen har effekt
Med 1% signifikansniveau, begås en type 1 fejl kun i et ud af 100 tests.
En type 1 fejl vil her betyde, at man fejlagtigt konkluderer at et medicinal produkt uden effekt virker.
Signifikansniveauet kan bruges til at bestemme konfidensniveauet 1-α, der angiver sandsynligheden for korrekt ikke at forkaste en sand nulhypotese


Klik her for at lære mere om signifikansniveauet!
, ville vi konkludere at der er forskel på varianserne da p-værdienp-værdien også kaldet signifikanssandsynligheden er et tal mellem 0 og 1, den angiver sandsynligheden for, hvis nulhypotesen er sand, at få en mere ekstrem teststørrelse, end den vi har fået i testet (teststørrelsen måler forskellen mellem fx. stikprøvegennemsnit og middelværdien antaget i nulhypotesen).
Jo lavere p-værdi, des mindre tror vi på nulhypotesen
Antag fx. at vi har en stikprøve af 100 mænds højde, med et gennemsnit på 176,32 cm.
Vi ønsker at teste om middel højden i populationen, kan antages at være 210 cm dvs.
H0: μ=210
H1: μ≠210
Vi vil her få en meget negativ teststørrelse, hvilket giver en mikroskopisk lille p-værdi.
Det vil være nærmest umuligt at få en mere ekstrem teststørrelse, hvis den sande middelhøjde er 210 cm.


Klik her for at lære mere om p-værdier!
er 0,0303666. Konklusionen er dog niveaufølsom, men vi benytter pooled t-testPooled t-test benyttes til test af gennemsnit for 2 kvantitative variable, når populationerne har samme varians (varianshomogenitet).
Eksempler på stikprøver, hvor middelværdierne kan testes vha. pooled t-test kunne være:
For 2 stikprøver med højder for CBS og SDU studerende, kan man teste om gennemsnitshøjden for CBS og SDU studerende er ens med pooled t-test, hvis der er varianshomogenitet.
For 2 stikprøver med med salgspriser for ejendomme i 2 byer, kan man teste om gennemsnitsprisen er højere for den ene by med pooled t-test, hvis der er varianshomogenitet.
Har de 2 populationer ikke ens varianser, kan man i stedet benytte et unpooled t-test, pooled t-test er dog det mest præcise.

Klik her for at lære mere om pooled t-test!
her.

Vor hypotesetestEt hypotese test, tester en nulhypotese H0 (grundtroen), mod en alternativ hypotese H1 (det modsatte udsagn af nulhypotesen).
Man tester om nulhypotesen kan forkastes eller ikke forkastes.
Da nulhypotesen er udgangspunktet (grundtroen), skal der en del beviser til, for at vi forkaster/afviser nulhypotesen.
Vi har 3 kategorier af hypotese test, se eksemplerne herunder:
Hypotese test med to-sidet alternativ hypotese:
H0: μ=34
H1: μ≠34
Vi forkaster H0 både hvis μ er signifikant større eller mindre end 34

Hypotese test med et-sidet alternativ hypotese opad:
H0: μ≤34
H1: μ>34
Vi forkaster kun H0 hvis μ er signifikant større end 34

Hypotese test med et-sidet alternativ hypotese nedad:
H0: μ≥34
H1: μ<34
Vi forkaster kun H0 hvis μ er signifikant mindre end 34

Klik her for at lære mere om hypotese tests!
for middelværdierne bliver:

$$H_{0}:\mu_{voldelige}-\mu_{ikke-voldelige}\leq0$$ $$H_{1}:\mu_{voldelige}-\mu_{ikke-voldelige}>0$$

Vi finder stikprøvegennemsnitteneEn stikprøve, er et udsnit af populationen (den store mængde vi ønsker at udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde, kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så alle danske mænd.


Klik her for at lære mere om stikprøver!
. For mordrater i voldelige stater er stikprøvegennemsnittetEn stikprøve, er et udsnit af populationen (den store mængde vi ønsker at udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde, kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så alle danske mænd.


Klik her for at lære mere om stikprøver!
10,58, for ikke voldelige stater er stikprøvegennemsnittetEn stikprøve, er et udsnit af populationen (den store mængde vi ønsker at udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde, kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så alle danske mænd.


Klik her for at lære mere om stikprøver!
4,21.

Nedenfor er Freestat output, testet for varianshomogenitetVarianshomogenitet betyder der er ens varianser for populationerne.
Hvis fx. vi har 2 stikprøver med højder for CBS og Cphbusiness studerende, vil varianshomogenitet betyde, at der er samme variation i de 2 populationer.
Testet kunne se ud som nedenfor, bemærk er der varianshomogenitet, er standardafvigelserne også altid ens.
H0: σCBSCph (Der er Varianshomogenitet)
H1: σCBS≠σCph (Der er ikke varianshomogenitet)

Klik her for at lære mere om varianshomogenitet!
i blå ramme, viser vi bør benytte unpooled t-testUnpooled t-test benyttes til test af gennemsnit for 2 kvantitative variable, når populationerne ikke har samme varians (der er ikke varianshomogenitet).
Eksempler på stikprøver, hvor middelværdierne kan testes vha. unpooled t-test kunne være:
For 2 stikprøver med højder for CBS og SDU studerende, kan man teste om gennemsnitshøjden for CBS og SDU studerende er ens med unpooled t-test, hvis der ikke er varianshomogenitet.
For 2 stikprøver med med salgspriser for ejendomme i 2 byer, kan man teste om gennemsnitsprisen er højere for den ene by med unpooled t-test, hvis der ikke er varianshomogenitet.
Har de 2 populationer ens varianser, kan man i stedet benytte et pooled t-test, hvilket er mere præcist.

Klik her for at lære mere om unpooled t-test!
:

TeststørrelsenTeststørrelsen kan populært forklares, som forskellen mellem observeret i stikprøven og forventet under nulhypotesen.

Teststørrelsen er et udtryk for forskellen mellem fx. gennemsnit, andel eller antal i stikprøven i forhold til påstanden i nulhypotesen H0.
Teststørrelsen korrigerer for stikprøvestørrelse og standardafvigelse, men beregnes forskelligt afhængigt af hvilket test der udføres.
Testes fx. middelværdi μ eller eller hældning i lineær regression β, benyttes t-teststørrelsen
Testes andele kan fx. z-teststørrelsen benyttes
Antag fx. at vi har en stikprøve af 100 mænds højde, med et gennemsnit på 176,32 cm.
Vi ønsker at teste om middel højden i populationen, kan antages at være 210 cm dvs.
H0: μ=210
H1: μ≠210
Vi vil her få en meget negativ teststørrelse, 176,32-210 divideret med standardfejlen for middelværdien SEM
Ønskede at teste om middel højden i populationen, kunne antages at være 150 cm ud fra samme stikprøve ville vi få en meget positiv teststørrelse, 176,32-150 divideret med standardfejlen for middelværdien SEM


Klik her for at lære mere om teststørrelser!
i pooled t-testenPooled t-test benyttes til test af gennemsnit for 2 kvantitative variable, når populationerne har samme varians (varianshomogenitet).
Eksempler på stikprøver, hvor middelværdierne kan testes vha. pooled t-test kunne være:
For 2 stikprøver med højder for CBS og SDU studerende, kan man teste om gennemsnitshøjden for CBS og SDU studerende er ens med pooled t-test, hvis der er varianshomogenitet.
For 2 stikprøver med med salgspriser for ejendomme i 2 byer, kan man teste om gennemsnitsprisen er højere for den ene by med pooled t-test, hvis der er varianshomogenitet.
Har de 2 populationer ikke ens varianser, kan man i stedet benytte et unpooled t-test, pooled t-test er dog det mest præcise.

Klik her for at lære mere om pooled t-test!
ovenfor bliver stor 7,0706, der er altså meget stor forskel på mordraten. Vi får tilsvarende nedenfor en unpooled teststørrelseTeststørrelsen kan populært forklares, som forskellen mellem observeret i stikprøven og forventet under nulhypotesen.

Teststørrelsen er et udtryk for forskellen mellem fx. gennemsnit, andel eller antal i stikprøven i forhold til påstanden i nulhypotesen H0.
Teststørrelsen korrigerer for stikprøvestørrelse og standardafvigelse, men beregnes forskelligt afhængigt af hvilket test der udføres.
Testes fx. middelværdi μ eller eller hældning i lineær regression β, benyttes t-teststørrelsen
Testes andele kan fx. z-teststørrelsen benyttes
Antag fx. at vi har en stikprøve af 100 mænds højde, med et gennemsnit på 176,32 cm.
Vi ønsker at teste om middel højden i populationen, kan antages at være 210 cm dvs.
H0: μ=210
H1: μ≠210
Vi vil her få en meget negativ teststørrelse, 176,32-210 divideret med standardfejlen for middelværdien SEM
Ønskede at teste om middel højden i populationen, kunne antages at være 150 cm ud fra samme stikprøve ville vi få en meget positiv teststørrelse, 176,32-150 divideret med standardfejlen for middelværdien SEM


Klik her for at lære mere om teststørrelser!
på 7,4868. Begge teststørrelserTeststørrelsen kan populært forklares, som forskellen mellem observeret i stikprøven og forventet under nulhypotesen.

Teststørrelsen er et udtryk for forskellen mellem fx. gennemsnit, andel eller antal i stikprøven i forhold til påstanden i nulhypotesen H0.
Teststørrelsen korrigerer for stikprøvestørrelse og standardafvigelse, men beregnes forskelligt afhængigt af hvilket test der udføres.
Testes fx. middelværdi μ eller eller hældning i lineær regression β, benyttes t-teststørrelsen
Testes andele kan fx. z-teststørrelsen benyttes
Antag fx. at vi har en stikprøve af 100 mænds højde, med et gennemsnit på 176,32 cm.
Vi ønsker at teste om middel højden i populationen, kan antages at være 210 cm dvs.
H0: μ=210
H1: μ≠210
Vi vil her få en meget negativ teststørrelse, 176,32-210 divideret med standardfejlen for middelværdien SEM
Ønskede at teste om middel højden i populationen, kunne antages at være 150 cm ud fra samme stikprøve ville vi få en meget positiv teststørrelse, 176,32-150 divideret med standardfejlen for middelværdien SEM


Klik her for at lære mere om teststørrelser!
er langt større end 2, hvilket giver os meget små p-værdierp-værdien også kaldet signifikanssandsynligheden er et tal mellem 0 og 1, den angiver sandsynligheden for, hvis nulhypotesen er sand, at få en mere ekstrem teststørrelse, end den vi har fået i testet (teststørrelsen måler forskellen mellem fx. stikprøvegennemsnit og middelværdien antaget i nulhypotesen).
Jo lavere p-værdi, des mindre tror vi på nulhypotesen
Antag fx. at vi har en stikprøve af 100 mænds højde, med et gennemsnit på 176,32 cm.
Vi ønsker at teste om middel højden i populationen, kan antages at være 210 cm dvs.
H0: μ=210
H1: μ≠210
Vi vil her få en meget negativ teststørrelse, hvilket giver en mikroskopisk lille p-værdi.
Det vil være nærmest umuligt at få en mere ekstrem teststørrelse, hvis den sande middelhøjde er 210 cm.


Klik her for at lære mere om p-værdier!
, så vi vil med sikkerhed forkaste nulhypotesenNulhypotesen H0 er vores grundtro i et hypotesetest, vi har altid lighedstegn i nulhypotesen. Der skal stærke beviser til at forkaste nulhypotesen.
Eksempler på nulhypoteser er:
H0: μ=45 (Middelværdien er 45)
H0: μ≤45 (Middelværdien er højst 45)
H0: μ≥45 (Middelværdien er mindst 45)

Klik her for at lære mere om hypotesetests!
i begge analyser. I unpooled testen bliver p-værdienp-værdien også kaldet signifikanssandsynligheden er et tal mellem 0 og 1, den angiver sandsynligheden for, hvis nulhypotesen er sand, at få en mere ekstrem teststørrelse, end den vi har fået i testet (teststørrelsen måler forskellen mellem fx. stikprøvegennemsnit og middelværdien antaget i nulhypotesen).
Jo lavere p-værdi, des mindre tror vi på nulhypotesen
Antag fx. at vi har en stikprøve af 100 mænds højde, med et gennemsnit på 176,32 cm.
Vi ønsker at teste om middel højden i populationen, kan antages at være 210 cm dvs.
H0: μ=210
H1: μ≠210
Vi vil her få en meget negativ teststørrelse, hvilket giver en mikroskopisk lille p-værdi.
Det vil være nærmest umuligt at få en mere ekstrem teststørrelse, hvis den sande middelhøjde er 210 cm.


Klik her for at lære mere om p-værdier!
et meget lille tal, tæt på 0%, dette kan ses i nedenstående Freestat output.

Output fra Freestat når vi benytter unpooled t-testUnpooled t-test benyttes til test af gennemsnit for 2 kvantitative variable, når populationerne ikke har samme varians (der er ikke varianshomogenitet).
Eksempler på stikprøver, hvor middelværdierne kan testes vha. unpooled t-test kunne være:
For 2 stikprøver med højder for CBS og SDU studerende, kan man teste om gennemsnitshøjden for CBS og SDU studerende er ens med unpooled t-test, hvis der ikke er varianshomogenitet.
For 2 stikprøver med med salgspriser for ejendomme i 2 byer, kan man teste om gennemsnitsprisen er højere for den ene by med unpooled t-test, hvis der ikke er varianshomogenitet.
Har de 2 populationer ens varianser, kan man i stedet benytte et pooled t-test, hvilket er mere præcist.

Klik her for at lære mere om unpooled t-test!
til analysen, ses herunder:

Parret t-test


Hent Datasættet 20 DK US aktier til videoen ovenfor

Hvis vi betragter en variabel før og efter en treatment, treatment kan fx. være en behandling med et medicinsk produkt, det er vigtigt at vi betragter samme respondenter, før og efter treatment. I parret t-testParret t-test benyttes til test af gennemsnit for 2 kvantitative variable, hvor hver observation er en måling af samme objekt.
Eksempler på stikprøver, hvor middelværdierne kan testes vha. parret t-test kunne være:
De samme 68 rotters (samme objekter) blodtryk målt før og efter medicinsk behandling.
Dagsafkastet for Danske Bank aktien og Nordea aktien på de samme 68 handelsdage (samme objekter).
Omsætningen for de samme 68 dagligvarebutikker (samme objekter) før og efter en reklamekampagne.
Parret t-test har altid samme antal observationer, dette er ikke nødvendigt for pooled og unpooled t-test.

Klik her for at lære mere om parret t-test!
vil der altid være tale om samme størrelse af datasættene før og efter treatment, treatment kan også være tid. Hvis man forestiller sig at en bank måler 40 kunders gennemsnitlige netbank besøgstid, før og efter en softwareopdatering, hvis der her er tale om de samme kunder, kan vi bruge parret t-testParret t-test benyttes til test af gennemsnit for 2 kvantitative variable, hvor hver observation er en måling af samme objekt.
Eksempler på stikprøver, hvor middelværdierne kan testes vha. parret t-test kunne være:
De samme 68 rotters (samme objekter) blodtryk målt før og efter medicinsk behandling.
Dagsafkastet for Danske Bank aktien og Nordea aktien på de samme 68 handelsdage (samme objekter).
Omsætningen for de samme 68 dagligvarebutikker (samme objekter) før og efter en reklamekampagne.
Parret t-test har altid samme antal observationer, dette er ikke nødvendigt for pooled og unpooled t-test.

Klik her for at lære mere om parret t-test!
her. I videoeksemplet betragtede vi 2 aktier på samme handelsdage, her var objektet ikke en respondent, men derimod handelsdagen, her brugte vi også parret t-testParret t-test benyttes til test af gennemsnit for 2 kvantitative variable, hvor hver observation er en måling af samme objekt.
Eksempler på stikprøver, hvor middelværdierne kan testes vha. parret t-test kunne være:
De samme 68 rotters (samme objekter) blodtryk målt før og efter medicinsk behandling.
Dagsafkastet for Danske Bank aktien og Nordea aktien på de samme 68 handelsdage (samme objekter).
Omsætningen for de samme 68 dagligvarebutikker (samme objekter) før og efter en reklamekampagne.
Parret t-test har altid samme antal observationer, dette er ikke nødvendigt for pooled og unpooled t-test.

Klik her for at lære mere om parret t-test!
.

Quiz

Quiz Test af 2 middelværdier

Selvtest

Selvtest Realkredit 2 middelværdier med videoløsning

Spørgsmål

Vi ser igen på bankdata.

1. Bestem ved hjælp af konfidensintervaller for forskellen, om der er signifikant forskel på kvinder og mænds gennemsnitlige uddannelseslængde?
2. Bestem ved hjælp af konfidensintervaller for forskellen, om der er signifikant på ledelsens og administationens gennemsnitlige uddannelse i populationen?
1. Bemærk der er uens varianser, vi skal således benytte Unpooled t-test til at bestemme konfidensintervaller.
Der er 216 kvinder, deres gennemsnitlige uddannelseslængde er 12,37, Der er 258 mænd, deres gennemsnitlige uddannelseslængde er 14,43
Vi kan med 95% sikkerhed sige at forskellen på mænds og kvinders gennemsnitlige uddannelse i populationen, ligger mellem 1,58 år og 2,54 år.
Vi kan med 99% sikkerhed sige at forskellen på mænds og kvinders gennemsnitlige uddannelse i populationen, ligger mellem 1,43 år og 2,69 år. Vi er altså ret sikre på, at der er forskel på uddannelseslængden for mænd og kvinder, da 0 ikke engang er indeholdt i 99% konfidensintervallet.


Havde vi i stedet benyttet pooled t-test havde vi nået samme konklusion, der er ikke meget forskel på grænserne:
Vi kan med 95% sikkerhed sige at forskellen på mænds og kvinders gennemsnitlige uddannelse i populationen, ligger mellem 1,57 år og 2,55 år.
Vi kan med 99% sikkerhed sige at forskellen på mænds og kvinders gennemsnitlige uddannelse i populationen, ligger mellem 1,42 år og 2,7 år. Vi er altså ret sikre på, at der er forskel på uddannelseslængden for mænd og kvinder, da 0 ikke engang er indeholdt i 99% konfidensintervallet.

2. Bemærk der er uens varianser, vi skal således benytte Unpooled t-test til at bestemme konfidensintervaller. Der er 363 personer i administrative stillinger, deres gennemsnitlige uddannelseslængde er 12,87, Der er 84 i ledelsen, deres gennemsnitlige uddannelseslængde er 17,25
Vi kan med 95% sikkerhed sige at forskellen på ledelsens og administrationens gennemsnitlige uddannelse i populationen, ligger mellem 3,96 år og 4,81 år.

Vi kan med 99% sikkerhed sige at forskellen på ledelsens og administrationens gennemsnitlige uddannelse i populationen, ligger mellem 3,82 år og 4,94 år. Vi er altså ret sikre på, at der er forskel på uddannelseslængden for ledere og administrativt personale, da 0 ikke engang er indeholdt i 99% konfidensintervallet.
Opgave 3 (30 %) En række klagesager i Nykøbing Bank har fået en del kunder til at forlade banken. Det er vigtigt for Nykøbing Bank at fastholde sine kunder i lokalområdet i mange år. Banken ønsker derfor en nærmere analyse af kundeancienniteten.

Spørgsmål 3,1 (5 %)
Undersøg om kundeancienniteten i banken er normalfordelt.

Spørgsmål 3,2 (10 %)
Test på 5 % testniveau om den gennemsnitlige kundeanciennitet er under 20 år.
I undersøgelsen af 75 kunder fra 2015, var kundeancienniteten på 20 år med en standardafvigelse på 10 år. Spørgsmål 3,3 (5 %)
Test på 5 % testniveau om standardafvigelserne er ens i de 2 undersøgelser.

Spørgsmål 3,4 (10 %)
Test på 5 % testniveau om den gennemsnitlige anciennitet er faldet fra 2015 til 2016.

Du finder hele opgaver i linket:

2016 8 Eksamen Statistik Opgave
2016 8 Eksamen Statistik Data






Du har nu adgang

Alle kapitler er åbne.