9. 2 Middelværdier
Konfidensinterval for 2 middelværdier
Pooled og unpooled t-test
Vi kan ofte være interesseret i at sammenligne middelværdier, til dette kan vi benytte en af flere tests. Hvis
vi har 2 kvantitative stikprøverEn stikprøve, er et udsnit af populationen (den store mængde vi ønsker at
udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi
stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele
populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde,
kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så
alle danske mænd.
Klik her for at
lære mere om stikprøver!
, kan vi undersøge om forskellen i middelværdierne er signifikant
forskellig. Det er muligt at bruge en pooled t-testPooled t-test benyttes til test af gennemsnit for 2 kvantitative variable,
når populationerne har samme varians (varianshomogenitet).
Eksempler på stikprøver, hvor middelværdierne kan testes vha. pooled
t-test kunne være:
For 2 stikprøver med højder for CBS og SDU studerende, kan man teste om
gennemsnitshøjden for CBS og SDU studerende er ens med pooled t-test,
hvis der er varianshomogenitet.
For 2 stikprøver med med salgspriser for ejendomme i 2 byer, kan man
teste om gennemsnitsprisen er højere for den ene by med pooled t-test,
hvis der er varianshomogenitet.
Har de 2 populationer ikke ens varianser, kan man i stedet benytte et
unpooled t-test, pooled t-test er dog det mest præcise.
Klik her for at
lære mere om pooled t-test!, hvis vi har ens standardafvigelser og dermed ens varianser for
de 2 stikprøverEn stikprøve, er et udsnit af populationen (den store mængde vi ønsker at
udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi
stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele
populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde,
kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så
alle danske mænd.
Klik her for at
lære mere om stikprøver!
. Man bruger en unpooled t-testUnpooled t-test benyttes til test af gennemsnit for 2 kvantitative
variable, når populationerne ikke har samme varians (der er ikke
varianshomogenitet).
Eksempler på stikprøver, hvor middelværdierne kan testes vha. unpooled
t-test kunne være:
For 2 stikprøver med højder for CBS og SDU studerende, kan man teste om
gennemsnitshøjden for CBS og SDU studerende er ens med unpooled t-test,
hvis der ikke er varianshomogenitet.
For 2 stikprøver med med salgspriser for ejendomme i 2 byer, kan man
teste om gennemsnitsprisen er højere for den ene by med unpooled t-test,
hvis der ikke er varianshomogenitet.
Har de 2 populationer ens varianser, kan man i stedet benytte et pooled
t-test, hvilket er mere præcist.
Klik her for at
lære mere om unpooled t-test!, hvis varianserne ikke er ens. Vi kan teste om varianserne er ens, en
sådan test for varianshomogenitetVarianshomogenitet betyder der er ens varianser for populationerne.
Hvis fx. vi har 2 stikprøver med højder for CBS og Cphbusiness
studerende, vil varianshomogenitet betyde, at der er samme variation i
de 2 populationer.
Testet kunne se ud som nedenfor, bemærk er der varianshomogenitet, er
standardafvigelserne også altid ens.
H0: σCBS=σCph (Der er
Varianshomogenitet)
H1: σCBS≠σCph (Der er ikke
varianshomogenitet)
Klik her
for
at lære mere om varianshomogenitet!, findes i det meste software incl. FREESTAT. Hvis man ikke har mulighed
for at teste, kan man bruge tommelfingerreglen: Hvis den største af de 2 stikprøversEn stikprøve, er et udsnit af populationen (den store mængde vi ønsker at
udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi
stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele
populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde,
kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så
alle danske mænd.
Klik her for at
lære mere om stikprøver!
standardafvigelse, er mere end
dobbelt så stor, som den lille stikprøvesEn stikprøve, er et udsnit af populationen (den store mængde vi ønsker at
udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi
stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele
populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde,
kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så
alle danske mænd.
Klik her for at
lære mere om stikprøver!
standardafvigelse, benyttes unpooled t-testUnpooled t-test benyttes til test af gennemsnit for 2 kvantitative
variable, når populationerne ikke har samme varians (der er ikke
varianshomogenitet).
Eksempler på stikprøver, hvor middelværdierne kan testes vha. unpooled
t-test kunne være:
For 2 stikprøver med højder for CBS og SDU studerende, kan man teste om
gennemsnitshøjden for CBS og SDU studerende er ens med unpooled t-test,
hvis der ikke er varianshomogenitet.
For 2 stikprøver med med salgspriser for ejendomme i 2 byer, kan man
teste om gennemsnitsprisen er højere for den ene by med unpooled t-test,
hvis der ikke er varianshomogenitet.
Har de 2 populationer ens varianser, kan man i stedet benytte et pooled
t-test, hvilket er mere præcist.
Klik her for at
lære mere om unpooled t-test!.
Samme metode bruges i praksis til A/B-test i den finansielle sektor, fx når man sammenligner gennemsnitlig responstid eller model-score mellem to versioner af en ML-model.
Vi ser igen på eksemplet med ejendomsmægleren, der undersøgte kundernes afstand til filialerne. Den gennemsnitlige
afstand til nærmeste filial var, 748 meter i stikprøvenEn stikprøve, er et udsnit af populationen (den store mængde vi ønsker at
udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi
stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele
populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde,
kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så
alle danske mænd.
Klik her for at
lære mere om stikprøver!
med 200 respondenter. StandardafvigelsenStandardafvigelsen fortæller hvor meget en variabel typisk varierer
omkring middelværdien.
Standardafvigelsen også kaldet spredningen, findes som kvadratroden af
variansen, i modsætning til variansen er standardafvigelsen i samme enhed
som variablen hvilket gør tolkning nemmere.
Kursen for en aktie med middelkurs 100 Kr. og standardafvigelse 1 svinger
meget mindre, end en aktie med middelkurs 100 og standardafvigelse 10. Da
investorer er risikoaverse vil de foretrække aktien med den mindste
standardafvigelse.
Klik her
for
at lære mere om standardafvigelsen! er 102
meter.
Mægleren har data fra en tilsvarende undersøgelse hos en konkurrerende kæde, her er den gennemsnitlige afstand 702
meter og standardafvigelsenStandardafvigelsen fortæller hvor meget en variabel typisk varierer
omkring middelværdien.
Standardafvigelsen også kaldet spredningen, findes som kvadratroden af
variansen, i modsætning til variansen er standardafvigelsen i samme enhed
som variablen hvilket gør tolkning nemmere.
Kursen for en aktie med middelkurs 100 Kr. og standardafvigelse 1 svinger
meget mindre, end en aktie med middelkurs 100 og standardafvigelse 10. Da
investorer er risikoaverse vil de foretrække aktien med den mindste
standardafvigelse.
Klik her
for
at lære mere om standardafvigelsen! er 89 meter i en stikprøve
En stikprøve, er et udsnit af populationen (den store mængde vi ønsker at
udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi
stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele
populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde,
kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så
alle danske mænd.
Klik her for at
lære mere om stikprøver!
af størrelse 40.
I Freestat kan man sætte de 2 stikprøverEn stikprøve, er et udsnit af populationen (den store mængde vi ønsker at
udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi
stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele
populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde,
kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så
alle danske mænd.
Klik her for at
lære mere om stikprøver!
ind i analysen Pooled t-testPooled t-test benyttes til test af gennemsnit for 2 kvantitative variable,
når populationerne har samme varians (varianshomogenitet).
Eksempler på stikprøver, hvor middelværdierne kan testes vha. pooled
t-test kunne være:
For 2 stikprøver med højder for CBS og SDU studerende, kan man teste om
gennemsnitshøjden for CBS og SDU studerende er ens med pooled t-test,
hvis der er varianshomogenitet.
For 2 stikprøver med med salgspriser for ejendomme i 2 byer, kan man
teste om gennemsnitsprisen er højere for den ene by med pooled t-test,
hvis der er varianshomogenitet.
Har de 2 populationer ikke ens varianser, kan man i stedet benytte et
unpooled t-test, pooled t-test er dog det mest præcise.
Klik her for at
lære mere om pooled t-test! varianshomogenitetVarianshomogenitet betyder der er ens varianser for populationerne.
Hvis fx. vi har 2 stikprøver med højder for CBS og Cphbusiness
studerende, vil varianshomogenitet betyde, at der er samme variation i
de 2 populationer.
Testet kunne se ud som nedenfor, bemærk er der varianshomogenitet, er
standardafvigelserne også altid ens.
H0: σCBS=σCph (Der er
Varianshomogenitet)
H1: σCBS≠σCph (Der er ikke
varianshomogenitet)
Klik her
for
at lære mere om varianshomogenitet! i fanen Pooled. Vi
får følgende output.
Her har vi som ses af output fra Freestat, valgt mæglerens egen undersøgelse som 1. stikprøveEn stikprøve, er et udsnit af populationen (den store mængde vi ønsker at
udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi
stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele
populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde,
kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så
alle danske mænd.
Klik her for at
lære mere om stikprøver!
, og
konkurrentens som 2. stikprøveEn stikprøve, er et udsnit af populationen (den store mængde vi ønsker at
udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi
stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele
populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde,
kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så
alle danske mænd.
Klik her for at
lære mere om stikprøver!
. Vi kan med 95% sikkerhed sige at forskellen mellem mæglerens og
konkurrentens kunders gennemsnitlige afstand til filial ligger mellem 11,9 og 80,1 meter (markeret med rødt). Da 0
ikke er indeholdt i konfidensintervalletKonfidensintervallet beregnes ud fra en stikprøve, og angiver nedre og
øvre grænser indenfor hvilke populations parameteren, ligger med en vis
sandsynlighed.
Er 95% konfidensintervallet for mænds gennemsnitlige højde fx. 172 cm.
og 182 cm. kan vi sige:
Vi kan med 95% sandsynlighed sige den gennemsnitlige højde for mænd i
populationen, ligger mellem 172 cm. og 182 cm.
Jo større stikprøve og jo lavere sikkerhed (konfidensniveau), jo mere
præcist bliver vore konfidensinterval (interval estimatet), dvs
intervallet bliver smallere.
Vi kan beregne konfidensintervaller for parametre vi estimerer, fx.
gennemsnittet, standardafvigelsen, andelen etc.
I modsætning til et punktestimat for fx. middelværdien, fortæller
konfidensintervallet os noget om kvaliteten af vort estimat/gæt, ud fra
bredden af konfidensintervallet.
Klik her for at
lære mere om konfidensintervallet!
kan vi konstatere at denne forskel er signifikant, der er altså
forskel på afstanden til nærmeste filial i de 2 kæder. Vi kan undersøge om vi også er 99% sikre på konklusionen ved
at ændre signifikansniveauetSignifikansniveauet α typisk 1%, 5% eller 10%, fastsættes inden et test og
sammenlignes med p-værdien.
Er p-værdien mindre end signifikansniveauet forkastes nulhypotesen, ellers
ikke.
Signifikansniveauet angiver sandsynligheden for at forkaste en sand
nulhypotese (en type 1 fejl også kaldet en falsk positiv)
Medicinal industrien arbejder ofte med 1% signifikansniveau, hvor et
test kunne være:
H0: Medicinen har ingen effekt
H1: Medicinen har effekt
Med 1% signifikansniveau, begås en type 1 fejl kun i et ud af 100
tests.
En type 1 fejl vil her betyde, at man fejlagtigt konkluderer at et
medicinal produkt uden effekt virker.
Signifikansniveauet kan bruges til at bestemme konfidensniveauet 1-α,
der angiver sandsynligheden for korrekt ikke at forkaste en sand
nulhypotese
Klik her
for at lære mere om signifikansniveauet! til 1%, jo et bredere konfidensintervalKonfidensintervallet beregnes ud fra en stikprøve, og angiver nedre og
øvre grænser indenfor hvilke populations parameteren, ligger med en vis
sandsynlighed.
Er 95% konfidensintervallet for mænds gennemsnitlige højde fx. 172 cm.
og 182 cm. kan vi sige:
Vi kan med 95% sandsynlighed sige den gennemsnitlige højde for mænd i
populationen, ligger mellem 172 cm. og 182 cm.
Jo større stikprøve og jo lavere sikkerhed (konfidensniveau), jo mere
præcist bliver vore konfidensinterval (interval estimatet), dvs
intervallet bliver smallere.
Vi kan beregne konfidensintervaller for parametre vi estimerer, fx.
gennemsnittet, standardafvigelsen, andelen etc.
I modsætning til et punktestimat for fx. middelværdien, fortæller
konfidensintervallet os noget om kvaliteten af vort estimat/gæt, ud fra
bredden af konfidensintervallet.
Klik her for at
lære mere om konfidensintervallet!
, da præcisionen falder, når
sikkerheden stiger.
Det er ikke så vigtigt hvilken stikprøveEn stikprøve, er et udsnit af populationen (den store mængde vi ønsker at
udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi
stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele
populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde,
kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så
alle danske mænd.
Klik her for at
lære mere om stikprøver!
, der er 1. og 2. stikprøveEn stikprøve, er et udsnit af populationen (den store mængde vi ønsker at
udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi
stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele
populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde,
kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så
alle danske mænd.
Klik her for at
lære mere om stikprøver!
, men det er væsentligt for
tolkningen af konfidensintervalletKonfidensintervallet beregnes ud fra en stikprøve, og angiver nedre og
øvre grænser indenfor hvilke populations parameteren, ligger med en vis
sandsynlighed.
Er 95% konfidensintervallet for mænds gennemsnitlige højde fx. 172 cm.
og 182 cm. kan vi sige:
Vi kan med 95% sandsynlighed sige den gennemsnitlige højde for mænd i
populationen, ligger mellem 172 cm. og 182 cm.
Jo større stikprøve og jo lavere sikkerhed (konfidensniveau), jo mere
præcist bliver vore konfidensinterval (interval estimatet), dvs
intervallet bliver smallere.
Vi kan beregne konfidensintervaller for parametre vi estimerer, fx.
gennemsnittet, standardafvigelsen, andelen etc.
I modsætning til et punktestimat for fx. middelværdien, fortæller
konfidensintervallet os noget om kvaliteten af vort estimat/gæt, ud fra
bredden af konfidensintervallet.
Klik her for at
lære mere om konfidensintervallet!
. Bemærk konfidensintervalletsKonfidensintervallet beregnes ud fra en stikprøve, og angiver nedre og
øvre grænser indenfor hvilke populations parameteren, ligger med en vis
sandsynlighed.
Er 95% konfidensintervallet for mænds gennemsnitlige højde fx. 172 cm.
og 182 cm. kan vi sige:
Vi kan med 95% sandsynlighed sige den gennemsnitlige højde for mænd i
populationen, ligger mellem 172 cm. og 182 cm.
Jo større stikprøve og jo lavere sikkerhed (konfidensniveau), jo mere
præcist bliver vore konfidensinterval (interval estimatet), dvs
intervallet bliver smallere.
Vi kan beregne konfidensintervaller for parametre vi estimerer, fx.
gennemsnittet, standardafvigelsen, andelen etc.
I modsætning til et punktestimat for fx. middelværdien, fortæller
konfidensintervallet os noget om kvaliteten af vort estimat/gæt, ud fra
bredden af konfidensintervallet.
Klik her for at
lære mere om konfidensintervallet!
øvre grænse, vil hvis man bytter rundt,
blive den nedre grænse med fortegnsskift, og tilsvarende for den nedre grænse. Begge grænser i
konfidensintervalletKonfidensintervallet beregnes ud fra en stikprøve, og angiver nedre og
øvre grænser indenfor hvilke populations parameteren, ligger med en vis
sandsynlighed.
Er 95% konfidensintervallet for mænds gennemsnitlige højde fx. 172 cm.
og 182 cm. kan vi sige:
Vi kan med 95% sandsynlighed sige den gennemsnitlige højde for mænd i
populationen, ligger mellem 172 cm. og 182 cm.
Jo større stikprøve og jo lavere sikkerhed (konfidensniveau), jo mere
præcist bliver vore konfidensinterval (interval estimatet), dvs
intervallet bliver smallere.
Vi kan beregne konfidensintervaller for parametre vi estimerer, fx.
gennemsnittet, standardafvigelsen, andelen etc.
I modsætning til et punktestimat for fx. middelværdien, fortæller
konfidensintervallet os noget om kvaliteten af vort estimat/gæt, ud fra
bredden af konfidensintervallet.
Klik her for at
lære mere om konfidensintervallet!
er positive, forskellen måles altid som 1. stikprøveEn stikprøve, er et udsnit af populationen (den store mængde vi ønsker at
udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi
stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele
populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde,
kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så
alle danske mænd.
Klik her for at
lære mere om stikprøver!
minus 2. stikprøveEn stikprøve, er et udsnit af populationen (den store mængde vi ønsker at
udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi
stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele
populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde,
kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så
alle danske mænd.
Klik her for at
lære mere om stikprøver!
, specielt i dette tilfælde altså kædens egen undersøgelse minus konkurrentens undersøgelse. Det er altid en
MEGET god ide, at holde fuldstændig styr på hvilken stikprøveEn stikprøve, er et udsnit af populationen (den store mængde vi ønsker at
udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi
stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele
populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde,
kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så
alle danske mænd.
Klik her for at
lære mere om stikprøver!
, der er 1. og 2., hvilket vi senere vil se i
forbindelse med hypotestests med ensidet alternativhypotese.
Vi skal undersøge om varianserne er ens, tommelfingerreglen er overholdt, da standardafvigelsen for den store stikprøve $$\hat{\sigma}_{1}=102$$ ikke er mere end dobbelt så stor, som standardafvigelsen for den lille stikprøve $$\hat{\sigma}_2=89$$ Vi har dog en mere præcis metode, nederst til højre markeret med blåt testes varianshomogenitet automatisk. Vi har endnu ikke gennemgået hvorledes hypotesetests opstilles og aflæses, men vi kan godt forstå sidste del i konklusionen af hypotesetesten, “varianserne er ens”.
Vi kan som nævnt ændre signifikansniveauetSignifikansniveauet α typisk 1%, 5% eller 10%, fastsættes inden et test og
sammenlignes med p-værdien.
Er p-værdien mindre end signifikansniveauet forkastes nulhypotesen, ellers
ikke.
Signifikansniveauet angiver sandsynligheden for at forkaste en sand
nulhypotese (en type 1 fejl også kaldet en falsk positiv)
Medicinal industrien arbejder ofte med 1% signifikansniveau, hvor et
test kunne være:
H0: Medicinen har ingen effekt
H1: Medicinen har effekt
Med 1% signifikansniveau, begås en type 1 fejl kun i et ud af 100
tests.
En type 1 fejl vil her betyde, at man fejlagtigt konkluderer at et
medicinal produkt uden effekt virker.
Signifikansniveauet kan bruges til at bestemme konfidensniveauet 1-α,
der angiver sandsynligheden for korrekt ikke at forkaste en sand
nulhypotese
Klik her
for at lære mere om signifikansniveauet! til 1% for at se, om konfidensintervalletKonfidensintervallet beregnes ud fra en stikprøve, og angiver nedre og
øvre grænser indenfor hvilke populations parameteren, ligger med en vis
sandsynlighed.
Er 95% konfidensintervallet for mænds gennemsnitlige højde fx. 172 cm.
og 182 cm. kan vi sige:
Vi kan med 95% sandsynlighed sige den gennemsnitlige højde for mænd i
populationen, ligger mellem 172 cm. og 182 cm.
Jo større stikprøve og jo lavere sikkerhed (konfidensniveau), jo mere
præcist bliver vore konfidensinterval (interval estimatet), dvs
intervallet bliver smallere.
Vi kan beregne konfidensintervaller for parametre vi estimerer, fx.
gennemsnittet, standardafvigelsen, andelen etc.
I modsætning til et punktestimat for fx. middelværdien, fortæller
konfidensintervallet os noget om kvaliteten af vort estimat/gæt, ud fra
bredden af konfidensintervallet.
Klik her for at
lære mere om konfidensintervallet!
nu indeholder 0.
Vi kan med 99% sikkerhed sige, at forskellen mellem mæglerens og konkurrentens kunders gennemsnitlige afstand til filial ligger mellem 1,1 og 90,9 meter. Vi er altså relativt sikre på vor konklusion, om forskel i afstande til nærmeste filial for de 2 kæder.
Varianshomogenitet
Forudsætninger
En forudsætning for at benytte pooled t-testPooled t-test benyttes til test af gennemsnit for 2 kvantitative variable,
når populationerne har samme varians (varianshomogenitet).
Eksempler på stikprøver, hvor middelværdierne kan testes vha. pooled
t-test kunne være:
For 2 stikprøver med højder for CBS og SDU studerende, kan man teste om
gennemsnitshøjden for CBS og SDU studerende er ens med pooled t-test,
hvis der er varianshomogenitet.
For 2 stikprøver med med salgspriser for ejendomme i 2 byer, kan man
teste om gennemsnitsprisen er højere for den ene by med pooled t-test,
hvis der er varianshomogenitet.
Har de 2 populationer ikke ens varianser, kan man i stedet benytte et
unpooled t-test, pooled t-test er dog det mest præcise.
Klik her for at
lære mere om pooled t-test!, til at undersøge om 2 middelværdier kan antages at være identiske, er
at der er varianshomogenitetVarianshomogenitet betyder der er ens varianser for populationerne.
Hvis fx. vi har 2 stikprøver med højder for CBS og Cphbusiness
studerende, vil varianshomogenitet betyde, at der er samme variation i
de 2 populationer.
Testet kunne se ud som nedenfor, bemærk er der varianshomogenitet, er
standardafvigelserne også altid ens.
H0: σCBS=σCph (Der er
Varianshomogenitet)
H1: σCBS≠σCph (Der er ikke
varianshomogenitet)
Klik her
for
at lære mere om varianshomogenitet!. For at vi kan undersøge om populationsvariansernePopulationen er den store mængde, vi ønsker at udtale os om. Fx alle
iphone brugere i København, alle kontohavere i Danske Bank, alle danske
kvinder etc.
Vi bruger som redskab stikprøver som er en lille del af populationen
til at udtale os om populationen, da det er billigere end at undersøge
hele populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde,
kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så
alle danske mænd.
Klik her for at
lære mere om populationen!
er ens, skal vi først
undersøge om populationernePopulationen er den store mængde, vi ønsker at udtale os om. Fx alle
iphone brugere i København, alle kontohavere i Danske Bank, alle danske
kvinder etc.
Vi bruger som redskab stikprøver som er en lille del af populationen
til at udtale os om populationen, da det er billigere end at undersøge
hele populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde,
kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så
alle danske mænd.
Klik her for at
lære mere om populationen!
kan antages normalfordelte. Det nemmeste er at undersøge forudsætningen om
normalfordelte populationerPopulationen er den store mængde, vi ønsker at udtale os om. Fx alle
iphone brugere i København, alle kontohavere i Danske Bank, alle danske
kvinder etc.
Vi bruger som redskab stikprøver som er en lille del af populationen
til at udtale os om populationen, da det er billigere end at undersøge
hele populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde,
kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så
alle danske mænd.
Klik her for at
lære mere om populationen!
, ved at se på normalfraktildiagrammerneNormalfraktildiagrammer kan bruges til at afgøre, om en stikprøve kan
antages at stamme fra normalfordelt population.
Hvis punkterne ligger pænt omkring den rette linje er
normalitetsbetingelsen opfyldt. Ved test af fx. en mindre kvantitativ
stikprøve og varianshomogenitet forudsættes at variablene opfylder
normalitetsbetingelsen.
Klik her
for
at lære mere om normalfraktildiagrammer! for de 2 stikprøverEn stikprøve, er et udsnit af populationen (den store mængde vi ønsker at
udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi
stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele
populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde,
kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så
alle danske mænd.
Klik her for at
lære mere om stikprøver!
.
Hvis vi vil undersøge om der er signifikant forskel i middelværdierne, skal vi tjekke at
begge stikprøverEn stikprøve, er et udsnit af populationen (den store mængde vi ønsker at
udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi
stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele
populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde,
kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så
alle danske mænd.
Klik her for at
lære mere om stikprøver!
stammer fra normalfordelingerNormalfordelingen er en symmetrisk, klokkeformet fordeling.
Mange fænomener er normalfordelte fx. nedbørsmængder, højde,
stikprøvefordelingen etc.
Normalfordelingen bestemmes entydigt ud fra middelværdien μ og
standardafvigelsen σ
Normalfordelte stokastiske variable har mange gode egenskaber, addition af
og multiplikation med en faktor giver igen normalfordelte stokastiske
variable.
Danskernes højde er fx. normalfordelt med middelværdi μ = 180,2 cm. og
standardafvigelse σ = 7,42
Klik her for at
lære mere om normalfordelingen!, da dette er en forudsætning for at vi kan teste korrekt for
varianshomogenitetVarianshomogenitet betyder der er ens varianser for populationerne.
Hvis fx. vi har 2 stikprøver med højder for CBS og Cphbusiness
studerende, vil varianshomogenitet betyde, at der er samme variation i
de 2 populationer.
Testet kunne se ud som nedenfor, bemærk er der varianshomogenitet, er
standardafvigelserne også altid ens.
H0: σCBS=σCph (Der er
Varianshomogenitet)
H1: σCBS≠σCph (Der er ikke
varianshomogenitet)
Klik her
for
at lære mere om varianshomogenitet!. Vi kan til dette benytte normalfraktildiagrammerNormalfraktildiagrammer kan bruges til at afgøre, om en stikprøve kan
antages at stamme fra normalfordelt population.
Hvis punkterne ligger pænt omkring den rette linje er
normalitetsbetingelsen opfyldt. Ved test af fx. en mindre kvantitativ
stikprøve og varianshomogenitet forudsættes at variablene opfylder
normalitetsbetingelsen.
Klik her
for
at lære mere om normalfraktildiagrammer! for de 2 stikprøverEn stikprøve, er et udsnit af populationen (den store mængde vi ønsker at
udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi
stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele
populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde,
kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så
alle danske mænd.
Klik her for at
lære mere om stikprøver!
vi har indsamlet.
I Freestat genereres normalfraktildiagrammerNormalfraktildiagrammer kan bruges til at afgøre, om en stikprøve kan
antages at stamme fra normalfordelt population.
Hvis punkterne ligger pænt omkring den rette linje er
normalitetsbetingelsen opfyldt. Ved test af fx. en mindre kvantitativ
stikprøve og varianshomogenitet forudsættes at variablene opfylder
normalitetsbetingelsen.
Klik her
for
at lære mere om normalfraktildiagrammer! direkte for en stikprøveEn stikprøve, er et udsnit af populationen (den store mængde vi ønsker at
udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi
stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele
populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde,
kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så
alle danske mænd.
Klik her for at
lære mere om stikprøver!
, når data indsættes i
første fane Middelværdi standardafvigelse. Bemærk vi skal indsætte de 2 stikprøverEn stikprøve, er et udsnit af populationen (den store mængde vi ønsker at
udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi
stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele
populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde,
kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så
alle danske mænd.
Klik her for at
lære mere om stikprøver!
særskilt således vi får 2
normalfraktildiagrammerNormalfraktildiagrammer kan bruges til at afgøre, om en stikprøve kan
antages at stamme fra normalfordelt population.
Hvis punkterne ligger pænt omkring den rette linje er
normalitetsbetingelsen opfyldt. Ved test af fx. en mindre kvantitativ
stikprøve og varianshomogenitet forudsættes at variablene opfylder
normalitetsbetingelsen.
Klik her
for
at lære mere om normalfraktildiagrammer!, som vist herunder.
Eksempel på normalfraktildiagram dannet i FREESTAT for stikprøve 1
Eksempel på normalfraktildiagram dannet i FREESTAT for stikprøve 2
Her vil det ofte være lidt af en skønssag at vurdere om stikprøverneEn stikprøve, er et udsnit af populationen (den store mængde vi ønsker at
udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi
stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele
populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde,
kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så
alle danske mænd.
Klik her for at
lære mere om stikprøver!
stammer fra normalfordelte
populationerPopulationen er den store mængde, vi ønsker at udtale os om. Fx alle
iphone brugere i København, alle kontohavere i Danske Bank, alle danske
kvinder etc.
Vi bruger som redskab stikprøver som er en lille del af populationen
til at udtale os om populationen, da det er billigere end at undersøge
hele populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde,
kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så
alle danske mænd.
Klik her for at
lære mere om populationen!
, bemærk små afvigelser fra linjen vil ved mindre stikprøverEn stikprøve, er et udsnit af populationen (den store mængde vi ønsker at
udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi
stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele
populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde,
kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så
alle danske mænd.
Klik her for at
lære mere om stikprøver!
, virke voldsommere end ved større
stikprøverEn stikprøve, er et udsnit af populationen (den store mængde vi ønsker at
udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi
stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele
populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde,
kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så
alle danske mænd.
Klik her for at
lære mere om stikprøver!
, da vi jo har “zoomet” ind i normalfraktildiagrammetNormalfraktildiagrammer kan bruges til at afgøre, om en stikprøve kan
antages at stamme fra normalfordelt population.
Hvis punkterne ligger pænt omkring den rette linje er
normalitetsbetingelsen opfyldt. Ved test af fx. en mindre kvantitativ
stikprøve og varianshomogenitet forudsættes at variablene opfylder
normalitetsbetingelsen.
Klik her
for
at lære mere om normalfraktildiagrammer!. I dette eksempel kan vi godt konkludere,
at data i stikprøveEn stikprøve, er et udsnit af populationen (den store mængde vi ønsker at
udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi
stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele
populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde,
kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så
alle danske mænd.
Klik her for at
lære mere om stikprøver!
1 stammer fra en normalfordelt populationPopulationen er den store mængde, vi ønsker at udtale os om. Fx alle
iphone brugere i København, alle kontohavere i Danske Bank, alle danske
kvinder etc.
Vi bruger som redskab stikprøver som er en lille del af populationen
til at udtale os om populationen, da det er billigere end at undersøge
hele populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde,
kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så
alle danske mænd.
Klik her for at
lære mere om populationen!
. NormalfraktildiagrammetNormalfraktildiagrammer kan bruges til at afgøre, om en stikprøve kan
antages at stamme fra normalfordelt population.
Hvis punkterne ligger pænt omkring den rette linje er
normalitetsbetingelsen opfyldt. Ved test af fx. en mindre kvantitativ
stikprøve og varianshomogenitet forudsættes at variablene opfylder
normalitetsbetingelsen.
Klik her
for
at lære mere om normalfraktildiagrammer! for stikprøveEn stikprøve, er et udsnit af populationen (den store mængde vi ønsker at
udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi
stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele
populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde,
kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så
alle danske mænd.
Klik her for at
lære mere om stikprøver!
2 er ikke så
pænt; konkluderer man, at fordelingen ikke er normal, gør man opmærksom på, at forudsætningen ikke er opfyldt, samt at
dette kan give problemer med kvaliteten af analysen, men gennemfører fortsat analysen med forbeholdet.
Afvigelser i enderne tillades i højere grad end afvigelser omkring midten af diagrammet.
Sammenligning af 2 middelværdier ens varians Pooled t-test
Hvis vi har 2 stikprøverEn stikprøve, er et udsnit af populationen (den store mængde vi ønsker at
udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi
stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele
populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde,
kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så
alle danske mænd.
Klik her for at
lære mere om stikprøver!
og ønsker at sammenligne middelværdierne kan vi benytte en pooled t-testPooled t-test benyttes til test af gennemsnit for 2 kvantitative variable,
når populationerne har samme varians (varianshomogenitet).
Eksempler på stikprøver, hvor middelværdierne kan testes vha. pooled
t-test kunne være:
For 2 stikprøver med højder for CBS og SDU studerende, kan man teste om
gennemsnitshøjden for CBS og SDU studerende er ens med pooled t-test,
hvis der er varianshomogenitet.
For 2 stikprøver med med salgspriser for ejendomme i 2 byer, kan man
teste om gennemsnitsprisen er højere for den ene by med pooled t-test,
hvis der er varianshomogenitet.
Har de 2 populationer ikke ens varianser, kan man i stedet benytte et
unpooled t-test, pooled t-test er dog det mest præcise.
Klik her for at
lære mere om pooled t-test!, hvis de 2
populationerPopulationen er den store mængde, vi ønsker at udtale os om. Fx alle
iphone brugere i København, alle kontohavere i Danske Bank, alle danske
kvinder etc.
Vi bruger som redskab stikprøver som er en lille del af populationen
til at udtale os om populationen, da det er billigere end at undersøge
hele populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde,
kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så
alle danske mænd.
Klik her for at
lære mere om populationen!
har samme standardafvigelse.
Man kan undersøge om stikprøvernesEn stikprøve, er et udsnit af populationen (den store mængde vi ønsker at
udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi
stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele
populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde,
kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så
alle danske mænd.
Klik her for at
lære mere om stikprøver!
varianser er homogene, dette gøres ved en test af om standardafvigelserne er
ens:
Hvilket er det samme som at teste om varianserne er ens:
$$H_{0}:\sigma_{1}^{2}=\sigma_{2}^{2}$$ $$H_{1}:\sigma_{1}^{2}\neq\sigma_{2}^{2}$$For at konkludere om nulhypotesenNulhypotesen H0 er vores grundtro i et hypotesetest, vi har
altid lighedstegn i nulhypotesen. Der skal stærke beviser til at forkaste
nulhypotesen.
Eksempler på nulhypoteser er:
H0: μ=45 (Middelværdien er 45)
H0: μ≤45 (Middelværdien er højst 45)
H0: μ≥45 (Middelværdien er mindst 45)
Klik her for at lære mere om
hypotesetests! skal forkastes, bestemmes signifikanssandsynlighedenSignifikanssandsynligheden også kaldet p-værdien er et tal mellem 0 og 1,
den angiver sandsynligheden for, hvis nulhypotesen er sand, at få en mere
ekstrem teststørrelse, end den vi har fået i testet (teststørrelsen måler
forskellen mellem fx. stikprøvegennemsnit og middelværdien antaget i
nulhypotesen).
Jo lavere p-værdi, des mindre tror vi på nulhypotesen
Antag fx. at vi har en stikprøve af 100 mænds højde, med et gennemsnit
på 176,32 cm.
Vi ønsker at teste om middel højden i populationen, kan antages at være
210 cm dvs.
H0: μ=210
H1: μ≠210
Vi vil her få en meget negativ teststørrelse, hvilket giver en
mikroskopisk lille p-værdi.
Det vil være nærmest umuligt at få en
mere ekstrem teststørrelse, hvis den sande middelhøjde er 210 cm.
Klik her
for at lære mere om signifikanssandsynligheder! vha. et
F-test. Man kan fx forestille sig en bank ønsker at undersøge om mænd og kvinder, har samme indestående på deres
lønkonti. Her kan man, hvis varianserne er ens (de vil normalt ikke være kendte), benytte en pooled t-testPooled t-test benyttes til test af gennemsnit for 2 kvantitative variable,
når populationerne har samme varians (varianshomogenitet).
Eksempler på stikprøver, hvor middelværdierne kan testes vha. pooled
t-test kunne være:
For 2 stikprøver med højder for CBS og SDU studerende, kan man teste om
gennemsnitshøjden for CBS og SDU studerende er ens med pooled t-test,
hvis der er varianshomogenitet.
For 2 stikprøver med med salgspriser for ejendomme i 2 byer, kan man
teste om gennemsnitsprisen er højere for den ene by med pooled t-test,
hvis der er varianshomogenitet.
Har de 2 populationer ikke ens varianser, kan man i stedet benytte et
unpooled t-test, pooled t-test er dog det mest præcise.
Klik her for at
lære mere om pooled t-test!. Vi går
her ikke i detaljer, med formlerne til beregning af teststørrelsenTeststørrelsen kan populært forklares, som forskellen mellem observeret i
stikprøven og forventet under nulhypotesen.
Teststørrelsen er et udtryk for forskellen mellem fx. gennemsnit, andel
eller antal i stikprøven i forhold til påstanden i nulhypotesen
H0.
Teststørrelsen korrigerer for stikprøvestørrelse og standardafvigelse, men
beregnes forskelligt afhængigt af hvilket test der udføres.
Testes fx. middelværdi μ eller eller hældning i lineær regression β,
benyttes t-teststørrelsen
Testes andele kan fx. z-teststørrelsen benyttes
Antag fx. at vi har
en stikprøve af 100 mænds højde, med et gennemsnit på 176,32 cm.
Vi ønsker at teste om middel højden i populationen, kan antages at være
210 cm dvs.
H0: μ=210
H1: μ≠210
Vi vil her få en meget negativ teststørrelse, 176,32-210 divideret med
standardfejlen for middelværdien SEM
Ønskede at teste om middel højden i populationen, kunne antages at være
150 cm ud fra samme stikprøve ville vi få en meget positiv
teststørrelse, 176,32-150 divideret med standardfejlen for middelværdien
SEM
Klik her
for at lære mere om teststørrelser!, software regner dette ud for os.
Man skal ligesom ved små stikprøverEn stikprøve, er et udsnit af populationen (den store mængde vi ønsker at
udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi
stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele
populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde,
kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så
alle danske mænd.
Klik her for at
lære mere om stikprøver!
i test af en middelværdi, sikre sig normalitet i populationenPopulationen er den store mængde, vi ønsker at udtale os om. Fx alle
iphone brugere i København, alle kontohavere i Danske Bank, alle danske
kvinder etc.
Vi bruger som redskab stikprøver som er en lille del af populationen
til at udtale os om populationen, da det er billigere end at undersøge
hele populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde,
kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så
alle danske mænd.
Klik her for at
lære mere om populationen!
. Dette
kan på samme måde gøres visuelt i et normalfraktildiagramNormalfraktildiagrammer kan bruges til at afgøre, om en stikprøve kan
antages at stamme fra normalfordelt population.
Hvis punkterne ligger pænt omkring den rette linje er
normalitetsbetingelsen opfyldt. Ved test af fx. en mindre kvantitativ
stikprøve og varianshomogenitet forudsættes at variablene opfylder
normalitetsbetingelsen.
Klik her
for
at lære mere om normalfraktildiagrammer! for de 2 stikprøverEn stikprøve, er et udsnit af populationen (den store mængde vi ønsker at
udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi
stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele
populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde,
kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så
alle danske mænd.
Klik her for at
lære mere om stikprøver!
.
Eksempel Statistik karakterer
Hent Datasættet statistik karakterer til videoen ovenfor
Vi kunne være interesseret i, at teste om kvinder får højere karakterer end mænd. Der er 29
kvinder og 25 mænd i stikprøvenEn stikprøve, er et udsnit af populationen (den store mængde vi ønsker at
udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi
stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele
populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde,
kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så
alle danske mænd.
Klik her for at
lære mere om stikprøver!
. Da begge stikprøverEn stikprøve, er et udsnit af populationen (den store mængde vi ønsker at
udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi
stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele
populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde,
kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så
alle danske mænd.
Klik her for at
lære mere om stikprøver!
er mindre end 30, skal vi undersøge om
stikprøvenEn stikprøve, er et udsnit af populationen (den store mængde vi ønsker at
udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi
stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele
populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde,
kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så
alle danske mænd.
Klik her for at
lære mere om stikprøver!
kan antages at stamme fra en normalfordelt populationPopulationen er den store mængde, vi ønsker at udtale os om. Fx alle
iphone brugere i København, alle kontohavere i Danske Bank, alle danske
kvinder etc.
Vi bruger som redskab stikprøver som er en lille del af populationen
til at udtale os om populationen, da det er billigere end at undersøge
hele populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde,
kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så
alle danske mænd.
Klik her for at
lære mere om populationen!
. Dette efterprøves i 2
normalfraktildiagrammerNormalfraktildiagrammer kan bruges til at afgøre, om en stikprøve kan
antages at stamme fra normalfordelt population.
Hvis punkterne ligger pænt omkring den rette linje er
normalitetsbetingelsen opfyldt. Ved test af fx. en mindre kvantitativ
stikprøve og varianshomogenitet forudsættes at variablene opfylder
normalitetsbetingelsen.
Klik her
for
at lære mere om normalfraktildiagrammer!. I Freestat kan man enkeltvis paste begge fordelinger ind i en kvantitativ
stikprøveEn stikprøve, er et udsnit af populationen (den store mængde vi ønsker at
udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi
stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele
populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde,
kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så
alle danske mænd.
Klik her for at
lære mere om stikprøver!
, og indsætte de 2 normalfraktildiagrammerNormalfraktildiagrammer kan bruges til at afgøre, om en stikprøve kan
antages at stamme fra normalfordelt population.
Hvis punkterne ligger pænt omkring den rette linje er
normalitetsbetingelsen opfyldt. Ved test af fx. en mindre kvantitativ
stikprøve og varianshomogenitet forudsættes at variablene opfylder
normalitetsbetingelsen.
Klik her
for
at lære mere om normalfraktildiagrammer!, nedenfor er indsat Freestat
normalfraktildiagrammetNormalfraktildiagrammer kan bruges til at afgøre, om en stikprøve kan
antages at stamme fra normalfordelt population.
Hvis punkterne ligger pænt omkring den rette linje er
normalitetsbetingelsen opfyldt. Ved test af fx. en mindre kvantitativ
stikprøve og varianshomogenitet forudsættes at variablene opfylder
normalitetsbetingelsen.
Klik her
for
at lære mere om normalfraktildiagrammer! for kvinder.
Herunder er indsat Freestat normalfraktildiagrammetNormalfraktildiagrammer kan bruges til at afgøre, om en stikprøve kan
antages at stamme fra normalfordelt population.
Hvis punkterne ligger pænt omkring den rette linje er
normalitetsbetingelsen opfyldt. Ved test af fx. en mindre kvantitativ
stikprøve og varianshomogenitet forudsættes at variablene opfylder
normalitetsbetingelsen.
Klik her
for
at lære mere om normalfraktildiagrammer! for mænd.
Vi har nok på forhånd en formodning om, at statistik karakterer generelt følger en bimodal fordeling, enten får man
en lav eller høj karakter. Man kan godt ane denne tendens, da vi kan se data ikke ligger helt pænt omkring den rette
linje. Bemærk observationerne, illustreret ved punkter, ligger på rette linjer. Dette skyldes, at vi jo har hele
karakterer. Vi konstaterer der synes at være problemer med normaliteten af populationernePopulationen er den store mængde, vi ønsker at udtale os om. Fx alle
iphone brugere i København, alle kontohavere i Danske Bank, alle danske
kvinder etc.
Vi bruger som redskab stikprøver som er en lille del af populationen
til at udtale os om populationen, da det er billigere end at undersøge
hele populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde,
kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så
alle danske mænd.
Klik her for at
lære mere om populationen!
, og dermed kvaliteten,
præcisionen i analysen. Vi går imidlertid her videre med en pooled t-testPooled t-test benyttes til test af gennemsnit for 2 kvantitative variable,
når populationerne har samme varians (varianshomogenitet).
Eksempler på stikprøver, hvor middelværdierne kan testes vha. pooled
t-test kunne være:
For 2 stikprøver med højder for CBS og SDU studerende, kan man teste om
gennemsnitshøjden for CBS og SDU studerende er ens med pooled t-test,
hvis der er varianshomogenitet.
For 2 stikprøver med med salgspriser for ejendomme i 2 byer, kan man
teste om gennemsnitsprisen er højere for den ene by med pooled t-test,
hvis der er varianshomogenitet.
Har de 2 populationer ikke ens varianser, kan man i stedet benytte et
unpooled t-test, pooled t-test er dog det mest præcise.
Klik her for at
lære mere om pooled t-test!, hvis varianserne for mænd og
kvinder er ens, ellers skal vi benytte en unpooled t-testUnpooled t-test benyttes til test af gennemsnit for 2 kvantitative
variable, når populationerne ikke har samme varians (der er ikke
varianshomogenitet).
Eksempler på stikprøver, hvor middelværdierne kan testes vha. unpooled
t-test kunne være:
For 2 stikprøver med højder for CBS og SDU studerende, kan man teste om
gennemsnitshøjden for CBS og SDU studerende er ens med unpooled t-test,
hvis der ikke er varianshomogenitet.
For 2 stikprøver med med salgspriser for ejendomme i 2 byer, kan man
teste om gennemsnitsprisen er højere for den ene by med unpooled t-test,
hvis der ikke er varianshomogenitet.
Har de 2 populationer ens varianser, kan man i stedet benytte et pooled
t-test, hvilket er mere præcist.
Klik her for at
lære mere om unpooled t-test!.
Vi konstaterer at signifikanssandsynlighedenSignifikanssandsynligheden også kaldet p-værdien er et tal mellem 0 og 1,
den angiver sandsynligheden for, hvis nulhypotesen er sand, at få en mere
ekstrem teststørrelse, end den vi har fået i testet (teststørrelsen måler
forskellen mellem fx. stikprøvegennemsnit og middelværdien antaget i
nulhypotesen).
Jo lavere p-værdi, des mindre tror vi på nulhypotesen
Antag fx. at vi har en stikprøve af 100 mænds højde, med et gennemsnit
på 176,32 cm.
Vi ønsker at teste om middel højden i populationen, kan antages at være
210 cm dvs.
H0: μ=210
H1: μ≠210
Vi vil her få en meget negativ teststørrelse, hvilket giver en
mikroskopisk lille p-værdi.
Det vil være nærmest umuligt at få en
mere ekstrem teststørrelse, hvis den sande middelhøjde er 210 cm.
Klik her
for at lære mere om signifikanssandsynligheder! er 0,8656, hvilket direkte kan aflæses i nedenstående
Freestat output. Vi kan altså ikke forkaste nulhypotesenNulhypotesen H0 er vores grundtro i et hypotesetest, vi har
altid lighedstegn i nulhypotesen. Der skal stærke beviser til at forkaste
nulhypotesen.
Eksempler på nulhypoteser er:
H0: μ=45 (Middelværdien er 45)
H0: μ≤45 (Middelværdien er højst 45)
H0: μ≥45 (Middelværdien er mindst 45)
Klik her for at lære mere om
hypotesetests! og konstaterer at varianserne er ens, og det er
derfor korrekt at anvende pooled t-testPooled t-test benyttes til test af gennemsnit for 2 kvantitative variable,
når populationerne har samme varians (varianshomogenitet).
Eksempler på stikprøver, hvor middelværdierne kan testes vha. pooled
t-test kunne være:
For 2 stikprøver med højder for CBS og SDU studerende, kan man teste om
gennemsnitshøjden for CBS og SDU studerende er ens med pooled t-test,
hvis der er varianshomogenitet.
For 2 stikprøver med med salgspriser for ejendomme i 2 byer, kan man
teste om gennemsnitsprisen er højere for den ene by med pooled t-test,
hvis der er varianshomogenitet.
Har de 2 populationer ikke ens varianser, kan man i stedet benytte et
unpooled t-test, pooled t-test er dog det mest præcise.
Klik her for at
lære mere om pooled t-test! til at undersøge om kvinders karakterer er højere end mænds. Når vi tester
to middelværdier undersøger vi, om forskel mellem middelværdierne er forskellig fra 0. Vi får en t-teststørrelseTeststørrelsen kan populært forklares, som forskellen mellem observeret i
stikprøven og forventet under nulhypotesen.
Teststørrelsen er et udtryk for forskellen mellem fx. gennemsnit, andel
eller antal i stikprøven i forhold til påstanden i nulhypotesen
H0.
Teststørrelsen korrigerer for stikprøvestørrelse og standardafvigelse, men
beregnes forskelligt afhængigt af hvilket test der udføres.
Testes fx. middelværdi μ eller eller hældning i lineær regression β,
benyttes t-teststørrelsen
Testes andele kan fx. z-teststørrelsen benyttes
Antag fx. at vi har
en stikprøve af 100 mænds højde, med et gennemsnit på 176,32 cm.
Vi ønsker at teste om middel højden i populationen, kan antages at være
210 cm dvs.
H0: μ=210
H1: μ≠210
Vi vil her få en meget negativ teststørrelse, 176,32-210 divideret med
standardfejlen for middelværdien SEM
Ønskede at teste om middel højden i populationen, kunne antages at være
150 cm ud fra samme stikprøve ville vi få en meget positiv
teststørrelse, 176,32-150 divideret med standardfejlen for middelværdien
SEM
Klik her
for at lære mere om teststørrelser! jo
større denne numerisk er jo større er forskellen mellem middelværdierne. En numerisk stor t-teststørrelseTeststørrelsen kan populært forklares, som forskellen mellem observeret i
stikprøven og forventet under nulhypotesen.
Teststørrelsen er et udtryk for forskellen mellem fx. gennemsnit, andel
eller antal i stikprøven i forhold til påstanden i nulhypotesen
H0.
Teststørrelsen korrigerer for stikprøvestørrelse og standardafvigelse, men
beregnes forskelligt afhængigt af hvilket test der udføres.
Testes fx. middelværdi μ eller eller hældning i lineær regression β,
benyttes t-teststørrelsen
Testes andele kan fx. z-teststørrelsen benyttes
Antag fx. at vi har
en stikprøve af 100 mænds højde, med et gennemsnit på 176,32 cm.
Vi ønsker at teste om middel højden i populationen, kan antages at være
210 cm dvs.
H0: μ=210
H1: μ≠210
Vi vil her få en meget negativ teststørrelse, 176,32-210 divideret med
standardfejlen for middelværdien SEM
Ønskede at teste om middel højden i populationen, kunne antages at være
150 cm ud fra samme stikprøve ville vi få en meget positiv
teststørrelse, 176,32-150 divideret med standardfejlen for middelværdien
SEM
Klik her
for at lære mere om teststørrelser! udtrykker
altså stor forskel. Hypoteserne bliver:
Hvilket vi også kan skrive som:
$$H_{0}:\mu_{kvinder}-\mu_{mænd}\leq0$$ $$H_{1}:\mu_{kvinder}-\mu_{mænd}>0$$Vi får en teststørrelseTeststørrelsen kan populært forklares, som forskellen mellem observeret i
stikprøven og forventet under nulhypotesen.
Teststørrelsen er et udtryk for forskellen mellem fx. gennemsnit, andel
eller antal i stikprøven i forhold til påstanden i nulhypotesen
H0.
Teststørrelsen korrigerer for stikprøvestørrelse og standardafvigelse, men
beregnes forskelligt afhængigt af hvilket test der udføres.
Testes fx. middelværdi μ eller eller hældning i lineær regression β,
benyttes t-teststørrelsen
Testes andele kan fx. z-teststørrelsen benyttes
Antag fx. at vi har
en stikprøve af 100 mænds højde, med et gennemsnit på 176,32 cm.
Vi ønsker at teste om middel højden i populationen, kan antages at være
210 cm dvs.
H0: μ=210
H1: μ≠210
Vi vil her få en meget negativ teststørrelse, 176,32-210 divideret med
standardfejlen for middelværdien SEM
Ønskede at teste om middel højden i populationen, kunne antages at være
150 cm ud fra samme stikprøve ville vi få en meget positiv
teststørrelse, 176,32-150 divideret med standardfejlen for middelværdien
SEM
Klik her
for at lære mere om teststørrelser! på 0.536, denne medfører en p-værdip-værdien også kaldet signifikanssandsynligheden er et tal mellem 0 og 1,
den angiver sandsynligheden for, hvis nulhypotesen er sand, at få en mere
ekstrem teststørrelse, end den vi har fået i testet (teststørrelsen måler
forskellen mellem fx. stikprøvegennemsnit og middelværdien antaget i
nulhypotesen).
Jo lavere p-værdi, des mindre tror vi på nulhypotesen
Antag fx. at vi har en stikprøve af 100 mænds højde, med et gennemsnit
på 176,32 cm.
Vi ønsker at teste om middel højden i populationen, kan antages at være
210 cm dvs.
H0: μ=210
H1: μ≠210
Vi vil her få en meget negativ teststørrelse, hvilket giver en
mikroskopisk lille p-værdi.
Det vil være nærmest umuligt at få en mere ekstrem teststørrelse, hvis
den sande middelhøjde er 210 cm.
Klik her
for at lære mere om p-værdier! på 29,71%. Vi kan ikke forkaste
nulhypotesenNulhypotesen H0 er vores grundtro i et hypotesetest, vi har
altid lighedstegn i nulhypotesen. Der skal stærke beviser til at forkaste
nulhypotesen.
Eksempler på nulhypoteser er:
H0: μ=45 (Middelværdien er 45)
H0: μ≤45 (Middelværdien er højst 45)
H0: μ≥45 (Middelværdien er mindst 45)
Klik her for at lære mere om
hypotesetests!.
Vi kan altså ikke konkludere, at kvinder får en højere karakter end mænd.
Bemærk i Freestat, står der D for difference, dette skyldes man kan undersøge om en forskel mellem middelværdier kan være fx. 0,25, ved at sætte D, i det gule felt til 0,25.
Sammenligning af 2 middelværdier uens varians Unpooled t-test
Skal vi undersøge 2 kvantitative stikprøverEn stikprøve, er et udsnit af populationen (den store mængde vi ønsker at
udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi
stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele
populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde,
kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så
alle danske mænd.
Klik her for at
lære mere om stikprøver!
, der stammer fra populationerPopulationen er den store mængde, vi ønsker at udtale os om. Fx alle
iphone brugere i København, alle kontohavere i Danske Bank, alle danske
kvinder etc.
Vi bruger som redskab stikprøver som er en lille del af populationen
til at udtale os om populationen, da det er billigere end at undersøge
hele populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde,
kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så
alle danske mænd.
Klik her for at
lære mere om populationen!
med uens varians, benytter vi
unpooled t-testUnpooled t-test benyttes til test af gennemsnit for 2 kvantitative
variable, når populationerne ikke har samme varians (der er ikke
varianshomogenitet).
Eksempler på stikprøver, hvor middelværdierne kan testes vha. unpooled
t-test kunne være:
For 2 stikprøver med højder for CBS og SDU studerende, kan man teste om
gennemsnitshøjden for CBS og SDU studerende er ens med unpooled t-test,
hvis der ikke er varianshomogenitet.
For 2 stikprøver med med salgspriser for ejendomme i 2 byer, kan man
teste om gennemsnitsprisen er højere for den ene by med unpooled t-test,
hvis der ikke er varianshomogenitet.
Har de 2 populationer ens varianser, kan man i stedet benytte et pooled
t-test, hvilket er mere præcist.
Klik her for at
lære mere om unpooled t-test!. Det er samme fremgangsmåde som ved pooled t-testPooled t-test benyttes til test af gennemsnit for 2 kvantitative variable,
når populationerne har samme varians (varianshomogenitet).
Eksempler på stikprøver, hvor middelværdierne kan testes vha. pooled
t-test kunne være:
For 2 stikprøver med højder for CBS og SDU studerende, kan man teste om
gennemsnitshøjden for CBS og SDU studerende er ens med pooled t-test,
hvis der er varianshomogenitet.
For 2 stikprøver med med salgspriser for ejendomme i 2 byer, kan man
teste om gennemsnitsprisen er højere for den ene by med pooled t-test,
hvis der er varianshomogenitet.
Har de 2 populationer ikke ens varianser, kan man i stedet benytte et
unpooled t-test, pooled t-test er dog det mest præcise.
Klik her for at
lære mere om pooled t-test!, men unpooled testen er ikke så præcis som pooled.
Derfor starter vi i pooled t-testPooled t-test benyttes til test af gennemsnit for 2 kvantitative variable,
når populationerne har samme varians (varianshomogenitet).
Eksempler på stikprøver, hvor middelværdierne kan testes vha. pooled
t-test kunne være:
For 2 stikprøver med højder for CBS og SDU studerende, kan man teste om
gennemsnitshøjden for CBS og SDU studerende er ens med pooled t-test,
hvis der er varianshomogenitet.
For 2 stikprøver med med salgspriser for ejendomme i 2 byer, kan man
teste om gennemsnitsprisen er højere for den ene by med pooled t-test,
hvis der er varianshomogenitet.
Har de 2 populationer ikke ens varianser, kan man i stedet benytte et
unpooled t-test, pooled t-test er dog det mest præcise.
Klik her for at
lære mere om pooled t-test! og gennemfører kun unpooled t-testUnpooled t-test benyttes til test af gennemsnit for 2 kvantitative
variable, når populationerne ikke har samme varians (der er ikke
varianshomogenitet).
Eksempler på stikprøver, hvor middelværdierne kan testes vha. unpooled
t-test kunne være:
For 2 stikprøver med højder for CBS og SDU studerende, kan man teste om
gennemsnitshøjden for CBS og SDU studerende er ens med unpooled t-test,
hvis der ikke er varianshomogenitet.
For 2 stikprøver med med salgspriser for ejendomme i 2 byer, kan man
teste om gennemsnitsprisen er højere for den ene by med unpooled t-test,
hvis der ikke er varianshomogenitet.
Har de 2 populationer ens varianser, kan man i stedet benytte et pooled
t-test, hvilket er mere præcist.
Klik her for at
lære mere om unpooled t-test! hvis varianserne ikke er ens.
Eksempel US Crime
Hent Datasættet US Crime her
I datasættet US Crime er de beregnede rater pr. 100.000 borgere fordelt på stat. arresteret for hhv. mord overfald og voldtægt. Ydermere er angivet graden af urbanisering, højere betyder staten har større arealer med bymæssig bebyggelse. Observationssættet er baseret på en stor 1973 undersøgelse af 100.000 arrestationer. Mordraterne er illustreret på kortet nedenfor.
Lad os groft dele staterne i voldelige og ikke-voldelige stater, hvis der er 150 overfald/assaults eller derunder, betegner vi staten som ikke voldelig. Stater med mere end 150 overfald pr 100000 borgere betegnes som voldelige.
Er det gennemsnitlige antal mord pr. 100000 borgere lavere i ikke-voldelige stater?
For at besvare spørgsmålet er man nødt til at sortere data efter Assault og tage Murder med i sorteringen. Herefter
skal man dele Murder i de voldelige og ikke-voldelige grupper. Hvis det driller, kan man se, hvordan sorteringen skal
foretages. Vi får følgende hypotesetestEt hypotese test, tester en nulhypotese H0 (grundtroen), mod en
alternativ hypotese H1 (det modsatte udsagn af
nulhypotesen).
Man tester om nulhypotesen kan forkastes eller ikke forkastes.
Da nulhypotesen er udgangspunktet (grundtroen), skal der en del beviser
til, for at vi forkaster/afviser nulhypotesen.
Vi har 3 kategorier af
hypotese test, se eksemplerne herunder:
Hypotese test med to-sidet alternativ hypotese:
H0: μ=34
H1: μ≠34
Vi forkaster H0 både hvis μ er signifikant større eller
mindre end 34
Hypotese test med et-sidet alternativ hypotese opad:
H0: μ≤34
H1: μ>34
Vi forkaster kun H0 hvis μ er signifikant større end
34
Hypotese test med et-sidet alternativ hypotese nedad:
H0: μ≥34
H1: μ<34
Vi forkaster kun H0 hvis μ er signifikant mindre end
34
Klik
her for at lære mere om hypotese tests!:
Der er 21 ikke voldelige stater, og 27 voldelige stater. Vi skal altså huske at undersøge om stikprøverneEn stikprøve, er et udsnit af populationen (den store mængde vi ønsker at
udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi
stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele
populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde,
kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så
alle danske mænd.
Klik her for at
lære mere om stikprøver!
stammer
fra normalfordelte populationerPopulationen er den store mængde, vi ønsker at udtale os om. Fx alle
iphone brugere i København, alle kontohavere i Danske Bank, alle danske
kvinder etc.
Vi bruger som redskab stikprøver som er en lille del af populationen
til at udtale os om populationen, da det er billigere end at undersøge
hele populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde,
kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så
alle danske mænd.
Klik her for at
lære mere om populationen!
, normalfraktildiagrammerneNormalfraktildiagrammer kan bruges til at afgøre, om en stikprøve kan
antages at stamme fra normalfordelt population.
Hvis punkterne ligger pænt omkring den rette linje er
normalitetsbetingelsen opfyldt. Ved test af fx. en mindre kvantitativ
stikprøve og varianshomogenitet forudsættes at variablene opfylder
normalitetsbetingelsen.
Klik her
for
at lære mere om normalfraktildiagrammer! er her udeladt.
Vi skal også undersøge om der er varianshomogenitetVarianshomogenitet betyder der er ens varianser for populationerne.
Hvis fx. vi har 2 stikprøver med højder for CBS og Cphbusiness
studerende, vil varianshomogenitet betyde, at der er samme variation i
de 2 populationer.
Testet kunne se ud som nedenfor, bemærk er der varianshomogenitet, er
standardafvigelserne også altid ens.
H0: σCBS=σCph (Der er
Varianshomogenitet)
H1: σCBS≠σCph (Der er ikke
varianshomogenitet)
Klik her
for
at lære mere om varianshomogenitet!. Hvis vi tester varianshomogenitetVarianshomogenitet betyder der er ens varianser for populationerne.
Hvis fx. vi har 2 stikprøver med højder for CBS og Cphbusiness
studerende, vil varianshomogenitet betyde, at der er samme variation i
de 2 populationer.
Testet kunne se ud som nedenfor, bemærk er der varianshomogenitet, er
standardafvigelserne også altid ens.
H0: σCBS=σCph (Der er
Varianshomogenitet)
H1: σCBS≠σCph (Der er ikke
varianshomogenitet)
Klik her
for
at lære mere om varianshomogenitet! :
Konstaterer vi at på 5% signifikansniveauSignifikansniveauet α typisk 1%, 5% eller 10%, fastsættes inden et test og
sammenlignes med p-værdien.
Er p-værdien mindre end signifikansniveauet forkastes nulhypotesen, ellers
ikke.
Signifikansniveauet angiver sandsynligheden for at forkaste en sand
nulhypotese (en type 1 fejl også kaldet en falsk positiv)
Medicinal industrien arbejder ofte med 1% signifikansniveau, hvor et
test kunne være:
H0: Medicinen har ingen effekt
H1: Medicinen har effekt
Med 1% signifikansniveau, begås en type 1 fejl kun i et ud af 100
tests.
En type 1 fejl vil her betyde, at man fejlagtigt konkluderer at et
medicinal produkt uden effekt virker.
Signifikansniveauet kan bruges til at bestemme konfidensniveauet 1-α,
der angiver sandsynligheden for korrekt ikke at forkaste en sand
nulhypotese
Klik her
for at lære mere om signifikansniveauet!, ville vi konkludere at der er forskel på varianserne da
p-værdienp-værdien også kaldet signifikanssandsynligheden er et tal mellem 0 og 1,
den angiver sandsynligheden for, hvis nulhypotesen er sand, at få en mere
ekstrem teststørrelse, end den vi har fået i testet (teststørrelsen måler
forskellen mellem fx. stikprøvegennemsnit og middelværdien antaget i
nulhypotesen).
Jo lavere p-værdi, des mindre tror vi på nulhypotesen
Antag fx. at vi har en stikprøve af 100 mænds højde, med et gennemsnit
på 176,32 cm.
Vi ønsker at teste om middel højden i populationen, kan antages at være
210 cm dvs.
H0: μ=210
H1: μ≠210
Vi vil her få en meget negativ teststørrelse, hvilket giver en
mikroskopisk lille p-værdi.
Det vil være nærmest umuligt at få en mere ekstrem teststørrelse, hvis
den sande middelhøjde er 210 cm.
Klik her
for at lære mere om p-værdier! er 0,0303666. Konklusionen er dog niveaufølsom, men vi benytter pooled t-testPooled t-test benyttes til test af gennemsnit for 2 kvantitative variable,
når populationerne har samme varians (varianshomogenitet).
Eksempler på stikprøver, hvor middelværdierne kan testes vha. pooled
t-test kunne være:
For 2 stikprøver med højder for CBS og SDU studerende, kan man teste om
gennemsnitshøjden for CBS og SDU studerende er ens med pooled t-test,
hvis der er varianshomogenitet.
For 2 stikprøver med med salgspriser for ejendomme i 2 byer, kan man
teste om gennemsnitsprisen er højere for den ene by med pooled t-test,
hvis der er varianshomogenitet.
Har de 2 populationer ikke ens varianser, kan man i stedet benytte et
unpooled t-test, pooled t-test er dog det mest præcise.
Klik her for at
lære mere om pooled t-test! her.
Vor hypotesetestEt hypotese test, tester en nulhypotese H0 (grundtroen), mod en
alternativ hypotese H1 (det modsatte udsagn af
nulhypotesen).
Man tester om nulhypotesen kan forkastes eller ikke forkastes.
Da nulhypotesen er udgangspunktet (grundtroen), skal der en del beviser
til, for at vi forkaster/afviser nulhypotesen.
Vi har 3 kategorier af
hypotese test, se eksemplerne herunder:
Hypotese test med to-sidet alternativ hypotese:
H0: μ=34
H1: μ≠34
Vi forkaster H0 både hvis μ er signifikant større eller
mindre end 34
Hypotese test med et-sidet alternativ hypotese opad:
H0: μ≤34
H1: μ>34
Vi forkaster kun H0 hvis μ er signifikant større end
34
Hypotese test med et-sidet alternativ hypotese nedad:
H0: μ≥34
H1: μ<34
Vi forkaster kun H0 hvis μ er signifikant mindre end
34
Klik
her for at lære mere om hypotese tests! for middelværdierne bliver:
Vi finder stikprøvegennemsnitteneEn stikprøve, er et udsnit af populationen (den store mængde vi ønsker at
udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi
stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele
populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde,
kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så
alle danske mænd.
Klik her for at
lære mere om stikprøver!
. For mordrater i voldelige stater er stikprøvegennemsnittetEn stikprøve, er et udsnit af populationen (den store mængde vi ønsker at
udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi
stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele
populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde,
kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så
alle danske mænd.
Klik her for at
lære mere om stikprøver!
10,58, for ikke
voldelige stater er stikprøvegennemsnittetEn stikprøve, er et udsnit af populationen (den store mængde vi ønsker at
udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi
stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele
populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde,
kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så
alle danske mænd.
Klik her for at
lære mere om stikprøver!
4,21.
Nedenfor er Freestat output, testet for varianshomogenitetVarianshomogenitet betyder der er ens varianser for populationerne.
Hvis fx. vi har 2 stikprøver med højder for CBS og Cphbusiness
studerende, vil varianshomogenitet betyde, at der er samme variation i
de 2 populationer.
Testet kunne se ud som nedenfor, bemærk er der varianshomogenitet, er
standardafvigelserne også altid ens.
H0: σCBS=σCph (Der er
Varianshomogenitet)
H1: σCBS≠σCph (Der er ikke
varianshomogenitet)
Klik her
for
at lære mere om varianshomogenitet! i blå ramme, viser vi bør
benytte unpooled t-testUnpooled t-test benyttes til test af gennemsnit for 2 kvantitative
variable, når populationerne ikke har samme varians (der er ikke
varianshomogenitet).
Eksempler på stikprøver, hvor middelværdierne kan testes vha. unpooled
t-test kunne være:
For 2 stikprøver med højder for CBS og SDU studerende, kan man teste om
gennemsnitshøjden for CBS og SDU studerende er ens med unpooled t-test,
hvis der ikke er varianshomogenitet.
For 2 stikprøver med med salgspriser for ejendomme i 2 byer, kan man
teste om gennemsnitsprisen er højere for den ene by med unpooled t-test,
hvis der ikke er varianshomogenitet.
Har de 2 populationer ens varianser, kan man i stedet benytte et pooled
t-test, hvilket er mere præcist.
Klik her for at
lære mere om unpooled t-test!:
TeststørrelsenTeststørrelsen kan populært forklares, som forskellen mellem observeret i
stikprøven og forventet under nulhypotesen.
Teststørrelsen er et udtryk for forskellen mellem fx. gennemsnit, andel
eller antal i stikprøven i forhold til påstanden i nulhypotesen
H0.
Teststørrelsen korrigerer for stikprøvestørrelse og standardafvigelse, men
beregnes forskelligt afhængigt af hvilket test der udføres.
Testes fx. middelværdi μ eller eller hældning i lineær regression β,
benyttes t-teststørrelsen
Testes andele kan fx. z-teststørrelsen benyttes
Antag fx. at vi har
en stikprøve af 100 mænds højde, med et gennemsnit på 176,32 cm.
Vi ønsker at teste om middel højden i populationen, kan antages at være
210 cm dvs.
H0: μ=210
H1: μ≠210
Vi vil her få en meget negativ teststørrelse, 176,32-210 divideret med
standardfejlen for middelværdien SEM
Ønskede at teste om middel højden i populationen, kunne antages at være
150 cm ud fra samme stikprøve ville vi få en meget positiv
teststørrelse, 176,32-150 divideret med standardfejlen for middelværdien
SEM
Klik her
for at lære mere om teststørrelser! i pooled t-testenPooled t-test benyttes til test af gennemsnit for 2 kvantitative variable,
når populationerne har samme varians (varianshomogenitet).
Eksempler på stikprøver, hvor middelværdierne kan testes vha. pooled
t-test kunne være:
For 2 stikprøver med højder for CBS og SDU studerende, kan man teste om
gennemsnitshøjden for CBS og SDU studerende er ens med pooled t-test,
hvis der er varianshomogenitet.
For 2 stikprøver med med salgspriser for ejendomme i 2 byer, kan man
teste om gennemsnitsprisen er højere for den ene by med pooled t-test,
hvis der er varianshomogenitet.
Har de 2 populationer ikke ens varianser, kan man i stedet benytte et
unpooled t-test, pooled t-test er dog det mest præcise.
Klik her for at
lære mere om pooled t-test! ovenfor bliver stor 7,0706, der er altså meget stor forskel på mordraten.
Vi får tilsvarende nedenfor en unpooled teststørrelseTeststørrelsen kan populært forklares, som forskellen mellem observeret i
stikprøven og forventet under nulhypotesen.
Teststørrelsen er et udtryk for forskellen mellem fx. gennemsnit, andel
eller antal i stikprøven i forhold til påstanden i nulhypotesen
H0.
Teststørrelsen korrigerer for stikprøvestørrelse og standardafvigelse, men
beregnes forskelligt afhængigt af hvilket test der udføres.
Testes fx. middelværdi μ eller eller hældning i lineær regression β,
benyttes t-teststørrelsen
Testes andele kan fx. z-teststørrelsen benyttes
Antag fx. at vi har
en stikprøve af 100 mænds højde, med et gennemsnit på 176,32 cm.
Vi ønsker at teste om middel højden i populationen, kan antages at være
210 cm dvs.
H0: μ=210
H1: μ≠210
Vi vil her få en meget negativ teststørrelse, 176,32-210 divideret med
standardfejlen for middelværdien SEM
Ønskede at teste om middel højden i populationen, kunne antages at være
150 cm ud fra samme stikprøve ville vi få en meget positiv
teststørrelse, 176,32-150 divideret med standardfejlen for middelværdien
SEM
Klik her
for at lære mere om teststørrelser! på 7,4868. Begge teststørrelserTeststørrelsen kan populært forklares, som forskellen mellem observeret i
stikprøven og forventet under nulhypotesen.
Teststørrelsen er et udtryk for forskellen mellem fx. gennemsnit, andel
eller antal i stikprøven i forhold til påstanden i nulhypotesen
H0.
Teststørrelsen korrigerer for stikprøvestørrelse og standardafvigelse, men
beregnes forskelligt afhængigt af hvilket test der udføres.
Testes fx. middelværdi μ eller eller hældning i lineær regression β,
benyttes t-teststørrelsen
Testes andele kan fx. z-teststørrelsen benyttes
Antag fx. at vi har
en stikprøve af 100 mænds højde, med et gennemsnit på 176,32 cm.
Vi ønsker at teste om middel højden i populationen, kan antages at være
210 cm dvs.
H0: μ=210
H1: μ≠210
Vi vil her få en meget negativ teststørrelse, 176,32-210 divideret med
standardfejlen for middelværdien SEM
Ønskede at teste om middel højden i populationen, kunne antages at være
150 cm ud fra samme stikprøve ville vi få en meget positiv
teststørrelse, 176,32-150 divideret med standardfejlen for middelværdien
SEM
Klik her
for at lære mere om teststørrelser! er langt større end
2, hvilket giver os meget små p-værdierp-værdien også kaldet signifikanssandsynligheden er et tal mellem 0 og 1,
den angiver sandsynligheden for, hvis nulhypotesen er sand, at få en mere
ekstrem teststørrelse, end den vi har fået i testet (teststørrelsen måler
forskellen mellem fx. stikprøvegennemsnit og middelværdien antaget i
nulhypotesen).
Jo lavere p-værdi, des mindre tror vi på nulhypotesen
Antag fx. at vi har en stikprøve af 100 mænds højde, med et gennemsnit
på 176,32 cm.
Vi ønsker at teste om middel højden i populationen, kan antages at være
210 cm dvs.
H0: μ=210
H1: μ≠210
Vi vil her få en meget negativ teststørrelse, hvilket giver en
mikroskopisk lille p-værdi.
Det vil være nærmest umuligt at få en mere ekstrem teststørrelse, hvis
den sande middelhøjde er 210 cm.
Klik her
for at lære mere om p-værdier!, så vi vil med sikkerhed forkaste nulhypotesenNulhypotesen H0 er vores grundtro i et hypotesetest, vi har
altid lighedstegn i nulhypotesen. Der skal stærke beviser til at forkaste
nulhypotesen.
Eksempler på nulhypoteser er:
H0: μ=45 (Middelværdien er 45)
H0: μ≤45 (Middelværdien er højst 45)
H0: μ≥45 (Middelværdien er mindst 45)
Klik her for at lære mere om
hypotesetests! i begge analyser. I
unpooled testen bliver p-værdienp-værdien også kaldet signifikanssandsynligheden er et tal mellem 0 og 1,
den angiver sandsynligheden for, hvis nulhypotesen er sand, at få en mere
ekstrem teststørrelse, end den vi har fået i testet (teststørrelsen måler
forskellen mellem fx. stikprøvegennemsnit og middelværdien antaget i
nulhypotesen).
Jo lavere p-værdi, des mindre tror vi på nulhypotesen
Antag fx. at vi har en stikprøve af 100 mænds højde, med et gennemsnit
på 176,32 cm.
Vi ønsker at teste om middel højden i populationen, kan antages at være
210 cm dvs.
H0: μ=210
H1: μ≠210
Vi vil her få en meget negativ teststørrelse, hvilket giver en
mikroskopisk lille p-værdi.
Det vil være nærmest umuligt at få en mere ekstrem teststørrelse, hvis
den sande middelhøjde er 210 cm.
Klik her
for at lære mere om p-værdier! et meget lille tal, tæt på 0%, dette kan ses i nedenstående Freestat
output.
Output fra Freestat når vi benytter unpooled t-testUnpooled t-test benyttes til test af gennemsnit for 2 kvantitative
variable, når populationerne ikke har samme varians (der er ikke
varianshomogenitet).
Eksempler på stikprøver, hvor middelværdierne kan testes vha. unpooled
t-test kunne være:
For 2 stikprøver med højder for CBS og SDU studerende, kan man teste om
gennemsnitshøjden for CBS og SDU studerende er ens med unpooled t-test,
hvis der ikke er varianshomogenitet.
For 2 stikprøver med med salgspriser for ejendomme i 2 byer, kan man
teste om gennemsnitsprisen er højere for den ene by med unpooled t-test,
hvis der ikke er varianshomogenitet.
Har de 2 populationer ens varianser, kan man i stedet benytte et pooled
t-test, hvilket er mere præcist.
Klik her for at
lære mere om unpooled t-test! til analysen, ses herunder:
Parret t-test
Hent Datasættet 20 DK US aktier til videoen ovenfor
Hvis vi betragter en variabel før og efter en treatment, treatment kan fx. være en behandling med et medicinsk
produkt, det er vigtigt at vi betragter samme respondenter, før og efter treatment. I parret t-testParret t-test benyttes til test af gennemsnit for 2 kvantitative variable,
hvor hver observation er en måling af samme objekt.
Eksempler på stikprøver, hvor middelværdierne kan testes vha. parret
t-test kunne være:
De samme 68 rotters (samme objekter) blodtryk målt før og efter
medicinsk behandling.
Dagsafkastet for Danske Bank aktien og Nordea aktien på de samme 68
handelsdage (samme objekter).
Omsætningen for de samme 68 dagligvarebutikker (samme objekter) før og
efter en reklamekampagne.
Parret t-test har altid samme antal observationer, dette er ikke
nødvendigt for pooled og unpooled t-test.
Klik her for at
lære mere om parret t-test! vil der altid
være tale om samme størrelse af datasættene før og efter treatment, treatment kan også være tid. Hvis man
forestiller sig at en bank måler 40 kunders gennemsnitlige netbank besøgstid, før og efter en softwareopdatering,
hvis der her er tale om de samme kunder, kan vi bruge parret t-testParret t-test benyttes til test af gennemsnit for 2 kvantitative variable,
hvor hver observation er en måling af samme objekt.
Eksempler på stikprøver, hvor middelværdierne kan testes vha. parret
t-test kunne være:
De samme 68 rotters (samme objekter) blodtryk målt før og efter
medicinsk behandling.
Dagsafkastet for Danske Bank aktien og Nordea aktien på de samme 68
handelsdage (samme objekter).
Omsætningen for de samme 68 dagligvarebutikker (samme objekter) før og
efter en reklamekampagne.
Parret t-test har altid samme antal observationer, dette er ikke
nødvendigt for pooled og unpooled t-test.
Klik her for at
lære mere om parret t-test! her. I videoeksemplet betragtede vi 2 aktier på
samme handelsdage, her var objektet ikke en respondent, men derimod handelsdagen, her brugte vi også parret t-testParret t-test benyttes til test af gennemsnit for 2 kvantitative variable,
hvor hver observation er en måling af samme objekt.
Eksempler på stikprøver, hvor middelværdierne kan testes vha. parret
t-test kunne være:
De samme 68 rotters (samme objekter) blodtryk målt før og efter
medicinsk behandling.
Dagsafkastet for Danske Bank aktien og Nordea aktien på de samme 68
handelsdage (samme objekter).
Omsætningen for de samme 68 dagligvarebutikker (samme objekter) før og
efter en reklamekampagne.
Parret t-test har altid samme antal observationer, dette er ikke
nødvendigt for pooled og unpooled t-test.
Klik her for at
lære mere om parret t-test!.
Quiz
Selvtest
Spørgsmål
1. Bestem ved hjælp af konfidensintervaller for forskellen, om der er signifikant forskel på kvinder og mænds gennemsnitlige uddannelseslængde?
2. Bestem ved hjælp af konfidensintervaller for forskellen, om der er signifikant på ledelsens og administationens gennemsnitlige uddannelse i populationen?
Der er 216 kvinder, deres gennemsnitlige uddannelseslængde er 12,37, Der er 258 mænd, deres gennemsnitlige uddannelseslængde er 14,43
Vi kan med 95% sikkerhed sige at forskellen på mænds og kvinders gennemsnitlige uddannelse i populationen, ligger mellem 1,58 år og 2,54 år.
Vi kan med 99% sikkerhed sige at forskellen på mænds og kvinders gennemsnitlige uddannelse i populationen, ligger mellem 1,43 år og 2,69 år. Vi er altså ret sikre på, at der er forskel på uddannelseslængden for mænd og kvinder, da 0 ikke engang er indeholdt i 99% konfidensintervallet.
Havde vi i stedet benyttet pooled t-test havde vi nået samme konklusion, der er ikke meget forskel på grænserne:
Vi kan med 95% sikkerhed sige at forskellen på mænds og kvinders gennemsnitlige uddannelse i populationen, ligger mellem 1,57 år og 2,55 år.
Vi kan med 99% sikkerhed sige at forskellen på mænds og kvinders gennemsnitlige uddannelse i populationen, ligger mellem 1,42 år og 2,7 år. Vi er altså ret sikre på, at der er forskel på uddannelseslængden for mænd og kvinder, da 0 ikke engang er indeholdt i 99% konfidensintervallet.
2. Bemærk der er uens varianser, vi skal således benytte Unpooled t-test til at bestemme konfidensintervaller. Der er 363 personer i administrative stillinger, deres gennemsnitlige uddannelseslængde er 12,87, Der er 84 i ledelsen, deres gennemsnitlige uddannelseslængde er 17,25
Vi kan med 95% sikkerhed sige at forskellen på ledelsens og administrationens gennemsnitlige uddannelse i populationen, ligger mellem 3,96 år og 4,81 år.
Vi kan med 99% sikkerhed sige at forskellen på ledelsens og administrationens gennemsnitlige uddannelse i populationen, ligger mellem 3,82 år og 4,94 år. Vi er altså ret sikre på, at der er forskel på uddannelseslængden for ledere og administrativt personale, da 0 ikke engang er indeholdt i 99% konfidensintervallet.
Spørgsmål 3,1 (5 %)
Undersøg om kundeancienniteten i banken er normalfordelt.
Spørgsmål 3,2 (10 %)
Test på 5 % testniveau om den gennemsnitlige kundeanciennitet er under 20 år.
I undersøgelsen af 75 kunder fra 2015, var kundeancienniteten på 20 år med en standardafvigelse på 10 år. Spørgsmål 3,3 (5 %)
Test på 5 % testniveau om standardafvigelserne er ens i de 2 undersøgelser.
Spørgsmål 3,4 (10 %)
Test på 5 % testniveau om den gennemsnitlige anciennitet er faldet fra 2015 til 2016.
Du finder hele opgaver i linket:
2016 8 Eksamen Statistik Opgave
2016 8 Eksamen Statistik Data