11. Lineær regressionsanalyse
Hvis en variabel Y, påvirkes lineært af en anden X, kan vi bestemme en lineær funktion til at forudsige værdien af Y for værdier af X. Nedenfor er et mini-eksempel vi kun benytter for at vise hvad det er vi beregner. Vi går ikke i detaljer med de matematiske beviser og formler bag teknikken.
Joe & The Juice
En kvik juicer har observeret hvordan vejret er, og hvor mange Go Away Doc-drinks der er solgt.
| Temperatur | Drinks |
|---|---|
| 2 | 1 |
| 4 | 5 |
| 8 | 6 |
Tabel 11.1: Observerede temperaturer og antal solgte Go Away Doc-drinks hos Joe & The Juice — mini-eksempel til beregning af den simple lineære regressionslinje.
Kilde: Egen tilvirkning.
Det virker ikke logisk at salget på Joe & The Juice påvirker temperaturen, derimod giver det god mening at temperaturen påvirker salget af drinks. Vi angiver salget af drinks på y-aksen og temperaturen på x-aksen.
Variablen vi ønsker at forudsige, her salget af drinks, kalder vi:
- Y
- Responsvariablen
- Den forklarede variabel
- Den afhængige variabel
- Den endogene variabel
En variabel vi bruger til at forudsige, her temperaturen, kaldes:
- X
- Prædiktoren
- Den forklarende variabel
- Den uafhængige variabel
- Den eksogene variabel
Baseret på observationerne kan vi forsøge at forudsige salget af drinks, til dette formål opstiller vi en lineær model. Normalt når vi har en lineær funktion har vi i matematik lært at denne har forskriften
$$y=ax+b$$Når vi har at gøre med lineær regression bruger vi typisk betegnelsen
$\beta_{1}$ eller mere sigende
$\beta_{temperatur}$ eller
$\beta_{temp}$ om hældningskoefficienten a. Vi bruger ofte betegnelsen
$\beta_{0}$ eller
$\alpha$ om skæringen med y-aksen b også kaldet interceptet.
Det betyder vores gamle matematik formel for linjen
$$y=ax+b$$
Bliver til vores model af virkeligheden:
$$\hat{Y}=\hat{\beta}_{temp}⋅X_{temp}+\hat{\beta}_{0}$$
For at vi kan bruge modellen til at sige noget om salget af drinks, skal vi baseret på vore observationer estimere
hældningskoefficienten $\beta_{temp}$ og skæringen $\beta_{0}$. Vi kender ikke de sande værdier parametrene $\beta_{temp}$ og
$\beta_{0}$, men ud fra vore faktiske observationer kan vi give vores bedste gæt
parameterestimaterne $\hat{\beta}_{temp}$ og $\hat{\beta}_{0}$. Software beregner parameterestimaterne til linjen, der bedst
beskriver sammenhængen mellem den uafhængige variabel temperatur og responsvariablen drinks. Vi kalder denne linje
regressionslinjen. Da den beregnede værdi af antallet af drinks er baseret på estimater, vælger vi at skrive
$\hat{Y}$ i stedet for Y.
Nedenstående forklaring på metoden til beregning af modellens forklaringskraft, kan være svær at forstå. Det er ikke
nødvendigt for at fortolke modellerne, men kan give indsigt i mekanikken bag modellen.
Når vi beregner estimaterneEstimat betyder gæt.
Hvis vi har en stikprøve, hvor vi har målt 100 mænds højde til
gennemsnitligt 179 cm., er vores bedste gæt på middelhøjden i populationen
179 cm. Vi kan skrive vort estimat for μ er 179 cm.
Klik her for at lære mere om parametre og parameter-estimater! for regressionslinjen, bruger vi en metode, der kaldes mindste kvadraters metodeMindste kvadraters metode (OLS — Ordinary Least Squares) finder den bedste rette linje gennem datapunkter ved
at minimere summen af de kvadrerede afstande fra punkterne til linjen.
Adrien-Marie Legendre publicerede metoden først i 1805; Carl Friedrich Gauss hævdede at have brugt den
allerede fra 1795, men offentliggjorde først sin udgave i 1809. Metoden er stadig grundlaget for lineær
regression og mange AI-modeller — hvert lag i et neuralt netværk er i bund og grund en lineær
regression.
Klik her for at lære mere om
lineær regression i kapitel 11! (på
engelsk ordinary least squares OLSMindste kvadraters metode (OLS — Ordinary Least Squares) finder den bedste rette linje gennem datapunkter ved
at minimere summen af de kvadrerede afstande fra punkterne til linjen.
Adrien-Marie Legendre publicerede metoden først i 1805; Carl Friedrich Gauss hævdede at have brugt den
allerede fra 1795, men offentliggjorde først sin udgave i 1809. Metoden er stadig grundlaget for lineær
regression og mange AI-modeller — hvert lag i et neuralt netværk er i bund og grund en lineær
regression.
Klik her for at lære mere om
lineær regression i kapitel 11!) til at beregne vore estimaterEstimat betyder gæt.
Hvis vi har en stikprøve, hvor vi har målt 100 mænds højde til
gennemsnitligt 179 cm., er vores bedste gæt på middelhøjden i populationen
179 cm. Vi kan skrive vort estimat for μ er 179 cm.
Klik her for at lære mere om parametre og parameter-estimater!.
Vi får software til at beregne de 2 estimater:
$$\hat{\beta}_{temp}=0{,}75 \ \ \hat{\beta}_{0}=0{,}5$$
Disse parameterestimater kan vi nu indsætte i modellen:
$$\hat{Y}=\hat{\beta}_{temp}⋅X_{temp}+\hat{\beta}_{0}$$
$$\hat{Y}=0{,}75⋅X_{temp}+0{,}5$$
Når vi kender en temperatur fx. 6 grader, kan vi indsætte denne værdi i regressionslinjen, i stedet for
$X_{temp}$ og forudsige/estimere hvad salget af drinks vil være.
$$\hat{Y}=0{,}75⋅X_{temp}+0{,}5⇔$$
$$\hat{Y}=0{,}75⋅6+0{,}5⇔$$
$$\hat{Y}=5$$
Vi kan i figuren se at de sorte prikker er faktiske observationer, og linjen er modellen af virkeligheden. Vi har
beregnet modellens forudsigelse af drinkssalget ved de 3 temperaturer 2, 4 og 8 grader, modellens forudsigelser er
illustreret ved sorte trekanter. Vi kalder forskellen mellem observerede og estimerede værdier for residualer,
definitionen for residualer er altså observeret minus estimeret (forudsagt) værdi. Man benytter ofte det græske bogstav epsilon
ϵ
til at betegne residualerne. For at have et mål for hvor stor forskellen mellem modellen og de faktiske
observationer er samlet set, bruger vi summen af de kvadrerede residualer SSR. Residualer af observerede salg af
drinks beregnes som:
$$SSR=(1-2)^{2}+(5-3{,}5)^{2}+(6-6{,}5)^{2}=1+2{,}25+0{,}25=3{,}5$$
Vi kalder værdien for summen af kvadrerede residualer på engelsk SSR sums of squared residuals, de 3 kvadrerede
residualer er illustreret som de 3 grå kvadrater i figuren nedenfor.
Figur 11.1: Joe & The Juice: observationer (punkter), forudsagte værdier (trekanter), residualerResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den
lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen
ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære
regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da
bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen
er altså 1 mio. under den ifølge modellen forventede pris.
Klik
her for at lære mere om lineær regressionsanalyse! (stiplede linjer) og kvadrerede residualerResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den
lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen
ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære
regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da
bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen
er altså 1 mio. under den ifølge modellen forventede pris.
Klik
her for at lære mere om lineær regressionsanalyse! (grå kvadrater). SSR = 1 + 2,25 + 0,25 = 3,5. Hold musen over punkterne for fx «4 grader 5 drinks».
Kilde: Egen tilvirkning.
Hvis der ikke er en lineær sammenhæng mellem temperatur og drinkssalg, og regressionslinjen derfor ikke kan bruges til at forklare salget, så kan vi i stedet benytte det observerede gennemsnitlige salg af drinks. Vi beregner det gennemsnitlige salg af drinks i stikprøven som $\frac{1+5+6}{3}=\frac{12}{3}=4$ . Vi beregner nu de summen af de kvadrerede afvigelser fra det gennemsnitlige observerede salg af drinks som: $$SST=(1-4)^{2}+(5-4)^{2}+(6-4)^{2}=9+1+4=14$$ Vi kalder værdien for summen af kvadrerede afvigelser total på engelsk SST sums of squared total, de 3 kvadrerede afvigelser er illustreret som de 3 grå kvadrater i figuren nedenfor.
Figur 11.2: Joe & The Juice: observationer (punkter), gennemsnitligt salg ȳ = 4 (trekanter), afvigelser fra gennemsnittet (stiplede linjer) og kvadrerede afvigelser (grå kvadrater). SST = 9 + 1 + 4 = 14, og R-kvadratet = 1 − SSR/SST = 0,75. Hold musen over punkterne for fx «4 grader 5 drinks».
Kilde: Egen tilvirkning.
Vi kan vise hvor godt responsvariablen forklares ud fra den forklarende variabel i modellen, vha. forholdet mellem
SSR og SST. Er SSR og SST næsten ens, vinder vi ikke meget ved at beskrive responsvariablen Y ud fra den forklarende
variabel X. SST vil aldrig være mindre end SSR, da en linje med tilpasset hældningskoefficient altid vil beskrive
observationerne mindst lige så godt som en vandret linje. Vi beskriver modellens forklaringskraft ud fra R-kvadreret
som er defineret som:
$$1-\frac{SSR}{SST}=1-\frac{3{,}5}{14}=1-0{,}25=0{,}75$$
Vi kan udtrykke dette som at 75% af variationen i responsvariablen - Drinks solgt kan forklares ved variationen i
den forklarende variabel - Temperatur. Denne forklaringskraft afhænger dog af om der er nok observationer, og at
disse viser at hældningen på den rette linje er signifikant forskellig fra 0. Er hældningen på linjen 0, betyder
det, at man sælger samme antal drinks ligegyldigt hvordan vejret er. Vi bør have flere observationer end de kun 3 vi
benytter i dette minieksempel.
Her har vi kun en forklarende variabel temperatur, vi kalder derfor specielt analysen for simpel lineær regressionLineær regression handler om at finde en simpel sammenhæng mellem to ting — fx temperatur (X) og issalg (Y). Hvor mange is sælger en kiosk, når temperaturen er 27 grader? Man samler data for temperaturer og issalg, tegner den bedste rette linje gennem punkterne — og aflæser svaret. Det er lineær regression.
Ved multipel lineær regression bruger man flere X-variable samtidig — fx både temperatur, ugedag og om det er ferie — for at forudsige Y (issalget) mere præcist.
Klik
her for at lære mere om lineær regressionsanalyse!.
Vi vil senere se på analyse vha. lineær regressionLineær regression handler om at finde en simpel sammenhæng mellem to ting — fx temperatur (X) og issalg (Y). Hvor mange is sælger en kiosk, når temperaturen er 27 grader? Man samler data for temperaturer og issalg, tegner den bedste rette linje gennem punkterne — og aflæser svaret. Det er lineær regression.
Ved multipel lineær regression bruger man flere X-variable samtidig — fx både temperatur, ugedag og om det er ferie — for at forudsige Y (issalget) mere præcist.
Klik
her for at lære mere om lineær regressionsanalyse! med flere forklarende variable, denne analysetype kalder vi for
multipel lineær regressionLineær regression handler om at finde en simpel sammenhæng mellem to ting — fx temperatur (X) og issalg (Y). Hvor mange is sælger en kiosk, når temperaturen er 27 grader? Man samler data for temperaturer og issalg, tegner den bedste rette linje gennem punkterne — og aflæser svaret. Det er lineær regression.
Ved multipel lineær regression bruger man flere X-variable samtidig — fx både temperatur, ugedag og om det er ferie — for at forudsige Y (issalget) mere præcist.
Klik
her for at lære mere om lineær regressionsanalyse!.
Freestat output lineær regression
Vi kan få software til at beregne output for os, i Freestat kan fanen mreg, benyttes til lineær regression . Vi skal altid taste værdier for responsvariablen Y i I-søjlen husk overskift. Vi sætter en eller flere forklarende variable i de efterfølgende søjler.

I cellen C11 ses SSR som vi tidligere regnede ud til at være 3,5.
I cellen C12 ses SST som vi tidligere regnede ud til at være 14.
I cellen B3 ses R-kvadreret som vi tidligere regnede ud til at være 0,75.
I cellen B15 ses estimatet for parameteren $\beta_{0}$ altså $\hat{\beta}_{0}$.
I cellen B16 ses estimatet for parameteren $\beta_{temp}$ altså $\hat{\beta}_{temp}$.
I cellerne I3-I5 har vi de faktiske værdier.
I cellerne G3-G5 har vi de forventede eller forudsagte værdier.
I cellerne H3-H5 har vi residualerneResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den
lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen
ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære
regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da
bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen
er altså 1 mio. under den ifølge modellen forventede pris.
Klik
her for at lære mere om lineær regressionsanalyse!, dette er faktisk minus forudsagt.
Vi nævnte tidligere at modellen her egentlig er urealistisk lille, dette resulterer i at den ikke kan bruges til noget,
da den ene forklarende variabel ikke er signifikant.
Vi opstiller et t-test, for at afgøre om temperaturen har en effekt:
$$H_{0}:\beta_{temp}=0\ Den\ forklarende\ variabel\ er\ ikke\ signifikant$$
$$H_{1}:\beta_{temp}\neq0\ Den\ forklarende\ variabel\ er\ signifikant$$
Nulhypotesen betyder at vi ikke kan afvise at hældningen på regressionslinjen er 0, hvilket betyder at den vil være
vandret. Hvis regressionslinjen er vandret, har temperaturen ingen effekt på salget, salget vil jo være konstant
ifølge modellen.
AlternativhypotesenAlternativhypotesen H1 eller Ha er det
modsatte udsagn af nulhypotesen i et hypotesetest, vi har aldrig
lighedstegn i alternativhypotesen. Der skal stærke beviser til at forkaste
nulhypotesen, sker dette tror vi på udsagnet i alternativhypotesen.
Eksempler på alternativhypoteser er:
H1: μ≠45 (Middelværdien er ikke 45)
H1: μ<45 (Middelværdien er mindre end 45)
H1: μ>45 (Middelværdien er større end 45)
Klik her for at lære mere om
hypotesetests! siger derimod at den ene forklarende variabel er signifikant forskellig fra 0. Det vil altså
sige at temperaturen har effekt på drinkssalg.
I cellen D16 ses t-teststørrelsen for testet af $\beta_{temp}$ . Er teststørrelsen cirka mindre end -2
eller større end 2, får vi en
p-værdi der er mindre end 0,05.
I cellen E16 ses p-værdien for testet, her er p-værdien større end 0,05, hvilket betyder, vi kan
ikke forkaste nulhypotesen. Vi kan altså ikke afvise at $\beta_{temp}=0$
, hvilket vil sige temperaturen påvirker ikke salget af drinks signifikant. Havde vi haft en større
stikprøvestørrelse, er det muligt, vi havde kunnet konkludere at hældningen $\beta_{temp}$ var signifikant forskellig
fra 0.
Den simple lineære regression er byggestenen i mange kreditscorings- og forecastingmodeller, og moderne
ML-modeller som Random ForestRandom Forest kombinerer mange beslutningstræer til én model. Hvert træ ser på et tilfældigt udsnit af data,
og flertallet af træernes svar bliver det endelige resultat — derfor "skov".
Leo Breiman introducerede metoden i 2001; den er i dag en af de mest populære inden for maskinlæring. Han startede som
fysiker og arbejdede med kernevåben, før han skiftede til statistik.
Klik her for at
læse mere om Random Forest i kapitel 1! og gradient boosting er i høj grad udvidelser af samme grundtanke.
Simpel lineær regression Rømø
Hent Datasættet Sommerhuse Rømø der benyttes i videoerne
Hvis vi ønsker at undersøge om lejeprisen på sommerhuse afhænger af størrelsen på sommerhuset, kan vi benytte
lineær
regressionsanalyseLineær regression handler om at finde en simpel sammenhæng mellem to ting — fx temperatur (X) og issalg (Y). Hvor mange is sælger en kiosk, når temperaturen er 27 grader? Man samler data for temperaturer og issalg, tegner den bedste rette linje gennem punkterne — og aflæser svaret. Det er lineær regression.
Ved multipel lineær regression bruger man flere X-variable samtidig — fx både temperatur, ugedag og om det er ferie — for at forudsige Y (issalget) mere præcist.
Klik
her for at lære mere om lineær regressionsanalyse! til at afgøre om lejeprisen kan forudsiges størrelsen.
For at vi kan beskrive responsvariablen vha. lineær regression, skal der være en lineær sammenhæng, dette kan vi undersøge ved at plotte de 2 variable i et XY punktdiagram. I datasættet findes data som lejepriser og størrelse, for 57 sommerhuse beliggende på Rømø. Vi kan undersøge, om der er en lineær sammenhæng mellem disse i et punktdiagram. Det er naturligt at antage at lejeprisen afhænger af størrelsen og ikke omvendt, dvs. responsvariablen Y er lejepris og den uafhængige variabel X er størrelsen i kvm. Vi kan forvente en positiv sammenhæng mellem de 2 variable, dvs. jo større sommerhus jo større lejepris.
Ud fra figuren, er antagelsen om en lineær sammenhæng rimelig.
Figur 11.3: Rømø: lejepris pr. uge vs. størrelse (n = 57) med regressionslinje ŷ = 61,32·kvm + 709. Hold musen over punkterne for koordinater.
Kilde: Egen tilvirkning baseret på datasættet Sommerhuse leje Rømø.
Når man producerer en simpel lineær regression i Freestat fanen linreg, får man automatisk
linjetilpasningsplot, residualplotResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den
lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen
ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære
regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da
bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen
er altså 1 mio. under den ifølge modellen forventede pris.
Klik
her for at lære mere om lineær regressionsanalyse! og normalfraktildiagramNormalfraktildiagrammer kan bruges til at afgøre, om en stikprøve kan
antages at stamme fra normalfordelt population.
Hvis punkterne ligger pænt omkring den rette linje er
normalitetsbetingelsen opfyldt. Ved test af fx. en mindre kvantitativ
stikprøve og varianshomogenitet forudsættes at variablene opfylder
normalitetsbetingelsen.
Klik her
for
at lære mere om normalfraktildiagrammer!. Freestat giver os ligeledes følgende
beregninger:

Brugbarhed, signifikanssandsynlighed og R-kvadreret
Modellen er signifikant ud fra p-værdienp-værdien også kaldet signifikanssandsynligheden er et tal mellem 0 og 1,
den angiver sandsynligheden for, hvis nulhypotesen er sand, at få en mere
ekstrem teststørrelse, end den vi har fået i testet (teststørrelsen måler
forskellen mellem fx. stikprøvegennemsnit og middelværdien antaget i
nulhypotesen).
Jo lavere p-værdi, des mindre tror vi på nulhypotesen
Antag fx. at vi har en stikprøve af 100 mænds højde, med et gennemsnit
på 176,32 cm.
Vi ønsker at teste om middel højden i populationen, kan antages at være
210 cm dvs.
H0: μ=210
H1: μ≠210
Vi vil her få en meget negativ teststørrelse, hvilket giver en
mikroskopisk lille p-værdi.
Det vil være nærmest umuligt at få en mere ekstrem teststørrelse, hvis
den sande middelhøjde er 210 cm.
Klik her
for at lære mere om p-værdier! i cellen E12 eller E16, dvs.
størrelsen har klart en effekt på lejeprisen. Vi tester begge steder hypotesen
Størrelsen har en effekt, da p-værdienp-værdien også kaldet signifikanssandsynligheden er et tal mellem 0 og 1,
den angiver sandsynligheden for, hvis nulhypotesen er sand, at få en mere
ekstrem teststørrelse, end den vi har fået i testet (teststørrelsen måler
forskellen mellem fx. stikprøvegennemsnit og middelværdien antaget i
nulhypotesen).
Jo lavere p-værdi, des mindre tror vi på nulhypotesen
Antag fx. at vi har en stikprøve af 100 mænds højde, med et gennemsnit
på 176,32 cm.
Vi ønsker at teste om middel højden i populationen, kan antages at være
210 cm dvs.
H0: μ=210
H1: μ≠210
Vi vil her få en meget negativ teststørrelse, hvilket giver en
mikroskopisk lille p-værdi.
Det vil være nærmest umuligt at få en mere ekstrem teststørrelse, hvis
den sande middelhøjde er 210 cm.
Klik her
for at lære mere om p-værdier! er mindre end 0,0001 og dermed er klart under
signifikansniveauetSignifikansniveauet α typisk 1%, 5% eller 10%, fastsættes inden et test og
sammenlignes med p-værdien.
Er p-værdien mindre end signifikansniveauet forkastes nulhypotesen, ellers
ikke.
Signifikansniveauet angiver sandsynligheden for at forkaste en sand
nulhypotese (en type 1 fejl også kaldet en falsk positiv)
Medicinal industrien arbejder ofte med 1% signifikansniveau, hvor et
test kunne være:
H0: Medicinen har ingen effekt
H1: Medicinen har effekt
Med 1% signifikansniveau, begås en type 1 fejl kun i et ud af 100
tests.
En type 1 fejl vil her betyde, at man fejlagtigt konkluderer at et
medicinal produkt uden effekt virker.
Signifikansniveauet kan bruges til at bestemme konfidensniveauet 1-α,
der angiver sandsynligheden for korrekt ikke at forkaste en sand
nulhypotese
Klik her
for at lære mere om signifikansniveauet! på 5%. Vi forkaster nulhypotesenNulhypotesen H0 er vores grundtro i et hypotesetest, vi har
altid lighedstegn i nulhypotesen. Der skal stærke beviser til at forkaste
nulhypotesen.
Eksempler på nulhypoteser er:
H0: μ=45 (Middelværdien er 45)
H0: μ≤45 (Middelværdien er højst 45)
H0: μ≥45 (Middelværdien er mindst 45)
Klik her for at lære mere om
hypotesetests!, og konstaterer den forklarende variabel
Kvm. har en effekt på responsvariablen Lejepris pr. uge.
EstimatetEstimat betyder gæt.
Hvis vi har en stikprøve, hvor vi har målt 100 mænds højde til
gennemsnitligt 179 cm., er vores bedste gæt på middelhøjden i populationen
179 cm. Vi kan skrive vort estimat for μ er 179 cm.
Klik her for at lære mere om parametre og parameter-estimater! for skæringen med y-aksen 709,32 er ikke signifikant, p-værdienp-værdien også kaldet signifikanssandsynligheden er et tal mellem 0 og 1,
den angiver sandsynligheden for, hvis nulhypotesen er sand, at få en mere
ekstrem teststørrelse, end den vi har fået i testet (teststørrelsen måler
forskellen mellem fx. stikprøvegennemsnit og middelværdien antaget i
nulhypotesen).
Jo lavere p-værdi, des mindre tror vi på nulhypotesen
Antag fx. at vi har en stikprøve af 100 mænds højde, med et gennemsnit
på 176,32 cm.
Vi ønsker at teste om middel højden i populationen, kan antages at være
210 cm dvs.
H0: μ=210
H1: μ≠210
Vi vil her få en meget negativ teststørrelse, hvilket giver en
mikroskopisk lille p-værdi.
Det vil være nærmest umuligt at få en mere ekstrem teststørrelse, hvis
den sande middelhøjde er 210 cm.
Klik her
for at lære mere om p-værdier! i celle
E15 15,61% er jo større end 5% signifikansniveauetSignifikansniveauet α typisk 1%, 5% eller 10%, fastsættes inden et test og
sammenlignes med p-værdien.
Er p-værdien mindre end signifikansniveauet forkastes nulhypotesen, ellers
ikke.
Signifikansniveauet angiver sandsynligheden for at forkaste en sand
nulhypotese (en type 1 fejl også kaldet en falsk positiv)
Medicinal industrien arbejder ofte med 1% signifikansniveau, hvor et
test kunne være:
H0: Medicinen har ingen effekt
H1: Medicinen har effekt
Med 1% signifikansniveau, begås en type 1 fejl kun i et ud af 100
tests.
En type 1 fejl vil her betyde, at man fejlagtigt konkluderer at et
medicinal produkt uden effekt virker.
Signifikansniveauet kan bruges til at bestemme konfidensniveauet 1-α,
der angiver sandsynligheden for korrekt ikke at forkaste en sand
nulhypotese
Klik her
for at lære mere om signifikansniveauet!,
Skæringen kunne derfor være fx. 0. Normalt interesserer denne test os ikke, vi udelader derfor test af skæringen
fra fremtidige analyser. For at sikre den optimale tilpasning af regressionslinjen (og dermed minimere
residualerneResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den
lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen
ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære
regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da
bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen
er altså 1 mio. under den ifølge modellen forventede pris.
Klik
her for at lære mere om lineær regressionsanalyse!), bibeholder vi altid skæringen i modellen.
Ud fra R-kvadreret i cellen B3 konstateres at 69% af variationen i responsvariablen Lejepris pr uge, kan forklares ud fra variationen i den forklarende variabel Kvm. Herudover skal 31% af variationen i lejepris, forklares ud fra andre faktorer, der ikke er beskrevet i modellen.
Model
Vi kan aflæse parameterestimaterne for $\beta_{0}$ og $\beta_{Kvm}$ i cellerne B15 og B16, vi kan herefter opstille modellen: $$\hat{Y}=\hat{\beta}_{0}+\hat{\beta}_{Kvm}X$$ $$\hat{Y}=709{,}32+61{,}32X$$
Tolkning af koefficienter
Ifølge modellen vil lejeprisen pr. uge for et hus på 0 Kvm. være 709,32. Her er det vigtigt at bemærke at vi ikke har observeret huse i nærheden af denne størrelse, der er derfor tale om ekstrapolation. Det er behæftet med usikkerhed at benytte modellen til forudsigelser udenfor intervallet understøttet af data. Vi bemærkede før at skæringen ikke er signifikant forskellig fra 0.
Ifølge modellen vil lejeprisen pr. uge stige med 61,32, for hver kvadratmeter større sommerhuset er.
Vi kan beregne hvad et 100 Kvm. sommerhus ifølge modellen koster:
$$709{,}32+61{,}32∗100=6841{,}32$$Bemærk her forudsiges en lejepris for en sommerhusstørrelse, der er understøttet af data, vi har jo observationer for sommerhuse der er mindre og større end 100 Kvm. Når vi forudsiger lejeprisen er der tale om interpolation.
Forudsiger vi en lejepris for et 10 eller 200 Kvm. sommerhus er der tale om ekstrapolation, dette er behæftet med usikkerhed.
Prædiktionsinterval
For den simple lineære regression, kan vi forudsige, i hvilket interval responsvariablen lejepris pr. uge vil ligge med 95% sandsynlighed, for en bestemt værdi af den uafhængige variabel Kvm. I celle D4, kan vi indtaste en vilkårlig x-værdi og bestemme et prædiktionsinterval også kaldet et forudsigelsesinterval. I Freestat output er indsat 100, hvilket svarer til at lejeprisen pr. uge vil med 95% sikkerhed ligge mellem D6 4649 DKK og D8 9034 DKK. for et 100 Kvm. sommerhus. Der er tale om et meget bredt interval hvilket skyldes, at vi udtaler os om et enkelt sommerhus.
Konfidensinterval
For den simple lineære regression, kan vi forudsige, i hvilket interval den gennemsnitlige lejepris pr.
uge vil ligge med 95% sandsynlighed for en bestemt størrelse sommerhus. I celle
E4,
kan vi indtaste en vilkårlig x-værdi og bestemme et konfidensintervalKonfidensintervallet beregnes ud fra en stikprøve, og angiver nedre og
øvre grænser indenfor hvilke populations parameteren, ligger med en vis
sandsynlighed.
Er 95% konfidensintervallet for mænds gennemsnitlige højde fx. 172 cm.
og 182 cm. kan vi sige:
Vi kan med 95% sandsynlighed sige den gennemsnitlige højde for mænd i
populationen, ligger mellem 172 cm. og 182 cm.
Jo større stikprøve og jo lavere sikkerhed (konfidensniveau), jo mere
præcist bliver vore konfidensinterval (interval estimatet), dvs
intervallet bliver smallere.
Vi kan beregne konfidensintervaller for parametre vi estimerer, fx.
gennemsnittet, standardafvigelsen, andelen etc.
I modsætning til et punktestimat for fx. middelværdien, fortæller
konfidensintervallet os noget om kvaliteten af vort estimat/gæt, ud fra
bredden af konfidensintervallet.
Klik her for at
lære mere om konfidensintervallet!
. I Freestat output er indsat 100,
hvilket svarer til at den gennemsnitlige lejepris pr. uge vil med 95% sikkerhed ligge mellem
E6 6514 DKK og E8 7169 DKK. for et 100 Kvm.
sommerhus. Bemærk konfidensintervalletKonfidensintervallet beregnes ud fra en stikprøve, og angiver nedre og
øvre grænser indenfor hvilke populations parameteren, ligger med en vis
sandsynlighed.
Er 95% konfidensintervallet for mænds gennemsnitlige højde fx. 172 cm.
og 182 cm. kan vi sige:
Vi kan med 95% sandsynlighed sige den gennemsnitlige højde for mænd i
populationen, ligger mellem 172 cm. og 182 cm.
Jo større stikprøve og jo lavere sikkerhed (konfidensniveau), jo mere
præcist bliver vore konfidensinterval (interval estimatet), dvs
intervallet bliver smallere.
Vi kan beregne konfidensintervaller for parametre vi estimerer, fx.
gennemsnittet, standardafvigelsen, andelen etc.
I modsætning til et punktestimat for fx. middelværdien, fortæller
konfidensintervallet os noget om kvaliteten af vort estimat/gæt, ud fra
bredden af konfidensintervallet.
Klik her for at
lære mere om konfidensintervallet!
er smallere end prædiktionsintervallet, da vi udtaler os
om gennemsnittet og ikke et enkelt sommerhus.
Forudsætninger
Vi undersøger ligeledes om forudsætningerne om varianshomogenitetVarianshomogenitet betyder der er ens varianser for populationerne.
Hvis fx. vi har 2 stikprøver med højder for CBS og Cphbusiness
studerende, vil varianshomogenitet betyde, at der er samme variation i
de 2 populationer.
Testet kunne se ud som nedenfor, bemærk er der varianshomogenitet, er
standardafvigelserne også altid ens.
H0: σCBS=σCph (Der er
Varianshomogenitet)
H1: σCBS≠σCph (Der er ikke
varianshomogenitet)
Klik her
for
at lære mere om varianshomogenitet! ved residualplottetResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den
lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen
ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære
regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da
bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen
er altså 1 mio. under den ifølge modellen forventede pris.
Klik
her for at lære mere om lineær regressionsanalyse!, plottet ser
fornuftigt ud, de største residualerResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den
lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen
ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære
regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da
bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen
er altså 1 mio. under den ifølge modellen forventede pris.
Klik
her for at lære mere om lineær regressionsanalyse! er for sommerhuse med et areal omkring 90 til 120 kvm, men vi vil
her konstatere at der ikke er problemer med forudsætningen om varianshomogenitetVarianshomogenitet betyder der er ens varianser for populationerne.
Hvis fx. vi har 2 stikprøver med højder for CBS og Cphbusiness
studerende, vil varianshomogenitet betyde, at der er samme variation i
de 2 populationer.
Testet kunne se ud som nedenfor, bemærk er der varianshomogenitet, er
standardafvigelserne også altid ens.
H0: σCBS=σCph (Der er
Varianshomogenitet)
H1: σCBS≠σCph (Der er ikke
varianshomogenitet)
Klik her
for
at lære mere om varianshomogenitet!.
Der er ikke nogen tydelig systematik i residualplottetResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den
lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen
ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære
regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da
bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen
er altså 1 mio. under den ifølge modellen forventede pris.
Klik
her for at lære mere om lineær regressionsanalyse!, hvorfor vi konstaterer forudsætningen om uafhængighedAfhængighed betyder sammenhæng og bruges i forbindelse med Chi i anden
tests.
Hvis der er afhængighed mellem 2 kvalitative fx køn og mobiltelefonmærke,
betyder det, at der er sammenhæng mellem køn og mobiltelefonmærke.
Mænd og kvinder benytter altså forskellige mobiltelefonmærker. Er der
uafhængighed mellem køn og mobiltelefonmærke, betyder det altså, at der ikke er
forskel på hvilket mobiltelefonmærke mænd og kvinder foretrækker.
Klik her
for
at lære mere om afhængighed! af
residualerneResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den
lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen
ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære
regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da
bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen
er altså 1 mio. under den ifølge modellen forventede pris.
Klik
her for at lære mere om lineær regressionsanalyse! er opfyldt.
Figur 11.4: ResidualplotResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den
lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen
ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære
regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da
bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen
er altså 1 mio. under den ifølge modellen forventede pris.
Klik
her for at lære mere om lineær regressionsanalyse! for Rømø-modellen: residualResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den
lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen
ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære
regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da
bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen
er altså 1 mio. under den ifølge modellen forventede pris.
Klik
her for at lære mere om lineær regressionsanalyse! vs. fitted lejepris. Ingen tydelig trompetform eller systematik, hvilket understøtter varianshomogenitetVarianshomogenitet betyder der er ens varianser for populationerne.
Hvis fx. vi har 2 stikprøver med højder for CBS og Cphbusiness
studerende, vil varianshomogenitet betyde, at der er samme variation i
de 2 populationer.
Testet kunne se ud som nedenfor, bemærk er der varianshomogenitet, er
standardafvigelserne også altid ens.
H0: σCBS=σCph (Der er
Varianshomogenitet)
H1: σCBS≠σCph (Der er ikke
varianshomogenitet)
Klik her
for
at lære mere om varianshomogenitet! og uafhængighedAfhængighed betyder sammenhæng og bruges i forbindelse med Chi i anden
tests.
Hvis der er afhængighed mellem 2 kvalitative fx køn og mobiltelefonmærke,
betyder det, at der er sammenhæng mellem køn og mobiltelefonmærke.
Mænd og kvinder benytter altså forskellige mobiltelefonmærker. Er der
uafhængighed mellem køn og mobiltelefonmærke, betyder det altså, at der ikke er
forskel på hvilket mobiltelefonmærke mænd og kvinder foretrækker.
Klik her
for
at lære mere om afhængighed!. Hold musen over punkterne for tal.
Kilde: Egen tilvirkning baseret på datasættet Sommerhuse leje Rømø.
Der er i normalfraktildiagrammetNormalfraktildiagrammer kan bruges til at afgøre, om en stikprøve kan
antages at stamme fra normalfordelt population.
Hvis punkterne ligger pænt omkring den rette linje er
normalitetsbetingelsen opfyldt. Ved test af fx. en mindre kvantitativ
stikprøve og varianshomogenitet forudsættes at variablene opfylder
normalitetsbetingelsen.
Klik her
for
at lære mere om normalfraktildiagrammer! store afvigelser i enderne, dette er ikke så kritisk som omkring
medianenMedianen angiver den miderste observation af et ordnet observationssæt,
medianen kaldes også 0,5 fraktilen.
0,5 fraktilen kaldes medianen eller 2. kvartil, 50% af observationerne er
mindre end medianen, 50% er større.
Hvis fx. medianen for mænds højde er 177 cm betyder det at 50% af mændene
højst er 177 cm, og 50% er højere 177 cm.
Klik her for at lære mere om medianen!. Forudsætningen om normalitet af residualerneResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den
lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen
ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære
regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da
bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen
er altså 1 mio. under den ifølge modellen forventede pris.
Klik
her for at lære mere om lineær regressionsanalyse! synes ikke opfyldt, hvilket bemærkes da
dette har effekt på kvaliteten af modellen.
Figur 11.5: NormalfraktildiagramNormalfraktildiagrammer kan bruges til at afgøre, om en stikprøve kan
antages at stamme fra normalfordelt population.
Hvis punkterne ligger pænt omkring den rette linje er
normalitetsbetingelsen opfyldt. Ved test af fx. en mindre kvantitativ
stikprøve og varianshomogenitet forudsættes at variablene opfylder
normalitetsbetingelsen.
Klik her
for
at lære mere om normalfraktildiagrammer! for residualerneResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den
lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen
ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære
regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da
bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen
er altså 1 mio. under den ifølge modellen forventede pris.
Klik
her for at lære mere om lineær regressionsanalyse! i Rømø-modellen. Punkterne følger overvejende referencelinjen, men afviger i halerne, hvilket svækker antagelsen om normalfordelte residualerResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den
lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen
ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære
regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da
bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen
er altså 1 mio. under den ifølge modellen forventede pris.
Klik
her for at lære mere om lineær regressionsanalyse!.
Kilde: Egen tilvirkning baseret på datasættet Sommerhuse leje Rømø.
Multipel lineær regression
Hent Datasættet Sommerhuse Rømø der benyttes i videoerneDummy variable
Vi kan ikke benytte kvalitative variableEn kvalitativ variabel, er typisk en ikke numerisk variabel, hvor vi ikke
kan beregne gennemsnit, fraktiler osv., her giver det kun mening at
beregne andele fx.
Hvilket kæledyr har du?
{hund, kat, hund, kat, hund, marsvin, kat,...}
Hvilket parti vil du stemme på?
{Socialdemokratiet, Konservative, Venstre, Venstre, Radikale,...
etc.}
Hvad er din primære bankforbindelse?
{Danske Bank, Nordea, Jyske Bank,...}
Klik her
for at lære mere om kvalitative variable! i lineær regressionsanalyseLineær regression handler om at finde en simpel sammenhæng mellem to ting — fx temperatur (X) og issalg (Y). Hvor mange is sælger en kiosk, når temperaturen er 27 grader? Man samler data for temperaturer og issalg, tegner den bedste rette linje gennem punkterne — og aflæser svaret. Det er lineær regression.
Ved multipel lineær regression bruger man flere X-variable samtidig — fx både temperatur, ugedag og om det er ferie — for at forudsige Y (issalget) mere præcist.
Klik
her for at lære mere om lineær regressionsanalyse! direkte, vi kan imidlertid
kode kvalitative variableEn kvalitativ variabel, er typisk en ikke numerisk variabel, hvor vi ikke
kan beregne gennemsnit, fraktiler osv., her giver det kun mening at
beregne andele fx.
Hvilket kæledyr har du?
{hund, kat, hund, kat, hund, marsvin, kat,...}
Hvilket parti vil du stemme på?
{Socialdemokratiet, Konservative, Venstre, Venstre, Radikale,...
etc.}
Hvad er din primære bankforbindelse?
{Danske Bank, Nordea, Jyske Bank,...}
Klik her
for at lære mere om kvalitative variable! som kvantitative variableEn kvantitativ variabel, er populært sagt en numerisk variabel man kan
"regne med " fx. finde gennemsnit, median, standardafvigelse, fraktiler
osv. Eksempler på kvantitative variable er:
Mænds højde i cm.
{176, 188, 169, 177, 181, 182,...}
Aktiekurs
{437,39, 437,78, 432,12, 431,03, 433,83, 433,81}
Antal børn i familien
{0, 1, 0, 3, 2, 1,0,1,0,...}
Nedbørsmængde i mm. i Dragør
{0,00, 0,02, 0,03, 0,12, 0,08, 1,12,1,43,1,21,0,03,...}
Indholdet i Coca Cola dåser i ml.
{333,12, 333,08, 332,82, 332,73, 332,93,...}
Klik her for at lære mere om
kvantitative variable!, vi kalder dummy variable.
En dummy variabelEn Dummy variabel, er en variabel, der kun kan antage værdierne 0 og 1.
Vi bruger dummy variable i lineær regression, når vi ønsker at have en
kvalitativ variabel med i den kvantitative regressionsanalyse. Vi siger
variablen er i basis når den er slukket dvs. lig med 0, variablen er
tændt når den antager værdien 1.
En kvalitativ binær variabel som køn, kan kodes til fx.
Dummy Mand, så er den tændt dvs. 1, når respondenten er en mand,
og i basis når det er en kvinde dvs. 0.
Man kan også kode variablen som Dummy Kvinde, med mand i basis,
dvs. når variablen er slukket, er der tale om en mand.
Kvalitative variable, der ikke er binære, som fx. ugedag, kan også kodes
som dummy variable. Når ugedag skal kodes som dummy variable, får
man 6 dummyvariable. Man skal vælge en basis, fx. mandag, så får man
dummyvariablene:
Dummy Tirsdag, Dummy Onsdag, Dummy Torsdag,
Dummy Fredag, Dummy Lørdag og Dummy Søndag.
Når de 6 dummy variable er slukket, er det så mandag, højst 1 dummy kan
være tændt ad gangen.
Klik her for
at
lære mere om dummy variable! er en variabel, der kun kan antage værdierne 0 og 1.
Vi bruger dummy variable i lineær regressionLineær regression handler om at finde en simpel sammenhæng mellem to ting — fx temperatur (X) og issalg (Y). Hvor mange is sælger en kiosk, når temperaturen er 27 grader? Man samler data for temperaturer og issalg, tegner den bedste rette linje gennem punkterne — og aflæser svaret. Det er lineær regression.
Ved multipel lineær regression bruger man flere X-variable samtidig — fx både temperatur, ugedag og om det er ferie — for at forudsige Y (issalget) mere præcist.
Klik
her for at lære mere om lineær regressionsanalyse!, når vi ønsker at have en
kvalitativ variabel med i den kvantitative regressionsanalyse. Vi siger
variablen er i basis når den er slukket dvs. lig med 0, variablen er
tændt når den antager værdien 1.
En kvalitativ binær variabel som køn, kan kodes til fx.
Dummy Mand, så er den tændt dvs. 1, når respondenten er en mand,
og i basis når det er en kvinde dvs. 0.
Man kan også kode variablen som Dummy Kvinde, med mand i basis,
dvs. når variablen er slukket, er der tale om en mand.
Hvis man forestiller sig en lineær regressionsLineær regression handler om at finde en simpel sammenhæng mellem to ting — fx temperatur (X) og issalg (Y). Hvor mange is sælger en kiosk, når temperaturen er 27 grader? Man samler data for temperaturer og issalg, tegner den bedste rette linje gennem punkterne — og aflæser svaret. Det er lineær regression.
Ved multipel lineær regression bruger man flere X-variable samtidig — fx både temperatur, ugedag og om det er ferie — for at forudsige Y (issalget) mere præcist.
Klik
her for at lære mere om lineær regressionsanalyse! model, hvor man estimerer responsvariablen personers højde i cm, ud
fra
x-variablene vægt og køn. Er mænd fx. 5 cm. højere end kvinder, og Dummy mand variablen har kvinde som basis
(værdien 0), vil estimatetEstimat betyder gæt.
Hvis vi har en stikprøve, hvor vi har målt 100 mænds højde til
gennemsnitligt 179 cm., er vores bedste gæt på middelhøjden i populationen
179 cm. Vi kan skrive vort estimat for μ er 179 cm.
Klik her for at lære mere om parametre og parameter-estimater! for Dummy mand være 5.
Har Dummy kvinde variablen mand som basis (værdien 0), vil estimatetEstimat betyder gæt.
Hvis vi har en stikprøve, hvor vi har målt 100 mænds højde til
gennemsnitligt 179 cm., er vores bedste gæt på middelhøjden i populationen
179 cm. Vi kan skrive vort estimat for μ er 179 cm.
Klik her for at lære mere om parametre og parameter-estimater! for Dummy kvinde være -5, det
betyder at er der
tale om en kvinde estimeres højden 5 cm lavere end basis som er en mand.
Kvalitative variableEn kvalitativ variabel, er typisk en ikke numerisk variabel, hvor vi ikke
kan beregne gennemsnit, fraktiler osv., her giver det kun mening at
beregne andele fx.
Hvilket kæledyr har du?
{hund, kat, hund, kat, hund, marsvin, kat,...}
Hvilket parti vil du stemme på?
{Socialdemokratiet, Konservative, Venstre, Venstre, Radikale,...
etc.}
Hvad er din primære bankforbindelse?
{Danske Bank, Nordea, Jyske Bank,...}
Klik her
for at lære mere om kvalitative variable!, der ikke er binære, som fx. ugedag, kan også kodes
som som dummy variable. Når ugedag skal kodes som dummy variable, får
man 6 dummyvariable. Man skal vælge en basis, fx. mandag, så får man
dummyvariablene:
Dummy Tirsdag, Dummy Onsdag, Dummy Torsdag,
Dummy Fredag, Dummy Lørdag og Dummy Søndag.
Når de 6 dummy variable er slukket, er det så mandag, højst 1 dummy kan
være tændt ad gangen.
Vil man kode 12 måneder som dummy variable, skal man således benytte 11 dummy
variable. Reglen er således at antal dummy variable, skal være lig med antallet udfald i den kvalitative variabel
minus 1. Binære kvalitative variableEn kvalitativ variabel, er typisk en ikke numerisk variabel, hvor vi ikke
kan beregne gennemsnit, fraktiler osv., her giver det kun mening at
beregne andele fx.
Hvilket kæledyr har du?
{hund, kat, hund, kat, hund, marsvin, kat,...}
Hvilket parti vil du stemme på?
{Socialdemokratiet, Konservative, Venstre, Venstre, Radikale,...
etc.}
Hvad er din primære bankforbindelse?
{Danske Bank, Nordea, Jyske Bank,...}
Klik her
for at lære mere om kvalitative variable! som fx. køn modelleres således ved 1 dummy variabelEn Dummy variabel, er en variabel, der kun kan antage værdierne 0 og 1.
Vi bruger dummy variable i lineær regression, når vi ønsker at have en
kvalitativ variabel med i den kvantitative regressionsanalyse. Vi siger
variablen er i basis når den er slukket dvs. lig med 0, variablen er
tændt når den antager værdien 1.
En kvalitativ binær variabel som køn, kan kodes til fx.
Dummy Mand, så er den tændt dvs. 1, når respondenten er en mand,
og i basis når det er en kvinde dvs. 0.
Man kan også kode variablen som Dummy Kvinde, med mand i basis,
dvs. når variablen er slukket, er der tale om en mand.
Kvalitative variable, der ikke er binære, som fx. ugedag, kan også kodes
som dummy variable. Når ugedag skal kodes som dummy variable, får
man 6 dummyvariable. Man skal vælge en basis, fx. mandag, så får man
dummyvariablene:
Dummy Tirsdag, Dummy Onsdag, Dummy Torsdag,
Dummy Fredag, Dummy Lørdag og Dummy Søndag.
Når de 6 dummy variable er slukket, er det så mandag, højst 1 dummy kan
være tændt ad gangen.
Klik her for
at
lære mere om dummy variable!.
Forudsætninger lineær regression.
Der er 4 forudsætninger, der skal være opfyldt for at kvaliteten af vor lineære regressionsmodel er god.
Linearitet, varianshomogenitetVarianshomogenitet betyder der er ens varianser for populationerne.
Hvis fx. vi har 2 stikprøver med højder for CBS og Cphbusiness
studerende, vil varianshomogenitet betyde, at der er samme variation i
de 2 populationer.
Testet kunne se ud som nedenfor, bemærk er der varianshomogenitet, er
standardafvigelserne også altid ens.
H0: σCBS=σCph (Der er
Varianshomogenitet)
H1: σCBS≠σCph (Der er ikke
varianshomogenitet)
Klik her
for
at lære mere om varianshomogenitet!, uafhængighedAfhængighed betyder sammenhæng og bruges i forbindelse med Chi i anden
tests.
Hvis der er afhængighed mellem 2 kvalitative fx køn og mobiltelefonmærke,
betyder det, at der er sammenhæng mellem køn og mobiltelefonmærke.
Mænd og kvinder benytter altså forskellige mobiltelefonmærker. Er der
uafhængighed mellem køn og mobiltelefonmærke, betyder det altså, at der ikke er
forskel på hvilket mobiltelefonmærke mænd og kvinder foretrækker.
Klik her
for
at lære mere om afhængighed! residualerResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den
lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen
ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære
regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da
bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen
er altså 1 mio. under den ifølge modellen forventede pris.
Klik
her for at lære mere om lineær regressionsanalyse! og normalitet residualerResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den
lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen
ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære
regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da
bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen
er altså 1 mio. under den ifølge modellen forventede pris.
Klik
her for at lære mere om lineær regressionsanalyse!. Vi
kan undersøge om de 4 forudsætninger er opfyldt, ved at se på 3 forskellige plots et linjetilpasningsplot, et
residualplotResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den
lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen
ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære
regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da
bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen
er altså 1 mio. under den ifølge modellen forventede pris.
Klik
her for at lære mere om lineær regressionsanalyse! og et normalfraktildiagramNormalfraktildiagrammer kan bruges til at afgøre, om en stikprøve kan
antages at stamme fra normalfordelt population.
Hvis punkterne ligger pænt omkring den rette linje er
normalitetsbetingelsen opfyldt. Ved test af fx. en mindre kvantitativ
stikprøve og varianshomogenitet forudsættes at variablene opfylder
normalitetsbetingelsen.
Klik her
for
at lære mere om normalfraktildiagrammer!. Et linjetilpasningsplot er et xy-punktdiagram hvor
regressionslinjen er indtegnet. De 3 plots tegnes automatisk, når man genererer en lineær regressionsmodelLineær regression handler om at finde en simpel sammenhæng mellem to ting — fx temperatur (X) og issalg (Y). Hvor mange is sælger en kiosk, når temperaturen er 27 grader? Man samler data for temperaturer og issalg, tegner den bedste rette linje gennem punkterne — og aflæser svaret. Det er lineær regression.
Ved multipel lineær regression bruger man flere X-variable samtidig — fx både temperatur, ugedag og om det er ferie — for at forudsige Y (issalget) mere præcist.
Klik
her for at lære mere om lineær regressionsanalyse! i
Freestat.
Linearitet
For at benytte lineær regression, er den vigtigste forudsætning, at der er en lineær sammenhæng mellem
den forklarende variabel X og responsvariablen Y. Er der ikke en lineær sammenhæng, kan vi ikke beskrive
sammenhængen ved en lineær regressionsmodelLineær regression handler om at finde en simpel sammenhæng mellem to ting — fx temperatur (X) og issalg (Y). Hvor mange is sælger en kiosk, når temperaturen er 27 grader? Man samler data for temperaturer og issalg, tegner den bedste rette linje gennem punkterne — og aflæser svaret. Det er lineær regression.
Ved multipel lineær regression bruger man flere X-variable samtidig — fx både temperatur, ugedag og om det er ferie — for at forudsige Y (issalget) mere præcist.
Klik
her for at lære mere om lineær regressionsanalyse!. Herunder er nogle eksempler på linjetilpasningsplots, hvor der er
problemer med forudsætningen om linearitet.
I de fire røde linjetilpasningsplots, er der problemer med linearitet. Responsvariablen i plot 1 og 2, kunne
bedre
beskrives ved en parabel. Modellerne over- og undervurderer konsekvent værdien af y. Hvis forudsætningen om
linearitet, ikke er opfyldt er det alvorligt, vi ser af figurerne at modellen ikke vil beskrive responsvariablen
korrekt. Responsvariablen i plot 3 og 4 kunne synes at følge en eksponentiel eller polynomisk udvikling. Bemærk
man
kan ikke umiddelbart ud fra r-kvadreret og p-værdienp-værdien også kaldet signifikanssandsynligheden er et tal mellem 0 og 1,
den angiver sandsynligheden for, hvis nulhypotesen er sand, at få en mere
ekstrem teststørrelse, end den vi har fået i testet (teststørrelsen måler
forskellen mellem fx. stikprøvegennemsnit og middelværdien antaget i
nulhypotesen).
Jo lavere p-værdi, des mindre tror vi på nulhypotesen
Antag fx. at vi har en stikprøve af 100 mænds højde, med et gennemsnit
på 176,32 cm.
Vi ønsker at teste om middel højden i populationen, kan antages at være
210 cm dvs.
H0: μ=210
H1: μ≠210
Vi vil her få en meget negativ teststørrelse, hvilket giver en
mikroskopisk lille p-værdi.
Det vil være nærmest umuligt at få en mere ekstrem teststørrelse, hvis
den sande middelhøjde er 210 cm.
Klik her
for at lære mere om p-værdier! for F- og t-testet, konstatere at der er problemer
med linearitetsantagelsen. Vi kan imidlertid let se der er problemer med lineariteten i linjetilpasningsplots.
Figur 11.6: Eksempel på manglende linearitet: observationerne følger et kurvet (parabelagtigt) mønster, så en ret linje systematisk over- og undervurderer y.
Kilde: Egen tilvirkning.
I de 4 linjetilpasningsplots nedenfor er problemet, at der tilsyneladende ikke er en lineær sammenhæng mellem den forklarende og responsvariablen. Vi kan her se ud fra R-kvadreret, at modellens forklaringskraft er meget lav for de 4 linjetilpasningsplots. Her giver det således ikke mening at beskrive responsvariablen ud fra den forklarende variabel.
Figur 11.7: Eksempel uden klar lineær sammenhæng: punkterne spreder sig tilfældigt om linjen, hvilket giver lav forklaringskraft (lav R-kvadreret).
Kilde: Egen tilvirkning.
I de 4 linjetilpasningsplots 9 til 12, nedenfor er forudsætningen om linearitet opfyldt, bemærk p-værdiernep-værdien også kaldet signifikanssandsynligheden er et tal mellem 0 og 1,
den angiver sandsynligheden for, hvis nulhypotesen er sand, at få en mere
ekstrem teststørrelse, end den vi har fået i testet (teststørrelsen måler
forskellen mellem fx. stikprøvegennemsnit og middelværdien antaget i
nulhypotesen).
Jo lavere p-værdi, des mindre tror vi på nulhypotesen
Antag fx. at vi har en stikprøve af 100 mænds højde, med et gennemsnit
på 176,32 cm.
Vi ønsker at teste om middel højden i populationen, kan antages at være
210 cm dvs.
H0: μ=210
H1: μ≠210
Vi vil her få en meget negativ teststørrelse, hvilket giver en
mikroskopisk lille p-værdi.
Det vil være nærmest umuligt at få en mere ekstrem teststørrelse, hvis
den sande middelhøjde er 210 cm.
Klik her
for at lære mere om p-værdier! alle
er
mindre end 5% samt R kvadreret er relativt høj.
Figur 11.8: Eksempel med opfyldt linearitet: punkterne følger tæt en ret linje (ŷ ≈ 1,7x + 0,3), og forudsætningen om linearitet er dermed opfyldt.
Kilde: Egen tilvirkning.
Varianshomogenitet
VarianshomogenitetVarianshomogenitet betyder der er ens varianser for populationerne.
Hvis fx. vi har 2 stikprøver med højder for CBS og Cphbusiness
studerende, vil varianshomogenitet betyde, at der er samme variation i
de 2 populationer.
Testet kunne se ud som nedenfor, bemærk er der varianshomogenitet, er
standardafvigelserne også altid ens.
H0: σCBS=σCph (Der er
Varianshomogenitet)
H1: σCBS≠σCph (Der er ikke
varianshomogenitet)
Klik her
for
at lære mere om varianshomogenitet! betyder responsvariablen Y skal have samme afvigelse fra regressionslinjen ligegyldigt hvilken
værdi den uafhængige variabel X har. I eksemplet med Joe & The Juice betyder det, for alle temperaturer skal det
faktiske salg af drinks, afvige nogenlunde med samme størrelse. Hvis det fx. er 20 grader og afvigelsen i forhold
til det af modellen forudsagte er 100 drinks mod en afvigelse på kun 5 drinks når det er 0 grader, er der ikke
varianshomogenitetVarianshomogenitet betyder der er ens varianser for populationerne.
Hvis fx. vi har 2 stikprøver med højder for CBS og Cphbusiness
studerende, vil varianshomogenitet betyde, at der er samme variation i
de 2 populationer.
Testet kunne se ud som nedenfor, bemærk er der varianshomogenitet, er
standardafvigelserne også altid ens.
H0: σCBS=σCph (Der er
Varianshomogenitet)
H1: σCBS≠σCph (Der er ikke
varianshomogenitet)
Klik her
for
at lære mere om varianshomogenitet!. Det er nemmest at undersøge om der er varianshomogenitetVarianshomogenitet betyder der er ens varianser for populationerne.
Hvis fx. vi har 2 stikprøver med højder for CBS og Cphbusiness
studerende, vil varianshomogenitet betyde, at der er samme variation i
de 2 populationer.
Testet kunne se ud som nedenfor, bemærk er der varianshomogenitet, er
standardafvigelserne også altid ens.
H0: σCBS=σCph (Der er
Varianshomogenitet)
H1: σCBS≠σCph (Der er ikke
varianshomogenitet)
Klik her
for
at lære mere om varianshomogenitet!, ved at se på
residualplottetResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den
lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen
ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære
regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da
bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen
er altså 1 mio. under den ifølge modellen forventede pris.
Klik
her for at lære mere om lineær regressionsanalyse!. Hvis der fx. er en trompetform, som i residualplotsResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den
lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen
ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære
regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da
bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen
er altså 1 mio. under den ifølge modellen forventede pris.
Klik
her for at lære mere om lineær regressionsanalyse! 1, 2, 3 og 4 nedenfor, er antagelsen om
varianshomogenitetVarianshomogenitet betyder der er ens varianser for populationerne.
Hvis fx. vi har 2 stikprøver med højder for CBS og Cphbusiness
studerende, vil varianshomogenitet betyde, at der er samme variation i
de 2 populationer.
Testet kunne se ud som nedenfor, bemærk er der varianshomogenitet, er
standardafvigelserne også altid ens.
H0: σCBS=σCph (Der er
Varianshomogenitet)
H1: σCBS≠σCph (Der er ikke
varianshomogenitet)
Klik her
for
at lære mere om varianshomogenitet! ikke opfyldt. I residualplotResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den
lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen
ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære
regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da
bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen
er altså 1 mio. under den ifølge modellen forventede pris.
Klik
her for at lære mere om lineær regressionsanalyse! 1 vil modellen være meget præcis, når X antager værdier
mellem 60 og 90 og gradvis mere upræcis herefter. Der er er varianshomogenitetVarianshomogenitet betyder der er ens varianser for populationerne.
Hvis fx. vi har 2 stikprøver med højder for CBS og Cphbusiness
studerende, vil varianshomogenitet betyde, at der er samme variation i
de 2 populationer.
Testet kunne se ud som nedenfor, bemærk er der varianshomogenitet, er
standardafvigelserne også altid ens.
H0: σCBS=σCph (Der er
Varianshomogenitet)
H1: σCBS≠σCph (Der er ikke
varianshomogenitet)
Klik her
for
at lære mere om varianshomogenitet! i resiudalplots 5, 6, 7 og
8,
det kan vi se da de lodrette afstande er nogenlunde de samme for alle værdier af den uafhængige variabel X,
hvilket
betyder variationen i afvigelserne er ens for alle værdier af den uafhængige variabel.
Er der varianshomogenitetVarianshomogenitet betyder der er ens varianser for populationerne.
Hvis fx. vi har 2 stikprøver med højder for CBS og Cphbusiness
studerende, vil varianshomogenitet betyde, at der er samme variation i
de 2 populationer.
Testet kunne se ud som nedenfor, bemærk er der varianshomogenitet, er
standardafvigelserne også altid ens.
H0: σCBS=σCph (Der er
Varianshomogenitet)
H1: σCBS≠σCph (Der er ikke
varianshomogenitet)
Klik her
for
at lære mere om varianshomogenitet!, siger man med et fint specialudtryk, at der er homoskedasticitet, hvilket
betyder der er ens varians for de forudsagte værdier og dermed ingen trompetform, forudsætningen er altså opfyldt.
Hvis der er trompetform, siger vi med et fint ord, at der er heteroskedasticitet, så er der altså ikke
varianshomogenitetVarianshomogenitet betyder der er ens varianser for populationerne.
Hvis fx. vi har 2 stikprøver med højder for CBS og Cphbusiness
studerende, vil varianshomogenitet betyde, at der er samme variation i
de 2 populationer.
Testet kunne se ud som nedenfor, bemærk er der varianshomogenitet, er
standardafvigelserne også altid ens.
H0: σCBS=σCph (Der er
Varianshomogenitet)
H1: σCBS≠σCph (Der er ikke
varianshomogenitet)
Klik her
for
at lære mere om varianshomogenitet!, forudsætningen er således ikke opfyldt.
Uafhængighed residualer
UafhængighedAfhængighed betyder sammenhæng og bruges i forbindelse med Chi i anden
tests.
Hvis der er afhængighed mellem 2 kvalitative fx køn og mobiltelefonmærke,
betyder det, at der er sammenhæng mellem køn og mobiltelefonmærke.
Mænd og kvinder benytter altså forskellige mobiltelefonmærker. Er der
uafhængighed mellem køn og mobiltelefonmærke, betyder det altså, at der ikke er
forskel på hvilket mobiltelefonmærke mænd og kvinder foretrækker.
Klik her
for
at lære mere om afhængighed! af residualerResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den
lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen
ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære
regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da
bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen
er altså 1 mio. under den ifølge modellen forventede pris.
Klik
her for at lære mere om lineær regressionsanalyse! betyder at hverken værdien af X eller andre residualerResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den
lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen
ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære
regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da
bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen
er altså 1 mio. under den ifølge modellen forventede pris.
Klik
her for at lære mere om lineær regressionsanalyse! påvirker en
residualResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den
lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen
ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære
regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da
bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen
er altså 1 mio. under den ifølge modellen forventede pris.
Klik
her for at lære mere om lineær regressionsanalyse!, målefejlen er altså tilfældig. I residualplotsResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den
lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen
ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære
regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da
bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen
er altså 1 mio. under den ifølge modellen forventede pris.
Klik
her for at lære mere om lineær regressionsanalyse! 1, 2, og 3 er der uafhængighedAfhængighed betyder sammenhæng og bruges i forbindelse med Chi i anden
tests.
Hvis der er afhængighed mellem 2 kvalitative fx køn og mobiltelefonmærke,
betyder det, at der er sammenhæng mellem køn og mobiltelefonmærke.
Mænd og kvinder benytter altså forskellige mobiltelefonmærker. Er der
uafhængighed mellem køn og mobiltelefonmærke, betyder det altså, at der ikke er
forskel på hvilket mobiltelefonmærke mænd og kvinder foretrækker.
Klik her
for
at lære mere om afhængighed! mellem
residualerneResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den
lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen
ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære
regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da
bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen
er altså 1 mio. under den ifølge modellen forventede pris.
Klik
her for at lære mere om lineær regressionsanalyse!, lave residualerResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den
lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen
ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære
regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da
bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen
er altså 1 mio. under den ifølge modellen forventede pris.
Klik
her for at lære mere om lineær regressionsanalyse! medfører fx ikke nødvendigvis lave eller høje residualerResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den
lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen
ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære
regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da
bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen
er altså 1 mio. under den ifølge modellen forventede pris.
Klik
her for at lære mere om lineær regressionsanalyse!.
Der er som før beskrevet ikke varianshomogenitetVarianshomogenitet betyder der er ens varianser for populationerne.
Hvis fx. vi har 2 stikprøver med højder for CBS og Cphbusiness
studerende, vil varianshomogenitet betyde, at der er samme variation i
de 2 populationer.
Testet kunne se ud som nedenfor, bemærk er der varianshomogenitet, er
standardafvigelserne også altid ens.
H0: σCBS=σCph (Der er
Varianshomogenitet)
H1: σCBS≠σCph (Der er ikke
varianshomogenitet)
Klik her
for
at lære mere om varianshomogenitet!, men der er ikke afhængighed i residualerneResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den
lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen
ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære
regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da
bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen
er altså 1 mio. under den ifølge modellen forventede pris.
Klik
her for at lære mere om lineær regressionsanalyse!
. I residualplotsResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den
lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen
ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære
regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da
bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen
er altså 1 mio. under den ifølge modellen forventede pris.
Klik
her for at lære mere om lineær regressionsanalyse! 4, 5 og 6, er der ikke uafhængige residualerResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den
lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen
ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære
regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da
bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen
er altså 1 mio. under den ifølge modellen forventede pris.
Klik
her for at lære mere om lineær regressionsanalyse!, lave residualerResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den
lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen
ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære
regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da
bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen
er altså 1 mio. under den ifølge modellen forventede pris.
Klik
her for at lære mere om lineær regressionsanalyse! medfører
lave
residualerResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den
lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen
ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære
regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da
bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen
er altså 1 mio. under den ifølge modellen forventede pris.
Klik
her for at lære mere om lineær regressionsanalyse! og høje residualerResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den
lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen
ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære
regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da
bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen
er altså 1 mio. under den ifølge modellen forventede pris.
Klik
her for at lære mere om lineær regressionsanalyse! medfører høje residualerResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den
lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen
ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære
regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da
bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen
er altså 1 mio. under den ifølge modellen forventede pris.
Klik
her for at lære mere om lineær regressionsanalyse!. Der må ikke være systematik
imellem residualerneResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den
lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen
ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære
regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da
bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen
er altså 1 mio. under den ifølge modellen forventede pris.
Klik
her for at lære mere om lineær regressionsanalyse!, punkterne i residualplottetResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den
lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen
ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære
regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da
bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen
er altså 1 mio. under den ifølge modellen forventede pris.
Klik
her for at lære mere om lineær regressionsanalyse! skal ligge tilfældigt som i residualplotResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den
lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen
ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære
regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da
bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen
er altså 1 mio. under den ifølge modellen forventede pris.
Klik
her for at lære mere om lineær regressionsanalyse! 7 og 8, her er
både antagelsen om varianshomogenitetVarianshomogenitet betyder der er ens varianser for populationerne.
Hvis fx. vi har 2 stikprøver med højder for CBS og Cphbusiness
studerende, vil varianshomogenitet betyde, at der er samme variation i
de 2 populationer.
Testet kunne se ud som nedenfor, bemærk er der varianshomogenitet, er
standardafvigelserne også altid ens.
H0: σCBS=σCph (Der er
Varianshomogenitet)
H1: σCBS≠σCph (Der er ikke
varianshomogenitet)
Klik her
for
at lære mere om varianshomogenitet! og uafhængige residualerResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den
lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen
ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære
regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da
bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen
er altså 1 mio. under den ifølge modellen forventede pris.
Klik
her for at lære mere om lineær regressionsanalyse! opfyldt.
Normalitet residualer
Vi kan undersøge normaliteten af residualerneResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den
lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen
ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære
regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da
bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen
er altså 1 mio. under den ifølge modellen forventede pris.
Klik
her for at lære mere om lineær regressionsanalyse! ved at plotte disse i et normalfraktildiagramNormalfraktildiagrammer kan bruges til at afgøre, om en stikprøve kan
antages at stamme fra normalfordelt population.
Hvis punkterne ligger pænt omkring den rette linje er
normalitetsbetingelsen opfyldt. Ved test af fx. en mindre kvantitativ
stikprøve og varianshomogenitet forudsættes at variablene opfylder
normalitetsbetingelsen.
Klik her
for
at lære mere om normalfraktildiagrammer!.
Her
skal punkterne ligge tæt omkring den rette linje. Af nedenstående plots er kun residualerneResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den
lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen
ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære
regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da
bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen
er altså 1 mio. under den ifølge modellen forventede pris.
Klik
her for at lære mere om lineær regressionsanalyse! i 1. plot
normalfordelte.
| Forudsætning | Plot | Udseende af plot |
|---|---|---|
| Linearitet af observationer | Linjetilpasningsplot | Observationerne følger en linjeform |
| UafhængighedAfhængighed betyder sammenhæng og bruges i forbindelse med Chi i anden
tests. Hvis der er afhængighed mellem 2 kvalitative fx køn og mobiltelefonmærke, betyder det, at der er sammenhæng mellem køn og mobiltelefonmærke. Mænd og kvinder benytter altså forskellige mobiltelefonmærker. Er der uafhængighed mellem køn og mobiltelefonmærke, betyder det altså, at der ikke er forskel på hvilket mobiltelefonmærke mænd og kvinder foretrækker. Klik her for at lære mere om afhængighed! af residualerneResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den lineære regressionsanalyse. Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen ejendomspriser. En ejendom er faktisk til salg for 4 mio, men den lineære regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen er altså 1 mio. under den ifølge modellen forventede pris. Klik her for at lære mere om lineær regressionsanalyse! |
ResidualplotResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den
lineære regressionsanalyse. Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen ejendomspriser. En ejendom er faktisk til salg for 4 mio, men den lineære regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen er altså 1 mio. under den ifølge modellen forventede pris. Klik her for at lære mere om lineær regressionsanalyse! |
Der er ikke systematik i residualplottetResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den
lineære regressionsanalyse. Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen ejendomspriser. En ejendom er faktisk til salg for 4 mio, men den lineære regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen er altså 1 mio. under den ifølge modellen forventede pris. Klik her for at lære mere om lineær regressionsanalyse! |
| VarianshomogenitetVarianshomogenitet betyder der er ens varianser for populationerne. Hvis fx. vi har 2 stikprøver med højder for CBS og Cphbusiness studerende, vil varianshomogenitet betyde, at der er samme variation i de 2 populationer. Testet kunne se ud som nedenfor, bemærk er der varianshomogenitet, er standardafvigelserne også altid ens. H0: σCBS=σCph (Der er Varianshomogenitet) H1: σCBS≠σCph (Der er ikke varianshomogenitet) Klik her for at lære mere om varianshomogenitet! homoskedasticitet |
ResidualplotResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den
lineære regressionsanalyse. Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen ejendomspriser. En ejendom er faktisk til salg for 4 mio, men den lineære regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen er altså 1 mio. under den ifølge modellen forventede pris. Klik her for at lære mere om lineær regressionsanalyse! |
Der er ikke trompetform i residualplottetResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den
lineære regressionsanalyse. Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen ejendomspriser. En ejendom er faktisk til salg for 4 mio, men den lineære regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen er altså 1 mio. under den ifølge modellen forventede pris. Klik her for at lære mere om lineær regressionsanalyse! |
| Normalitet af residualerneResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den
lineære regressionsanalyse. Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen ejendomspriser. En ejendom er faktisk til salg for 4 mio, men den lineære regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen er altså 1 mio. under den ifølge modellen forventede pris. Klik her for at lære mere om lineær regressionsanalyse! |
NormalfraktildiagramNormalfraktildiagrammer kan bruges til at afgøre, om en stikprøve kan
antages at stamme fra normalfordelt population. Hvis punkterne ligger pænt omkring den rette linje er normalitetsbetingelsen opfyldt. Ved test af fx. en mindre kvantitativ stikprøve og varianshomogenitet forudsættes at variablene opfylder normalitetsbetingelsen. Klik her for at lære mere om normalfraktildiagrammer! for residualerneResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den lineære regressionsanalyse. Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen ejendomspriser. En ejendom er faktisk til salg for 4 mio, men den lineære regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen er altså 1 mio. under den ifølge modellen forventede pris. Klik her for at lære mere om lineær regressionsanalyse! |
Punkterne ligger pænt om den rette linje |
Tabel 11.2: De 4 forudsætninger for lineær regressionLineær regression handler om at finde en simpel sammenhæng mellem to ting — fx temperatur (X) og issalg (Y). Hvor mange is sælger en kiosk, når temperaturen er 27 grader? Man samler data for temperaturer og issalg, tegner den bedste rette linje gennem punkterne — og aflæser svaret. Det er lineær regression.
Ved multipel lineær regression bruger man flere X-variable samtidig — fx både temperatur, ugedag og om det er ferie — for at forudsige Y (issalget) mere præcist.
Klik
her for at lære mere om lineær regressionsanalyse!, hvilket plot der bruges til at vurdere hver forudsætning, og hvad plottet skal vise, hvis forudsætningen er opfyldt.
Kilde: Egen tilvirkning.
Multikollinearitet
MultikollinearitetMultikollinearitet er et problem, der kan opstå i en multipel lineær regressionsmodel, hvis nogle af de forklarende X-variable indbyrdes er meget kraftigt korrelerede (tommelfingerreglen angiver en korrelationskoefficient mindre end -0,8 eller større end 0,8), kan man ikke isoleret forklare, deres effekt på responsvariablen Y, X-variablene påvirker samtidigt den anden X-variabel.Hvis vi har en multipel lineær regressionsmodel, der forudsiger Y-variablen brugtbilspriser, ud fra X-variablene, kørte km og alder på for bilen. Kørte km og alder på bilen, vil være kraftigt positivt korrelerede (jo ældre bil jo flere kørte km.). Det kan derfor evt. være svært isoleret at forklare effekten af at en bil er 1 år ældre, dette påvirker jo også km. kørt.
Klik her for at lære mere om multikollinearitet! kan opstå, når to uafhængige X-variable i en regressionsmodel er stærkt korrelerede. Dette betyder, at de indeholder meget af den samme information om variationen i den afhængige Y-variabel. Dette skaber problemer af flere årsager:
| Problem | Forklaring |
|---|---|
| Usikre koefficienter | Når uafhængige X-variable er kraftigt korrelerede, bliver det svært at skelne deres individuelle bidrag til variationen i den afhængige Y-variabel. Dette fører til usikre og ustabile koefficienter. |
| Forvrængede statistiske tests | p-værdiernep-værdien også kaldet signifikanssandsynligheden er et tal mellem 0 og 1,
den angiver sandsynligheden for, hvis nulhypotesen er sand, at få en mere
ekstrem teststørrelse, end den vi har fået i testet (teststørrelsen måler
forskellen mellem fx. stikprøvegennemsnit og middelværdien antaget i
nulhypotesen). Jo lavere p-værdi, des mindre tror vi på nulhypotesen Antag fx. at vi har en stikprøve af 100 mænds højde, med et gennemsnit på 176,32 cm. Vi ønsker at teste om middel højden i populationen, kan antages at være 210 cm dvs. H0: μ=210 H1: μ≠210 Vi vil her få en meget negativ teststørrelse, hvilket giver en mikroskopisk lille p-værdi. Det vil være nærmest umuligt at få en mere ekstrem teststørrelse, hvis den sande middelhøjde er 210 cm. Klik her for at lære mere om p-værdier! kan blive oppustede eller formindskede, hvilket kan føre til fejlagtige konklusioner om, hvorvidt en variabel er signifikant. |
| Afhængighed af små ændringer i data | Modellen kan blive meget følsom over for små ændringer i data, hvilket reducerer dens pålidelighed og generaliserbarhed. |
Tabel 11.3: Tre typer problemer, der kan opstå, når to uafhængige X-variable i en regressionsmodel er stærkt korrelerede (multikollinearitetMultikollinearitet er et problem, der kan opstå i en multipel lineær
regressionsmodel, hvis nogle af de forklarende X-variable indbyrdes er
meget kraftigt korrelerede (tommelfingerreglen angiver en
korrelationskoefficient mindre end -0,8 eller større end 0,8), kan man
ikke isoleret forklare, deres effekt på responsvariablen Y, X-variablene
påvirker samtidigt den anden X-variabel.
Hvis vi har en multipel lineær regressionsmodel, der forudsiger
Y-variablen brugtbilspriser, ud fra X-variablene, kørte km og alder på
for bilen. Kørte km og alder på bilen, vil være kraftigt positivt
korrelerede (jo ældre bil jo flere kørte km.). Det kan derfor evt. være
svært isoleret at forklare effekten af at en bil er 1 år ældre, dette
påvirker jo også km. kørt.
Klik her for at lære mere om multikollinearitet!).
Kilde: Egen tilvirkning.
Hvis vi har en multipel lineær regressionsmodel, der forudsiger Y-variablen brugtbilspriser, ud fra X-variablene, kørte km og alder på for bilen. Kørte km og alder på bilen, vil være kraftigt positivt korrelerede (jo ældre bil jo flere kørte km.). Det kan derfor evt. være svært isoleret at forklare effekten af at en bil er 1 år ældre, dette påvirker jo også km. kørt.
Klik her for at lære mere om multikollinearitet! er et problem, der kun kan opstå i en multipel lineær regressionsmodelLineær regression handler om at finde en simpel sammenhæng mellem to ting — fx temperatur (X) og issalg (Y). Hvor mange is sælger en kiosk, når temperaturen er 27 grader? Man samler data for temperaturer og issalg, tegner den bedste rette linje gennem punkterne — og aflæser svaret. Det er lineær regression.
Ved multipel lineær regression bruger man flere X-variable samtidig — fx både temperatur, ugedag og om det er ferie — for at forudsige Y (issalget) mere præcist.
Klik her for at lære mere om lineær regressionsanalyse!, da det jo kun er den indbyrdes korrelationKorrelationen angiver hvor meget 2 variable samvarierer, vi kan måle korrelationen vha. korrelationskoefficienten der er et tal mellem -1 og 1.
Korrelationskoefficienten er klart positiv hvis høje og lave værdier for den ene variabel følges med høje og lave værdier for den anden variabel.
Korrelationskoefficienten er klart negativ hvis høje og lave værdier for den ene variabel følges med lave og høje værdier for den anden variabel.
Er der ingen samvariation mellem 2 variable er korrelationskoefficienten tæt på 0.
Korrelationskoefficienten i en kiosk mellem afsætning af is og temperaturen vil være positiv, jo koldere/varmere det er jo mindre/større afsætning af is.
Korrelationskoefficienten i en kiosk mellem afsætning af varm kakao og temperaturen vil være negativ, jo koldere/varmere det er jo større/mindre afsætning af kakao.
For to variable som ikke er korrelerede (de samvarierer ikke) som fx. Apple aktie kursen og nedbørsmængden i Dragør, vil vi få en korrelationskoefficient tæt på 0.
Klik her for at lære mere om korrelationsanalyse! mellem to X-variable, der ikke må være for kraftig. Som en tommelfingerregel siger man at en korrelationskoefficientKorrelationen angiver hvor meget 2 variable samvarierer, vi kan måle korrelationen vha. korrelationskoefficienten der er et tal mellem -1 og 1.
Korrelationskoefficienten er klart positiv hvis høje og lave værdier for den ene variabel følges med høje og lave værdier for den anden variabel.
Korrelationskoefficienten er klart negativ hvis høje og lave værdier for den ene variabel følges med lave og høje værdier for den anden variabel.
Er der ingen samvariation mellem 2 variable er korrelationskoefficienten tæt på 0.
Korrelationskoefficienten i en kiosk mellem afsætning af is og temperaturen vil være positiv, jo koldere/varmere det er jo mindre/større afsætning af is.
Korrelationskoefficienten i en kiosk mellem afsætning af varm kakao og temperaturen vil være negativ, jo koldere/varmere det er jo større/mindre afsætning af kakao.
For to variable som ikke er korrelerede (de samvarierer ikke) som fx. Apple aktie kursen og nedbørsmængden i Dragør, vil vi få en korrelationskoefficient tæt på 0.
Klik her for at lære mere om korrelationsanalyse! mindre end -0,8 eller større end 0,8, giver problemer med multikollinearitetMultikollinearitet er et problem, der kan opstå i en multipel lineær regressionsmodel, hvis nogle af de forklarende X-variable indbyrdes er meget kraftigt korrelerede (tommelfingerreglen angiver en korrelationskoefficient mindre end -0,8 eller større end 0,8), kan man ikke isoleret forklare, deres effekt på responsvariablen Y, X-variablene påvirker samtidigt den anden X-variabel.
Hvis vi har en multipel lineær regressionsmodel, der forudsiger Y-variablen brugtbilspriser, ud fra X-variablene, kørte km og alder på for bilen. Kørte km og alder på bilen, vil være kraftigt positivt korrelerede (jo ældre bil jo flere kørte km.). Det kan derfor evt. være svært isoleret at forklare effekten af at en bil er 1 år ældre, dette påvirker jo også km. kørt.
Klik her for at lære mere om multikollinearitet!, således kan man ikke isoleret forklare hver X-variabels effekt på responsvariablen Y.
| Eksempel | Forklaring |
|---|---|
| Bilpriser forklaret ved km. og alder | Hvis vi har en multipel lineær regressionsmodelLineær regression handler om at finde en simpel sammenhæng mellem to ting — fx temperatur (X) og issalg (Y). Hvor mange is sælger en kiosk, når temperaturen er 27 grader? Man samler data for temperaturer og issalg, tegner den bedste rette linje gennem punkterne — og aflæser svaret. Det er lineær regression. Ved multipel lineær regression bruger man flere X-variable samtidig — fx både temperatur, ugedag og om det er ferie — for at forudsige Y (issalget) mere præcist. Klik her for at lære mere om lineær regressionsanalyse!, der forudsiger Y-variablen brugtbilspriser, ud fra X-variablene, kørte km og alder på for bilen. Kørte km og alder på bilen, vil være kraftigt positivt korrelerede (jo ældre bil jo flere kørte km.). Det kan derfor evt. være svært isoleret at forklare effekten af at en bil er 1 år ældre, dette påvirker jo også km. kørt. Her kunne man overveje at udelade f.eks. bilens alder, hvis korrelationskoefficientenKorrelationen angiver hvor meget 2 variable samvarierer, vi kan måle korrelationen vha. korrelationskoefficienten der er et tal mellem -1 og 1. Korrelationskoefficienten er klart positiv hvis høje og lave værdier for den ene variabel følges med høje og lave værdier for den anden variabel. Korrelationskoefficienten er klart negativ hvis høje og lave værdier for den ene variabel følges med lave og høje værdier for den anden variabel. Er der ingen samvariation mellem 2 variable er korrelationskoefficienten tæt på 0. Korrelationskoefficienten i en kiosk mellem afsætning af is og temperaturen vil være positiv, jo koldere/varmere det er jo mindre/større afsætning af is. Korrelationskoefficienten i en kiosk mellem afsætning af varm kakao og temperaturen vil være negativ, jo koldere/varmere det er jo større/mindre afsætning af kakao. For to variable som ikke er korrelerede (de samvarierer ikke) som fx. Apple aktie kursen og nedbørsmængden i Dragør, vil vi få en korrelationskoefficient tæt på 0. Klik her for at lære mere om korrelationsanalyse! er over 0,8. |
| Huspriser forklaret ved værelser og kvm. |
Skal man fx forudsige kontantprisen på parcelhuse ud fra f.eks. antal værelser og antal kvadratmeter, vil
værelser og
kvadratmeter nok være kraftigt positivt korrelerede. Hvis korrelationskoefficientenKorrelationen angiver hvor meget 2 variable samvarierer, vi kan måle
korrelationen vha. korrelationskoefficienten der er et tal mellem -1 og
1. Korrelationskoefficienten er klart positiv hvis høje og lave værdier for den ene variabel følges med høje og lave værdier for den anden variabel. Korrelationskoefficienten er klart negativ hvis høje og lave værdier for den ene variabel følges med lave og høje værdier for den anden variabel. Er der ingen samvariation mellem 2 variable er korrelationskoefficienten tæt på 0. Korrelationskoefficienten i en kiosk mellem afsætning af is og temperaturen vil være positiv, jo koldere/varmere det er jo mindre/større afsætning af is. Korrelationskoefficienten i en kiosk mellem afsætning af varm kakao og temperaturen vil være negativ, jo koldere/varmere det er jo større/mindre afsætning af kakao. For to variable som ikke er korrelerede (de samvarierer ikke) som fx. Apple aktie kursen og nedbørsmængden i Dragør, vil vi få en korrelationskoefficient tæt på 0. Klik her for at lære mere om korrelationsanalyse! er højere end 0,8 kunne man f.eks. udelade værelser, da denne diskrete variabel har en grovere og mindre præcis inddeling end kvadratmeter. |
Tabel 11.4: To eksempler på multikollinearitetMultikollinearitet er et problem, der kan opstå i en multipel lineær
regressionsmodel, hvis nogle af de forklarende X-variable indbyrdes er
meget kraftigt korrelerede (tommelfingerreglen angiver en
korrelationskoefficient mindre end -0,8 eller større end 0,8), kan man
ikke isoleret forklare, deres effekt på responsvariablen Y, X-variablene
påvirker samtidigt den anden X-variabel.
Hvis vi har en multipel lineær regressionsmodel, der forudsiger
Y-variablen brugtbilspriser, ud fra X-variablene, kørte km og alder på
for bilen. Kørte km og alder på bilen, vil være kraftigt positivt
korrelerede (jo ældre bil jo flere kørte km.). Det kan derfor evt. være
svært isoleret at forklare effekten af at en bil er 1 år ældre, dette
påvirker jo også km. kørt.
Klik her for at lære mere om multikollinearitet! mellem forklarende variable — brugtbilspriser (km og alder) og huspriser (værelser og kvm.).
Kilde: Egen tilvirkning.
Hvis vi har en multipel lineær regressionsmodel, der forudsiger Y-variablen brugtbilspriser, ud fra X-variablene, kørte km og alder på for bilen. Kørte km og alder på bilen, vil være kraftigt positivt korrelerede (jo ældre bil jo flere kørte km.). Det kan derfor evt. være svært isoleret at forklare effekten af at en bil er 1 år ældre, dette påvirker jo også km. kørt.
Klik her for at lære mere om multikollinearitet!, som ligger udenfor bogens pensum. Har man en model med multikollinearitetMultikollinearitet er et problem, der kan opstå i en multipel lineær regressionsmodel, hvis nogle af de forklarende X-variable indbyrdes er meget kraftigt korrelerede (tommelfingerreglen angiver en korrelationskoefficient mindre end -0,8 eller større end 0,8), kan man ikke isoleret forklare, deres effekt på responsvariablen Y, X-variablene påvirker samtidigt den anden X-variabel.
Hvis vi har en multipel lineær regressionsmodel, der forudsiger Y-variablen brugtbilspriser, ud fra X-variablene, kørte km og alder på for bilen. Kørte km og alder på bilen, vil være kraftigt positivt korrelerede (jo ældre bil jo flere kørte km.). Det kan derfor evt. være svært isoleret at forklare effekten af at en bil er 1 år ældre, dette påvirker jo også km. kørt.
Klik her for at lære mere om multikollinearitet!, kan man derfor udelade den ene af de forklarende X-variable af modellen.
Quiz
Selvtest
Spørgsmål
Vi ser fortsat på datasættet med sommerhuse på Rømø. Kan det seneste moderniseringsår forklare lejeprisen pr. uge?
Vi får en p-værdi på 0,0347 altså mindre end signifikansniveauet 5%. Dette betyder vi kan forkaste nulhypotesen i testet:
$$H_{0}:\beta_{Moderniseret}=0\ Moderniseret\ har\ ingen\ effekt$$ $$H_{1}:\beta_{Moderniseret}\neq0\ Moderniseret\ har\ effekt$$
Vi kan altså afvise at hældningen $\beta_{Moderniseret}$ er nul, hvilket betyder moderniseringår seneste har signifikant effekt. Hvis moderniseringsåret er et år senere vokser lejeprisen med 137,33 DKK., hvilket giver god mening. Her giver skæringen absolut ikke mening, skæringen svarer jo til at den forklarende variabel årstal er lig med nul, hvilket jo ville betyde at ugelejen for et sommerhus moderniseret det år Jesus blev født ville være -270884 DKK. Man får altså over kvart million om ugen, for at bo i det gamle skrammelhus ifølge modellen. Her er naturligvis tale om ekstrem ekstrapolation der ikke giver mening.
Modellens forklaringskraft R-kvadreret er kun 0,0786, hvilket er meget lavt, det betyder der er mange andre faktorer, der forklarer lejeprisen. Vi ved jo fra forrige analyse, at også størrelsen på sommerhuset forklarer en del af lejeprisen. I næste afsnit se hvordan vi med multipel regressionsanalyse kan kombinere flere forklarende variable.Vi får en p-værdi på 0,0945 altså større end signifikansniveauet. Dette betyder vi kan ikke forkaste nulhypotesen i testet: $$H_{0}:\beta_{Strandafstand}=0\ Strandafstand\ har\ ingen\ effekt$$ $$H_{1}:\beta_{Strandafstand}\neq0\ Strandafstand\ har\ effekt$$
Vi kan altså ikke afvise at hældningen $\beta_{Strandafstand}$ er nul, hvilket betyder moderniseringår seneste ikke har signifikant effekt. Det betyder vi kan ikke bruge modellen. Bemærk det er muligt variablen ville være signifikant, hvis den indgår i en multipel lineær regression, den er næsten signifikant i den simple lineære model. Når vi kontrollerer for andre forklarende variable i en multipel model, kan dette medføre den bliver signifikant. Bemærk hældningskoeficienten -1,04 i modellen er negativ hvilket vi ville forvente jo større afstand til strand jo lavere lejepris.
Benyt ovenstående datasæt til at opstille en multipel lineær regressionsmodel, der kan forklare husleje for
lejelejligheder ud fra følgende forklarende variable:
Værelser, Størrelse, Depositum, Aconto,
Forudbetalt leje, Elevator, Altan, moebleret, Storby og Region.
Bemærk du skal filtrere datasættet, så du udelukkende ser på lejelejligheder, dvs. observationer med
huse og værelser skal fjernes fra datasættet.
Data er ikke klargjorte mht. til dummy-variable, dvs. eventuelle kvalitative variable skal omdannes til
dummy-variable.
Startmodel med 13 forklarende variable:

Der foretages nu trinvis reduktion, for at fjerne insignifikante forklarende variable
Slutmodel med 11 forklarende variable:

Forudsætningen om fravær af multikollinearitet, er ikke helt opfyldt da korrelationen mellem Værelser og Størrelse er kraftig positiv, og større end grænsen på 0,8. Vi ender med at fjerne Værelser, da denne variabel er insignifikant. Så problemet er således ikke i slutmodellen.
Bemærk der er kraftig positiv korrelation mellem responsvariablen Husleje og den forklarende variabel Depositum, dette er fint, multikollinearitet er udelukkende for kraftig korrelation mellem forklarende variable.
Bemærk Freestats korrelationsmatrice kan kun håndtere 10 variable, derfor er der indsat 2 korrelationsmatricer nedenfor:


Residualplottet nedenfor viser forudsætningerne om varianshomogenitet og uafhængige residualer er opfyldt.

Normalfraktildiagrammet nedenfor viser forudsætningen om normalitet af residualerne er opfyldt.

Se videoen for uddybende kommentarer omkring tolkning af parameter estimater samt dannelse af dummy-variable.
Tolkningen af parameter estimaterne bliver:
Ifølge modellen koster en 0 kvadratmeter umøbleret lejelejlighed i region Hovedstaden i et ikke storby område, hvor Depositum, Aconto og Forudbetalt leje er 0 kr. uden altan og elevator 1799 kr. om måneden.
For hver kvadratmeter større lejligheden er stiger den månedlige leje med 51 kr.
For hver krone depositum er højere stiger den månedlige leje med 0,14 kr. altså 14 øre.
For hver krone forudbetalt leje er højere stiger den månedlige leje med 5 øre.
Hvis der er elevator i ejendommen er den månedlige leje 227 kr. højere.
Hvis der er altan i lejelejligheden er den månedlige leje 199 kr. højere.
Er lejelejligheden møbleret er den månedlige leje 1.559 kr. højere.
Ligger lejelejligheden i en storby er den månedlige leje 1.300 kr. højere.
Ligger lejelejligheden i region Midtjylland er den månedlige leje 2.077 kr. lavere end i region Hovedstaden.
Ligger lejelejligheden i region Syddanmark er den månedlige leje 2.898 kr. lavere end i region Hovedstaden.
Ligger lejelejligheden i region Sjælland er den månedlige leje 1.478 kr. lavere end i region Hovedstaden.
Ligger lejelejligheden i region Nordjylland er den månedlige leje 3.214 kr. lavere end i region Hovedstaden.
Alder målt som kundens alder i år
Bruttoindkomst pr. år målt i kr.
Kundeanciennitet målt som antal år kunden har været kunde i banken Om kunden har haft overtræk (0 = ikke overtræk og 1 = overtræk)
Om kunden bor i ejerbolig (0 = ikke ejerbolig og 1 = ejerbolig)
Banken har i maj 2016 ved tilfældig udvælgelse udtrukket en stikprøveEn stikprøve, er et udsnit af populationen (den store mængde vi ønsker at udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde, kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så alle danske mænd.
Klik her for at lære mere om stikprøver! på 28 kunder og undersøgt placering i rating-systemet samt de ovenfor nævnte variable.
Resultatet af denne dataindsamling findes i den udleverede Excel-fil.
Spørgsmål 1,1 (25 %)
Opstil en model der kan forklare kunders placering i rating-systemet. Alle forklarende variable skal være signifikante på 5 % niveau.
Fortolk dine resultater og vurdér i hvilken grad modellen er brugbar for Nykøbing Bank.
Spørgsmål 1,2 (5 %)
Beregn ved hjælp af din signifikante model fra spørgsmål 1,1 hvilken rating nedenstående kunde vil opnå:
Alder 34 år
Bruttoindkomst 580.000 kr. Har været kunde i banken i 3 år Har ikke haft overtræk Bor i ejerbolig.
Du finder hele opgaven i linket:
2016 8 Eksamen Statistik Opgave
2016 8 Eksamen Statistik Data