11. Lineær regressionsanalyse
11. Lineær regressionsanalyse

11. Lineær regressionsanalyse



Hvis en variabel Y, påvirkes lineært af en anden X, kan vi bestemme en lineær funktion til at forudsige værdien af Y for værdier af X. Nedenfor er et mini-eksempel vi kun benytter for at vise hvad det er vi beregner. Vi går ikke i detaljer med de matematiske beviser og formler bag teknikken.

Joe & The Juice

En kvik juicer har observeret hvordan vejret er, og hvor mange Go Away Doc-drinks der er solgt.

Temperatur Drinks
2 1
4 5
8 6

Tabel 11.1: Observerede temperaturer og antal solgte Go Away Doc-drinks hos Joe & The Juice — mini-eksempel til beregning af den simple lineære regressionslinje.
Kilde: Egen tilvirkning.

Det virker ikke logisk at salget på Joe & The Juice påvirker temperaturen, derimod giver det god mening at temperaturen påvirker salget af drinks. Vi angiver salget af drinks på y-aksen og temperaturen på x-aksen.

Variablen vi ønsker at forudsige, her salget af drinks, kalder vi:

  • Y
  • Responsvariablen
  • Den forklarede variabel
  • Den afhængige variabel
  • Den endogene variabel

En variabel vi bruger til at forudsige, her temperaturen, kaldes:

  • X
  • Prædiktoren
  • Den forklarende variabel
  • Den uafhængige variabel
  • Den eksogene variabel

Baseret på observationerne kan vi forsøge at forudsige salget af drinks, til dette formål opstiller vi en lineær model. Normalt når vi har en lineær funktion har vi i matematik lært at denne har forskriften

$$y=ax+b$$

Når vi har at gøre med lineær regression bruger vi typisk betegnelsen $\beta_{1}$ eller mere sigende $\beta_{temperatur}$ eller $\beta_{temp}$ om hældningskoefficienten a. Vi bruger ofte betegnelsen $\beta_{0}$ eller $\alpha$ om skæringen med y-aksen b også kaldet interceptet.

Det betyder vores gamle matematik formel for linjen $$y=ax+b$$ Bliver til vores model af virkeligheden: $$\hat{Y}=\hat{\beta}_{temp}⋅X_{temp}+\hat{\beta}_{0}$$ For at vi kan bruge modellen til at sige noget om salget af drinks, skal vi baseret på vore observationer estimere hældningskoefficienten $\beta_{temp}$ og skæringen $\beta_{0}$. Vi kender ikke de sande værdier parametrene $\beta_{temp}$ og $\beta_{0}$, men ud fra vore faktiske observationer kan vi give vores bedste gæt parameterestimaterne $\hat{\beta}_{temp}$ og $\hat{\beta}_{0}$. Software beregner parameterestimaterne til linjen, der bedst beskriver sammenhængen mellem den uafhængige variabel temperatur og responsvariablen drinks. Vi kalder denne linje regressionslinjen. Da den beregnede værdi af antallet af drinks er baseret på estimater, vælger vi at skrive $\hat{Y}$ i stedet for Y.

Nedenstående forklaring på metoden til beregning af modellens forklaringskraft, kan være svær at forstå. Det er ikke nødvendigt for at fortolke modellerne, men kan give indsigt i mekanikken bag modellen.

Når vi beregner estimaterneEstimat betyder gæt.
Hvis vi har en stikprøve, hvor vi har målt 100 mænds højde til gennemsnitligt 179 cm., er vores bedste gæt på middelhøjden i populationen 179 cm. Vi kan skrive vort estimat for μ er 179 cm.

Klik her for at lære mere om parametre og parameter-estimater!
for regressionslinjen, bruger vi en metode, der kaldes mindste kvadraters metodeMindste kvadraters metode (OLS — Ordinary Least Squares) finder den bedste rette linje gennem datapunkter ved at minimere summen af de kvadrerede afstande fra punkterne til linjen.
Adrien-Marie Legendre publicerede metoden først i 1805; Carl Friedrich Gauss hævdede at have brugt den allerede fra 1795, men offentliggjorde først sin udgave i 1809. Metoden er stadig grundlaget for lineær regression og mange AI-modeller — hvert lag i et neuralt netværk er i bund og grund en lineær regression.

Klik her for at lære mere om lineær regression i kapitel 11!
(på engelsk ordinary least squares OLSMindste kvadraters metode (OLS — Ordinary Least Squares) finder den bedste rette linje gennem datapunkter ved at minimere summen af de kvadrerede afstande fra punkterne til linjen.
Adrien-Marie Legendre publicerede metoden først i 1805; Carl Friedrich Gauss hævdede at have brugt den allerede fra 1795, men offentliggjorde først sin udgave i 1809. Metoden er stadig grundlaget for lineær regression og mange AI-modeller — hvert lag i et neuralt netværk er i bund og grund en lineær regression.

Klik her for at lære mere om lineær regression i kapitel 11!
) til at beregne vore estimaterEstimat betyder gæt.
Hvis vi har en stikprøve, hvor vi har målt 100 mænds højde til gennemsnitligt 179 cm., er vores bedste gæt på middelhøjden i populationen 179 cm. Vi kan skrive vort estimat for μ er 179 cm.

Klik her for at lære mere om parametre og parameter-estimater!
.

Vi får software til at beregne de 2 estimater: $$\hat{\beta}_{temp}=0{,}75 \ \ \hat{\beta}_{0}=0{,}5$$ Disse parameterestimater kan vi nu indsætte i modellen: $$\hat{Y}=\hat{\beta}_{temp}⋅X_{temp}+\hat{\beta}_{0}$$ $$\hat{Y}=0{,}75⋅X_{temp}+0{,}5$$ Når vi kender en temperatur fx. 6 grader, kan vi indsætte denne værdi i regressionslinjen, i stedet for $X_{temp}$ og forudsige/estimere hvad salget af drinks vil være. $$\hat{Y}=0{,}75⋅X_{temp}+0{,}5⇔$$ $$\hat{Y}=0{,}75⋅6+0{,}5⇔$$ $$\hat{Y}=5$$ Vi kan i figuren se at de sorte prikker er faktiske observationer, og linjen er modellen af virkeligheden. Vi har beregnet modellens forudsigelse af drinkssalget ved de 3 temperaturer 2, 4 og 8 grader, modellens forudsigelser er illustreret ved sorte trekanter. Vi kalder forskellen mellem observerede og estimerede værdier for residualer, definitionen for residualer er altså observeret minus estimeret (forudsagt) værdi. Man benytter ofte det græske bogstav epsilon ϵ til at betegne residualerne. For at have et mål for hvor stor forskellen mellem modellen og de faktiske observationer er samlet set, bruger vi summen af de kvadrerede residualer SSR. Residualer af observerede salg af drinks beregnes som: $$SSR=(1-2)^{2}+(5-3{,}5)^{2}+(6-6{,}5)^{2}=1+2{,}25+0{,}25=3{,}5$$ Vi kalder værdien for summen af kvadrerede residualer på engelsk SSR sums of squared residuals, de 3 kvadrerede residualer er illustreret som de 3 grå kvadrater i figuren nedenfor.

Figur 11.1: Joe & The Juice: observationer (punkter), forudsagte værdier (trekanter), residualerResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen er altså 1 mio. under den ifølge modellen forventede pris.


Klik her for at lære mere om lineær regressionsanalyse!
(stiplede linjer) og kvadrerede residualerResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen er altså 1 mio. under den ifølge modellen forventede pris.


Klik her for at lære mere om lineær regressionsanalyse!
(grå kvadrater). SSR = 1 + 2,25 + 0,25 = 3,5. Hold musen over punkterne for fx «4 grader 5 drinks».
Kilde: Egen tilvirkning.

Hvis der ikke er en lineær sammenhæng mellem temperatur og drinkssalg, og regressionslinjen derfor ikke kan bruges til at forklare salget, så kan vi i stedet benytte det observerede gennemsnitlige salg af drinks. Vi beregner det gennemsnitlige salg af drinks i stikprøven som $\frac{1+5+6}{3}=\frac{12}{3}=4$ . Vi beregner nu de summen af de kvadrerede afvigelser fra det gennemsnitlige observerede salg af drinks som: $$SST=(1-4)^{2}+(5-4)^{2}+(6-4)^{2}=9+1+4=14$$ Vi kalder værdien for summen af kvadrerede afvigelser total på engelsk SST sums of squared total, de 3 kvadrerede afvigelser er illustreret som de 3 grå kvadrater i figuren nedenfor.

Figur 11.2: Joe & The Juice: observationer (punkter), gennemsnitligt salg ȳ = 4 (trekanter), afvigelser fra gennemsnittet (stiplede linjer) og kvadrerede afvigelser (grå kvadrater). SST = 9 + 1 + 4 = 14, og R-kvadratet = 1 − SSR/SST = 0,75. Hold musen over punkterne for fx «4 grader 5 drinks».
Kilde: Egen tilvirkning.

Vi kan vise hvor godt responsvariablen forklares ud fra den forklarende variabel i modellen, vha. forholdet mellem SSR og SST. Er SSR og SST næsten ens, vinder vi ikke meget ved at beskrive responsvariablen Y ud fra den forklarende variabel X. SST vil aldrig være mindre end SSR, da en linje med tilpasset hældningskoefficient altid vil beskrive observationerne mindst lige så godt som en vandret linje. Vi beskriver modellens forklaringskraft ud fra R-kvadreret som er defineret som:

$$1-\frac{SSR}{SST}=1-\frac{3{,}5}{14}=1-0{,}25=0{,}75$$ Vi kan udtrykke dette som at 75% af variationen i responsvariablen - Drinks solgt kan forklares ved variationen i den forklarende variabel - Temperatur. Denne forklaringskraft afhænger dog af om der er nok observationer, og at disse viser at hældningen på den rette linje er signifikant forskellig fra 0. Er hældningen på linjen 0, betyder det, at man sælger samme antal drinks ligegyldigt hvordan vejret er. Vi bør have flere observationer end de kun 3 vi benytter i dette minieksempel.

Her har vi kun en forklarende variabel temperatur, vi kalder derfor specielt analysen for simpel lineær regressionLineær regression handler om at finde en simpel sammenhæng mellem to ting — fx temperatur (X) og issalg (Y). Hvor mange is sælger en kiosk, når temperaturen er 27 grader? Man samler data for temperaturer og issalg, tegner den bedste rette linje gennem punkterne — og aflæser svaret. Det er lineær regression.
Ved multipel lineær regression bruger man flere X-variable samtidig — fx både temperatur, ugedag og om det er ferie — for at forudsige Y (issalget) mere præcist.

Klik her for at lære mere om lineær regressionsanalyse!
. Vi vil senere se på analyse vha. lineær regressionLineær regression handler om at finde en simpel sammenhæng mellem to ting — fx temperatur (X) og issalg (Y). Hvor mange is sælger en kiosk, når temperaturen er 27 grader? Man samler data for temperaturer og issalg, tegner den bedste rette linje gennem punkterne — og aflæser svaret. Det er lineær regression.
Ved multipel lineær regression bruger man flere X-variable samtidig — fx både temperatur, ugedag og om det er ferie — for at forudsige Y (issalget) mere præcist.

Klik her for at lære mere om lineær regressionsanalyse!
med flere forklarende variable, denne analysetype kalder vi for multipel lineær regressionLineær regression handler om at finde en simpel sammenhæng mellem to ting — fx temperatur (X) og issalg (Y). Hvor mange is sælger en kiosk, når temperaturen er 27 grader? Man samler data for temperaturer og issalg, tegner den bedste rette linje gennem punkterne — og aflæser svaret. Det er lineær regression.
Ved multipel lineær regression bruger man flere X-variable samtidig — fx både temperatur, ugedag og om det er ferie — for at forudsige Y (issalget) mere præcist.

Klik her for at lære mere om lineær regressionsanalyse!
.

Freestat output lineær regression

Vi kan få software til at beregne output for os, i Freestat kan fanen mreg, benyttes til lineær regression . Vi skal altid taste værdier for responsvariablen Y i I-søjlen husk overskift. Vi sætter en eller flere forklarende variable i de efterfølgende søjler.

stikprøver

I cellen C11 ses SSR som vi tidligere regnede ud til at være 3,5.
I cellen C12 ses SST som vi tidligere regnede ud til at være 14.
I cellen B3 ses R-kvadreret som vi tidligere regnede ud til at være 0,75.
I cellen B15 ses estimatet for parameteren $\beta_{0}$ altså $\hat{\beta}_{0}$.
I cellen B16 ses estimatet for parameteren $\beta_{temp}$ altså $\hat{\beta}_{temp}$.
I cellerne I3-I5 har vi de faktiske værdier.
I cellerne G3-G5 har vi de forventede eller forudsagte værdier.
I cellerne H3-H5 har vi residualerneResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen er altså 1 mio. under den ifølge modellen forventede pris.


Klik her for at lære mere om lineær regressionsanalyse!
, dette er faktisk minus forudsagt.

Vi nævnte tidligere at modellen her egentlig er urealistisk lille, dette resulterer i at den ikke kan bruges til noget, da den ene forklarende variabel ikke er signifikant.

Vi opstiller et t-test, for at afgøre om temperaturen har en effekt:
$$H_{0}:\beta_{temp}=0\ Den\ forklarende\ variabel\ er\ ikke\ signifikant$$ $$H_{1}:\beta_{temp}\neq0\ Den\ forklarende\ variabel\ er\ signifikant$$ Nulhypotesen betyder at vi ikke kan afvise at hældningen på regressionslinjen er 0, hvilket betyder at den vil være vandret. Hvis regressionslinjen er vandret, har temperaturen ingen effekt på salget, salget vil jo være konstant ifølge modellen.

AlternativhypotesenAlternativhypotesen H1 eller Ha er det modsatte udsagn af nulhypotesen i et hypotesetest, vi har aldrig lighedstegn i alternativhypotesen. Der skal stærke beviser til at forkaste nulhypotesen, sker dette tror vi på udsagnet i alternativhypotesen.
Eksempler på alternativhypoteser er:
H1: μ≠45 (Middelværdien er ikke 45)
H1: μ<45 (Middelværdien er mindre end 45)
H1: μ>45 (Middelværdien er større end 45)

Klik her for at lære mere om hypotesetests!
siger derimod at den ene forklarende variabel er signifikant forskellig fra 0. Det vil altså sige at temperaturen har effekt på drinkssalg.

I cellen D16 ses t-teststørrelsen for testet af $\beta_{temp}$ . Er teststørrelsen cirka mindre end -2 eller større end 2, får vi en p-værdi der er mindre end 0,05. I cellen E16 ses p-værdien for testet, her er p-værdien større end 0,05, hvilket betyder, vi kan ikke forkaste nulhypotesen. Vi kan altså ikke afvise at $\beta_{temp}=0$ , hvilket vil sige temperaturen påvirker ikke salget af drinks signifikant. Havde vi haft en større stikprøvestørrelse, er det muligt, vi havde kunnet konkludere at hældningen $\beta_{temp}$ var signifikant forskellig fra 0.

Den simple lineære regression er byggestenen i mange kreditscorings- og forecastingmodeller, og moderne ML-modeller som Random ForestRandom Forest kombinerer mange beslutningstræer til én model. Hvert træ ser på et tilfældigt udsnit af data, og flertallet af træernes svar bliver det endelige resultat — derfor "skov".
Leo Breiman introducerede metoden i 2001; den er i dag en af de mest populære inden for maskinlæring. Han startede som fysiker og arbejdede med kernevåben, før han skiftede til statistik.

Klik her for at læse mere om Random Forest i kapitel 1!
og gradient boosting er i høj grad udvidelser af samme grundtanke.

Simpel lineær regression Rømø



Hent Datasættet Sommerhuse Rømø der benyttes i videoerne

Hvis vi ønsker at undersøge om lejeprisen på sommerhuse afhænger af størrelsen på sommerhuset, kan vi benytte lineær regressionsanalyseLineær regression handler om at finde en simpel sammenhæng mellem to ting — fx temperatur (X) og issalg (Y). Hvor mange is sælger en kiosk, når temperaturen er 27 grader? Man samler data for temperaturer og issalg, tegner den bedste rette linje gennem punkterne — og aflæser svaret. Det er lineær regression.
Ved multipel lineær regression bruger man flere X-variable samtidig — fx både temperatur, ugedag og om det er ferie — for at forudsige Y (issalget) mere præcist.

Klik her for at lære mere om lineær regressionsanalyse!
til at afgøre om lejeprisen kan forudsiges størrelsen.

For at vi kan beskrive responsvariablen vha. lineær regression, skal der være en lineær sammenhæng, dette kan vi undersøge ved at plotte de 2 variable i et XY punktdiagram. I datasættet findes data som lejepriser og størrelse, for 57 sommerhuse beliggende på Rømø. Vi kan undersøge, om der er en lineær sammenhæng mellem disse i et punktdiagram. Det er naturligt at antage at lejeprisen afhænger af størrelsen og ikke omvendt, dvs. responsvariablen Y er lejepris og den uafhængige variabel X er størrelsen i kvm. Vi kan forvente en positiv sammenhæng mellem de 2 variable, dvs. jo større sommerhus jo større lejepris.

Ud fra figuren, er antagelsen om en lineær sammenhæng rimelig.

Figur 11.3: Rømø: lejepris pr. uge vs. størrelse (n = 57) med regressionslinje ŷ = 61,32·kvm + 709. Hold musen over punkterne for koordinater.
Kilde: Egen tilvirkning baseret på datasættet Sommerhuse leje Rømø.

Når man producerer en simpel lineær regression i Freestat fanen linreg, får man automatisk linjetilpasningsplot, residualplotResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen er altså 1 mio. under den ifølge modellen forventede pris.


Klik her for at lære mere om lineær regressionsanalyse!
og normalfraktildiagramNormalfraktildiagrammer kan bruges til at afgøre, om en stikprøve kan antages at stamme fra normalfordelt population.
Hvis punkterne ligger pænt omkring den rette linje er normalitetsbetingelsen opfyldt. Ved test af fx. en mindre kvantitativ stikprøve og varianshomogenitet forudsættes at variablene opfylder normalitetsbetingelsen.

Klik her for at lære mere om normalfraktildiagrammer!
. Freestat giver os ligeledes følgende beregninger:

stikprøver

Brugbarhed, signifikanssandsynlighed og R-kvadreret

Modellen er signifikant ud fra p-værdienp-værdien også kaldet signifikanssandsynligheden er et tal mellem 0 og 1, den angiver sandsynligheden for, hvis nulhypotesen er sand, at få en mere ekstrem teststørrelse, end den vi har fået i testet (teststørrelsen måler forskellen mellem fx. stikprøvegennemsnit og middelværdien antaget i nulhypotesen).
Jo lavere p-værdi, des mindre tror vi på nulhypotesen
Antag fx. at vi har en stikprøve af 100 mænds højde, med et gennemsnit på 176,32 cm.
Vi ønsker at teste om middel højden i populationen, kan antages at være 210 cm dvs.
H0: μ=210
H1: μ≠210
Vi vil her få en meget negativ teststørrelse, hvilket giver en mikroskopisk lille p-værdi.
Det vil være nærmest umuligt at få en mere ekstrem teststørrelse, hvis den sande middelhøjde er 210 cm.


Klik her for at lære mere om p-værdier!
i cellen E12 eller E16, dvs. størrelsen har klart en effekt på lejeprisen. Vi tester begge steder hypotesen

$$H_{0}:\beta_{Kvm}=0\ variablen\ kvm.\ har\ ingen\ effekt$$ $$H_{1}:\beta_{Kvm}\neq0\ variablen\ kvm.\ har\ effekt$$

Størrelsen har en effekt, da p-værdienp-værdien også kaldet signifikanssandsynligheden er et tal mellem 0 og 1, den angiver sandsynligheden for, hvis nulhypotesen er sand, at få en mere ekstrem teststørrelse, end den vi har fået i testet (teststørrelsen måler forskellen mellem fx. stikprøvegennemsnit og middelværdien antaget i nulhypotesen).
Jo lavere p-værdi, des mindre tror vi på nulhypotesen
Antag fx. at vi har en stikprøve af 100 mænds højde, med et gennemsnit på 176,32 cm.
Vi ønsker at teste om middel højden i populationen, kan antages at være 210 cm dvs.
H0: μ=210
H1: μ≠210
Vi vil her få en meget negativ teststørrelse, hvilket giver en mikroskopisk lille p-værdi.
Det vil være nærmest umuligt at få en mere ekstrem teststørrelse, hvis den sande middelhøjde er 210 cm.


Klik her for at lære mere om p-værdier!
er mindre end 0,0001 og dermed er klart under signifikansniveauetSignifikansniveauet α typisk 1%, 5% eller 10%, fastsættes inden et test og sammenlignes med p-værdien.
Er p-værdien mindre end signifikansniveauet forkastes nulhypotesen, ellers ikke.
Signifikansniveauet angiver sandsynligheden for at forkaste en sand nulhypotese (en type 1 fejl også kaldet en falsk positiv)
Medicinal industrien arbejder ofte med 1% signifikansniveau, hvor et test kunne være:
H0: Medicinen har ingen effekt
H1: Medicinen har effekt
Med 1% signifikansniveau, begås en type 1 fejl kun i et ud af 100 tests.
En type 1 fejl vil her betyde, at man fejlagtigt konkluderer at et medicinal produkt uden effekt virker.
Signifikansniveauet kan bruges til at bestemme konfidensniveauet 1-α, der angiver sandsynligheden for korrekt ikke at forkaste en sand nulhypotese


Klik her for at lære mere om signifikansniveauet!
på 5%. Vi forkaster nulhypotesenNulhypotesen H0 er vores grundtro i et hypotesetest, vi har altid lighedstegn i nulhypotesen. Der skal stærke beviser til at forkaste nulhypotesen.
Eksempler på nulhypoteser er:
H0: μ=45 (Middelværdien er 45)
H0: μ≤45 (Middelværdien er højst 45)
H0: μ≥45 (Middelværdien er mindst 45)

Klik her for at lære mere om hypotesetests!
, og konstaterer den forklarende variabel Kvm. har en effekt på responsvariablen Lejepris pr. uge.

EstimatetEstimat betyder gæt.
Hvis vi har en stikprøve, hvor vi har målt 100 mænds højde til gennemsnitligt 179 cm., er vores bedste gæt på middelhøjden i populationen 179 cm. Vi kan skrive vort estimat for μ er 179 cm.

Klik her for at lære mere om parametre og parameter-estimater!
for skæringen med y-aksen 709,32 er ikke signifikant, p-værdienp-værdien også kaldet signifikanssandsynligheden er et tal mellem 0 og 1, den angiver sandsynligheden for, hvis nulhypotesen er sand, at få en mere ekstrem teststørrelse, end den vi har fået i testet (teststørrelsen måler forskellen mellem fx. stikprøvegennemsnit og middelværdien antaget i nulhypotesen).
Jo lavere p-værdi, des mindre tror vi på nulhypotesen
Antag fx. at vi har en stikprøve af 100 mænds højde, med et gennemsnit på 176,32 cm.
Vi ønsker at teste om middel højden i populationen, kan antages at være 210 cm dvs.
H0: μ=210
H1: μ≠210
Vi vil her få en meget negativ teststørrelse, hvilket giver en mikroskopisk lille p-værdi.
Det vil være nærmest umuligt at få en mere ekstrem teststørrelse, hvis den sande middelhøjde er 210 cm.


Klik her for at lære mere om p-værdier!
i celle E15 15,61% er jo større end 5% signifikansniveauetSignifikansniveauet α typisk 1%, 5% eller 10%, fastsættes inden et test og sammenlignes med p-værdien.
Er p-værdien mindre end signifikansniveauet forkastes nulhypotesen, ellers ikke.
Signifikansniveauet angiver sandsynligheden for at forkaste en sand nulhypotese (en type 1 fejl også kaldet en falsk positiv)
Medicinal industrien arbejder ofte med 1% signifikansniveau, hvor et test kunne være:
H0: Medicinen har ingen effekt
H1: Medicinen har effekt
Med 1% signifikansniveau, begås en type 1 fejl kun i et ud af 100 tests.
En type 1 fejl vil her betyde, at man fejlagtigt konkluderer at et medicinal produkt uden effekt virker.
Signifikansniveauet kan bruges til at bestemme konfidensniveauet 1-α, der angiver sandsynligheden for korrekt ikke at forkaste en sand nulhypotese


Klik her for at lære mere om signifikansniveauet!
,

$$H_{0}:\beta_{0}=0\ Lejeprisen\ for\ et\ 0\ kvm\ hus\ er\ 0\ DKK$$ $$H_{1}:\beta_{0}\neq0\ Lejeprisen\ for\ et\ 0\ kvm\ hus\ er\ forskellig\ fra\ 0\ DKK$$

Skæringen kunne derfor være fx. 0. Normalt interesserer denne test os ikke, vi udelader derfor test af skæringen fra fremtidige analyser. For at sikre den optimale tilpasning af regressionslinjen (og dermed minimere residualerneResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen er altså 1 mio. under den ifølge modellen forventede pris.


Klik her for at lære mere om lineær regressionsanalyse!
), bibeholder vi altid skæringen i modellen.

Ud fra R-kvadreret i cellen B3 konstateres at 69% af variationen i responsvariablen Lejepris pr uge, kan forklares ud fra variationen i den forklarende variabel Kvm. Herudover skal 31% af variationen i lejepris, forklares ud fra andre faktorer, der ikke er beskrevet i modellen.

Model

Vi kan aflæse parameterestimaterne for $\beta_{0}$ og $\beta_{Kvm}$ i cellerne B15 og B16, vi kan herefter opstille modellen: $$\hat{Y}=\hat{\beta}_{0}+\hat{\beta}_{Kvm}X$$ $$\hat{Y}=709{,}32+61{,}32X$$

Tolkning af koefficienter

Ifølge modellen vil lejeprisen pr. uge for et hus på 0 Kvm. være 709,32. Her er det vigtigt at bemærke at vi ikke har observeret huse i nærheden af denne størrelse, der er derfor tale om ekstrapolation. Det er behæftet med usikkerhed at benytte modellen til forudsigelser udenfor intervallet understøttet af data. Vi bemærkede før at skæringen ikke er signifikant forskellig fra 0.

Ifølge modellen vil lejeprisen pr. uge stige med 61,32, for hver kvadratmeter større sommerhuset er.

Vi kan beregne hvad et 100 Kvm. sommerhus ifølge modellen koster:

$$709{,}32+61{,}32∗100=6841{,}32$$

Bemærk her forudsiges en lejepris for en sommerhusstørrelse, der er understøttet af data, vi har jo observationer for sommerhuse der er mindre og større end 100 Kvm. Når vi forudsiger lejeprisen er der tale om interpolation.

Forudsiger vi en lejepris for et 10 eller 200 Kvm. sommerhus er der tale om ekstrapolation, dette er behæftet med usikkerhed.

Prædiktionsinterval

For den simple lineære regression, kan vi forudsige, i hvilket interval responsvariablen lejepris pr. uge vil ligge med 95% sandsynlighed, for en bestemt værdi af den uafhængige variabel Kvm. I celle D4, kan vi indtaste en vilkårlig x-værdi og bestemme et prædiktionsinterval også kaldet et forudsigelsesinterval. I Freestat output er indsat 100, hvilket svarer til at lejeprisen pr. uge vil med 95% sikkerhed ligge mellem D6 4649 DKK og D8 9034 DKK. for et 100 Kvm. sommerhus. Der er tale om et meget bredt interval hvilket skyldes, at vi udtaler os om et enkelt sommerhus.

Konfidensinterval

For den simple lineære regression, kan vi forudsige, i hvilket interval den gennemsnitlige lejepris pr. uge vil ligge med 95% sandsynlighed for en bestemt størrelse sommerhus. I celle E4, kan vi indtaste en vilkårlig x-værdi og bestemme et konfidensintervalKonfidensintervallet beregnes ud fra en stikprøve, og angiver nedre og øvre grænser indenfor hvilke populations parameteren, ligger med en vis sandsynlighed.
Er 95% konfidensintervallet for mænds gennemsnitlige højde fx. 172 cm. og 182 cm. kan vi sige:
Vi kan med 95% sandsynlighed sige den gennemsnitlige højde for mænd i populationen, ligger mellem 172 cm. og 182 cm.
Jo større stikprøve og jo lavere sikkerhed (konfidensniveau), jo mere præcist bliver vore konfidensinterval (interval estimatet), dvs intervallet bliver smallere.
Vi kan beregne konfidensintervaller for parametre vi estimerer, fx. gennemsnittet, standardafvigelsen, andelen etc.
I modsætning til et punktestimat for fx. middelværdien, fortæller konfidensintervallet os noget om kvaliteten af vort estimat/gæt, ud fra bredden af konfidensintervallet.


Klik her for at lære mere om konfidensintervallet!
. I Freestat output er indsat 100, hvilket svarer til at den gennemsnitlige lejepris pr. uge vil med 95% sikkerhed ligge mellem E6 6514 DKK og E8 7169 DKK. for et 100 Kvm. sommerhus. Bemærk konfidensintervalletKonfidensintervallet beregnes ud fra en stikprøve, og angiver nedre og øvre grænser indenfor hvilke populations parameteren, ligger med en vis sandsynlighed.
Er 95% konfidensintervallet for mænds gennemsnitlige højde fx. 172 cm. og 182 cm. kan vi sige:
Vi kan med 95% sandsynlighed sige den gennemsnitlige højde for mænd i populationen, ligger mellem 172 cm. og 182 cm.
Jo større stikprøve og jo lavere sikkerhed (konfidensniveau), jo mere præcist bliver vore konfidensinterval (interval estimatet), dvs intervallet bliver smallere.
Vi kan beregne konfidensintervaller for parametre vi estimerer, fx. gennemsnittet, standardafvigelsen, andelen etc.
I modsætning til et punktestimat for fx. middelværdien, fortæller konfidensintervallet os noget om kvaliteten af vort estimat/gæt, ud fra bredden af konfidensintervallet.


Klik her for at lære mere om konfidensintervallet!
er smallere end prædiktionsintervallet, da vi udtaler os om gennemsnittet og ikke et enkelt sommerhus.

Forudsætninger

Vi undersøger ligeledes om forudsætningerne om varianshomogenitetVarianshomogenitet betyder der er ens varianser for populationerne.
Hvis fx. vi har 2 stikprøver med højder for CBS og Cphbusiness studerende, vil varianshomogenitet betyde, at der er samme variation i de 2 populationer.
Testet kunne se ud som nedenfor, bemærk er der varianshomogenitet, er standardafvigelserne også altid ens.
H0: σCBSCph (Der er Varianshomogenitet)
H1: σCBS≠σCph (Der er ikke varianshomogenitet)

Klik her for at lære mere om varianshomogenitet!
ved residualplottetResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen er altså 1 mio. under den ifølge modellen forventede pris.


Klik her for at lære mere om lineær regressionsanalyse!
, plottet ser fornuftigt ud, de største residualerResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen er altså 1 mio. under den ifølge modellen forventede pris.


Klik her for at lære mere om lineær regressionsanalyse!
er for sommerhuse med et areal omkring 90 til 120 kvm, men vi vil her konstatere at der ikke er problemer med forudsætningen om varianshomogenitetVarianshomogenitet betyder der er ens varianser for populationerne.
Hvis fx. vi har 2 stikprøver med højder for CBS og Cphbusiness studerende, vil varianshomogenitet betyde, at der er samme variation i de 2 populationer.
Testet kunne se ud som nedenfor, bemærk er der varianshomogenitet, er standardafvigelserne også altid ens.
H0: σCBSCph (Der er Varianshomogenitet)
H1: σCBS≠σCph (Der er ikke varianshomogenitet)

Klik her for at lære mere om varianshomogenitet!
.

Der er ikke nogen tydelig systematik i residualplottetResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen er altså 1 mio. under den ifølge modellen forventede pris.


Klik her for at lære mere om lineær regressionsanalyse!
, hvorfor vi konstaterer forudsætningen om uafhængighedAfhængighed betyder sammenhæng og bruges i forbindelse med Chi i anden tests.
Hvis der er afhængighed mellem 2 kvalitative fx køn og mobiltelefonmærke, betyder det, at der er sammenhæng mellem køn og mobiltelefonmærke.
Mænd og kvinder benytter altså forskellige mobiltelefonmærker. Er der uafhængighed mellem køn og mobiltelefonmærke, betyder det altså, at der ikke er forskel på hvilket mobiltelefonmærke mænd og kvinder foretrækker.

Klik her for at lære mere om afhængighed!
af residualerneResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen er altså 1 mio. under den ifølge modellen forventede pris.


Klik her for at lære mere om lineær regressionsanalyse!
er opfyldt.

Figur 11.4: ResidualplotResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen er altså 1 mio. under den ifølge modellen forventede pris.


Klik her for at lære mere om lineær regressionsanalyse!
for Rømø-modellen: residualResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen er altså 1 mio. under den ifølge modellen forventede pris.


Klik her for at lære mere om lineær regressionsanalyse!
vs. fitted lejepris. Ingen tydelig trompetform eller systematik, hvilket understøtter varianshomogenitetVarianshomogenitet betyder der er ens varianser for populationerne.
Hvis fx. vi har 2 stikprøver med højder for CBS og Cphbusiness studerende, vil varianshomogenitet betyde, at der er samme variation i de 2 populationer.
Testet kunne se ud som nedenfor, bemærk er der varianshomogenitet, er standardafvigelserne også altid ens.
H0: σCBSCph (Der er Varianshomogenitet)
H1: σCBS≠σCph (Der er ikke varianshomogenitet)

Klik her for at lære mere om varianshomogenitet!
og uafhængighedAfhængighed betyder sammenhæng og bruges i forbindelse med Chi i anden tests.
Hvis der er afhængighed mellem 2 kvalitative fx køn og mobiltelefonmærke, betyder det, at der er sammenhæng mellem køn og mobiltelefonmærke.
Mænd og kvinder benytter altså forskellige mobiltelefonmærker. Er der uafhængighed mellem køn og mobiltelefonmærke, betyder det altså, at der ikke er forskel på hvilket mobiltelefonmærke mænd og kvinder foretrækker.

Klik her for at lære mere om afhængighed!
. Hold musen over punkterne for tal.
Kilde: Egen tilvirkning baseret på datasættet Sommerhuse leje Rømø.

Der er i normalfraktildiagrammetNormalfraktildiagrammer kan bruges til at afgøre, om en stikprøve kan antages at stamme fra normalfordelt population.
Hvis punkterne ligger pænt omkring den rette linje er normalitetsbetingelsen opfyldt. Ved test af fx. en mindre kvantitativ stikprøve og varianshomogenitet forudsættes at variablene opfylder normalitetsbetingelsen.

Klik her for at lære mere om normalfraktildiagrammer!
store afvigelser i enderne, dette er ikke så kritisk som omkring medianenMedianen angiver den miderste observation af et ordnet observationssæt, medianen kaldes også 0,5 fraktilen.
0,5 fraktilen kaldes medianen eller 2. kvartil, 50% af observationerne er mindre end medianen, 50% er større.
Hvis fx. medianen for mænds højde er 177 cm betyder det at 50% af mændene højst er 177 cm, og 50% er højere 177 cm.

Klik her for at lære mere om medianen!
. Forudsætningen om normalitet af residualerneResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen er altså 1 mio. under den ifølge modellen forventede pris.


Klik her for at lære mere om lineær regressionsanalyse!
synes ikke opfyldt, hvilket bemærkes da dette har effekt på kvaliteten af modellen.

Figur 11.5: NormalfraktildiagramNormalfraktildiagrammer kan bruges til at afgøre, om en stikprøve kan antages at stamme fra normalfordelt population.
Hvis punkterne ligger pænt omkring den rette linje er normalitetsbetingelsen opfyldt. Ved test af fx. en mindre kvantitativ stikprøve og varianshomogenitet forudsættes at variablene opfylder normalitetsbetingelsen.

Klik her for at lære mere om normalfraktildiagrammer!
for residualerneResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen er altså 1 mio. under den ifølge modellen forventede pris.


Klik her for at lære mere om lineær regressionsanalyse!
i Rømø-modellen. Punkterne følger overvejende referencelinjen, men afviger i halerne, hvilket svækker antagelsen om normalfordelte residualerResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen er altså 1 mio. under den ifølge modellen forventede pris.


Klik her for at lære mere om lineær regressionsanalyse!
.
Kilde: Egen tilvirkning baseret på datasættet Sommerhuse leje Rømø.

Multipel lineær regression

Hent Datasættet Sommerhuse Rømø der benyttes i videoerne


Dummy variable

Vi kan ikke benytte kvalitative variableEn kvalitativ variabel, er typisk en ikke numerisk variabel, hvor vi ikke kan beregne gennemsnit, fraktiler osv., her giver det kun mening at beregne andele fx.
Hvilket kæledyr har du?
{hund, kat, hund, kat, hund, marsvin, kat,...}
Hvilket parti vil du stemme på?
{Socialdemokratiet, Konservative, Venstre, Venstre, Radikale,... etc.}
Hvad er din primære bankforbindelse?
{Danske Bank, Nordea, Jyske Bank,...}


Klik her for at lære mere om kvalitative variable!
i lineær regressionsanalyseLineær regression handler om at finde en simpel sammenhæng mellem to ting — fx temperatur (X) og issalg (Y). Hvor mange is sælger en kiosk, når temperaturen er 27 grader? Man samler data for temperaturer og issalg, tegner den bedste rette linje gennem punkterne — og aflæser svaret. Det er lineær regression.
Ved multipel lineær regression bruger man flere X-variable samtidig — fx både temperatur, ugedag og om det er ferie — for at forudsige Y (issalget) mere præcist.

Klik her for at lære mere om lineær regressionsanalyse!
direkte, vi kan imidlertid kode kvalitative variableEn kvalitativ variabel, er typisk en ikke numerisk variabel, hvor vi ikke kan beregne gennemsnit, fraktiler osv., her giver det kun mening at beregne andele fx.
Hvilket kæledyr har du?
{hund, kat, hund, kat, hund, marsvin, kat,...}
Hvilket parti vil du stemme på?
{Socialdemokratiet, Konservative, Venstre, Venstre, Radikale,... etc.}
Hvad er din primære bankforbindelse?
{Danske Bank, Nordea, Jyske Bank,...}


Klik her for at lære mere om kvalitative variable!
som kvantitative variableEn kvantitativ variabel, er populært sagt en numerisk variabel man kan "regne med " fx. finde gennemsnit, median, standardafvigelse, fraktiler osv. Eksempler på kvantitative variable er:
Mænds højde i cm.
{176, 188, 169, 177, 181, 182,...}
Aktiekurs
{437,39, 437,78, 432,12, 431,03, 433,83, 433,81}
Antal børn i familien
{0, 1, 0, 3, 2, 1,0,1,0,...}
Nedbørsmængde i mm. i Dragør
{0,00, 0,02, 0,03, 0,12, 0,08, 1,12,1,43,1,21,0,03,...}
Indholdet i Coca Cola dåser i ml.
{333,12, 333,08, 332,82, 332,73, 332,93,...}


Klik her for at lære mere om kvantitative variable!
, vi kalder dummy variable. En dummy variabelEn Dummy variabel, er en variabel, der kun kan antage værdierne 0 og 1.
Vi bruger dummy variable i lineær regression, når vi ønsker at have en kvalitativ variabel med i den kvantitative regressionsanalyse. Vi siger variablen er i basis når den er slukket dvs. lig med 0, variablen er tændt når den antager værdien 1.
En kvalitativ binær variabel som køn, kan kodes til fx. Dummy Mand, så er den tændt dvs. 1, når respondenten er en mand, og i basis når det er en kvinde dvs. 0.
Man kan også kode variablen som Dummy Kvinde, med mand i basis, dvs. når variablen er slukket, er der tale om en mand.
Kvalitative variable, der ikke er binære, som fx. ugedag, kan også kodes som dummy variable. Når ugedag skal kodes som dummy variable, får man 6 dummyvariable. Man skal vælge en basis, fx. mandag, så får man dummyvariablene:
Dummy Tirsdag, Dummy Onsdag, Dummy Torsdag, Dummy Fredag, Dummy Lørdag og Dummy Søndag.
Når de 6 dummy variable er slukket, er det så mandag, højst 1 dummy kan være tændt ad gangen.

Klik her for at lære mere om dummy variable!
er en variabel, der kun kan antage værdierne 0 og 1.
Vi bruger dummy variable i lineær regressionLineær regression handler om at finde en simpel sammenhæng mellem to ting — fx temperatur (X) og issalg (Y). Hvor mange is sælger en kiosk, når temperaturen er 27 grader? Man samler data for temperaturer og issalg, tegner den bedste rette linje gennem punkterne — og aflæser svaret. Det er lineær regression.
Ved multipel lineær regression bruger man flere X-variable samtidig — fx både temperatur, ugedag og om det er ferie — for at forudsige Y (issalget) mere præcist.

Klik her for at lære mere om lineær regressionsanalyse!
, når vi ønsker at have en kvalitativ variabel med i den kvantitative regressionsanalyse. Vi siger variablen er i basis når den er slukket dvs. lig med 0, variablen er tændt når den antager værdien 1.
En kvalitativ binær variabel som køn, kan kodes til fx. Dummy Mand, så er den tændt dvs. 1, når respondenten er en mand, og i basis når det er en kvinde dvs. 0.
Man kan også kode variablen som Dummy Kvinde, med mand i basis, dvs. når variablen er slukket, er der tale om en mand.
Hvis man forestiller sig en lineær regressionsLineær regression handler om at finde en simpel sammenhæng mellem to ting — fx temperatur (X) og issalg (Y). Hvor mange is sælger en kiosk, når temperaturen er 27 grader? Man samler data for temperaturer og issalg, tegner den bedste rette linje gennem punkterne — og aflæser svaret. Det er lineær regression.
Ved multipel lineær regression bruger man flere X-variable samtidig — fx både temperatur, ugedag og om det er ferie — for at forudsige Y (issalget) mere præcist.

Klik her for at lære mere om lineær regressionsanalyse!
model, hvor man estimerer responsvariablen personers højde i cm, ud fra x-variablene vægt og køn. Er mænd fx. 5 cm. højere end kvinder, og Dummy mand variablen har kvinde som basis (værdien 0), vil estimatetEstimat betyder gæt.
Hvis vi har en stikprøve, hvor vi har målt 100 mænds højde til gennemsnitligt 179 cm., er vores bedste gæt på middelhøjden i populationen 179 cm. Vi kan skrive vort estimat for μ er 179 cm.

Klik her for at lære mere om parametre og parameter-estimater!
for Dummy mand være 5. Har Dummy kvinde variablen mand som basis (værdien 0), vil estimatetEstimat betyder gæt.
Hvis vi har en stikprøve, hvor vi har målt 100 mænds højde til gennemsnitligt 179 cm., er vores bedste gæt på middelhøjden i populationen 179 cm. Vi kan skrive vort estimat for μ er 179 cm.

Klik her for at lære mere om parametre og parameter-estimater!
for Dummy kvinde være -5, det betyder at er der tale om en kvinde estimeres højden 5 cm lavere end basis som er en mand.

Kvalitative variableEn kvalitativ variabel, er typisk en ikke numerisk variabel, hvor vi ikke kan beregne gennemsnit, fraktiler osv., her giver det kun mening at beregne andele fx.
Hvilket kæledyr har du?
{hund, kat, hund, kat, hund, marsvin, kat,...}
Hvilket parti vil du stemme på?
{Socialdemokratiet, Konservative, Venstre, Venstre, Radikale,... etc.}
Hvad er din primære bankforbindelse?
{Danske Bank, Nordea, Jyske Bank,...}


Klik her for at lære mere om kvalitative variable!
, der ikke er binære, som fx. ugedag, kan også kodes som som dummy variable. Når ugedag skal kodes som dummy variable, får man 6 dummyvariable. Man skal vælge en basis, fx. mandag, så får man dummyvariablene:
Dummy Tirsdag, Dummy Onsdag, Dummy Torsdag, Dummy Fredag, Dummy Lørdag og Dummy Søndag.
Når de 6 dummy variable er slukket, er det så mandag, højst 1 dummy kan være tændt ad gangen.
Vil man kode 12 måneder som dummy variable, skal man således benytte 11 dummy variable. Reglen er således at antal dummy variable, skal være lig med antallet udfald i den kvalitative variabel minus 1. Binære kvalitative variableEn kvalitativ variabel, er typisk en ikke numerisk variabel, hvor vi ikke kan beregne gennemsnit, fraktiler osv., her giver det kun mening at beregne andele fx.
Hvilket kæledyr har du?
{hund, kat, hund, kat, hund, marsvin, kat,...}
Hvilket parti vil du stemme på?
{Socialdemokratiet, Konservative, Venstre, Venstre, Radikale,... etc.}
Hvad er din primære bankforbindelse?
{Danske Bank, Nordea, Jyske Bank,...}


Klik her for at lære mere om kvalitative variable!
som fx. køn modelleres således ved 1 dummy variabelEn Dummy variabel, er en variabel, der kun kan antage værdierne 0 og 1.
Vi bruger dummy variable i lineær regression, når vi ønsker at have en kvalitativ variabel med i den kvantitative regressionsanalyse. Vi siger variablen er i basis når den er slukket dvs. lig med 0, variablen er tændt når den antager værdien 1.
En kvalitativ binær variabel som køn, kan kodes til fx. Dummy Mand, så er den tændt dvs. 1, når respondenten er en mand, og i basis når det er en kvinde dvs. 0.
Man kan også kode variablen som Dummy Kvinde, med mand i basis, dvs. når variablen er slukket, er der tale om en mand.
Kvalitative variable, der ikke er binære, som fx. ugedag, kan også kodes som dummy variable. Når ugedag skal kodes som dummy variable, får man 6 dummyvariable. Man skal vælge en basis, fx. mandag, så får man dummyvariablene:
Dummy Tirsdag, Dummy Onsdag, Dummy Torsdag, Dummy Fredag, Dummy Lørdag og Dummy Søndag.
Når de 6 dummy variable er slukket, er det så mandag, højst 1 dummy kan være tændt ad gangen.

Klik her for at lære mere om dummy variable!
.



Forudsætninger lineær regression.

Der er 4 forudsætninger, der skal være opfyldt for at kvaliteten af vor lineære regressionsmodel er god. Linearitet, varianshomogenitetVarianshomogenitet betyder der er ens varianser for populationerne.
Hvis fx. vi har 2 stikprøver med højder for CBS og Cphbusiness studerende, vil varianshomogenitet betyde, at der er samme variation i de 2 populationer.
Testet kunne se ud som nedenfor, bemærk er der varianshomogenitet, er standardafvigelserne også altid ens.
H0: σCBSCph (Der er Varianshomogenitet)
H1: σCBS≠σCph (Der er ikke varianshomogenitet)

Klik her for at lære mere om varianshomogenitet!
, uafhængighedAfhængighed betyder sammenhæng og bruges i forbindelse med Chi i anden tests.
Hvis der er afhængighed mellem 2 kvalitative fx køn og mobiltelefonmærke, betyder det, at der er sammenhæng mellem køn og mobiltelefonmærke.
Mænd og kvinder benytter altså forskellige mobiltelefonmærker. Er der uafhængighed mellem køn og mobiltelefonmærke, betyder det altså, at der ikke er forskel på hvilket mobiltelefonmærke mænd og kvinder foretrækker.

Klik her for at lære mere om afhængighed!
residualerResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen er altså 1 mio. under den ifølge modellen forventede pris.


Klik her for at lære mere om lineær regressionsanalyse!
og normalitet residualerResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen er altså 1 mio. under den ifølge modellen forventede pris.


Klik her for at lære mere om lineær regressionsanalyse!
. Vi kan undersøge om de 4 forudsætninger er opfyldt, ved at se på 3 forskellige plots et linjetilpasningsplot, et residualplotResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen er altså 1 mio. under den ifølge modellen forventede pris.


Klik her for at lære mere om lineær regressionsanalyse!
og et normalfraktildiagramNormalfraktildiagrammer kan bruges til at afgøre, om en stikprøve kan antages at stamme fra normalfordelt population.
Hvis punkterne ligger pænt omkring den rette linje er normalitetsbetingelsen opfyldt. Ved test af fx. en mindre kvantitativ stikprøve og varianshomogenitet forudsættes at variablene opfylder normalitetsbetingelsen.

Klik her for at lære mere om normalfraktildiagrammer!
. Et linjetilpasningsplot er et xy-punktdiagram hvor regressionslinjen er indtegnet. De 3 plots tegnes automatisk, når man genererer en lineær regressionsmodelLineær regression handler om at finde en simpel sammenhæng mellem to ting — fx temperatur (X) og issalg (Y). Hvor mange is sælger en kiosk, når temperaturen er 27 grader? Man samler data for temperaturer og issalg, tegner den bedste rette linje gennem punkterne — og aflæser svaret. Det er lineær regression.
Ved multipel lineær regression bruger man flere X-variable samtidig — fx både temperatur, ugedag og om det er ferie — for at forudsige Y (issalget) mere præcist.

Klik her for at lære mere om lineær regressionsanalyse!
i Freestat.

Linearitet

For at benytte lineær regression, er den vigtigste forudsætning, at der er en lineær sammenhæng mellem den forklarende variabel X og responsvariablen Y. Er der ikke en lineær sammenhæng, kan vi ikke beskrive sammenhængen ved en lineær regressionsmodelLineær regression handler om at finde en simpel sammenhæng mellem to ting — fx temperatur (X) og issalg (Y). Hvor mange is sælger en kiosk, når temperaturen er 27 grader? Man samler data for temperaturer og issalg, tegner den bedste rette linje gennem punkterne — og aflæser svaret. Det er lineær regression.
Ved multipel lineær regression bruger man flere X-variable samtidig — fx både temperatur, ugedag og om det er ferie — for at forudsige Y (issalget) mere præcist.

Klik her for at lære mere om lineær regressionsanalyse!
. Herunder er nogle eksempler på linjetilpasningsplots, hvor der er problemer med forudsætningen om linearitet.

I de fire røde linjetilpasningsplots, er der problemer med linearitet. Responsvariablen i plot 1 og 2, kunne bedre beskrives ved en parabel. Modellerne over- og undervurderer konsekvent værdien af y. Hvis forudsætningen om linearitet, ikke er opfyldt er det alvorligt, vi ser af figurerne at modellen ikke vil beskrive responsvariablen korrekt. Responsvariablen i plot 3 og 4 kunne synes at følge en eksponentiel eller polynomisk udvikling. Bemærk man kan ikke umiddelbart ud fra r-kvadreret og p-værdienp-værdien også kaldet signifikanssandsynligheden er et tal mellem 0 og 1, den angiver sandsynligheden for, hvis nulhypotesen er sand, at få en mere ekstrem teststørrelse, end den vi har fået i testet (teststørrelsen måler forskellen mellem fx. stikprøvegennemsnit og middelværdien antaget i nulhypotesen).
Jo lavere p-værdi, des mindre tror vi på nulhypotesen
Antag fx. at vi har en stikprøve af 100 mænds højde, med et gennemsnit på 176,32 cm.
Vi ønsker at teste om middel højden i populationen, kan antages at være 210 cm dvs.
H0: μ=210
H1: μ≠210
Vi vil her få en meget negativ teststørrelse, hvilket giver en mikroskopisk lille p-værdi.
Det vil være nærmest umuligt at få en mere ekstrem teststørrelse, hvis den sande middelhøjde er 210 cm.


Klik her for at lære mere om p-værdier!
for F- og t-testet, konstatere at der er problemer med linearitetsantagelsen. Vi kan imidlertid let se der er problemer med lineariteten i linjetilpasningsplots.

Figur 11.6: Eksempel på manglende linearitet: observationerne følger et kurvet (parabelagtigt) mønster, så en ret linje systematisk over- og undervurderer y.
Kilde: Egen tilvirkning.

I de 4 linjetilpasningsplots nedenfor er problemet, at der tilsyneladende ikke er en lineær sammenhæng mellem den forklarende og responsvariablen. Vi kan her se ud fra R-kvadreret, at modellens forklaringskraft er meget lav for de 4 linjetilpasningsplots. Her giver det således ikke mening at beskrive responsvariablen ud fra den forklarende variabel.

Figur 11.7: Eksempel uden klar lineær sammenhæng: punkterne spreder sig tilfældigt om linjen, hvilket giver lav forklaringskraft (lav R-kvadreret).
Kilde: Egen tilvirkning.

I de 4 linjetilpasningsplots 9 til 12, nedenfor er forudsætningen om linearitet opfyldt, bemærk p-værdiernep-værdien også kaldet signifikanssandsynligheden er et tal mellem 0 og 1, den angiver sandsynligheden for, hvis nulhypotesen er sand, at få en mere ekstrem teststørrelse, end den vi har fået i testet (teststørrelsen måler forskellen mellem fx. stikprøvegennemsnit og middelværdien antaget i nulhypotesen).
Jo lavere p-værdi, des mindre tror vi på nulhypotesen
Antag fx. at vi har en stikprøve af 100 mænds højde, med et gennemsnit på 176,32 cm.
Vi ønsker at teste om middel højden i populationen, kan antages at være 210 cm dvs.
H0: μ=210
H1: μ≠210
Vi vil her få en meget negativ teststørrelse, hvilket giver en mikroskopisk lille p-værdi.
Det vil være nærmest umuligt at få en mere ekstrem teststørrelse, hvis den sande middelhøjde er 210 cm.


Klik her for at lære mere om p-værdier!
alle er mindre end 5% samt R kvadreret er relativt høj.

Figur 11.8: Eksempel med opfyldt linearitet: punkterne følger tæt en ret linje (ŷ ≈ 1,7x + 0,3), og forudsætningen om linearitet er dermed opfyldt.
Kilde: Egen tilvirkning.

Varianshomogenitet

VarianshomogenitetVarianshomogenitet betyder der er ens varianser for populationerne.
Hvis fx. vi har 2 stikprøver med højder for CBS og Cphbusiness studerende, vil varianshomogenitet betyde, at der er samme variation i de 2 populationer.
Testet kunne se ud som nedenfor, bemærk er der varianshomogenitet, er standardafvigelserne også altid ens.
H0: σCBSCph (Der er Varianshomogenitet)
H1: σCBS≠σCph (Der er ikke varianshomogenitet)

Klik her for at lære mere om varianshomogenitet!
betyder responsvariablen Y skal have samme afvigelse fra regressionslinjen ligegyldigt hvilken værdi den uafhængige variabel X har. I eksemplet med Joe & The Juice betyder det, for alle temperaturer skal det faktiske salg af drinks, afvige nogenlunde med samme størrelse. Hvis det fx. er 20 grader og afvigelsen i forhold til det af modellen forudsagte er 100 drinks mod en afvigelse på kun 5 drinks når det er 0 grader, er der ikke varianshomogenitetVarianshomogenitet betyder der er ens varianser for populationerne.
Hvis fx. vi har 2 stikprøver med højder for CBS og Cphbusiness studerende, vil varianshomogenitet betyde, at der er samme variation i de 2 populationer.
Testet kunne se ud som nedenfor, bemærk er der varianshomogenitet, er standardafvigelserne også altid ens.
H0: σCBSCph (Der er Varianshomogenitet)
H1: σCBS≠σCph (Der er ikke varianshomogenitet)

Klik her for at lære mere om varianshomogenitet!
. Det er nemmest at undersøge om der er varianshomogenitetVarianshomogenitet betyder der er ens varianser for populationerne.
Hvis fx. vi har 2 stikprøver med højder for CBS og Cphbusiness studerende, vil varianshomogenitet betyde, at der er samme variation i de 2 populationer.
Testet kunne se ud som nedenfor, bemærk er der varianshomogenitet, er standardafvigelserne også altid ens.
H0: σCBSCph (Der er Varianshomogenitet)
H1: σCBS≠σCph (Der er ikke varianshomogenitet)

Klik her for at lære mere om varianshomogenitet!
, ved at se på residualplottetResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen er altså 1 mio. under den ifølge modellen forventede pris.


Klik her for at lære mere om lineær regressionsanalyse!
. Hvis der fx. er en trompetform, som i residualplotsResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen er altså 1 mio. under den ifølge modellen forventede pris.


Klik her for at lære mere om lineær regressionsanalyse!
1, 2, 3 og 4 nedenfor, er antagelsen om varianshomogenitetVarianshomogenitet betyder der er ens varianser for populationerne.
Hvis fx. vi har 2 stikprøver med højder for CBS og Cphbusiness studerende, vil varianshomogenitet betyde, at der er samme variation i de 2 populationer.
Testet kunne se ud som nedenfor, bemærk er der varianshomogenitet, er standardafvigelserne også altid ens.
H0: σCBSCph (Der er Varianshomogenitet)
H1: σCBS≠σCph (Der er ikke varianshomogenitet)

Klik her for at lære mere om varianshomogenitet!
ikke opfyldt. I residualplotResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen er altså 1 mio. under den ifølge modellen forventede pris.


Klik her for at lære mere om lineær regressionsanalyse!
1 vil modellen være meget præcis, når X antager værdier mellem 60 og 90 og gradvis mere upræcis herefter. Der er er varianshomogenitetVarianshomogenitet betyder der er ens varianser for populationerne.
Hvis fx. vi har 2 stikprøver med højder for CBS og Cphbusiness studerende, vil varianshomogenitet betyde, at der er samme variation i de 2 populationer.
Testet kunne se ud som nedenfor, bemærk er der varianshomogenitet, er standardafvigelserne også altid ens.
H0: σCBSCph (Der er Varianshomogenitet)
H1: σCBS≠σCph (Der er ikke varianshomogenitet)

Klik her for at lære mere om varianshomogenitet!
i resiudalplots 5, 6, 7 og 8, det kan vi se da de lodrette afstande er nogenlunde de samme for alle værdier af den uafhængige variabel X, hvilket betyder variationen i afvigelserne er ens for alle værdier af den uafhængige variabel.

Er der varianshomogenitetVarianshomogenitet betyder der er ens varianser for populationerne.
Hvis fx. vi har 2 stikprøver med højder for CBS og Cphbusiness studerende, vil varianshomogenitet betyde, at der er samme variation i de 2 populationer.
Testet kunne se ud som nedenfor, bemærk er der varianshomogenitet, er standardafvigelserne også altid ens.
H0: σCBSCph (Der er Varianshomogenitet)
H1: σCBS≠σCph (Der er ikke varianshomogenitet)

Klik her for at lære mere om varianshomogenitet!
, siger man med et fint specialudtryk, at der er homoskedasticitet, hvilket betyder der er ens varians for de forudsagte værdier og dermed ingen trompetform, forudsætningen er altså opfyldt. Hvis der er trompetform, siger vi med et fint ord, at der er heteroskedasticitet, så er der altså ikke varianshomogenitetVarianshomogenitet betyder der er ens varianser for populationerne.
Hvis fx. vi har 2 stikprøver med højder for CBS og Cphbusiness studerende, vil varianshomogenitet betyde, at der er samme variation i de 2 populationer.
Testet kunne se ud som nedenfor, bemærk er der varianshomogenitet, er standardafvigelserne også altid ens.
H0: σCBSCph (Der er Varianshomogenitet)
H1: σCBS≠σCph (Der er ikke varianshomogenitet)

Klik her for at lære mere om varianshomogenitet!
, forudsætningen er således ikke opfyldt.

Uafhængighed residualer

UafhængighedAfhængighed betyder sammenhæng og bruges i forbindelse med Chi i anden tests.
Hvis der er afhængighed mellem 2 kvalitative fx køn og mobiltelefonmærke, betyder det, at der er sammenhæng mellem køn og mobiltelefonmærke.
Mænd og kvinder benytter altså forskellige mobiltelefonmærker. Er der uafhængighed mellem køn og mobiltelefonmærke, betyder det altså, at der ikke er forskel på hvilket mobiltelefonmærke mænd og kvinder foretrækker.

Klik her for at lære mere om afhængighed!
af residualerResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen er altså 1 mio. under den ifølge modellen forventede pris.


Klik her for at lære mere om lineær regressionsanalyse!
betyder at hverken værdien af X eller andre residualerResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen er altså 1 mio. under den ifølge modellen forventede pris.


Klik her for at lære mere om lineær regressionsanalyse!
påvirker en residualResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen er altså 1 mio. under den ifølge modellen forventede pris.


Klik her for at lære mere om lineær regressionsanalyse!
, målefejlen er altså tilfældig. I residualplotsResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen er altså 1 mio. under den ifølge modellen forventede pris.


Klik her for at lære mere om lineær regressionsanalyse!
1, 2, og 3 er der uafhængighedAfhængighed betyder sammenhæng og bruges i forbindelse med Chi i anden tests.
Hvis der er afhængighed mellem 2 kvalitative fx køn og mobiltelefonmærke, betyder det, at der er sammenhæng mellem køn og mobiltelefonmærke.
Mænd og kvinder benytter altså forskellige mobiltelefonmærker. Er der uafhængighed mellem køn og mobiltelefonmærke, betyder det altså, at der ikke er forskel på hvilket mobiltelefonmærke mænd og kvinder foretrækker.

Klik her for at lære mere om afhængighed!
mellem residualerneResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen er altså 1 mio. under den ifølge modellen forventede pris.


Klik her for at lære mere om lineær regressionsanalyse!
, lave residualerResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen er altså 1 mio. under den ifølge modellen forventede pris.


Klik her for at lære mere om lineær regressionsanalyse!
medfører fx ikke nødvendigvis lave eller høje residualerResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen er altså 1 mio. under den ifølge modellen forventede pris.


Klik her for at lære mere om lineær regressionsanalyse!
. Der er som før beskrevet ikke varianshomogenitetVarianshomogenitet betyder der er ens varianser for populationerne.
Hvis fx. vi har 2 stikprøver med højder for CBS og Cphbusiness studerende, vil varianshomogenitet betyde, at der er samme variation i de 2 populationer.
Testet kunne se ud som nedenfor, bemærk er der varianshomogenitet, er standardafvigelserne også altid ens.
H0: σCBSCph (Der er Varianshomogenitet)
H1: σCBS≠σCph (Der er ikke varianshomogenitet)

Klik her for at lære mere om varianshomogenitet!
, men der er ikke afhængighed i residualerneResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen er altså 1 mio. under den ifølge modellen forventede pris.


Klik her for at lære mere om lineær regressionsanalyse!
. I residualplotsResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen er altså 1 mio. under den ifølge modellen forventede pris.


Klik her for at lære mere om lineær regressionsanalyse!
4, 5 og 6, er der ikke uafhængige residualerResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen er altså 1 mio. under den ifølge modellen forventede pris.


Klik her for at lære mere om lineær regressionsanalyse!
, lave residualerResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen er altså 1 mio. under den ifølge modellen forventede pris.


Klik her for at lære mere om lineær regressionsanalyse!
medfører lave residualerResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen er altså 1 mio. under den ifølge modellen forventede pris.


Klik her for at lære mere om lineær regressionsanalyse!
og høje residualerResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen er altså 1 mio. under den ifølge modellen forventede pris.


Klik her for at lære mere om lineær regressionsanalyse!
medfører høje residualerResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen er altså 1 mio. under den ifølge modellen forventede pris.


Klik her for at lære mere om lineær regressionsanalyse!
. Der må ikke være systematik imellem residualerneResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen er altså 1 mio. under den ifølge modellen forventede pris.


Klik her for at lære mere om lineær regressionsanalyse!
, punkterne i residualplottetResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen er altså 1 mio. under den ifølge modellen forventede pris.


Klik her for at lære mere om lineær regressionsanalyse!
skal ligge tilfældigt som i residualplotResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen er altså 1 mio. under den ifølge modellen forventede pris.


Klik her for at lære mere om lineær regressionsanalyse!
7 og 8, her er både antagelsen om varianshomogenitetVarianshomogenitet betyder der er ens varianser for populationerne.
Hvis fx. vi har 2 stikprøver med højder for CBS og Cphbusiness studerende, vil varianshomogenitet betyde, at der er samme variation i de 2 populationer.
Testet kunne se ud som nedenfor, bemærk er der varianshomogenitet, er standardafvigelserne også altid ens.
H0: σCBSCph (Der er Varianshomogenitet)
H1: σCBS≠σCph (Der er ikke varianshomogenitet)

Klik her for at lære mere om varianshomogenitet!
og uafhængige residualerResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen er altså 1 mio. under den ifølge modellen forventede pris.


Klik her for at lære mere om lineær regressionsanalyse!
opfyldt.

stikprøver

Normalitet residualer

Vi kan undersøge normaliteten af residualerneResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen er altså 1 mio. under den ifølge modellen forventede pris.


Klik her for at lære mere om lineær regressionsanalyse!
ved at plotte disse i et normalfraktildiagramNormalfraktildiagrammer kan bruges til at afgøre, om en stikprøve kan antages at stamme fra normalfordelt population.
Hvis punkterne ligger pænt omkring den rette linje er normalitetsbetingelsen opfyldt. Ved test af fx. en mindre kvantitativ stikprøve og varianshomogenitet forudsættes at variablene opfylder normalitetsbetingelsen.

Klik her for at lære mere om normalfraktildiagrammer!
. Her skal punkterne ligge tæt omkring den rette linje. Af nedenstående plots er kun residualerneResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen er altså 1 mio. under den ifølge modellen forventede pris.


Klik her for at lære mere om lineær regressionsanalyse!
i 1. plot normalfordelte.

stikprøver

Forudsætning Plot Udseende af plot
Linearitet af observationer Linjetilpasningsplot Observationerne følger en linjeform
UafhængighedAfhængighed betyder sammenhæng og bruges i forbindelse med Chi i anden tests.
Hvis der er afhængighed mellem 2 kvalitative fx køn og mobiltelefonmærke, betyder det, at der er sammenhæng mellem køn og mobiltelefonmærke.
Mænd og kvinder benytter altså forskellige mobiltelefonmærker. Er der uafhængighed mellem køn og mobiltelefonmærke, betyder det altså, at der ikke er forskel på hvilket mobiltelefonmærke mænd og kvinder foretrækker.

Klik her for at lære mere om afhængighed!
af residualerneResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen er altså 1 mio. under den ifølge modellen forventede pris.


Klik her for at lære mere om lineær regressionsanalyse!
ResidualplotResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen er altså 1 mio. under den ifølge modellen forventede pris.


Klik her for at lære mere om lineær regressionsanalyse!
Der er ikke systematik i residualplottetResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen er altså 1 mio. under den ifølge modellen forventede pris.


Klik her for at lære mere om lineær regressionsanalyse!
VarianshomogenitetVarianshomogenitet betyder der er ens varianser for populationerne.
Hvis fx. vi har 2 stikprøver med højder for CBS og Cphbusiness studerende, vil varianshomogenitet betyde, at der er samme variation i de 2 populationer.
Testet kunne se ud som nedenfor, bemærk er der varianshomogenitet, er standardafvigelserne også altid ens.
H0: σCBSCph (Der er Varianshomogenitet)
H1: σCBS≠σCph (Der er ikke varianshomogenitet)

Klik her for at lære mere om varianshomogenitet!
homoskedasticitet
ResidualplotResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen er altså 1 mio. under den ifølge modellen forventede pris.


Klik her for at lære mere om lineær regressionsanalyse!
Der er ikke trompetform i residualplottetResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen er altså 1 mio. under den ifølge modellen forventede pris.


Klik her for at lære mere om lineær regressionsanalyse!
Normalitet af residualerneResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen er altså 1 mio. under den ifølge modellen forventede pris.


Klik her for at lære mere om lineær regressionsanalyse!
NormalfraktildiagramNormalfraktildiagrammer kan bruges til at afgøre, om en stikprøve kan antages at stamme fra normalfordelt population.
Hvis punkterne ligger pænt omkring den rette linje er normalitetsbetingelsen opfyldt. Ved test af fx. en mindre kvantitativ stikprøve og varianshomogenitet forudsættes at variablene opfylder normalitetsbetingelsen.

Klik her for at lære mere om normalfraktildiagrammer!
for residualerneResidualen er forskellen mellem faktisk Y værdi og forudsagt Y værdi i den lineære regressionsanalyse.
Antag fx man bruger X-variablen kvm. til at forudsige Y-variablen ejendomspriser.
En ejendom er faktisk til salg for 4 mio, men den lineære regressionsmodel forudsiger at en 100 kvm ejendom skal koste 5 mio. Da bliver residualen faktisk - forudsagt = 4 - 5 = -1, prisen på ejendommen er altså 1 mio. under den ifølge modellen forventede pris.


Klik her for at lære mere om lineær regressionsanalyse!
Punkterne ligger pænt om den rette linje

Tabel 11.2: De 4 forudsætninger for lineær regressionLineær regression handler om at finde en simpel sammenhæng mellem to ting — fx temperatur (X) og issalg (Y). Hvor mange is sælger en kiosk, når temperaturen er 27 grader? Man samler data for temperaturer og issalg, tegner den bedste rette linje gennem punkterne — og aflæser svaret. Det er lineær regression.
Ved multipel lineær regression bruger man flere X-variable samtidig — fx både temperatur, ugedag og om det er ferie — for at forudsige Y (issalget) mere præcist.

Klik her for at lære mere om lineær regressionsanalyse!
, hvilket plot der bruges til at vurdere hver forudsætning, og hvad plottet skal vise, hvis forudsætningen er opfyldt.
Kilde: Egen tilvirkning.

Multikollinearitet

MultikollinearitetMultikollinearitet er et problem, der kan opstå i en multipel lineær regressionsmodel, hvis nogle af de forklarende X-variable indbyrdes er meget kraftigt korrelerede (tommelfingerreglen angiver en korrelationskoefficient mindre end -0,8 eller større end 0,8), kan man ikke isoleret forklare, deres effekt på responsvariablen Y, X-variablene påvirker samtidigt den anden X-variabel.
Hvis vi har en multipel lineær regressionsmodel, der forudsiger Y-variablen brugtbilspriser, ud fra X-variablene, kørte km og alder på for bilen. Kørte km og alder på bilen, vil være kraftigt positivt korrelerede (jo ældre bil jo flere kørte km.). Det kan derfor evt. være svært isoleret at forklare effekten af at en bil er 1 år ældre, dette påvirker jo også km. kørt.

Klik her for at lære mere om multikollinearitet!
kan opstå, når to uafhængige X-variable i en regressionsmodel er stærkt korrelerede. Dette betyder, at de indeholder meget af den samme information om variationen i den afhængige Y-variabel. Dette skaber problemer af flere årsager:

Problem Forklaring
Usikre koefficienter Når uafhængige X-variable er kraftigt korrelerede, bliver det svært at skelne deres individuelle bidrag til variationen i den afhængige Y-variabel. Dette fører til usikre og ustabile koefficienter.
Forvrængede statistiske tests p-værdiernep-værdien også kaldet signifikanssandsynligheden er et tal mellem 0 og 1, den angiver sandsynligheden for, hvis nulhypotesen er sand, at få en mere ekstrem teststørrelse, end den vi har fået i testet (teststørrelsen måler forskellen mellem fx. stikprøvegennemsnit og middelværdien antaget i nulhypotesen).
Jo lavere p-værdi, des mindre tror vi på nulhypotesen
Antag fx. at vi har en stikprøve af 100 mænds højde, med et gennemsnit på 176,32 cm.
Vi ønsker at teste om middel højden i populationen, kan antages at være 210 cm dvs.
H0: μ=210
H1: μ≠210
Vi vil her få en meget negativ teststørrelse, hvilket giver en mikroskopisk lille p-værdi.
Det vil være nærmest umuligt at få en mere ekstrem teststørrelse, hvis den sande middelhøjde er 210 cm.


Klik her for at lære mere om p-værdier!
kan blive oppustede eller formindskede, hvilket kan føre til fejlagtige konklusioner om, hvorvidt en variabel er signifikant.
Afhængighed af små ændringer i data Modellen kan blive meget følsom over for små ændringer i data, hvilket reducerer dens pålidelighed og generaliserbarhed.

Tabel 11.3: Tre typer problemer, der kan opstå, når to uafhængige X-variable i en regressionsmodel er stærkt korrelerede (multikollinearitetMultikollinearitet er et problem, der kan opstå i en multipel lineær regressionsmodel, hvis nogle af de forklarende X-variable indbyrdes er meget kraftigt korrelerede (tommelfingerreglen angiver en korrelationskoefficient mindre end -0,8 eller større end 0,8), kan man ikke isoleret forklare, deres effekt på responsvariablen Y, X-variablene påvirker samtidigt den anden X-variabel.
Hvis vi har en multipel lineær regressionsmodel, der forudsiger Y-variablen brugtbilspriser, ud fra X-variablene, kørte km og alder på for bilen. Kørte km og alder på bilen, vil være kraftigt positivt korrelerede (jo ældre bil jo flere kørte km.). Det kan derfor evt. være svært isoleret at forklare effekten af at en bil er 1 år ældre, dette påvirker jo også km. kørt.

Klik her for at lære mere om multikollinearitet!
).
Kilde: Egen tilvirkning.

MultikollinearitetMultikollinearitet er et problem, der kan opstå i en multipel lineær regressionsmodel, hvis nogle af de forklarende X-variable indbyrdes er meget kraftigt korrelerede (tommelfingerreglen angiver en korrelationskoefficient mindre end -0,8 eller større end 0,8), kan man ikke isoleret forklare, deres effekt på responsvariablen Y, X-variablene påvirker samtidigt den anden X-variabel.
Hvis vi har en multipel lineær regressionsmodel, der forudsiger Y-variablen brugtbilspriser, ud fra X-variablene, kørte km og alder på for bilen. Kørte km og alder på bilen, vil være kraftigt positivt korrelerede (jo ældre bil jo flere kørte km.). Det kan derfor evt. være svært isoleret at forklare effekten af at en bil er 1 år ældre, dette påvirker jo også km. kørt.

Klik her for at lære mere om multikollinearitet!
er et problem, der kun kan opstå i en multipel lineær regressionsmodelLineær regression handler om at finde en simpel sammenhæng mellem to ting — fx temperatur (X) og issalg (Y). Hvor mange is sælger en kiosk, når temperaturen er 27 grader? Man samler data for temperaturer og issalg, tegner den bedste rette linje gennem punkterne — og aflæser svaret. Det er lineær regression.
Ved multipel lineær regression bruger man flere X-variable samtidig — fx både temperatur, ugedag og om det er ferie — for at forudsige Y (issalget) mere præcist.

Klik her for at lære mere om lineær regressionsanalyse!
, da det jo kun er den indbyrdes korrelationKorrelationen angiver hvor meget 2 variable samvarierer, vi kan måle korrelationen vha. korrelationskoefficienten der er et tal mellem -1 og 1.
Korrelationskoefficienten er klart positiv hvis høje og lave værdier for den ene variabel følges med høje og lave værdier for den anden variabel.
Korrelationskoefficienten er klart negativ hvis høje og lave værdier for den ene variabel følges med lave og høje værdier for den anden variabel.
Er der ingen samvariation mellem 2 variable er korrelationskoefficienten tæt på 0.
Korrelationskoefficienten i en kiosk mellem afsætning af is og temperaturen vil være positiv, jo koldere/varmere det er jo mindre/større afsætning af is.
Korrelationskoefficienten i en kiosk mellem afsætning af varm kakao og temperaturen vil være negativ, jo koldere/varmere det er jo større/mindre afsætning af kakao.
For to variable som ikke er korrelerede (de samvarierer ikke) som fx. Apple aktie kursen og nedbørsmængden i Dragør, vil vi få en korrelationskoefficient tæt på 0.


Klik her for at lære mere om korrelationsanalyse!
mellem to X-variable, der ikke må være for kraftig. Som en tommelfingerregel siger man at en korrelationskoefficientKorrelationen angiver hvor meget 2 variable samvarierer, vi kan måle korrelationen vha. korrelationskoefficienten der er et tal mellem -1 og 1.
Korrelationskoefficienten er klart positiv hvis høje og lave værdier for den ene variabel følges med høje og lave værdier for den anden variabel.
Korrelationskoefficienten er klart negativ hvis høje og lave værdier for den ene variabel følges med lave og høje værdier for den anden variabel.
Er der ingen samvariation mellem 2 variable er korrelationskoefficienten tæt på 0.
Korrelationskoefficienten i en kiosk mellem afsætning af is og temperaturen vil være positiv, jo koldere/varmere det er jo mindre/større afsætning af is.
Korrelationskoefficienten i en kiosk mellem afsætning af varm kakao og temperaturen vil være negativ, jo koldere/varmere det er jo større/mindre afsætning af kakao.
For to variable som ikke er korrelerede (de samvarierer ikke) som fx. Apple aktie kursen og nedbørsmængden i Dragør, vil vi få en korrelationskoefficient tæt på 0.


Klik her for at lære mere om korrelationsanalyse!
mindre end -0,8 eller større end 0,8, giver problemer med multikollinearitetMultikollinearitet er et problem, der kan opstå i en multipel lineær regressionsmodel, hvis nogle af de forklarende X-variable indbyrdes er meget kraftigt korrelerede (tommelfingerreglen angiver en korrelationskoefficient mindre end -0,8 eller større end 0,8), kan man ikke isoleret forklare, deres effekt på responsvariablen Y, X-variablene påvirker samtidigt den anden X-variabel.
Hvis vi har en multipel lineær regressionsmodel, der forudsiger Y-variablen brugtbilspriser, ud fra X-variablene, kørte km og alder på for bilen. Kørte km og alder på bilen, vil være kraftigt positivt korrelerede (jo ældre bil jo flere kørte km.). Det kan derfor evt. være svært isoleret at forklare effekten af at en bil er 1 år ældre, dette påvirker jo også km. kørt.

Klik her for at lære mere om multikollinearitet!
, således kan man ikke isoleret forklare hver X-variabels effekt på responsvariablen Y.

Eksempel Forklaring
Bilpriser forklaret ved km. og alder Hvis vi har en multipel lineær regressionsmodelLineær regression handler om at finde en simpel sammenhæng mellem to ting — fx temperatur (X) og issalg (Y). Hvor mange is sælger en kiosk, når temperaturen er 27 grader? Man samler data for temperaturer og issalg, tegner den bedste rette linje gennem punkterne — og aflæser svaret. Det er lineær regression.
Ved multipel lineær regression bruger man flere X-variable samtidig — fx både temperatur, ugedag og om det er ferie — for at forudsige Y (issalget) mere præcist.

Klik her for at lære mere om lineær regressionsanalyse!
, der forudsiger Y-variablen brugtbilspriser, ud fra X-variablene, kørte km og alder på for bilen. Kørte km og alder på bilen, vil være kraftigt positivt korrelerede (jo ældre bil jo flere kørte km.). Det kan derfor evt. være svært isoleret at forklare effekten af at en bil er 1 år ældre, dette påvirker jo også km. kørt. Her kunne man overveje at udelade f.eks. bilens alder, hvis korrelationskoefficientenKorrelationen angiver hvor meget 2 variable samvarierer, vi kan måle korrelationen vha. korrelationskoefficienten der er et tal mellem -1 og 1.
Korrelationskoefficienten er klart positiv hvis høje og lave værdier for den ene variabel følges med høje og lave værdier for den anden variabel.
Korrelationskoefficienten er klart negativ hvis høje og lave værdier for den ene variabel følges med lave og høje værdier for den anden variabel.
Er der ingen samvariation mellem 2 variable er korrelationskoefficienten tæt på 0.
Korrelationskoefficienten i en kiosk mellem afsætning af is og temperaturen vil være positiv, jo koldere/varmere det er jo mindre/større afsætning af is.
Korrelationskoefficienten i en kiosk mellem afsætning af varm kakao og temperaturen vil være negativ, jo koldere/varmere det er jo større/mindre afsætning af kakao.
For to variable som ikke er korrelerede (de samvarierer ikke) som fx. Apple aktie kursen og nedbørsmængden i Dragør, vil vi få en korrelationskoefficient tæt på 0.


Klik her for at lære mere om korrelationsanalyse!
er over 0,8.
Huspriser forklaret ved værelser og kvm. Skal man fx forudsige kontantprisen på parcelhuse ud fra f.eks. antal værelser og antal kvadratmeter, vil værelser og kvadratmeter nok være kraftigt positivt korrelerede. Hvis korrelationskoefficientenKorrelationen angiver hvor meget 2 variable samvarierer, vi kan måle korrelationen vha. korrelationskoefficienten der er et tal mellem -1 og 1.
Korrelationskoefficienten er klart positiv hvis høje og lave værdier for den ene variabel følges med høje og lave værdier for den anden variabel.
Korrelationskoefficienten er klart negativ hvis høje og lave værdier for den ene variabel følges med lave og høje værdier for den anden variabel.
Er der ingen samvariation mellem 2 variable er korrelationskoefficienten tæt på 0.
Korrelationskoefficienten i en kiosk mellem afsætning af is og temperaturen vil være positiv, jo koldere/varmere det er jo mindre/større afsætning af is.
Korrelationskoefficienten i en kiosk mellem afsætning af varm kakao og temperaturen vil være negativ, jo koldere/varmere det er jo større/mindre afsætning af kakao.
For to variable som ikke er korrelerede (de samvarierer ikke) som fx. Apple aktie kursen og nedbørsmængden i Dragør, vil vi få en korrelationskoefficient tæt på 0.


Klik her for at lære mere om korrelationsanalyse!
er højere end 0,8 kunne man f.eks. udelade værelser, da denne diskrete variabel har en grovere og mindre præcis inddeling end kvadratmeter.

Tabel 11.4: To eksempler på multikollinearitetMultikollinearitet er et problem, der kan opstå i en multipel lineær regressionsmodel, hvis nogle af de forklarende X-variable indbyrdes er meget kraftigt korrelerede (tommelfingerreglen angiver en korrelationskoefficient mindre end -0,8 eller større end 0,8), kan man ikke isoleret forklare, deres effekt på responsvariablen Y, X-variablene påvirker samtidigt den anden X-variabel.
Hvis vi har en multipel lineær regressionsmodel, der forudsiger Y-variablen brugtbilspriser, ud fra X-variablene, kørte km og alder på for bilen. Kørte km og alder på bilen, vil være kraftigt positivt korrelerede (jo ældre bil jo flere kørte km.). Det kan derfor evt. være svært isoleret at forklare effekten af at en bil er 1 år ældre, dette påvirker jo også km. kørt.

Klik her for at lære mere om multikollinearitet!
mellem forklarende variable — brugtbilspriser (km og alder) og huspriser (værelser og kvm.).
Kilde: Egen tilvirkning.

Der findes forskellige metoder til at håndtere multikollinearitetMultikollinearitet er et problem, der kan opstå i en multipel lineær regressionsmodel, hvis nogle af de forklarende X-variable indbyrdes er meget kraftigt korrelerede (tommelfingerreglen angiver en korrelationskoefficient mindre end -0,8 eller større end 0,8), kan man ikke isoleret forklare, deres effekt på responsvariablen Y, X-variablene påvirker samtidigt den anden X-variabel.
Hvis vi har en multipel lineær regressionsmodel, der forudsiger Y-variablen brugtbilspriser, ud fra X-variablene, kørte km og alder på for bilen. Kørte km og alder på bilen, vil være kraftigt positivt korrelerede (jo ældre bil jo flere kørte km.). Det kan derfor evt. være svært isoleret at forklare effekten af at en bil er 1 år ældre, dette påvirker jo også km. kørt.

Klik her for at lære mere om multikollinearitet!
, som ligger udenfor bogens pensum. Har man en model med multikollinearitetMultikollinearitet er et problem, der kan opstå i en multipel lineær regressionsmodel, hvis nogle af de forklarende X-variable indbyrdes er meget kraftigt korrelerede (tommelfingerreglen angiver en korrelationskoefficient mindre end -0,8 eller større end 0,8), kan man ikke isoleret forklare, deres effekt på responsvariablen Y, X-variablene påvirker samtidigt den anden X-variabel.
Hvis vi har en multipel lineær regressionsmodel, der forudsiger Y-variablen brugtbilspriser, ud fra X-variablene, kørte km og alder på for bilen. Kørte km og alder på bilen, vil være kraftigt positivt korrelerede (jo ældre bil jo flere kørte km.). Det kan derfor evt. være svært isoleret at forklare effekten af at en bil er 1 år ældre, dette påvirker jo også km. kørt.

Klik her for at lære mere om multikollinearitet!
, kan man derfor udelade den ene af de forklarende X-variable af modellen.

Quiz

Quiz simpel lineær regression Quiz Multipel lineær regression

Selvtest

Selvtest simpel lineær regression med videoløsning

Spørgsmål

Datasættet sommerhuse

Vi ser fortsat på datasættet med sommerhuse på Rømø. Kan det seneste moderniseringsår forklare lejeprisen pr. uge?
stikprøver

stikprøver

Vi får en p-værdi på 0,0347 altså mindre end signifikansniveauet 5%. Dette betyder vi kan forkaste nulhypotesen i testet:
$$H_{0}:\beta_{Moderniseret}=0\ Moderniseret\ har\ ingen\ effekt$$ $$H_{1}:\beta_{Moderniseret}\neq0\ Moderniseret\ har\ effekt$$

Vi kan altså afvise at hældningen $\beta_{Moderniseret}$ er nul, hvilket betyder moderniseringår seneste har signifikant effekt. Hvis moderniseringsåret er et år senere vokser lejeprisen med 137,33 DKK., hvilket giver god mening. Her giver skæringen absolut ikke mening, skæringen svarer jo til at den forklarende variabel årstal er lig med nul, hvilket jo ville betyde at ugelejen for et sommerhus moderniseret det år Jesus blev født ville være -270884 DKK. Man får altså over kvart million om ugen, for at bo i det gamle skrammelhus ifølge modellen. Her er naturligvis tale om ekstrem ekstrapolation der ikke giver mening.

Modellens forklaringskraft R-kvadreret er kun 0,0786, hvilket er meget lavt, det betyder der er mange andre faktorer, der forklarer lejeprisen. Vi ved jo fra forrige analyse, at også størrelsen på sommerhuset forklarer en del af lejeprisen. I næste afsnit se hvordan vi med multipel regressionsanalyse kan kombinere flere forklarende variable.
Kan afstand til strand forklare lejeprisen pr. uge?
stikprøver

Vi får en p-værdi på 0,0945 altså større end signifikansniveauet. Dette betyder vi kan ikke forkaste nulhypotesen i testet: $$H_{0}:\beta_{Strandafstand}=0\ Strandafstand\ har\ ingen\ effekt$$ $$H_{1}:\beta_{Strandafstand}\neq0\ Strandafstand\ har\ effekt$$

Vi kan altså ikke afvise at hældningen $\beta_{Strandafstand}$ er nul, hvilket betyder moderniseringår seneste ikke har signifikant effekt. Det betyder vi kan ikke bruge modellen. Bemærk det er muligt variablen ville være signifikant, hvis den indgår i en multipel lineær regression, den er næsten signifikant i den simple lineære model. Når vi kontrollerer for andre forklarende variable i en multipel model, kan dette medføre den bliver signifikant. Bemærk hældningskoeficienten -1,04 i modellen er negativ hvilket vi ville forvente jo større afstand til strand jo lavere lejepris.

Datasæt Lejelejligheder Danmark
Benyt ovenstående datasæt til at opstille en multipel lineær regressionsmodel, der kan forklare husleje for lejelejligheder ud fra følgende forklarende variable:
Værelser, Størrelse, Depositum, Aconto, Forudbetalt leje, Elevator, Altan, moebleret, Storby og Region.
Bemærk du skal filtrere datasættet, så du udelukkende ser på lejelejligheder, dvs. observationer med huse og værelser skal fjernes fra datasættet.
Data er ikke klargjorte mht. til dummy-variable, dvs. eventuelle kvalitative variable skal omdannes til dummy-variable.



Startmodel med 13 forklarende variable:

Der foretages nu trinvis reduktion, for at fjerne insignifikante forklarende variable
Slutmodel med 11 forklarende variable:


Forudsætningen om fravær af multikollinearitet, er ikke helt opfyldt da korrelationen mellem Værelser og Størrelse er kraftig positiv, og større end grænsen på 0,8. Vi ender med at fjerne Værelser, da denne variabel er insignifikant. Så problemet er således ikke i slutmodellen.
Bemærk der er kraftig positiv korrelation mellem responsvariablen Husleje og den forklarende variabel Depositum, dette er fint, multikollinearitet er udelukkende for kraftig korrelation mellem forklarende variable.
Bemærk Freestats korrelationsmatrice kan kun håndtere 10 variable, derfor er der indsat 2 korrelationsmatricer nedenfor:



Residualplottet nedenfor viser forudsætningerne om varianshomogenitet og uafhængige residualer er opfyldt.
Normalfraktildiagrammet nedenfor viser forudsætningen om normalitet af residualerne er opfyldt.
Se videoen for uddybende kommentarer omkring tolkning af parameter estimater samt dannelse af dummy-variable.
Tolkningen af parameter estimaterne bliver:
Ifølge modellen koster en 0 kvadratmeter umøbleret lejelejlighed i region Hovedstaden i et ikke storby område, hvor Depositum, Aconto og Forudbetalt leje er 0 kr. uden altan og elevator 1799 kr. om måneden.
For hver kvadratmeter større lejligheden er stiger den månedlige leje med 51 kr.
For hver krone depositum er højere stiger den månedlige leje med 0,14 kr. altså 14 øre.
For hver krone forudbetalt leje er højere stiger den månedlige leje med 5 øre.
Hvis der er elevator i ejendommen er den månedlige leje 227 kr. højere.
Hvis der er altan i lejelejligheden er den månedlige leje 199 kr. højere.
Er lejelejligheden møbleret er den månedlige leje 1.559 kr. højere.
Ligger lejelejligheden i en storby er den månedlige leje 1.300 kr. højere.
Ligger lejelejligheden i region Midtjylland er den månedlige leje 2.077 kr. lavere end i region Hovedstaden.
Ligger lejelejligheden i region Syddanmark er den månedlige leje 2.898 kr. lavere end i region Hovedstaden.
Ligger lejelejligheden i region Sjælland er den månedlige leje 1.478 kr. lavere end i region Hovedstaden.
Ligger lejelejligheden i region Nordjylland er den månedlige leje 3.214 kr. lavere end i region Hovedstaden.

Opgave 1 (30 %) Nykøbing Bank ønsker opstille en model der kan forklare, hvilken risikogruppe en given kunde vil tilhøre. Banken antager, at variablen risikogruppe er kvantitativ. Som udgangspunkt forventer Nykøbing Bank, at følgende variable kan bruges til at forklare kundernes placering i risikogruppe:

Alder målt som kundens alder i år
Bruttoindkomst pr. år målt i kr.
Kundeanciennitet målt som antal år kunden har været kunde i banken Om kunden har haft overtræk (0 = ikke overtræk og 1 = overtræk)
Om kunden bor i ejerbolig (0 = ikke ejerbolig og 1 = ejerbolig)
Banken har i maj 2016 ved tilfældig udvælgelse udtrukket en stikprøveEn stikprøve, er et udsnit af populationen (den store mængde vi ønsker at udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde, kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så alle danske mænd.


Klik her for at lære mere om stikprøver!
på 28 kunder og undersøgt placering i rating-systemet samt de ovenfor nævnte variable.
Resultatet af denne dataindsamling findes i den udleverede Excel-fil.

Spørgsmål 1,1 (25 %)
Opstil en model der kan forklare kunders placering i rating-systemet. Alle forklarende variable skal være signifikante på 5 % niveau.
Fortolk dine resultater og vurdér i hvilken grad modellen er brugbar for Nykøbing Bank.

Spørgsmål 1,2 (5 %)
Beregn ved hjælp af din signifikante model fra spørgsmål 1,1 hvilken rating nedenstående kunde vil opnå:
Alder 34 år
Bruttoindkomst 580.000 kr. Har været kunde i banken i 3 år Har ikke haft overtræk Bor i ejerbolig.

Du finder hele opgaven i linket:

2016 8 Eksamen Statistik Opgave
2016 8 Eksamen Statistik Data

Du har nu adgang

Alle kapitler er åbne.