3. Deskriptiv statistik
3. Deskriptiv statistik

3. Deskriptiv statistik

Deskriptiv eller beskrivende statistik er metoder til vha. figurer, tabeller og deskriptorer (middelværdi, median etc.) at præsentere et datamateriale. Beskrivende statistik er simplere metoder end inferentiel eller matematisk teoretisk statistik, hvor konklusioner drages på baggrund af en egentlig statistisk analyse. Deskriptiv statistik bruges til at beskrive de data man har. Inferentiel statistik bruges til at generalisere, på baggrund af de data man har.



DK Aktiekurser datasættet fra videoen ovenfor

Tryg aktien

Vi har fra ovenfor et multivariat datasæt bestående af daglige procentvise afkast for 6 OMX25 aktier: TRYG, DDB, FLS, GENMAB, NOVO, ISS. Vi ønsker at beskrive det procentvise daglige afkast for Tryg vha. forskellige deskriptorer.

I histogrammet herunder kan vi se hvordan det daglige procentvise afkast på Trygaktien fordeler sig, der er klart flest dage hvor det procentvise afkast er tæt på 0.

Figur 3.1: Dagsafkast TRYG.CO i procent — hyppighed i antal dage. Hold musen over en søjle for interval og antal dage.

Her er samme data med færre søjler, nu har vi på y-aksen frekvensen af søjlerne i stedet for hyppigheden. Frekvensen er antallet af observationer i hver søjle divideret med det totale antal observationer.

Figur 3.2: Dagsafkast TRYG.CO i procent — frekvens (andel af 159 observationer). Hold musen over en søjle for interval og frekvens.

Middelværdien

Middelværdien af en variabel bestemmes ved at bestemme gennemsnittet for variablen. Da afkastet for Tryg indeholder n=159 observationer bliver formlen:

$$\bar{x} = {\sum_{1}^{n} x_i \over n} = {-1,28-0,94-2,59+...+0,67 \over 159} \approx -0,16$$

Variansen

Variansen (stikprøvevariansenEn stikprøve, er et udsnit af populationen (den store mængde vi ønsker at udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde, kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så alle danske mænd.


Klik her for at lære mere om stikprøver!
) er et udtryk for variationen omkring middelværdien i data:

$$ S^2 = {\sum_{1}^{n} ( x_i - \bar{x})^2 \over n-1} = $$ $$ {(-1,28--0,16)^2+(-0,94--0,16)^2+...+(0,67--0,16)^2 \over 158} \approx$$ $$ 1,38$$

Standardafvigelsen

StandardafvigelsenStandardafvigelsen fortæller hvor meget en variabel typisk varierer omkring middelværdien.
Standardafvigelsen også kaldet spredningen, findes som kvadratroden af variansen, i modsætning til variansen er standardafvigelsen i samme enhed som variablen hvilket gør tolkning nemmere.

Kursen for en aktie med middelkurs 100 Kr. og standardafvigelse 1 svinger meget mindre, end en aktie med middelkurs 100 og standardafvigelse 10. Da investorer er risikoaverse vil de foretrække aktien med den mindste standardafvigelse.

Klik her for at lære mere om standardafvigelsen!
er lig med kvadratroden af variansen, og er dermed ligeledes et mål for variationen omkring middelværdien. StandardafvigelsenStandardafvigelsen fortæller hvor meget en variabel typisk varierer omkring middelværdien.
Standardafvigelsen også kaldet spredningen, findes som kvadratroden af variansen, i modsætning til variansen er standardafvigelsen i samme enhed som variablen hvilket gør tolkning nemmere.

Kursen for en aktie med middelkurs 100 Kr. og standardafvigelse 1 svinger meget mindre, end en aktie med middelkurs 100 og standardafvigelse 10. Da investorer er risikoaverse vil de foretrække aktien med den mindste standardafvigelse.

Klik her for at lære mere om standardafvigelsen!
har i modsætning til variansen samme enhed som data, hvilket gør tolkning lettere.
Varians og standardafvigelse er afhængige af skala, hvilket fx. betyder, at værdier i kr. vil have 1000 gange større variation end størrelser målt i antal tusinde kr.
For fx. aktie afkast vil standardafvigelsenStandardafvigelsen fortæller hvor meget en variabel typisk varierer omkring middelværdien.
Standardafvigelsen også kaldet spredningen, findes som kvadratroden af variansen, i modsætning til variansen er standardafvigelsen i samme enhed som variablen hvilket gør tolkning nemmere.

Kursen for en aktie med middelkurs 100 Kr. og standardafvigelse 1 svinger meget mindre, end en aktie med middelkurs 100 og standardafvigelse 10. Da investorer er risikoaverse vil de foretrække aktien med den mindste standardafvigelse.

Klik her for at lære mere om standardafvigelsen!
være en vigtig parameterEn parameter betegner en ukendt konstant i en statistisk model eller formel, ud fra en stikprøve estimeres (gættes kvalificeret på) dens værdi.
En parameter kan fx. være β, μ, p, σ etc.
Vi ønsker at udtale os om danske mænds højde, populationen er så danske mænd. Stikprøve gennemsnittet for fx. 100 mænds højde 179,34 cm. er parameter estimatet (gættet på middelværdien i populationen). Den sande ukendte parameter i populationen er altså middelhøjden i populationen μ

I AI-sammenhæng bruges ordet parametre om de tal modellen justerer under træning — som knapper på et kæmpe regneapparat. GPT-1 havde 117 millioner parametre; de største modeller anslås til billioner.
Flere parametre = modellen kan skelne mellem flere sproglige mønstre — men det koster eksponentielt mere at træne.

Klik her for at lære mere om parametre og parameter-estimater!
, da investorer er risikoaverse ønskes mindst mulig standardafvigelse i forhold til afkastet.

Vi finder her standardafvigelsenStandardafvigelsen fortæller hvor meget en variabel typisk varierer omkring middelværdien.
Standardafvigelsen også kaldet spredningen, findes som kvadratroden af variansen, i modsætning til variansen er standardafvigelsen i samme enhed som variablen hvilket gør tolkning nemmere.

Kursen for en aktie med middelkurs 100 Kr. og standardafvigelse 1 svinger meget mindre, end en aktie med middelkurs 100 og standardafvigelse 10. Da investorer er risikoaverse vil de foretrække aktien med den mindste standardafvigelse.

Klik her for at lære mere om standardafvigelsen!
til 1,17 procent, vi kan populært sige, at den typiske afvigelse fra det gennemsnitlige dagsafkast på -0,16 procent for Trygaktien, er 1,17 procent.

$$ S = \sqrt{S^2} = \sqrt{1,38} \approx 1,17 $$

Modus

Modus/modalværdi/typetallet er den hyppigst forekommende observation for et observationssæt. Typetallet er ikke nødvendigvis godt til at beskrive data. Har vi fx. observationssættet: {1,1,2,3,4,5,6,7,8,9,10} er typetallet 1, medianenMedianen angiver den miderste observation af et ordnet observationssæt, medianen kaldes også 0,5 fraktilen.
0,5 fraktilen kaldes medianen eller 2. kvartil, 50% af observationerne er mindre end medianen, 50% er større.
Hvis fx. medianen for mænds højde er 177 cm betyder det at 50% af mændene højst er 177 cm, og 50% er højere 177 cm.

Klik her for at lære mere om medianen!
5 og middelværdien 5,09. I dette tilfælde med Trygaktien ville modusModus/modalværdi/typetallet er den hyppigst forekommende observation for et observations sæt.

Klik her for at lære mere om modus!
være en ringe deskriptor for observationssættet. Variablen dagsafkast i procent er kontinuert, det er derfor kun når vi afrunder dagsafkast at vi vil opleve flere dage med samme dagsafkast.

Bimodal og Unimodal

Har vi en fordeling med en top kalder vi den for unimodal, har fordelingen 2 toppe kalder vi den bimodal. Fordelingen for Tryg aktiens dagsafkast, er således unimodal. Havde man fx. en variabel med priserne for Tesla model 3 og model X, ville vi få en bimodal fordeling, da priserne ville danne 2 toppe. Model X er typisk væsentlig dyrere end Model 3.

Medianen, kvartiler og fraktilen

Når vi ønsker at beskrive middeltendensen i et datasæt kan vi angive middelværdien, typetallet eller medianenMedianen angiver den miderste observation af et ordnet observationssæt, medianen kaldes også 0,5 fraktilen.
0,5 fraktilen kaldes medianen eller 2. kvartil, 50% af observationerne er mindre end medianen, 50% er større.
Hvis fx. medianen for mænds højde er 177 cm betyder det at 50% af mændene højst er 177 cm, og 50% er højere 177 cm.

Klik her for at lære mere om medianen!
.


MedianenMedianen angiver den miderste observation af et ordnet observationssæt, medianen kaldes også 0,5 fraktilen.
0,5 fraktilen kaldes medianen eller 2. kvartil, 50% af observationerne er mindre end medianen, 50% er større.
Hvis fx. medianen for mænds højde er 177 cm betyder det at 50% af mændene højst er 177 cm, og 50% er højere 177 cm.

Klik her for at lære mere om medianen!
også kaldet 2. kvartil eller 50% fraktilen er den midterste observation i det ordnede datasæt, er der et lige antal observationer tages gennemsnittet. Man kan nu bestemme nedre kvartil også kaldet 1. kvartil eller 25% fraktilen, som midten af den nedre halvdel af det ordnede datasæt. Tilsvarende gælder for øvre kvartil også kaldet 3. kvartil eller 75% fraktilen blot for den øvre halvdel at det ordnede datasæt.

Hvis vi har et ordnet datasæt {11,13,15,16,16,18,20}, finder vi således medianenMedianen angiver den miderste observation af et ordnet observationssæt, medianen kaldes også 0,5 fraktilen.
0,5 fraktilen kaldes medianen eller 2. kvartil, 50% af observationerne er mindre end medianen, 50% er større.
Hvis fx. medianen for mænds højde er 177 cm betyder det at 50% af mændene højst er 177 cm, og 50% er højere 177 cm.

Klik her for at lære mere om medianen!
som den midterste observation, da vi har et ulige antal observationer. {11,13,15,16,16,18,20}. Vi kan udtrykke dette som at 50% af observationerne er 16 eller derover, eller ækvivalent, at 50% af observationerne er mindre end 16.

Vi kan bestemme 1. kvartil, som den midterste observation, i den nedre del at datasættet {11,13,15,16}. Vi har to midterste observationer {11,13,15,16}, i den nedre del af datasættet og bestemmer 0,25 fraktilen som gennemsnittet af disse:

$$ {13+15 \over 2}=14 $$

Vi kan udtrykke dette som at 75% af observationerne er 14 eller derover, eller at 25% af observationerne er mindre end 14.

Der er mere end 8 forskellige definitioner på kvartilerKvartiler angiver 0,25; 0,5 eller 0,75 andelen af et ordnet observationssæt.
Hvis fx. 0,75 fraktilen for mænds højde er 179 cm betyder det at 75% af mændene højst er 179 cm, og 25% er højere 179 cm.
0,25 fraktilen kaldes 1. kvartil, 25% af observationerne er mindre end 1. kvartil.
0,5 fraktilen kaldes medianen eller 2. kvartil, 50% af observationerne er mindre end medianen.
0,75 fraktilen kaldes 3. kvartil, 75% af observationerne er mindre end 3. kvartil.

Klik her for at lære mere om kvartiler!
og fraktilerFraktiler er et tal mellem 0 og 1, der angiver andelen af et ordnet observationssæt. Vi opdeler et datasæt ordnet fra mindst til størst efter andelen angivet ved fraktilen.
Hvis fx. 0,45 fraktilen for mænds højde er 176 cm betyder det at 45% af mændene højst er 176 cm, og 55% er højere 176 cm.
Kendte fraktiler er:
0,25 fraktilen kaldes også 1. kvartil, 25% af observationerne er mindre end 1. kvartil.
0,5 fraktilen kaldes også medianen, 50% af observationerne er mindre end medianen.
0,75 fraktilen kaldes også 3. kvartil, 75% af observationerne er mindre end 3. kvartil.
0,1, 0,2, 0,3, 0,4... kaldes deciler

Klik her for at lære mere om fraktiler!
alt efter kontinent og region, vi går ikke i detaljer med beregningsmetoderne, men softwareprogrammer kan beregne fraktilerFraktiler er et tal mellem 0 og 1, der angiver andelen af et ordnet observationssæt. Vi opdeler et datasæt ordnet fra mindst til størst efter andelen angivet ved fraktilen.
Hvis fx. 0,45 fraktilen for mænds højde er 176 cm betyder det at 45% af mændene højst er 176 cm, og 55% er højere 176 cm.
Kendte fraktiler er:
0,25 fraktilen kaldes også 1. kvartil, 25% af observationerne er mindre end 1. kvartil.
0,5 fraktilen kaldes også medianen, 50% af observationerne er mindre end medianen.
0,75 fraktilen kaldes også 3. kvartil, 75% af observationerne er mindre end 3. kvartil.
0,1, 0,2, 0,3, 0,4... kaldes deciler

Klik her for at lære mere om fraktiler!
for os, disse kan altså afvige en smule alt efter beregningsmetoden.

MedianenMedianen angiver den miderste observation af et ordnet observationssæt, medianen kaldes også 0,5 fraktilen.
0,5 fraktilen kaldes medianen eller 2. kvartil, 50% af observationerne er mindre end medianen, 50% er større.
Hvis fx. medianen for mænds højde er 177 cm betyder det at 50% af mændene højst er 177 cm, og 50% er højere 177 cm.

Klik her for at lære mere om medianen!
for Tryg findes ved at sortere data fra laveste til højeste procentvise dagsafkast -6,62; -3,14; -2,59; ...; 5,79 vi finder at medianenMedianen angiver den miderste observation af et ordnet observationssæt, medianen kaldes også 0,5 fraktilen.
0,5 fraktilen kaldes medianen eller 2. kvartil, 50% af observationerne er mindre end medianen, 50% er større.
Hvis fx. medianen for mænds højde er 177 cm betyder det at 50% af mændene højst er 177 cm, og 50% er højere 177 cm.

Klik her for at lære mere om medianen!
bliver -0,12.

Vi bestemmer ligeledes 1. kvartil til -0,78, og 2. kvartil til -0,12. 1. kvartil, MedianenMedianen angiver den miderste observation af et ordnet observationssæt, medianen kaldes også 0,5 fraktilen.
0,5 fraktilen kaldes medianen eller 2. kvartil, 50% af observationerne er mindre end medianen, 50% er større.
Hvis fx. medianen for mænds højde er 177 cm betyder det at 50% af mændene højst er 177 cm, og 50% er højere 177 cm.

Klik her for at lære mere om medianen!
og 3. kvartil kan ses i nedenstående boxplotEt boxplot viser median, kvartiler og eventuelle outliers i ét diagram.
John Tukey opfandt boxplottet i 1970'erne som en del af eksplorativ dataanalyse — en måde at undersøge data visuelt, før man laver formelle statistiske tests.

Klik her for at lære mere om boxplots!
diagram, som hhv. første, anden og tredie vandrette streg i boksen i boxplottetEt boxplot viser median, kvartiler og eventuelle outliers i ét diagram.
John Tukey opfandt boxplottet i 1970'erne som en del af eksplorativ dataanalyse — en måde at undersøge data visuelt, før man laver formelle statistiske tests.

Klik her for at lære mere om boxplots!
(den orange boks) for Tryg. Vi kan hvis vi skal forsøge at udtrykke fx. 1. kvartil med menneskeord sige at 25% af dagene var der et afkast på -0,78 procent eller derunder. Man kunne også udtrykke det som at 75% af dagene var afkastet på mere end -0,78 procent.

Kvartilafstanden eller IQR interquantile range betyder 3. kvartil minus 1. kvartil, i Tryg eksemplet bliver kvartilafstanden 0,49 - -0,78 = 1,27. Dette svarer præcis til højden på boksen i boxplottetEt boxplot viser median, kvartiler og eventuelle outliers i ét diagram.
John Tukey opfandt boxplottet i 1970'erne som en del af eksplorativ dataanalyse — en måde at undersøge data visuelt, før man laver formelle statistiske tests.

Klik her for at lære mere om boxplots!
for Tryg, vi kan altså konstatere at halvdelen af afkastene lå i et spænd på 1,27 procent.

Figur 3.3: BoxplotEt boxplot viser median, kvartiler og eventuelle outliers i ét diagram.
John Tukey opfandt boxplottet i 1970'erne som en del af eksplorativ dataanalyse — en måde at undersøge data visuelt, før man laver formelle statistiske tests.

Klik her for at lære mere om boxplots!
for TRYG.CO's daglige procentvise afkast — viser minimum, 1. kvartil, median, 3. kvartil og maksimum. Hold musen over boksen for min, kvartilerKvartiler angiver 0,25; 0,5 eller 0,75 andelen af et ordnet observationssæt.
Hvis fx. 0,75 fraktilen for mænds højde er 179 cm betyder det at 75% af mændene højst er 179 cm, og 25% er højere 179 cm.
0,25 fraktilen kaldes 1. kvartil, 25% af observationerne er mindre end 1. kvartil.
0,5 fraktilen kaldes medianen eller 2. kvartil, 50% af observationerne er mindre end medianen.
0,75 fraktilen kaldes 3. kvartil, 75% af observationerne er mindre end 3. kvartil.

Klik her for at lære mere om kvartiler!
, median, max og IQR.
Kilde: Egen tilvirkning.

Fraktiler

Vi kan ligeledes bestemme alle mulige andre fraktilerFraktiler er et tal mellem 0 og 1, der angiver andelen af et ordnet observationssæt. Vi opdeler et datasæt ordnet fra mindst til størst efter andelen angivet ved fraktilen.
Hvis fx. 0,45 fraktilen for mænds højde er 176 cm betyder det at 45% af mændene højst er 176 cm, og 55% er højere 176 cm.
Kendte fraktiler er:
0,25 fraktilen kaldes også 1. kvartil, 25% af observationerne er mindre end 1. kvartil.
0,5 fraktilen kaldes også medianen, 50% af observationerne er mindre end medianen.
0,75 fraktilen kaldes også 3. kvartil, 75% af observationerne er mindre end 3. kvartil.
0,1, 0,2, 0,3, 0,4... kaldes deciler

Klik her for at lære mere om fraktiler!
end 25% 50% og 75% fraktilerneFraktiler er et tal mellem 0 og 1, der angiver andelen af et ordnet observationssæt. Vi opdeler et datasæt ordnet fra mindst til størst efter andelen angivet ved fraktilen.
Hvis fx. 0,45 fraktilen for mænds højde er 176 cm betyder det at 45% af mændene højst er 176 cm, og 55% er højere 176 cm.
Kendte fraktiler er:
0,25 fraktilen kaldes også 1. kvartil, 25% af observationerne er mindre end 1. kvartil.
0,5 fraktilen kaldes også medianen, 50% af observationerne er mindre end medianen.
0,75 fraktilen kaldes også 3. kvartil, 75% af observationerne er mindre end 3. kvartil.
0,1, 0,2, 0,3, 0,4... kaldes deciler

Klik her for at lære mere om fraktiler!
, software angiver ofte en række af disse så man hurtigt kan danne sig et billede af datasættet. Nedenfor er en del fraktilerFraktiler er et tal mellem 0 og 1, der angiver andelen af et ordnet observationssæt. Vi opdeler et datasæt ordnet fra mindst til størst efter andelen angivet ved fraktilen.
Hvis fx. 0,45 fraktilen for mænds højde er 176 cm betyder det at 45% af mændene højst er 176 cm, og 55% er højere 176 cm.
Kendte fraktiler er:
0,25 fraktilen kaldes også 1. kvartil, 25% af observationerne er mindre end 1. kvartil.
0,5 fraktilen kaldes også medianen, 50% af observationerne er mindre end medianen.
0,75 fraktilen kaldes også 3. kvartil, 75% af observationerne er mindre end 3. kvartil.
0,1, 0,2, 0,3, 0,4... kaldes deciler

Klik her for at lære mere om fraktiler!
for Tryg datasættet angivet, nogle af disse kan direkte aflæses i boxplottetEt boxplot viser median, kvartiler og eventuelle outliers i ét diagram.
John Tukey opfandt boxplottet i 1970'erne som en del af eksplorativ dataanalyse — en måde at undersøge data visuelt, før man laver formelle statistiske tests.

Klik her for at lære mere om boxplots!
.

10% fraktilen, 20% fraktilen,…,90% fraktilen kaldes også for deciler.

Herunder ses fraktilerFraktiler er et tal mellem 0 og 1, der angiver andelen af et ordnet observationssæt. Vi opdeler et datasæt ordnet fra mindst til størst efter andelen angivet ved fraktilen.
Hvis fx. 0,45 fraktilen for mænds højde er 176 cm betyder det at 45% af mændene højst er 176 cm, og 55% er højere 176 cm.
Kendte fraktiler er:
0,25 fraktilen kaldes også 1. kvartil, 25% af observationerne er mindre end 1. kvartil.
0,5 fraktilen kaldes også medianen, 50% af observationerne er mindre end medianen.
0,75 fraktilen kaldes også 3. kvartil, 75% af observationerne er mindre end 3. kvartil.
0,1, 0,2, 0,3, 0,4... kaldes deciler

Klik her for at lære mere om fraktiler!
for dagligt afkast på Tryg aktien.

Fraktil Dagsafkast i %
0% Fraktilen dvs. minimum -6,62%
0,5% Fraktilen -3,87%
2,5% Fraktilen -2,19%
5% Fraktilen -1,73%
10% Fraktilen også kaldet 1. decil -1,43%
20% Fraktilen også kaldet 2. decil -0,94%
25% Fraktilen også kaldet 1. kvartil -0,78%
30% Fraktilen også kaldet 3. decil -0,66%
40% Fraktilen -0,3%
50% Fraktilen også kaldet medianenMedianen angiver den miderste observation af et ordnet observationssæt, medianen kaldes også 0,5 fraktilen.
0,5 fraktilen kaldes medianen eller 2. kvartil, 50% af observationerne er mindre end medianen, 50% er større.
Hvis fx. medianen for mænds højde er 177 cm betyder det at 50% af mændene højst er 177 cm, og 50% er højere 177 cm.

Klik her for at lære mere om medianen!
-0,12%
60% Fraktilen 0,1%
70% Fraktilen 0,37%
75% Fraktilen også kaldet 3. kvartil 0,49%
80% Fraktilen 0,61%
90% Fraktilen også kaldet 9. decil 0,98%
95% Fraktilen 1,36%
97,5% Fraktilen 1,79%
99,5% Fraktilen 2,99%
100% Fraktilen maksimalt observeret dagsafkast i % 5,79%

Tabel 3.1: FraktilerFraktiler er et tal mellem 0 og 1, der angiver andelen af et ordnet observationssæt. Vi opdeler et datasæt ordnet fra mindst til størst efter andelen angivet ved fraktilen.
Hvis fx. 0,45 fraktilen for mænds højde er 176 cm betyder det at 45% af mændene højst er 176 cm, og 55% er højere 176 cm.
Kendte fraktiler er:
0,25 fraktilen kaldes også 1. kvartil, 25% af observationerne er mindre end 1. kvartil.
0,5 fraktilen kaldes også medianen, 50% af observationerne er mindre end medianen.
0,75 fraktilen kaldes også 3. kvartil, 75% af observationerne er mindre end 3. kvartil.
0,1, 0,2, 0,3, 0,4... kaldes deciler

Klik her for at lære mere om fraktiler!
for TRYG.CO's daglige procentvise afkast, fra 0% (minimum) til 100% (maksimum), herunder decilerne og kvartilerneKvartiler angiver 0,25; 0,5 eller 0,75 andelen af et ordnet observationssæt.
Hvis fx. 0,75 fraktilen for mænds højde er 179 cm betyder det at 75% af mændene højst er 179 cm, og 25% er højere 179 cm.
0,25 fraktilen kaldes 1. kvartil, 25% af observationerne er mindre end 1. kvartil.
0,5 fraktilen kaldes medianen eller 2. kvartil, 50% af observationerne er mindre end medianen.
0,75 fraktilen kaldes 3. kvartil, 75% af observationerne er mindre end 3. kvartil.

Klik her for at lære mere om kvartiler!
.
Kilde: Egen tilvirkning.

Skævhed


SkævhedenSkævheden angiver om en fordeling er venstreskæv (hale mod venstre, skævheden er negativ), symmetrisk (skævheden er ca. 0) eller højreskæv (hale mod højre, skævheden er positiv)
Man vil ofte ud fra fordelingen i fx. et histogram eller et boksplot, kunne vurdere skævheden

Klik her for at lære mere om skævhed!
angiver hvor meget en fordeling afviger fra en symmetrisk fordeling. Hvis skævhedenSkævheden angiver om en fordeling er venstreskæv (hale mod venstre, skævheden er negativ), symmetrisk (skævheden er ca. 0) eller højreskæv (hale mod højre, skævheden er positiv)
Man vil ofte ud fra fordelingen i fx. et histogram eller et boksplot, kunne vurdere skævheden

Klik her for at lære mere om skævhed!
er positiv (højreskæv ), vil fordelingen have koncentrerede værdier til venstre og mere spredte værdier til højre, en hale mod højre. Er fordelingen venstreskæv vil skævhedenSkævheden angiver om en fordeling er venstreskæv (hale mod venstre, skævheden er negativ), symmetrisk (skævheden er ca. 0) eller højreskæv (hale mod højre, skævheden er positiv)
Man vil ofte ud fra fordelingen i fx. et histogram eller et boksplot, kunne vurdere skævheden

Klik her for at lære mere om skævhed!
være negativ, og fordelingen har hale mod venstre. Hvis skævhedenSkævheden angiver om en fordeling er venstreskæv (hale mod venstre, skævheden er negativ), symmetrisk (skævheden er ca. 0) eller højreskæv (hale mod højre, skævheden er positiv)
Man vil ofte ud fra fordelingen i fx. et histogram eller et boksplot, kunne vurdere skævheden

Klik her for at lære mere om skævhed!
er 0 eller tæt på nul siger vi fordelingen er symmetrisk.

Formlen for skævhedSkævheden angiver om en fordeling er venstreskæv (hale mod venstre, skævheden er negativ), symmetrisk (skævheden er ca. 0) eller højreskæv (hale mod højre, skævheden er positiv)
Man vil ofte ud fra fordelingen i fx. et histogram eller et boksplot, kunne vurdere skævheden

Klik her for at lære mere om skævhed!
er lidt indviklet, men softwarepakker kan beregne denne, der findes et par forskellige beregningsmetoder så man kan godt få forskellige resultater. I Excel bruges formlen =SKEW() eller på dansk =SKÆVHEDSkævheden angiver om en fordeling er venstreskæv (hale mod venstre, skævheden er negativ), symmetrisk (skævheden er ca. 0) eller højreskæv (hale mod højre, skævheden er positiv)
Man vil ofte ud fra fordelingen i fx. et histogram eller et boksplot, kunne vurdere skævheden

Klik her for at lære mere om skævhed!
(). SkævhedenSkævheden angiver om en fordeling er venstreskæv (hale mod venstre, skævheden er negativ), symmetrisk (skævheden er ca. 0) eller højreskæv (hale mod højre, skævheden er positiv)
Man vil ofte ud fra fordelingen i fx. et histogram eller et boksplot, kunne vurdere skævheden

Klik her for at lære mere om skævhed!
for Tryg variablen kan beregnes til -0,31, det betyder fordelingen er en lille smule venstreskæv, det er svært at se, men der er et par negative afkast, som gør at middelværdien er mindre end medianenMedianen angiver den miderste observation af et ordnet observationssæt, medianen kaldes også 0,5 fraktilen.
0,5 fraktilen kaldes medianen eller 2. kvartil, 50% af observationerne er mindre end medianen, 50% er større.
Hvis fx. medianen for mænds højde er 177 cm betyder det at 50% af mændene højst er 177 cm, og 50% er højere 177 cm.

Klik her for at lære mere om medianen!
. Vi siger at medianenMedianen angiver den miderste observation af et ordnet observationssæt, medianen kaldes også 0,5 fraktilen.
0,5 fraktilen kaldes medianen eller 2. kvartil, 50% af observationerne er mindre end medianen, 50% er større.
Hvis fx. medianen for mænds højde er 177 cm betyder det at 50% af mændene højst er 177 cm, og 50% er højere 177 cm.

Klik her for at lære mere om medianen!
er mere stabil overfor outliers (ekstreme observationer) hvorimod middelværdien påvirkes af outliers. Bemærk man får måske et resultat, der afviger en smule fra det her beregnede, dette skyldes de forskellige metoder til beregning.

Navn SkævhedSkævheden angiver om en fordeling er venstreskæv (hale mod venstre, skævheden er negativ), symmetrisk (skævheden er ca. 0) eller højreskæv (hale mod højre, skævheden er positiv)
Man vil ofte ud fra fordelingen i fx. et histogram eller et boksplot, kunne vurdere skævheden

Klik her for at lære mere om skævhed!
Typisk form Indikator
Højreskæv Større end 0 Hale mod højre Middelværdi større end Median
Venstreskæv Mindre end 0 Hale mod venstre Median større end Middelværdi
Symmetrisk 0 eller tæt på 0 Samme haler mod højre og venstre Median tæt på middelværdi

Tabel 3.2: Sammenhængen mellem skævhedensSkævheden angiver om en fordeling er venstreskæv (hale mod venstre, skævheden er negativ), symmetrisk (skævheden er ca. 0) eller højreskæv (hale mod højre, skævheden er positiv)
Man vil ofte ud fra fordelingen i fx. et histogram eller et boksplot, kunne vurdere skævheden

Klik her for at lære mere om skævhed!
fortegn, fordelingens typiske form og forholdet mellem middelværdi og median.
Kilde: Egen tilvirkning.

Figur 3.4: Illustration af højreskæv, symmetrisk og venstreskæv fordeling.
Kilde: Egen tilvirkning.

Kurtosis


KurtosisKurtosis (topstejlhed) angiver om en fordeling er spids (leptokurtisk), klokkeformet (mesokurtisk) eller flad (platykurtisk).
Normalfordelingen er klokkeformet (mesokurtisk), man kan beregne kurtosis som et tal er fordelingen:
Spids (leptokurtisk) er kurtosis positiv
Klokkeformet (mesokurtisk) er kurtosis ca. 0
Flad (platykurtisk) er kurtosis negativ
Man vil ofte ud fra fordelingen i fx. et histogram kunne vurdere topstejlheden.


Klik her for at lære mere om kurtosis!
eller topstejlhed beskriver hvor spids eller flad en fordeling er. Hvis kurtosisKurtosis (topstejlhed) angiver om en fordeling er spids (leptokurtisk), klokkeformet (mesokurtisk) eller flad (platykurtisk).
Normalfordelingen er klokkeformet (mesokurtisk), man kan beregne kurtosis som et tal er fordelingen:
Spids (leptokurtisk) er kurtosis positiv
Klokkeformet (mesokurtisk) er kurtosis ca. 0
Flad (platykurtisk) er kurtosis negativ
Man vil ofte ud fra fordelingen i fx. et histogram kunne vurdere topstejlheden.


Klik her for at lære mere om kurtosis!
er positiv, er der meget vægt helt inde ved midten og ud i halerne det giver en spids, slank bredfodet fordeling, der kaldes leptokurtisk. Hvis kurtosisKurtosis (topstejlhed) angiver om en fordeling er spids (leptokurtisk), klokkeformet (mesokurtisk) eller flad (platykurtisk).
Normalfordelingen er klokkeformet (mesokurtisk), man kan beregne kurtosis som et tal er fordelingen:
Spids (leptokurtisk) er kurtosis positiv
Klokkeformet (mesokurtisk) er kurtosis ca. 0
Flad (platykurtisk) er kurtosis negativ
Man vil ofte ud fra fordelingen i fx. et histogram kunne vurdere topstejlheden.


Klik her for at lære mere om kurtosis!
er negativ er der meget vægt mellem middelværdien og halerne, er kurven platykurtisk. Et typisk leptokurtisk datasæt vil i et histogram typisk have få høje søjler i midten og en eller to lange flade haler. Et platykurtisk datasæt vil typisk have mange næsten lige høje søjler, og kun enkelte lave søjler i siderne. Er kurtosisKurtosis (topstejlhed) angiver om en fordeling er spids (leptokurtisk), klokkeformet (mesokurtisk) eller flad (platykurtisk).
Normalfordelingen er klokkeformet (mesokurtisk), man kan beregne kurtosis som et tal er fordelingen:
Spids (leptokurtisk) er kurtosis positiv
Klokkeformet (mesokurtisk) er kurtosis ca. 0
Flad (platykurtisk) er kurtosis negativ
Man vil ofte ud fra fordelingen i fx. et histogram kunne vurdere topstejlheden.


Klik her for at lære mere om kurtosis!
tæt på nul, siger vi fordelingen er mesokurtisk eller klokkeformet, normalfordelingerNormalfordelingen er en symmetrisk, klokkeformet fordeling.
Mange fænomener er normalfordelte fx. nedbørsmængder, højde, stikprøvefordelingen etc.
Normalfordelingen bestemmes entydigt ud fra middelværdien μ og standardafvigelsen σ
Normalfordelte stokastiske variable har mange gode egenskaber, addition af og multiplikation med en faktor giver igen normalfordelte stokastiske variable.
Danskernes højde er fx. normalfordelt med middelværdi μ = 180,2 cm. og standardafvigelse σ = 7,42

Klik her for at lære mere om normalfordelingen!
er mesokurtiske.

Der findes forskellige lidt indviklede beregningsformler for kurtosisKurtosis (topstejlhed) angiver om en fordeling er spids (leptokurtisk), klokkeformet (mesokurtisk) eller flad (platykurtisk).
Normalfordelingen er klokkeformet (mesokurtisk), man kan beregne kurtosis som et tal er fordelingen:
Spids (leptokurtisk) er kurtosis positiv
Klokkeformet (mesokurtisk) er kurtosis ca. 0
Flad (platykurtisk) er kurtosis negativ
Man vil ofte ud fra fordelingen i fx. et histogram kunne vurdere topstejlheden.


Klik her for at lære mere om kurtosis!
, men softwarepakker rapporterer den. I Excel bruges formlen =KURT() eller på dansk =TOPSTEJL(). KurtosisKurtosis (topstejlhed) angiver om en fordeling er spids (leptokurtisk), klokkeformet (mesokurtisk) eller flad (platykurtisk).
Normalfordelingen er klokkeformet (mesokurtisk), man kan beregne kurtosis som et tal er fordelingen:
Spids (leptokurtisk) er kurtosis positiv
Klokkeformet (mesokurtisk) er kurtosis ca. 0
Flad (platykurtisk) er kurtosis negativ
Man vil ofte ud fra fordelingen i fx. et histogram kunne vurdere topstejlheden.


Klik her for at lære mere om kurtosis!
for Tryg variablen er 8,77 dvs. positiv, det betyder fordelingen er spids eller leptokurtisk, hvilket man måske kan fornemme, bemærk man får ikke nødvendigvis præcis samme værdi når man beregner kurtosisKurtosis (topstejlhed) angiver om en fordeling er spids (leptokurtisk), klokkeformet (mesokurtisk) eller flad (platykurtisk).
Normalfordelingen er klokkeformet (mesokurtisk), man kan beregne kurtosis som et tal er fordelingen:
Spids (leptokurtisk) er kurtosis positiv
Klokkeformet (mesokurtisk) er kurtosis ca. 0
Flad (platykurtisk) er kurtosis negativ
Man vil ofte ud fra fordelingen i fx. et histogram kunne vurdere topstejlheden.


Klik her for at lære mere om kurtosis!
, ligesom med fraktilerFraktiler er et tal mellem 0 og 1, der angiver andelen af et ordnet observationssæt. Vi opdeler et datasæt ordnet fra mindst til størst efter andelen angivet ved fraktilen.
Hvis fx. 0,45 fraktilen for mænds højde er 176 cm betyder det at 45% af mændene højst er 176 cm, og 55% er højere 176 cm.
Kendte fraktiler er:
0,25 fraktilen kaldes også 1. kvartil, 25% af observationerne er mindre end 1. kvartil.
0,5 fraktilen kaldes også medianen, 50% af observationerne er mindre end medianen.
0,75 fraktilen kaldes også 3. kvartil, 75% af observationerne er mindre end 3. kvartil.
0,1, 0,2, 0,3, 0,4... kaldes deciler

Klik her for at lære mere om fraktiler!
findes der mange forskellige måder at beregne kurtosisKurtosis (topstejlhed) angiver om en fordeling er spids (leptokurtisk), klokkeformet (mesokurtisk) eller flad (platykurtisk).
Normalfordelingen er klokkeformet (mesokurtisk), man kan beregne kurtosis som et tal er fordelingen:
Spids (leptokurtisk) er kurtosis positiv
Klokkeformet (mesokurtisk) er kurtosis ca. 0
Flad (platykurtisk) er kurtosis negativ
Man vil ofte ud fra fordelingen i fx. et histogram kunne vurdere topstejlheden.


Klik her for at lære mere om kurtosis!
på. Det er ikke vigtigt hvilken metode der benyttes, tolkningen er vigtigere.

Fordeling KurtosisKurtosis (topstejlhed) angiver om en fordeling er spids (leptokurtisk), klokkeformet (mesokurtisk) eller flad (platykurtisk).
Normalfordelingen er klokkeformet (mesokurtisk), man kan beregne kurtosis som et tal er fordelingen:
Spids (leptokurtisk) er kurtosis positiv
Klokkeformet (mesokurtisk) er kurtosis ca. 0
Flad (platykurtisk) er kurtosis negativ
Man vil ofte ud fra fordelingen i fx. et histogram kunne vurdere topstejlheden.


Klik her for at lære mere om kurtosis!
Typisk form
Platykurtisk Mindre end nul Flad
Leptokurtisk Større end nul Spids
Mesokurtisk 0 eller tæt på 0 Klokkeformet

Tabel 3.3: Sammenhængen mellem kurtosisKurtosis (topstejlhed) angiver om en fordeling er spids (leptokurtisk), klokkeformet (mesokurtisk) eller flad (platykurtisk).
Normalfordelingen er klokkeformet (mesokurtisk), man kan beregne kurtosis som et tal er fordelingen:
Spids (leptokurtisk) er kurtosis positiv
Klokkeformet (mesokurtisk) er kurtosis ca. 0
Flad (platykurtisk) er kurtosis negativ
Man vil ofte ud fra fordelingen i fx. et histogram kunne vurdere topstejlheden.


Klik her for at lære mere om kurtosis!
' fortegn, fordelingens navn (platykurtisk, leptokurtisk, mesokurtisk) og typisk form.
Kilde: Egen tilvirkning.

Figur 3.5: Illustration af platykurtisk (flad), mesokurtisk (klokkeformet) og leptokurtisk (spids) fordeling.
Kilde: Egen tilvirkning.

Netop skævhedSkævheden angiver om en fordeling er venstreskæv (hale mod venstre, skævheden er negativ), symmetrisk (skævheden er ca. 0) eller højreskæv (hale mod højre, skævheden er positiv)
Man vil ofte ud fra fordelingen i fx. et histogram eller et boksplot, kunne vurdere skævheden

Klik her for at lære mere om skævhed!
og kurtosisKurtosis (topstejlhed) angiver om en fordeling er spids (leptokurtisk), klokkeformet (mesokurtisk) eller flad (platykurtisk).
Normalfordelingen er klokkeformet (mesokurtisk), man kan beregne kurtosis som et tal er fordelingen:
Spids (leptokurtisk) er kurtosis positiv
Klokkeformet (mesokurtisk) er kurtosis ca. 0
Flad (platykurtisk) er kurtosis negativ
Man vil ofte ud fra fordelingen i fx. et histogram kunne vurdere topstejlheden.


Klik her for at lære mere om kurtosis!
er de mål, risikostyringsmodeller i banker bruger til at opdage "fat tails" i afkastfordelinger og kalibrere Value-at-Risk, og ML-modeller estimerer i stigende grad disse mål løbende på store datamængder af markedsdata.

Quiz

Quiz om deskriptiv statistik

Selvtest

Selvtest Realkredit Deskriptiv statistik

Spørgsmål

1. Hvad bliver medianen for datasættet {2,5,2,5,3,4}?
2. Hvad bliver 25% fraktilen for datasættet {2,5,2,5,3,4}?
3. Hvad bliver 1. kvartil for datasættet {2,5,2,5,3,4}?
4. Hvad bliver 2. kvartil for datasættet {2,5,2,5,3,4}?
5. Hvad bliver 0,75 fraktilen for datasættet {2,5,2,5,3,4}?
6. Du er nystartet porteføljeforvalter i private banking afdelingen i en større bank, du forestår forvaltningen af 10 kunders formuer. I antal tusinde kroner udgør porteføljerne:
{344,421,293,459,228,391,375,377,318,428}
Du er fredag aften på Victor i dit Tiger suit. Under cocktails i baren falder du i snak med en velhavende jysk mand, Anders Holch Povlsen. Han er meget imponeret over dine prognoser og investeringsforslag. Mandag morgen kontakter en af hans medarbejdere dig, Anders Holch Povlsen ønsker, du skal forvalte en formue på 2 mia. kr. altså 2.000.000 tusinde kr. for ham. Hvorledes vil du bedst beskrive din typiske klient ved medianen eller middelværdien?

1. Det ordnede datasæt bliver: {2,2,3,4,5,5}. Der er 2 midterste observationer 3 og 4, {2,2,3,4,5,5}, gennemsnittet af disse er 3,5 Medianen bliver altså 3,5
2. Det ordnede datasæt bliver: {2,2,3,4,5,5}. 25% fraktilen bliver 2
3. Det ordnede datasæt bliver: {2,2,3,4,5,5}. 1. kvartil bliver 2
4. Det ordnede datasæt bliver: {2,2,3,4,5,5}. 2. kvartil bliver 3,5
$$ \frac{3 + 4}{2} = 3{,}5 $$
5. Det ordnede datasæt bliver: {2,2,3,4,5,5}. 0,75 fraktilen bliver 5
6. Middelværdi og median for den gamle portefølje er henholdsvis 363 400 og 376 000. Middelværdi og median for den ny portefølje er henholdsvis 182 148 545 og 377 000.
Den gennemsnitlige porteføljeværdi, er steget voldsomt efter den nye superklient, men den typiske klient beskrives her bedst ved medianen. Dette skyldes medianen ikke påvirkes væsentligt af denne nye store kunde, vi kan kalde denne observation for en outlier. Medianen er altså mere stabil overfor outliers i forhold til middelværdien.

I linket her er data vedr. verdens superrigeste. Formuen finalWorth mio. USD er opgjort i antal millioner USD, de følgende spørgsmål relaterer sig udelukkende til denne variabel.
Bemærk datasættet er stort med flere end 2000 observationer, sørg for at hente seneste version af Freestat under Materialer. 1. Hvilken type variabel er variablen finalWorth mio. USD?
2. Hvad er den gennemsnitlige formue?
3. Hvad er medianen?
4. Hvad er fordelingens skævhed?
5. Hvad er 3. kvartil?
6. Hvad er Kvartilafstanden?
7. 10% af de rigeste velhavere har en formue der er større end?
8. 2,5% af de rigeste velhavere har en formue der er større end?
9. 90% af de fattigste velhavere har en formue der er mindre end?
10 Er fordelingen flad, klokkeformet eller spids?
11 Er fordelingen platykurtisk, mesokurtisk eller leptokurtisk?
12 Hvad er variationsbredden?

1. Variablen finalWorth mio. USD er en kvantitativ, kontinuert variabel, ratioskala.
2. Den gennemsnitlige formue er 4.762,35 mio USD dvs. 4,76 mia. USD
3. Medianen for variablen finalWorth mio. USD er 2.400 mio USD dvs. 2,4 mia. USD
4. Fordelingens skævhed er 9,95, fordelingen er som vi vel ville forvente klart højreskæv. Der er velhavere med meget store formuer, dvs. outliers med høje værdier, vanvittigt rige mennesker, som fx Elon Musk, Bill Gates, Warren Buffet etc. disse danner en hale mod højre.
5. 3. kvartil er 4.300 mio USD.
6. Kvartilafstanden er 2,8 mia. USD, størrelsen findes som 3. kvartil minus 1. kvartil. 50% af velhaverne ligger i et spænd på 2,8 mia. USD
7. 10% af velhaverne har en formue der er større end 8,2 mia. USD, her skal vi bestemme 90% fraktilen, denne fremgår direkte af Freestat.
8. 2,5% af velhaverne har en formue der er større end 22,8 mia. USD, her skal vi bestemme 97,5% fraktilen, denne fremgår direkte af Freestat.
9. 90% af velhaverne har en formue der er mindre end 8,2 mia. USD, her skal vi bestemme 90% fraktilen, denne fremgår direkte af Freestat, dette er samme svar som i spørgsmål 7.
10 Fordelingen er klart spids, da kurtosis er meget høj 136,43
11 Fordelingen er pr. definition leptokurtisk, da kurtosis er meget høj 136,43
12 Variationsbredden findes som den rigeste minus den fattigste milliardær, variationsbredden bliver altså 219-1 = 218 Mia. USD

Vi kan da også se af histogrammet nedenfor at fordelingen er meget højreskæv og spids:

Forbes
Herunder ses det output man ville generere i Freestat.
stdKI99

I linket her er filen Forbes Superrige, filen indeholder data vedr. de rigeste mennesker i verden. Vi vil i de næste spørgsmål se på fordelingen af variablen alder, pas på denne variabel er ikke komplet, sørg for at fjerne observationer med manglende data (fx. vha. Excels filter). Der er personer, for hvem man ikke har kunnet indhente oplysninger om alder.

1. Er datasættet bivariat?
2. Hvad er den gennemsnitlige alder for de rigeste?
3. Hvad er medianen for alder?
4. Hvad er aldersfordelingens skævhed?
5. Hvad er 3. kvartil for Age?
6. Hvad er Kvartilafstanden for Age?
7. 25% af velhaverne er ældre end?
8. 2,5% af de yngste velhavere er yngre end?
9. 0,5% er yngre end?
10. Er fordelingen flad, klokkeformet eller spids?
11. Er fordelingen platykurtisk, mesokurtisk eller leptokurtisk ?
12. Hvad er aldersspændet?

1. Nej datasættet er ikke bivariat men multivariat.
2. Den gennemsnitlige alder for de rigeste er 64,21 år.
3. Medianen for alder er 64 år.
4. Aldersfordelingens skævhed -0,03 fordelingen kan derfor betegnes som symmetrisk.
5. 3. kvartil for Age er 74 år.
6. Kvartilafstanden for Age er 19 år.
7. 25% af velhaverne er ældre end 74 år.
8. 2,5% af de yngste velhavere er yngre end 38 år.
9. 0,5% er yngre end 30 år.
10. Fordelingen er klokkeformet da kurtosis er -0,29 dvs. tæt på 0.
11. Er fordelingen mesokurtisk, jvf. spørgsmål 10.
12. Aldersspændet er 100 - 19 = 81 år.
stdKI99 Herunder ses det output man ville generere i Freestat. stdKI99

I linket her er filen Verdensøkonomien_2023.xlsx. Besvar følgende spørgsmål for variablen BNP/GDP. BNP bruttonationalproduktet er værdien af de varer og ydelser som et land producerer.

1. Hvilken type variabel er variablen BNP USD?
2. Hvad er det gennemsnitlige BNP USD for landene?
3. Hvad er medianen for landene?
4. Hvad er fordelingens skævhed, er denne som du ville have forventet?
5. Hvad er 3. kvartil?
6. Hvad er Kvartilafstanden?
7. 25% af landene med størst produktion, har et BNP der er større end?
8. 2,5% af landene med mindst produktion, har et BNP der er mindre end?
9. 90% af landene med mindst produktion, har et BNP der er mindre end?
10 Er fordelingen flad, klokkeformet eller spids?
11 Er fordelingen platykurtisk, mesokurtisk eller leptokurtisk?
12 Hvad er variationsbredden?

Bemærk der er lande, hvor BNP ikke er oplyst, disse skal ikke medtages. Man kunne for overskuelighedens skyld overveje at ændre enhederne fra USD til fx. milliarder USD.
1. Variablen BNP USD er en kvantitativ, kontinuert variabel, ratioskala.
2. Hvad er det gennemsnitlige BNP USD for landene 556.730.449.505 USD eller 557 mia. USD.
3. Medianen for variablen BNP USD er kun 45.559.202.049 USD. altså 46 mia. USD
4. Fordelingens skævhed er 8,62, fordelingen er voldsomt højreskæv pga. outliers Kina og USA.
5. 3. kvartil er 290.923.534.701 USD. eller 291 mia. USD
6. Kvartilafstanden er 278.025.227.611 USD. eller 278 mia. USD
7. 25% af landene med størst produktion, har et BNP der er større end 290.923.534.701 USD. eller 290 mia. USD
8. 2,5% af landene med mindst produktion, har et BNP der er mindre end 474.928.608 USD. eller 474 mio. USD
9. 90% af landene med mindst produktion, har et BNP der er mindre end 940.038.548.669 USD. eller 940 mia. USD
10 Fordelingen er klart spids, der er rigtig mange lande med et mindre BNP, mens vi har en gruppe lande med forholdsmæssig høj produktion hvilket som ses af histogrammet giver en meget spids fordeling.
11 Er fordelingen derfor leptokurtisk da den er spids.
12 Variationsbredden er forskellen mellem landet med højeste USA og laveste produktion Tuvalu, dvs. 25.462.700.000.000-60.349.391=25.462.639.650.609 altså 25,5 billioner USD.

Herunder ses FREESTAT output


Herunder ses histogrammet for BNP for forskellige lande, vi kan af histogrammet se at fordelingen er højreskæv og leptokurtisk (spids). Der er outliers fx USA og Kina med BNP langt over 5.000 mia. USD. Histogrammet er lavet i Excel vha. pivot tabeller.

Copy

I linket her er filen VIRKSOMHEDER-DK, der viser data for 369 danske virksomheder med ekstern revision. Der er således en overvægt af virksomheder af en vis størrelse, hvorfor samtlige beløb er angivet i antal 1000 DKK. Besvar følgende spørgsmål for variablen egenkapital i antal 1000 DKK.

1. Hvilken type variabel er variablen egenkapital?
2. Hvad er det gennemsnitlige egenkapital for virksomhederne?
3. Hvad er medianen for egenkapital?
4. Hvad er fordelingens skævhed, er denne som du ville have forventet?
5. Hvad er 3. kvartil?
6. Hvad er Kvartilafstanden?
7. 25% af de mest velpolstrede virksomheder, har en egenkapital der er større end?
8. 2,5% af de mindst velpolstrede virksomheder, har en egenkapital der er mindre end?
9. 90% af virksomhederne med mindst egenkapital, har en egenkapital der er mindre end?
10 Er fordelingen flad, klokkeformet eller spids?
11 Er fordelingen platykurtisk, mesokurtisk eller leptokurtisk ?
12 Hvad er variationsbredden?

1. Variablen egenkapital er en kvantitativ, kontinuert variabel, ratioskala.
2. Hvad er det gennemsnitlige egenkapital for virksomhederne 155327,97 1000 DKK.
3. Medianen for variablen egenkapital er 26054 1000 DKK.
4. Fordelingens skævhed er 12,28
5. 3. kvartil er 113453 1000 DKK.
6. Hvad er Kvartilafstanden 112169 1000 DKK.
7. 25% af de mest velpolstrede virksomheder, har en egenkapital der er større end 113453 1000 DKK.
8. 2,5% af de mindst velpolstrede virksomheder, har en egenkapital der er mindre end 117 1000 DKK.
9. 90% af virksomhederne med mindst egenkapital, har en egenkapital der er mindre end 229359 1000 DKK.
10 Fordelingen er klart spids med positiv kurtosis.
11 Fordelingen derfor leptokurtisk da den er spids.
12 Variationsbredden er forskellen mellem det virksomheden med højeste og laveste egenkapital, dvs. 10712042-37 =10712005 1000 DKK.

Herunder ses histogrammet for egenkapital for de danske virksomheder i antal 1000 DKK, vi kan af histogrammet se at fordelingen er højreskæv og leptokurtisk. Der er klare outliers, dvs store etablerede virksomheder med megen egenkapital.

stdKI99


Du har nu adgang

Alle kapitler er åbne.