3. Deskriptiv statistik
Deskriptiv eller beskrivende statistik er metoder til vha. figurer, tabeller og deskriptorer (middelværdi, median etc.) at præsentere et datamateriale. Beskrivende statistik er simplere metoder end inferentiel eller matematisk teoretisk statistik, hvor konklusioner drages på baggrund af en egentlig statistisk analyse. Deskriptiv statistik bruges til at beskrive de data man har. Inferentiel statistik bruges til at generalisere, på baggrund af de data man har.
DK Aktiekurser datasættet fra videoen ovenfor
Tryg aktien
Vi har fra ovenfor et multivariat datasæt bestående af daglige procentvise afkast for 6 OMX25 aktier: TRYG, DDB, FLS, GENMAB, NOVO, ISS. Vi ønsker at beskrive det procentvise daglige afkast for Tryg vha. forskellige deskriptorer.
I histogrammet herunder kan vi se hvordan det daglige procentvise afkast på Trygaktien fordeler sig, der er klart flest dage hvor det procentvise afkast er tæt på 0.
Figur 3.1: Dagsafkast TRYG.CO i procent — hyppighed i antal dage. Hold musen over en søjle for interval og antal dage.
Her er samme data med færre søjler, nu har vi på y-aksen frekvensen af søjlerne i stedet for hyppigheden. Frekvensen er antallet af observationer i hver søjle divideret med det totale antal observationer.
Figur 3.2: Dagsafkast TRYG.CO i procent — frekvens (andel af 159 observationer). Hold musen over en søjle for interval og frekvens.
Middelværdien
Middelværdien af en variabel bestemmes ved at bestemme gennemsnittet for variablen. Da afkastet for Tryg indeholder n=159 observationer bliver formlen:
$$\bar{x} = {\sum_{1}^{n} x_i \over n} = {-1,28-0,94-2,59+...+0,67 \over 159} \approx -0,16$$
Variansen
Variansen (stikprøvevariansenEn stikprøve, er et udsnit af populationen (den store mængde vi ønsker at
udtale os om), hvis stikprøven afspejler populationen korrekt, siger vi
stikprøven er repræsentativ.
Vi bruger stikprøver, da det er billigere end at undersøge hele
populationen.
Hvis vi fx. ønsker at udtale os om danske mænds gennemsnitlige højde,
kan vi udtage en stikprøve, hvor vi måler 100 mænds højde.
Stikprøven består så af de 100 målinger af højderne, populationen er så
alle danske mænd.
Klik her for at
lære mere om stikprøver!
) er et udtryk for variationen omkring middelværdien i data:
$$ S^2 = {\sum_{1}^{n} ( x_i - \bar{x})^2 \over n-1} = $$ $$ {(-1,28--0,16)^2+(-0,94--0,16)^2+...+(0,67--0,16)^2 \over 158} \approx$$ $$ 1,38$$
Standardafvigelsen
StandardafvigelsenStandardafvigelsen fortæller hvor meget en variabel typisk varierer
omkring middelværdien.
Standardafvigelsen også kaldet spredningen, findes som kvadratroden af
variansen, i modsætning til variansen er standardafvigelsen i samme enhed
som variablen hvilket gør tolkning nemmere.
Kursen for en aktie med middelkurs 100 Kr. og standardafvigelse 1 svinger
meget mindre, end en aktie med middelkurs 100 og standardafvigelse 10. Da
investorer er risikoaverse vil de foretrække aktien med den mindste
standardafvigelse.
Klik her
for
at lære mere om standardafvigelsen! er lig med kvadratroden af variansen, og er dermed ligeledes et mål for variationen omkring
middelværdien. StandardafvigelsenStandardafvigelsen fortæller hvor meget en variabel typisk varierer
omkring middelværdien.
Standardafvigelsen også kaldet spredningen, findes som kvadratroden af
variansen, i modsætning til variansen er standardafvigelsen i samme enhed
som variablen hvilket gør tolkning nemmere.
Kursen for en aktie med middelkurs 100 Kr. og standardafvigelse 1 svinger
meget mindre, end en aktie med middelkurs 100 og standardafvigelse 10. Da
investorer er risikoaverse vil de foretrække aktien med den mindste
standardafvigelse.
Klik her
for
at lære mere om standardafvigelsen! har i modsætning til variansen samme enhed som data, hvilket gør tolkning lettere.
Varians og standardafvigelse er afhængige af skala, hvilket fx. betyder, at værdier i kr. vil have 1000 gange
større variation end størrelser målt i antal tusinde kr.
For fx. aktie afkast vil standardafvigelsenStandardafvigelsen fortæller hvor meget en variabel typisk varierer
omkring middelværdien.
Standardafvigelsen også kaldet spredningen, findes som kvadratroden af
variansen, i modsætning til variansen er standardafvigelsen i samme enhed
som variablen hvilket gør tolkning nemmere.
Kursen for en aktie med middelkurs 100 Kr. og standardafvigelse 1 svinger
meget mindre, end en aktie med middelkurs 100 og standardafvigelse 10. Da
investorer er risikoaverse vil de foretrække aktien med den mindste
standardafvigelse.
Klik her
for
at lære mere om standardafvigelsen! være en
vigtig parameterEn parameter betegner en ukendt konstant i en statistisk model eller
formel, ud fra en stikprøve estimeres (gættes kvalificeret på) dens
værdi.
En parameter kan fx. være β, μ, p, σ etc.
Vi ønsker at udtale os om danske mænds højde, populationen er så danske
mænd. Stikprøve gennemsnittet for fx. 100 mænds højde 179,34 cm. er
parameter estimatet (gættet på middelværdien i populationen). Den sande
ukendte parameter i populationen er altså middelhøjden i populationen
μ
I AI-sammenhæng bruges ordet parametre om de tal modellen justerer under træning — som knapper på et kæmpe
regneapparat. GPT-1 havde 117 millioner parametre; de største modeller anslås til billioner.
Flere parametre = modellen kan skelne mellem flere sproglige mønstre — men det koster eksponentielt mere at
træne.
Klik her for at lære mere om parametre og parameter-estimater!, da investorer er risikoaverse ønskes mindst mulig standardafvigelse i forhold til
afkastet.
Vi finder her standardafvigelsenStandardafvigelsen fortæller hvor meget en variabel typisk varierer
omkring middelværdien.
Standardafvigelsen også kaldet spredningen, findes som kvadratroden af
variansen, i modsætning til variansen er standardafvigelsen i samme enhed
som variablen hvilket gør tolkning nemmere.
Kursen for en aktie med middelkurs 100 Kr. og standardafvigelse 1 svinger
meget mindre, end en aktie med middelkurs 100 og standardafvigelse 10. Da
investorer er risikoaverse vil de foretrække aktien med den mindste
standardafvigelse.
Klik her
for
at lære mere om standardafvigelsen! til 1,17 procent, vi kan populært sige, at den typiske afvigelse fra det
gennemsnitlige
dagsafkast på -0,16 procent for Trygaktien, er
1,17 procent.
$$ S = \sqrt{S^2} = \sqrt{1,38} \approx 1,17 $$
Modus
Modus/modalværdi/typetallet er den hyppigst forekommende observation for et observationssæt. Typetallet er ikke
nødvendigvis godt til at beskrive data. Har vi fx. observationssættet: {1,1,2,3,4,5,6,7,8,9,10} er typetallet 1,
medianenMedianen angiver den miderste observation af et ordnet observationssæt,
medianen kaldes også 0,5 fraktilen.
0,5 fraktilen kaldes medianen eller 2. kvartil, 50% af observationerne er
mindre end medianen, 50% er større.
Hvis fx. medianen for mænds højde er 177 cm betyder det at 50% af mændene
højst er 177 cm, og 50% er højere 177 cm.
Klik her for at lære mere om medianen! 5 og middelværdien 5,09. I dette tilfælde med Trygaktien ville modusModus/modalværdi/typetallet er den hyppigst forekommende observation for
et observations sæt.
Klik her
for at lære mere om modus! være en ringe
deskriptor for
observationssættet. Variablen dagsafkast i procent er kontinuert, det er derfor kun når vi afrunder dagsafkast at
vi vil opleve flere dage med samme dagsafkast.
Bimodal og Unimodal
Har vi en fordeling med en top kalder vi den for unimodal, har fordelingen 2 toppe kalder vi den bimodal. Fordelingen for Tryg aktiens dagsafkast, er således unimodal. Havde man fx. en variabel med priserne for Tesla model 3 og model X, ville vi få en bimodal fordeling, da priserne ville danne 2 toppe. Model X er typisk væsentlig dyrere end Model 3.
Medianen, kvartiler og fraktilen
Når vi ønsker at beskrive middeltendensen i et datasæt kan vi angive middelværdien, typetallet eller medianenMedianen angiver den miderste observation af et ordnet observationssæt,
medianen kaldes også 0,5 fraktilen.
0,5 fraktilen kaldes medianen eller 2. kvartil, 50% af observationerne er
mindre end medianen, 50% er større.
Hvis fx. medianen for mænds højde er 177 cm betyder det at 50% af mændene
højst er 177 cm, og 50% er højere 177 cm.
Klik her for at lære mere om medianen!
.
MedianenMedianen angiver den miderste observation af et ordnet observationssæt,
medianen kaldes også 0,5 fraktilen.
0,5 fraktilen kaldes medianen eller 2. kvartil, 50% af observationerne er
mindre end medianen, 50% er større.
Hvis fx. medianen for mænds højde er 177 cm betyder det at 50% af mændene
højst er 177 cm, og 50% er højere 177 cm.
Klik her for at lære mere om medianen! også kaldet 2. kvartil eller 50% fraktilen er den midterste observation i det ordnede
datasæt, er der et lige antal observationer tages gennemsnittet. Man kan nu bestemme nedre kvartil også
kaldet 1. kvartil eller 25% fraktilen, som midten af den nedre halvdel af det ordnede datasæt.
Tilsvarende gælder for øvre kvartil også kaldet 3. kvartil eller 75% fraktilen blot for
den øvre halvdel at det ordnede datasæt.
Hvis vi har et ordnet datasæt {11,13,15,16,16,18,20}, finder vi således medianenMedianen angiver den miderste observation af et ordnet observationssæt,
medianen kaldes også 0,5 fraktilen.
0,5 fraktilen kaldes medianen eller 2. kvartil, 50% af observationerne er
mindre end medianen, 50% er større.
Hvis fx. medianen for mænds højde er 177 cm betyder det at 50% af mændene
højst er 177 cm, og 50% er højere 177 cm.
Klik her for at lære mere om medianen! som den midterste
observation, da vi har et ulige antal observationer.
{11,13,15,16,16,18,20}. Vi kan udtrykke dette som at 50% af
observationerne er 16 eller derover, eller ækvivalent, at 50% af observationerne er mindre end 16.
$$ {13+15 \over 2}=14 $$
Vi kan udtrykke dette som at 75% af observationerne er 14 eller derover, eller at 25% af observationerne er mindre end 14.Der er mere end 8 forskellige definitioner på kvartilerKvartiler angiver 0,25; 0,5 eller 0,75 andelen af et ordnet
observationssæt.
Hvis fx. 0,75 fraktilen for mænds højde er 179 cm betyder det at 75% af
mændene højst er 179 cm, og 25% er højere 179 cm.
0,25 fraktilen kaldes 1. kvartil, 25% af observationerne er mindre end 1.
kvartil.
0,5 fraktilen kaldes medianen eller 2. kvartil, 50% af observationerne er
mindre end medianen.
0,75 fraktilen kaldes 3. kvartil, 75% af observationerne er mindre end 3.
kvartil.
Klik her for at lære mere om kvartiler! og fraktilerFraktiler er et tal mellem 0 og 1, der angiver andelen af et ordnet
observationssæt. Vi opdeler et datasæt ordnet fra mindst til størst efter
andelen angivet ved fraktilen.
Hvis fx. 0,45 fraktilen for mænds højde er 176 cm betyder det at 45% af
mændene højst er 176 cm, og 55% er højere 176 cm.
Kendte fraktiler er:
0,25 fraktilen kaldes også 1. kvartil, 25% af observationerne er mindre
end 1. kvartil.
0,5 fraktilen kaldes også medianen, 50% af observationerne er mindre end
medianen.
0,75 fraktilen kaldes også 3. kvartil, 75% af observationerne er mindre
end 3. kvartil.
0,1, 0,2, 0,3, 0,4... kaldes deciler
Klik her for at lære mere om fraktiler! alt efter kontinent og
region, vi går ikke i detaljer med beregningsmetoderne, men softwareprogrammer kan beregne fraktilerFraktiler er et tal mellem 0 og 1, der angiver andelen af et ordnet
observationssæt. Vi opdeler et datasæt ordnet fra mindst til størst efter
andelen angivet ved fraktilen.
Hvis fx. 0,45 fraktilen for mænds højde er 176 cm betyder det at 45% af
mændene højst er 176 cm, og 55% er højere 176 cm.
Kendte fraktiler er:
0,25 fraktilen kaldes også 1. kvartil, 25% af observationerne er mindre
end 1. kvartil.
0,5 fraktilen kaldes også medianen, 50% af observationerne er mindre end
medianen.
0,75 fraktilen kaldes også 3. kvartil, 75% af observationerne er mindre
end 3. kvartil.
0,1, 0,2, 0,3, 0,4... kaldes deciler
Klik her for at lære mere om fraktiler! for
os, disse kan altså afvige en smule alt efter beregningsmetoden.
MedianenMedianen angiver den miderste observation af et ordnet observationssæt,
medianen kaldes også 0,5 fraktilen.
0,5 fraktilen kaldes medianen eller 2. kvartil, 50% af observationerne er
mindre end medianen, 50% er større.
Hvis fx. medianen for mænds højde er 177 cm betyder det at 50% af mændene
højst er 177 cm, og 50% er højere 177 cm.
Klik her for at lære mere om medianen! for Tryg findes ved at sortere data fra laveste til højeste procentvise dagsafkast -6,62;
-3,14; -2,59; ...; 5,79
vi finder at medianenMedianen angiver den miderste observation af et ordnet observationssæt,
medianen kaldes også 0,5 fraktilen.
0,5 fraktilen kaldes medianen eller 2. kvartil, 50% af observationerne er
mindre end medianen, 50% er større.
Hvis fx. medianen for mænds højde er 177 cm betyder det at 50% af mændene
højst er 177 cm, og 50% er højere 177 cm.
Klik her for at lære mere om medianen!
bliver -0,12.
Vi bestemmer ligeledes 1. kvartil til -0,78, og 2. kvartil til -0,12. 1. kvartil,
MedianenMedianen angiver den miderste observation af et ordnet observationssæt,
medianen kaldes også 0,5 fraktilen.
0,5 fraktilen kaldes medianen eller 2. kvartil, 50% af observationerne er
mindre end medianen, 50% er større.
Hvis fx. medianen for mænds højde er 177 cm betyder det at 50% af mændene
højst er 177 cm, og 50% er højere 177 cm.
Klik her for at lære mere om medianen! og 3. kvartil kan ses i nedenstående boxplotEt boxplot viser median, kvartiler og eventuelle outliers i ét diagram.
John Tukey opfandt boxplottet i 1970'erne som en del af eksplorativ dataanalyse — en måde at undersøge
data visuelt, før man laver formelle statistiske tests.
Klik her for at lære mere om
boxplots! diagram, som hhv. første, anden og tredie vandrette
streg i boksen i boxplottetEt boxplot viser median, kvartiler og eventuelle outliers i ét diagram.
John Tukey opfandt boxplottet i 1970'erne som en del af eksplorativ dataanalyse — en måde at undersøge
data visuelt, før man laver formelle statistiske tests.
Klik her for at lære mere om
boxplots! (den orange boks) for Tryg. Vi kan hvis vi skal forsøge at udtrykke fx. 1. kvartil
med menneskeord sige at 25% af dagene var der et afkast på -0,78 procent eller derunder. Man kunne også
udtrykke det som at 75% af dagene
var afkastet på mere end -0,78 procent.
Kvartilafstanden eller IQR interquantile range betyder 3. kvartil minus 1. kvartil, i Tryg
eksemplet bliver kvartilafstanden 0,49 - -0,78 = 1,27. Dette svarer præcis til højden på boksen i boxplottetEt boxplot viser median, kvartiler og eventuelle outliers i ét diagram.
John Tukey opfandt boxplottet i 1970'erne som en del af eksplorativ dataanalyse — en måde at undersøge
data visuelt, før man laver formelle statistiske tests.
Klik her for at lære mere om
boxplots!
for Tryg, vi kan altså konstatere at halvdelen af afkastene lå i et spænd på 1,27 procent.
Figur 3.3: BoxplotEt boxplot viser median, kvartiler og eventuelle outliers i ét diagram.
John Tukey opfandt boxplottet i 1970'erne som en del af eksplorativ dataanalyse — en måde at undersøge
data visuelt, før man laver formelle statistiske tests.
Klik her for at lære mere om
boxplots! for TRYG.CO's daglige procentvise afkast — viser minimum, 1. kvartil, median, 3. kvartil og maksimum. Hold musen over boksen for min, kvartilerKvartiler angiver 0,25; 0,5 eller 0,75 andelen af et ordnet
observationssæt.
Hvis fx. 0,75 fraktilen for mænds højde er 179 cm betyder det at 75% af
mændene højst er 179 cm, og 25% er højere 179 cm.
0,25 fraktilen kaldes 1. kvartil, 25% af observationerne er mindre end 1.
kvartil.
0,5 fraktilen kaldes medianen eller 2. kvartil, 50% af observationerne er
mindre end medianen.
0,75 fraktilen kaldes 3. kvartil, 75% af observationerne er mindre end 3.
kvartil.
Klik her for at lære mere om kvartiler!, median, max og IQR.
Kilde: Egen tilvirkning.
Fraktiler
Vi kan ligeledes bestemme alle mulige andre fraktilerFraktiler er et tal mellem 0 og 1, der angiver andelen af et ordnet
observationssæt. Vi opdeler et datasæt ordnet fra mindst til størst efter
andelen angivet ved fraktilen.
Hvis fx. 0,45 fraktilen for mænds højde er 176 cm betyder det at 45% af
mændene højst er 176 cm, og 55% er højere 176 cm.
Kendte fraktiler er:
0,25 fraktilen kaldes også 1. kvartil, 25% af observationerne er mindre
end 1. kvartil.
0,5 fraktilen kaldes også medianen, 50% af observationerne er mindre end
medianen.
0,75 fraktilen kaldes også 3. kvartil, 75% af observationerne er mindre
end 3. kvartil.
0,1, 0,2, 0,3, 0,4... kaldes deciler
Klik her for at lære mere om fraktiler! end 25% 50% og 75% fraktilerneFraktiler er et tal mellem 0 og 1, der angiver andelen af et ordnet
observationssæt. Vi opdeler et datasæt ordnet fra mindst til størst efter
andelen angivet ved fraktilen.
Hvis fx. 0,45 fraktilen for mænds højde er 176 cm betyder det at 45% af
mændene højst er 176 cm, og 55% er højere 176 cm.
Kendte fraktiler er:
0,25 fraktilen kaldes også 1. kvartil, 25% af observationerne er mindre
end 1. kvartil.
0,5 fraktilen kaldes også medianen, 50% af observationerne er mindre end
medianen.
0,75 fraktilen kaldes også 3. kvartil, 75% af observationerne er mindre
end 3. kvartil.
0,1, 0,2, 0,3, 0,4... kaldes deciler
Klik her for at lære mere om fraktiler!, software angiver
ofte en række af disse så man hurtigt kan danne sig et billede af datasættet. Nedenfor er en del fraktilerFraktiler er et tal mellem 0 og 1, der angiver andelen af et ordnet
observationssæt. Vi opdeler et datasæt ordnet fra mindst til størst efter
andelen angivet ved fraktilen.
Hvis fx. 0,45 fraktilen for mænds højde er 176 cm betyder det at 45% af
mændene højst er 176 cm, og 55% er højere 176 cm.
Kendte fraktiler er:
0,25 fraktilen kaldes også 1. kvartil, 25% af observationerne er mindre
end 1. kvartil.
0,5 fraktilen kaldes også medianen, 50% af observationerne er mindre end
medianen.
0,75 fraktilen kaldes også 3. kvartil, 75% af observationerne er mindre
end 3. kvartil.
0,1, 0,2, 0,3, 0,4... kaldes deciler
Klik her for at lære mere om fraktiler!
for Tryg datasættet angivet, nogle af disse kan direkte aflæses i boxplottetEt boxplot viser median, kvartiler og eventuelle outliers i ét diagram.
John Tukey opfandt boxplottet i 1970'erne som en del af eksplorativ dataanalyse — en måde at undersøge
data visuelt, før man laver formelle statistiske tests.
Klik her for at lære mere om
boxplots!.
10% fraktilen, 20% fraktilen,…,90% fraktilen kaldes også for deciler.
Herunder ses fraktilerFraktiler er et tal mellem 0 og 1, der angiver andelen af et ordnet
observationssæt. Vi opdeler et datasæt ordnet fra mindst til størst efter
andelen angivet ved fraktilen.
Hvis fx. 0,45 fraktilen for mænds højde er 176 cm betyder det at 45% af
mændene højst er 176 cm, og 55% er højere 176 cm.
Kendte fraktiler er:
0,25 fraktilen kaldes også 1. kvartil, 25% af observationerne er mindre
end 1. kvartil.
0,5 fraktilen kaldes også medianen, 50% af observationerne er mindre end
medianen.
0,75 fraktilen kaldes også 3. kvartil, 75% af observationerne er mindre
end 3. kvartil.
0,1, 0,2, 0,3, 0,4... kaldes deciler
Klik her for at lære mere om fraktiler! for dagligt afkast på Tryg aktien.
| Fraktil | Dagsafkast i % |
|---|---|
| 0% Fraktilen dvs. minimum | -6,62% |
| 0,5% Fraktilen | -3,87% |
| 2,5% Fraktilen | -2,19% |
| 5% Fraktilen | -1,73% |
| 10% Fraktilen også kaldet 1. decil | -1,43% |
| 20% Fraktilen også kaldet 2. decil | -0,94% |
| 25% Fraktilen også kaldet 1. kvartil | -0,78% |
| 30% Fraktilen også kaldet 3. decil | -0,66% |
| 40% Fraktilen | -0,3% |
| 50% Fraktilen også kaldet medianenMedianen angiver den miderste observation af et ordnet observationssæt,
medianen kaldes også 0,5 fraktilen. 0,5 fraktilen kaldes medianen eller 2. kvartil, 50% af observationerne er mindre end medianen, 50% er større. Hvis fx. medianen for mænds højde er 177 cm betyder det at 50% af mændene højst er 177 cm, og 50% er højere 177 cm. Klik her for at lære mere om medianen! |
-0,12% |
| 60% Fraktilen | 0,1% |
| 70% Fraktilen | 0,37% |
| 75% Fraktilen også kaldet 3. kvartil | 0,49% |
| 80% Fraktilen | 0,61% |
| 90% Fraktilen også kaldet 9. decil | 0,98% |
| 95% Fraktilen | 1,36% |
| 97,5% Fraktilen | 1,79% |
| 99,5% Fraktilen | 2,99% |
| 100% Fraktilen maksimalt observeret dagsafkast i % | 5,79% |
Tabel 3.1: FraktilerFraktiler er et tal mellem 0 og 1, der angiver andelen af et ordnet
observationssæt. Vi opdeler et datasæt ordnet fra mindst til størst efter
andelen angivet ved fraktilen.
Hvis fx. 0,45 fraktilen for mænds højde er 176 cm betyder det at 45% af
mændene højst er 176 cm, og 55% er højere 176 cm.
Kendte fraktiler er:
0,25 fraktilen kaldes også 1. kvartil, 25% af observationerne er mindre
end 1. kvartil.
0,5 fraktilen kaldes også medianen, 50% af observationerne er mindre end
medianen.
0,75 fraktilen kaldes også 3. kvartil, 75% af observationerne er mindre
end 3. kvartil.
0,1, 0,2, 0,3, 0,4... kaldes deciler
Klik her for at lære mere om fraktiler! for TRYG.CO's daglige procentvise afkast, fra 0% (minimum) til 100% (maksimum), herunder decilerne og kvartilerneKvartiler angiver 0,25; 0,5 eller 0,75 andelen af et ordnet
observationssæt.
Hvis fx. 0,75 fraktilen for mænds højde er 179 cm betyder det at 75% af
mændene højst er 179 cm, og 25% er højere 179 cm.
0,25 fraktilen kaldes 1. kvartil, 25% af observationerne er mindre end 1.
kvartil.
0,5 fraktilen kaldes medianen eller 2. kvartil, 50% af observationerne er
mindre end medianen.
0,75 fraktilen kaldes 3. kvartil, 75% af observationerne er mindre end 3.
kvartil.
Klik her for at lære mere om kvartiler!.
Kilde: Egen tilvirkning.
Skævhed
SkævhedenSkævheden angiver om en fordeling er venstreskæv (hale mod venstre,
skævheden er negativ), symmetrisk (skævheden er ca. 0) eller højreskæv
(hale mod højre, skævheden er positiv)
Man vil ofte ud fra fordelingen i fx. et histogram eller et boksplot,
kunne vurdere skævheden
Klik her for at
lære
mere om skævhed! angiver hvor meget en fordeling afviger fra en symmetrisk fordeling. Hvis skævhedenSkævheden angiver om en fordeling er venstreskæv (hale mod venstre,
skævheden er negativ), symmetrisk (skævheden er ca. 0) eller højreskæv
(hale mod højre, skævheden er positiv)
Man vil ofte ud fra fordelingen i fx. et histogram eller et boksplot,
kunne vurdere skævheden
Klik her for at
lære
mere om skævhed! er positiv
(højreskæv ), vil fordelingen have koncentrerede værdier til venstre og mere spredte værdier til højre, en
hale mod højre. Er fordelingen venstreskæv vil skævhedenSkævheden angiver om en fordeling er venstreskæv (hale mod venstre,
skævheden er negativ), symmetrisk (skævheden er ca. 0) eller højreskæv
(hale mod højre, skævheden er positiv)
Man vil ofte ud fra fordelingen i fx. et histogram eller et boksplot,
kunne vurdere skævheden
Klik her for at
lære
mere om skævhed! være negativ, og fordelingen har hale mod
venstre. Hvis skævhedenSkævheden angiver om en fordeling er venstreskæv (hale mod venstre,
skævheden er negativ), symmetrisk (skævheden er ca. 0) eller højreskæv
(hale mod højre, skævheden er positiv)
Man vil ofte ud fra fordelingen i fx. et histogram eller et boksplot,
kunne vurdere skævheden
Klik her for at
lære
mere om skævhed! er 0 eller tæt på nul siger vi fordelingen er symmetrisk.
Formlen for skævhedSkævheden angiver om en fordeling er venstreskæv (hale mod venstre,
skævheden er negativ), symmetrisk (skævheden er ca. 0) eller højreskæv
(hale mod højre, skævheden er positiv)
Man vil ofte ud fra fordelingen i fx. et histogram eller et boksplot,
kunne vurdere skævheden
Klik her for at
lære
mere om skævhed! er lidt indviklet, men softwarepakker kan beregne denne, der findes et par forskellige
beregningsmetoder så man kan godt få forskellige resultater. I Excel bruges formlen =SKEW() eller på dansk
=SKÆVHEDSkævheden angiver om en fordeling er venstreskæv (hale mod venstre,
skævheden er negativ), symmetrisk (skævheden er ca. 0) eller højreskæv
(hale mod højre, skævheden er positiv)
Man vil ofte ud fra fordelingen i fx. et histogram eller et boksplot,
kunne vurdere skævheden
Klik her for at
lære
mere om skævhed!(). SkævhedenSkævheden angiver om en fordeling er venstreskæv (hale mod venstre,
skævheden er negativ), symmetrisk (skævheden er ca. 0) eller højreskæv
(hale mod højre, skævheden er positiv)
Man vil ofte ud fra fordelingen i fx. et histogram eller et boksplot,
kunne vurdere skævheden
Klik her for at
lære
mere om skævhed! for Tryg variablen kan beregnes til -0,31, det betyder fordelingen er en lille smule
venstreskæv, det er svært at se, men der er et par negative afkast, som gør at middelværdien er mindre end
medianenMedianen angiver den miderste observation af et ordnet observationssæt,
medianen kaldes også 0,5 fraktilen.
0,5 fraktilen kaldes medianen eller 2. kvartil, 50% af observationerne er
mindre end medianen, 50% er større.
Hvis fx. medianen for mænds højde er 177 cm betyder det at 50% af mændene
højst er 177 cm, og 50% er højere 177 cm.
Klik her for at lære mere om medianen!. Vi siger at medianenMedianen angiver den miderste observation af et ordnet observationssæt,
medianen kaldes også 0,5 fraktilen.
0,5 fraktilen kaldes medianen eller 2. kvartil, 50% af observationerne er
mindre end medianen, 50% er større.
Hvis fx. medianen for mænds højde er 177 cm betyder det at 50% af mændene
højst er 177 cm, og 50% er højere 177 cm.
Klik her for at lære mere om medianen! er mere stabil overfor outliers (ekstreme observationer) hvorimod
middelværdien påvirkes af outliers. Bemærk man får måske et resultat, der afviger en smule fra det her beregnede,
dette skyldes de forskellige metoder til beregning.
| Navn | SkævhedSkævheden angiver om en fordeling er venstreskæv (hale mod venstre,
skævheden er negativ), symmetrisk (skævheden er ca. 0) eller højreskæv
(hale mod højre, skævheden er positiv) Man vil ofte ud fra fordelingen i fx. et histogram eller et boksplot, kunne vurdere skævheden Klik her for at lære mere om skævhed! |
Typisk form | Indikator |
|---|---|---|---|
| Højreskæv | Større end 0 | Hale mod højre | Middelværdi større end Median |
| Venstreskæv | Mindre end 0 | Hale mod venstre | Median større end Middelværdi |
| Symmetrisk | 0 eller tæt på 0 | Samme haler mod højre og venstre | Median tæt på middelværdi |
Tabel 3.2: Sammenhængen mellem skævhedensSkævheden angiver om en fordeling er venstreskæv (hale mod venstre,
skævheden er negativ), symmetrisk (skævheden er ca. 0) eller højreskæv
(hale mod højre, skævheden er positiv)
Man vil ofte ud fra fordelingen i fx. et histogram eller et boksplot,
kunne vurdere skævheden
Klik her for at
lære
mere om skævhed! fortegn, fordelingens typiske form og forholdet mellem middelværdi og median.
Kilde: Egen tilvirkning.
Kilde: Egen tilvirkning.
Kurtosis
KurtosisKurtosis (topstejlhed) angiver om en fordeling er spids (leptokurtisk),
klokkeformet (mesokurtisk) eller flad (platykurtisk).
Normalfordelingen er klokkeformet (mesokurtisk), man kan beregne
kurtosis som et tal er fordelingen:
Spids (leptokurtisk) er kurtosis positiv
Klokkeformet (mesokurtisk) er kurtosis ca. 0
Flad (platykurtisk) er kurtosis negativ
Man vil ofte ud fra fordelingen i fx. et histogram kunne vurdere
topstejlheden.
Klik
her for at lære mere om kurtosis! eller topstejlhed beskriver hvor spids eller flad en fordeling er. Hvis kurtosisKurtosis (topstejlhed) angiver om en fordeling er spids (leptokurtisk),
klokkeformet (mesokurtisk) eller flad (platykurtisk).
Normalfordelingen er klokkeformet (mesokurtisk), man kan beregne
kurtosis som et tal er fordelingen:
Spids (leptokurtisk) er kurtosis positiv
Klokkeformet (mesokurtisk) er kurtosis ca. 0
Flad (platykurtisk) er kurtosis negativ
Man vil ofte ud fra fordelingen i fx. et histogram kunne vurdere
topstejlheden.
Klik
her for at lære mere om kurtosis! er positiv, er der meget
vægt helt inde ved midten og ud i halerne det giver en spids, slank bredfodet fordeling, der kaldes leptokurtisk.
Hvis kurtosisKurtosis (topstejlhed) angiver om en fordeling er spids (leptokurtisk),
klokkeformet (mesokurtisk) eller flad (platykurtisk).
Normalfordelingen er klokkeformet (mesokurtisk), man kan beregne
kurtosis som et tal er fordelingen:
Spids (leptokurtisk) er kurtosis positiv
Klokkeformet (mesokurtisk) er kurtosis ca. 0
Flad (platykurtisk) er kurtosis negativ
Man vil ofte ud fra fordelingen i fx. et histogram kunne vurdere
topstejlheden.
Klik
her for at lære mere om kurtosis! er negativ er der meget vægt mellem middelværdien og halerne, er kurven platykurtisk. Et typisk
leptokurtisk datasæt vil i et histogram typisk have få høje søjler i midten og en eller to lange flade haler. Et
platykurtisk datasæt vil typisk have mange næsten lige høje søjler, og kun enkelte lave søjler i siderne. Er
kurtosisKurtosis (topstejlhed) angiver om en fordeling er spids (leptokurtisk),
klokkeformet (mesokurtisk) eller flad (platykurtisk).
Normalfordelingen er klokkeformet (mesokurtisk), man kan beregne
kurtosis som et tal er fordelingen:
Spids (leptokurtisk) er kurtosis positiv
Klokkeformet (mesokurtisk) er kurtosis ca. 0
Flad (platykurtisk) er kurtosis negativ
Man vil ofte ud fra fordelingen i fx. et histogram kunne vurdere
topstejlheden.
Klik
her for at lære mere om kurtosis! tæt på nul, siger vi fordelingen er mesokurtisk eller klokkeformet, normalfordelingerNormalfordelingen er en symmetrisk, klokkeformet fordeling.
Mange fænomener er normalfordelte fx. nedbørsmængder, højde,
stikprøvefordelingen etc.
Normalfordelingen bestemmes entydigt ud fra middelværdien μ og
standardafvigelsen σ
Normalfordelte stokastiske variable har mange gode egenskaber, addition af
og multiplikation med en faktor giver igen normalfordelte stokastiske
variable.
Danskernes højde er fx. normalfordelt med middelværdi μ = 180,2 cm. og
standardafvigelse σ = 7,42
Klik her for at
lære mere om normalfordelingen! er mesokurtiske.
Der findes forskellige lidt indviklede beregningsformler for kurtosisKurtosis (topstejlhed) angiver om en fordeling er spids (leptokurtisk),
klokkeformet (mesokurtisk) eller flad (platykurtisk).
Normalfordelingen er klokkeformet (mesokurtisk), man kan beregne
kurtosis som et tal er fordelingen:
Spids (leptokurtisk) er kurtosis positiv
Klokkeformet (mesokurtisk) er kurtosis ca. 0
Flad (platykurtisk) er kurtosis negativ
Man vil ofte ud fra fordelingen i fx. et histogram kunne vurdere
topstejlheden.
Klik
her for at lære mere om kurtosis!, men softwarepakker rapporterer den. I Excel
bruges formlen =KURT() eller på dansk =TOPSTEJL(). KurtosisKurtosis (topstejlhed) angiver om en fordeling er spids (leptokurtisk),
klokkeformet (mesokurtisk) eller flad (platykurtisk).
Normalfordelingen er klokkeformet (mesokurtisk), man kan beregne
kurtosis som et tal er fordelingen:
Spids (leptokurtisk) er kurtosis positiv
Klokkeformet (mesokurtisk) er kurtosis ca. 0
Flad (platykurtisk) er kurtosis negativ
Man vil ofte ud fra fordelingen i fx. et histogram kunne vurdere
topstejlheden.
Klik
her for at lære mere om kurtosis! for Tryg variablen er 8,77 dvs. positiv, det betyder
fordelingen
er spids eller leptokurtisk, hvilket man måske kan fornemme, bemærk man får ikke nødvendigvis præcis samme værdi
når man beregner kurtosisKurtosis (topstejlhed) angiver om en fordeling er spids (leptokurtisk),
klokkeformet (mesokurtisk) eller flad (platykurtisk).
Normalfordelingen er klokkeformet (mesokurtisk), man kan beregne
kurtosis som et tal er fordelingen:
Spids (leptokurtisk) er kurtosis positiv
Klokkeformet (mesokurtisk) er kurtosis ca. 0
Flad (platykurtisk) er kurtosis negativ
Man vil ofte ud fra fordelingen i fx. et histogram kunne vurdere
topstejlheden.
Klik
her for at lære mere om kurtosis!, ligesom med fraktilerFraktiler er et tal mellem 0 og 1, der angiver andelen af et ordnet
observationssæt. Vi opdeler et datasæt ordnet fra mindst til størst efter
andelen angivet ved fraktilen.
Hvis fx. 0,45 fraktilen for mænds højde er 176 cm betyder det at 45% af
mændene højst er 176 cm, og 55% er højere 176 cm.
Kendte fraktiler er:
0,25 fraktilen kaldes også 1. kvartil, 25% af observationerne er mindre
end 1. kvartil.
0,5 fraktilen kaldes også medianen, 50% af observationerne er mindre end
medianen.
0,75 fraktilen kaldes også 3. kvartil, 75% af observationerne er mindre
end 3. kvartil.
0,1, 0,2, 0,3, 0,4... kaldes deciler
Klik her for at lære mere om fraktiler! findes der mange forskellige måder at beregne kurtosisKurtosis (topstejlhed) angiver om en fordeling er spids (leptokurtisk),
klokkeformet (mesokurtisk) eller flad (platykurtisk).
Normalfordelingen er klokkeformet (mesokurtisk), man kan beregne
kurtosis som et tal er fordelingen:
Spids (leptokurtisk) er kurtosis positiv
Klokkeformet (mesokurtisk) er kurtosis ca. 0
Flad (platykurtisk) er kurtosis negativ
Man vil ofte ud fra fordelingen i fx. et histogram kunne vurdere
topstejlheden.
Klik
her for at lære mere om kurtosis! på. Det er
ikke vigtigt hvilken metode der benyttes, tolkningen er vigtigere.
| Fordeling | KurtosisKurtosis (topstejlhed) angiver om en fordeling er spids (leptokurtisk),
klokkeformet (mesokurtisk) eller flad (platykurtisk). Normalfordelingen er klokkeformet (mesokurtisk), man kan beregne kurtosis som et tal er fordelingen: Spids (leptokurtisk) er kurtosis positiv Klokkeformet (mesokurtisk) er kurtosis ca. 0 Flad (platykurtisk) er kurtosis negativ Man vil ofte ud fra fordelingen i fx. et histogram kunne vurdere topstejlheden. Klik her for at lære mere om kurtosis! |
Typisk form |
|---|---|---|
| Platykurtisk | Mindre end nul | Flad |
| Leptokurtisk | Større end nul | Spids |
| Mesokurtisk | 0 eller tæt på 0 | Klokkeformet |
Tabel 3.3: Sammenhængen mellem kurtosisKurtosis (topstejlhed) angiver om en fordeling er spids (leptokurtisk),
klokkeformet (mesokurtisk) eller flad (platykurtisk).
Normalfordelingen er klokkeformet (mesokurtisk), man kan beregne
kurtosis som et tal er fordelingen:
Spids (leptokurtisk) er kurtosis positiv
Klokkeformet (mesokurtisk) er kurtosis ca. 0
Flad (platykurtisk) er kurtosis negativ
Man vil ofte ud fra fordelingen i fx. et histogram kunne vurdere
topstejlheden.
Klik
her for at lære mere om kurtosis!' fortegn, fordelingens navn (platykurtisk, leptokurtisk, mesokurtisk) og typisk form.
Kilde: Egen tilvirkning.
Kilde: Egen tilvirkning.
Netop skævhedSkævheden angiver om en fordeling er venstreskæv (hale mod venstre,
skævheden er negativ), symmetrisk (skævheden er ca. 0) eller højreskæv
(hale mod højre, skævheden er positiv)
Man vil ofte ud fra fordelingen i fx. et histogram eller et boksplot,
kunne vurdere skævheden
Klik her for at
lære
mere om skævhed! og kurtosisKurtosis (topstejlhed) angiver om en fordeling er spids (leptokurtisk),
klokkeformet (mesokurtisk) eller flad (platykurtisk).
Normalfordelingen er klokkeformet (mesokurtisk), man kan beregne
kurtosis som et tal er fordelingen:
Spids (leptokurtisk) er kurtosis positiv
Klokkeformet (mesokurtisk) er kurtosis ca. 0
Flad (platykurtisk) er kurtosis negativ
Man vil ofte ud fra fordelingen i fx. et histogram kunne vurdere
topstejlheden.
Klik
her for at lære mere om kurtosis! er de mål, risikostyringsmodeller i banker bruger til at opdage "fat tails" i
afkastfordelinger og kalibrere Value-at-Risk, og ML-modeller estimerer i stigende grad disse mål løbende på
store datamængder af markedsdata.
Quiz
Selvtest
Spørgsmål
1. Hvad bliver medianen for datasættet {2,5,2,5,3,4}?
2. Hvad bliver 25% fraktilen for datasættet {2,5,2,5,3,4}?
3. Hvad bliver 1. kvartil for datasættet {2,5,2,5,3,4}?
4. Hvad bliver 2. kvartil for datasættet {2,5,2,5,3,4}?
5. Hvad bliver 0,75 fraktilen for datasættet {2,5,2,5,3,4}?
6. Du er nystartet porteføljeforvalter i private banking afdelingen i en større bank, du forestår
forvaltningen af 10 kunders formuer. I antal tusinde kroner udgør
porteføljerne:
{344,421,293,459,228,391,375,377,318,428}
Du er fredag aften på Victor i dit Tiger suit. Under cocktails i baren falder du i snak med en velhavende
jysk
mand, Anders Holch Povlsen. Han er meget imponeret over dine prognoser og investeringsforslag. Mandag morgen
kontakter en af hans medarbejdere dig, Anders Holch Povlsen ønsker, du skal forvalte en formue på 2 mia. kr.
altså
2.000.000 tusinde kr. for ham. Hvorledes vil du bedst beskrive din typiske klient ved medianen eller
middelværdien?
1. Det ordnede datasæt bliver: {2,2,3,4,5,5}. Der er 2 midterste observationer 3 og 4, {2,2,3,4,5,5},
gennemsnittet af disse er 3,5 Medianen bliver altså 3,5
2. Det ordnede datasæt bliver: {2,2,3,4,5,5}. 25% fraktilen bliver 2
3. Det ordnede datasæt bliver: {2,2,3,4,5,5}. 1. kvartil bliver 2
4. Det ordnede datasæt bliver: {2,2,3,4,5,5}. 2. kvartil bliver 3,5
$$ \frac{3 + 4}{2} = 3{,}5 $$
5. Det ordnede datasæt bliver: {2,2,3,4,5,5}. 0,75 fraktilen bliver 5
6. Middelværdi og median for den gamle portefølje er henholdsvis 363 400 og 376 000. Middelværdi og median
for den ny portefølje er henholdsvis 182 148 545 og 377 000.
Den gennemsnitlige porteføljeværdi, er steget voldsomt efter den nye superklient, men den typiske klient
beskrives her bedst ved medianen. Dette skyldes medianen ikke påvirkes væsentligt af denne nye store kunde,
vi kan kalde denne observation for en outlier. Medianen er altså mere stabil overfor outliers i forhold til
middelværdien.
I linket her
er data vedr. verdens superrigeste. Formuen finalWorth mio. USD er opgjort i antal millioner USD, de
følgende spørgsmål relaterer sig udelukkende til denne variabel.
Bemærk datasættet er stort med flere end
2000 observationer, sørg for at hente seneste version af Freestat under Materialer.
1. Hvilken type variabel er variablen finalWorth mio. USD?
2. Hvad er den gennemsnitlige formue?
3. Hvad er medianen?
4. Hvad er fordelingens skævhed?
5. Hvad er 3. kvartil?
6. Hvad er Kvartilafstanden?
7. 10% af de rigeste velhavere har en formue der er større end?
8. 2,5% af de rigeste velhavere har en formue der er større end?
9. 90% af de fattigste velhavere har en formue der er mindre end?
10 Er fordelingen flad, klokkeformet eller spids?
11 Er fordelingen platykurtisk, mesokurtisk eller leptokurtisk?
12 Hvad er variationsbredden?
1. Variablen finalWorth mio. USD er en kvantitativ, kontinuert variabel, ratioskala.
2. Den gennemsnitlige formue er 4.762,35 mio USD dvs. 4,76 mia. USD
3. Medianen for variablen finalWorth mio. USD er 2.400 mio USD dvs. 2,4 mia. USD
4. Fordelingens skævhed er 9,95, fordelingen er som vi vel ville forvente klart højreskæv. Der er velhavere
med meget store formuer, dvs. outliers med høje værdier, vanvittigt rige mennesker, som fx Elon Musk, Bill
Gates, Warren Buffet etc. disse danner en hale mod højre.
5. 3. kvartil er 4.300 mio USD.
6. Kvartilafstanden er 2,8 mia. USD, størrelsen findes som 3. kvartil minus 1. kvartil. 50% af velhaverne
ligger i et spænd på 2,8 mia. USD
7. 10% af velhaverne har en formue der er større end 8,2 mia. USD, her skal vi bestemme 90% fraktilen,
denne fremgår direkte af Freestat.
8. 2,5% af velhaverne har en formue der er større end 22,8 mia. USD, her skal vi bestemme 97,5% fraktilen,
denne fremgår direkte af Freestat.
9. 90% af velhaverne har en formue der er mindre end 8,2 mia. USD, her skal vi bestemme 90% fraktilen,
denne fremgår direkte af Freestat, dette er samme svar som i spørgsmål 7.
10 Fordelingen er klart spids, da kurtosis er meget høj 136,43
11 Fordelingen er pr. definition leptokurtisk, da kurtosis er meget høj 136,43
12 Variationsbredden findes som den rigeste minus den fattigste milliardær, variationsbredden bliver altså
219-1 = 218 Mia. USD
Vi kan da også se af histogrammet nedenfor at fordelingen er meget højreskæv og spids:
Herunder ses det output man ville generere i Freestat.
I linket her er filen Forbes Superrige, filen indeholder data vedr. de rigeste mennesker i verden. Vi vil i
de næste spørgsmål se på fordelingen af variablen alder, pas på denne variabel er ikke komplet, sørg for at
fjerne observationer med manglende data (fx. vha. Excels filter). Der er personer, for hvem man ikke har
kunnet indhente oplysninger om alder.
1. Er datasættet bivariat?
2. Hvad er den gennemsnitlige alder for de rigeste?
3. Hvad er medianen for alder?
4. Hvad er aldersfordelingens skævhed?
5. Hvad er 3. kvartil for Age?
6. Hvad er Kvartilafstanden for Age?
7. 25% af velhaverne er ældre end?
8. 2,5% af de yngste velhavere er yngre end?
9. 0,5% er yngre end?
10. Er fordelingen flad, klokkeformet eller spids?
11. Er fordelingen platykurtisk, mesokurtisk eller leptokurtisk ?
12. Hvad er aldersspændet?
1. Nej datasættet er ikke bivariat men multivariat.
2. Den gennemsnitlige alder for de rigeste er 64,21 år.
3. Medianen for alder er 64 år.
4. Aldersfordelingens skævhed -0,03 fordelingen kan derfor betegnes som symmetrisk.
5. 3. kvartil for Age er 74 år.
6. Kvartilafstanden for Age er 19 år.
7. 25% af velhaverne er ældre end 74 år.
8. 2,5% af de yngste velhavere er yngre end 38 år.
9. 0,5% er yngre end 30 år.
10. Fordelingen er klokkeformet da kurtosis er -0,29 dvs. tæt på 0.
11. Er fordelingen mesokurtisk, jvf. spørgsmål 10.
12. Aldersspændet er 100 - 19 = 81 år.
Herunder ses det output man ville generere i Freestat.
I linket her er
filen Verdensøkonomien_2023.xlsx. Besvar følgende spørgsmål for variablen BNP/GDP. BNP
bruttonationalproduktet er værdien af de varer og ydelser som et land producerer.
1. Hvilken type variabel er variablen BNP USD?
2. Hvad er det gennemsnitlige BNP USD for landene?
3. Hvad er medianen for landene?
4. Hvad er fordelingens skævhed, er denne som du ville have forventet?
5. Hvad er 3. kvartil?
6. Hvad er Kvartilafstanden?
7. 25% af landene med størst produktion, har et BNP der er større end?
8. 2,5% af landene med mindst produktion, har et BNP der er mindre end?
9. 90% af landene med mindst produktion, har et BNP der er mindre end?
10 Er fordelingen flad, klokkeformet eller spids?
11 Er fordelingen platykurtisk, mesokurtisk eller leptokurtisk?
12 Hvad er variationsbredden?
Bemærk der er lande, hvor BNP ikke er oplyst, disse skal ikke medtages. Man kunne for overskuelighedens
skyld overveje at ændre
enhederne fra USD til fx. milliarder USD.
1. Variablen BNP USD er en kvantitativ, kontinuert variabel, ratioskala.
2. Hvad er det gennemsnitlige BNP USD for landene 556.730.449.505 USD eller 557 mia. USD.
3. Medianen for variablen BNP USD er kun 45.559.202.049 USD. altså 46 mia. USD
4. Fordelingens skævhed er 8,62, fordelingen er voldsomt højreskæv pga. outliers Kina og USA.
5. 3. kvartil er 290.923.534.701 USD. eller 291 mia. USD
6. Kvartilafstanden er 278.025.227.611 USD. eller 278 mia. USD
7. 25% af landene med størst produktion, har et BNP der er større end 290.923.534.701 USD. eller 290 mia.
USD
8. 2,5% af landene med mindst produktion, har et BNP der er mindre end 474.928.608 USD. eller 474 mio.
USD
9. 90% af landene med mindst produktion, har et BNP der er mindre end 940.038.548.669 USD. eller 940 mia.
USD
10 Fordelingen er klart spids, der er rigtig mange lande med et mindre BNP, mens vi har en gruppe lande med
forholdsmæssig høj produktion hvilket som ses af histogrammet giver en meget spids fordeling.
11 Er fordelingen derfor leptokurtisk da den er spids.
12 Variationsbredden er forskellen mellem landet med højeste USA og laveste produktion Tuvalu, dvs.
25.462.700.000.000-60.349.391=25.462.639.650.609 altså 25,5 billioner USD.
Herunder ses FREESTAT output
Herunder ses histogrammet for BNP for forskellige lande, vi kan af histogrammet se at fordelingen er
højreskæv og leptokurtisk (spids). Der er outliers fx USA og Kina med BNP langt over 5.000 mia. USD.
Histogrammet er lavet i Excel vha. pivot tabeller.
Copy
I linket her er filen VIRKSOMHEDER-DK, der viser data for 369 danske virksomheder med ekstern revision. Der
er således en overvægt af virksomheder af en vis størrelse, hvorfor samtlige beløb er angivet i antal 1000
DKK. Besvar følgende spørgsmål for variablen egenkapital i antal 1000 DKK.
1. Hvilken type variabel er variablen egenkapital?
2. Hvad er det gennemsnitlige egenkapital for virksomhederne?
3. Hvad er medianen for egenkapital?
4. Hvad er fordelingens skævhed, er denne som du ville have forventet?
5. Hvad er 3. kvartil?
6. Hvad er Kvartilafstanden?
7. 25% af de mest velpolstrede virksomheder, har en egenkapital der er større end?
8. 2,5% af de mindst velpolstrede virksomheder, har en egenkapital der er mindre end?
9. 90% af virksomhederne med mindst egenkapital, har en egenkapital der er mindre end?
10 Er fordelingen flad, klokkeformet eller spids?
11 Er fordelingen platykurtisk, mesokurtisk eller leptokurtisk ?
12 Hvad er variationsbredden?
1. Variablen egenkapital er en kvantitativ, kontinuert variabel, ratioskala.
2. Hvad er det gennemsnitlige egenkapital for virksomhederne 155327,97 1000 DKK.
3. Medianen for variablen egenkapital er 26054 1000 DKK.
4. Fordelingens skævhed er 12,28
5. 3. kvartil er 113453 1000 DKK.
6. Hvad er Kvartilafstanden 112169 1000 DKK.
7. 25% af de mest velpolstrede virksomheder, har en egenkapital der er større end 113453 1000 DKK.
8. 2,5% af de mindst velpolstrede virksomheder, har en egenkapital der er mindre end 117 1000 DKK.
9. 90% af virksomhederne med mindst egenkapital, har en egenkapital der er mindre end 229359 1000 DKK.
10 Fordelingen er klart spids med positiv kurtosis.
11 Fordelingen derfor leptokurtisk da den er spids.
12 Variationsbredden er forskellen mellem det virksomheden med højeste og laveste egenkapital, dvs.
10712042-37 =10712005 1000 DKK.
Herunder ses histogrammet for egenkapital for de danske virksomheder i antal 1000 DKK, vi kan af
histogrammet se at fordelingen er højreskæv og leptokurtisk. Der er klare outliers, dvs store etablerede
virksomheder med megen egenkapital.