16. Sandsynligheder
16. Sandsynligheder

16. Sandsynligheder


Klik her for hente datasættet til videoen ovenfor

Vi vil her se på sandsynlighederSandsynlighedsregning handler om at beregne, hvor sandsynligt et udfald er — fx P(6) = 1/6 for en terning.
ChatGPT gør det samme, bare med alle ord i sproget som mulige udfald i stedet for terningesider.

Klik her for at lære mere i kapitel 16!
. Generelt beregner man sandsynlighederSandsynlighedsregning handler om at beregne, hvor sandsynligt et udfald er — fx P(6) = 1/6 for en terning.
ChatGPT gør det samme, bare med alle ord i sproget som mulige udfald i stedet for terningesider.

Klik her for at lære mere i kapitel 16!
ved at finde antal gunstige udfald divideret med antal mulige udfald.

Skal vi finde sandsynligheden for at slå en sekser med en terning, er gunstige udfald at slå en sekser, mens mulige udfald er at slå fra 1 til 6.
Vi kan skrive dette som:

$$ P(En\ sekser) = {Antal\ gunstige \over Antal\ mulige} = {1 \over 6} \approx 0,1667 \approx 16,67\% $$

Man har spurgt 800 respondenter, om de dagligt drikker kun the, kun kaffe eller både the og kaffe, og har fået følgende svar:

Kun Kaffe Kun The The og Kaffe Ialt
400 200 200 800

Tabel 16.1: Fordeling af 800 respondenters svar på, om de dagligt drikker kun kaffe, kun the, eller begge dele.
Kilde: Egen tilvirkning.

Vi kan opstille resultaterne i et Venn-diagram som vist på figuren herunder. Vi kan udføre et stokastisk eksperiment og tilfældigt udtage en person og undersøge, hvor stor sandsynligheden er for at vedkommende drikker kaffe.

Figur 16.1: Venn-diagram over 800 respondenters kaffe- og thedrikning — 400 drikker kun kaffe, 200 kun the, og 200 begge dele.
Kilde: Egen tilvirkning.

Vi skriver P for probability dvs. sandsynlighed. Sandsynligheden for at en person drikker kaffe kan opskrives som:

$$ P(Kaffe) = {Antal\ kaffedrikkere \over Antal\ adspurgte} = {600 \over 800} = 0,75=75\% $$

Forenings- og fælleshændelser

Sandsynligheden for at en person drikker the eller kaffe, er en foreningshændelse (vi bruger symbolet ∪ ), det skriver vi som: $$ P(The \cup Kaffe) = {Antal\ The\ eller\ kaffedrikkere \over Antal\ adspurgte} = {800 \over 800} = 1 $$ Sandsynligheden for at en person drikker the og kaffe, er en fælleshændelse (vi bruger symbolet ∩), det skriver vi som: $$ P(The \cap Kaffe) = {Antal\ The\ og\ kaffedrikkere \over Antal\ adspurgte} = {200 \over 800} = 0,25 $$ Har man svært ved at huske betydningen af de 2 symboler, så tænk på at foreningshændelsen ∪ (det ligner jo en kop), kan rumme mere end fælleshændelsen ∩ (der er ikke meget plads på toppen).

Betingede sandsynligheder

Vi kan også se på en mindre gruppe af de adspurgte, hvis fx. man kun vil se på kaffedrikkerne kunne man ønske at undersøge, hvor stor en andel af kaffedrikkerne der både drikker the og kaffe. Vi siger at vi betinger med en hændelse, hvis vi ser på en sådan delmængde af de adspurgte. Betingede sandsynlighederSandsynlighedsregning handler om at beregne, hvor sandsynligt et udfald er — fx P(6) = 1/6 for en terning.
ChatGPT gør det samme, bare med alle ord i sproget som mulige udfald i stedet for terningesider.

Klik her for at lære mere i kapitel 16!
kan formuleres på flere måder fx:

  • Givet at man drikker kaffe, hvad er da sandsynligheden for at man ligeledes drikker the?
  • Hvis man drikker kaffe, hvad er da sandsynligheden for at man ligeledes drikker the?
  • Hvad er sandsynligheden for at man drikker the, når man drikker kaffe?
  • Hvad er andelen af kaffedrikkere, der drikker the?

  • Vi siger, at vi betinger med hændelsen A, man drikker kaffe, og ser således kun på gruppen af kaffedrikkere. Hvad er så sandsynligheden for at man også drikker the hændelsen B? Vi skal altså bestemme sandsynligheden for B givet A, med symboler skriver vi det som:

    \(P(B|A)\) Vi kan udregne dette som: $$ P(B|A) = \frac{P(B \cap A)}{P(A)} $$ Det betyder, at vi kan udregne andelen af kaffedrikkere, der drikker the, ved formlen: $$ P(B|A) = \frac{P(kaffe\ og\ the|kaffe)}{P(kaffe)} = \frac{200/800}{600/800} = \frac{1}{3} \approx 33\% $$

    Betingede sandsynlighederSandsynlighedsregning handler om at beregne, hvor sandsynligt et udfald er — fx P(6) = 1/6 for en terning.
    ChatGPT gør det samme, bare med alle ord i sproget som mulige udfald i stedet for terningesider.

    Klik her for at lære mere i kapitel 16!
    og uafhængighedAfhængighed betyder sammenhæng og bruges i forbindelse med Chi i anden tests.
    Hvis der er afhængighed mellem 2 kvalitative fx køn og mobiltelefonmærke, betyder det, at der er sammenhæng mellem køn og mobiltelefonmærke.
    Mænd og kvinder benytter altså forskellige mobiltelefonmærker. Er der uafhængighed mellem køn og mobiltelefonmærke, betyder det altså, at der ikke er forskel på hvilket mobiltelefonmærke mænd og kvinder foretrækker.

    Klik her for at lære mere om afhængighed!
    er kernen i mange kreditrisikomodeller, fx P(misligholdelse | kundetræk), og moderne ML-baserede kreditmodeller er i bund og grund avancerede udregninger af netop denne slags betingede sandsynlighederSandsynlighedsregning handler om at beregne, hvor sandsynligt et udfald er — fx P(6) = 1/6 for en terning.
    ChatGPT gør det samme, bare med alle ord i sproget som mulige udfald i stedet for terningesider.

    Klik her for at lære mere i kapitel 16!
    .

    Race og dødsdom eksempel

    Race tiltalt Dødsdom Ikke dødsdom Total
    Hvid 53 430 483
    Afrikansk amerikaner 15 176 191
    Total 68 606 674

    Tabel 16.2: Antal dødsdomme og ikke-dødsdomme blandt 674 tiltalte fordelt på den tiltaltes race.
    Kilde: Egen tilvirkning.

    Sandsynligheden for at blive dødsdømt, når man er tiltalt kan udregnes til:

    $$ P(dødsdom) = \frac{dødsdømte}{alle\ tiltalte} = \frac{68}{674} = 0,1009 $$

    Sandsynligheden for at blive dødsdømt, når man er hvid og tiltalt er en betinget sandsynlighed, denne kan udregnes til:

    $$ P(dødsdom|hvid) = \frac{P(dødsdom \cap hvid)}{P(hvide\ tiltalte)} = \frac{53}{483} = 0,1097 $$

    Sandsynligheden for at blive dødsdømt, hvis man er afrikansk-amerikaner og tiltalt er en betinget sandsynlighed, denne kan udregnes til:

    $$ P(dødsdom|sort) = \frac{P(dødsdom \cap sort)}{P(sorte\ tiltalte)} = \frac{15}{191} = 0,0785 $$

    Dette tyder ikke på at der er racemæssig forskel på andelen af dødsdømte.

    Uafhængighed

    Vi kan sige at 2 hændelser A og B er uafhængige, hvis sandsynligheden for at den ene hændelse indtræffer ikke påvirkes af om den anden hændelse indtræffer eller ej.

    Sandsynligheden for at slå krone med en mønt og slå en sekser med en terning, er 2 hændelser der er uafhængige.

    Trækker man et es fra et spil kort, vil sandsynligheden for igen at trække et es være påvirket af det første træk, nu vil sandsynligheden for at trække es være mindre. Disse hændelser er ikke uafhængige.

    Vi kan udtrykke uafhængige hændelser vha. betingede sandsynlighederSandsynlighedsregning handler om at beregne, hvor sandsynligt et udfald er — fx P(6) = 1/6 for en terning.
    ChatGPT gør det samme, bare med alle ord i sproget som mulige udfald i stedet for terningesider.

    Klik her for at lære mere i kapitel 16!
    .

    $$ P(A|B) = P(A) $$

    Her står sandsynligheden for A er den samme ligegyldigt om hændelsen B indtræffer eller ej.

    $$ P(B|A) = P(B) $$

    Her står sandsynligheden for B er den samme ligegyldigt om hændelsen A indtræffer eller ej.

    Vi kan omskrive begge ligninger til nedenstående resultat.

    $$ P(A|B) = P(A) \Leftrightarrow \frac{P(A \cap B)}{P(B)} = P(A) \Leftrightarrow P(A \cap B) = P(A) \cdot P(B) $$

    Så hændelserne A og B er uafhængige hvis sandsynligheden for fælleshændelsen \(P(A \cap B)\) er lig med produktet af sandsynlighederneSandsynlighedsregning handler om at beregne, hvor sandsynligt et udfald er — fx P(6) = 1/6 for en terning.
    ChatGPT gør det samme, bare med alle ord i sproget som mulige udfald i stedet for terningesider.

    Klik her for at lære mere i kapitel 16!
    for hændelserne \(P(A) \cdot P(B)\)
    Vi nævnte at sandsynligheden for at slå krone med en mønt og slå en sekser med en terning, er 2 hændelser der er uafhængige. Sandsynligheden for fælleshændelsen krone og sekser kan skrives som:
    $$ P(A \cap B) = P(krone \cap sekser) = \frac{1}{12} $$
    Dette er det samme som produktet af sandsynlighederne for hændelserne: $$ P(A) \cdot P(B) = P(krone) \cdot P(sekser) = \frac{1}{2} \cdot \frac{1}{6} = \frac{1}{12} $$ Er hændelserne drikke kaffe og the uafhængige? Vi finder sandsynligheden for fælleshændelsen: $$ P(Kaffe \cap The) = \frac{200}{800} = 0,25 $$ Er sandsynligheden for fælleshændelsen lig med produktet af sandsynlighederne? $$ P(Kaffe) \cdot P(The) = \frac{600}{800} \cdot \frac{400}{800} = \frac{3}{4} \cdot \frac{1}{2} = \frac{3}{8} = 0,375 $$ Hændelserne er altså ikke umiddelbart uafhængige, da 0,25 ikke er lig med 0,375.
    Vi ser på om hændelserne hvid tiltalt og dødsdom er afhængige. Vi finder sandsynligheden for fælleshændelsen: $$ P(Dødsdom \cap Hvid) = \frac{53}{674} = 0,08 $$ Er sandsynligheden for fælleshændelsen lig med produktet af sandsynlighederne? $$ P(Dødsdom) \cdot P(Hvid) = \frac{68}{674} \cdot \frac{483}{674} = 0,10 \cdot 0,72 = 0,072 $$ Sandsynlighederne 0,08 og 0,072 er tæt på hinanden, udtaler vi os om en population ville vi nok ikke kunne afvise at hændelserne er uafhængige. Vi vil i afsnittet om Chi i anden Chi i anden tests (skrives også som Χ2-tests) kan bruges til at teste om der er sammenhæng mellem 2 kvalitative variable fx. køn og mobiltelefonmærke.
    Chi i anden testet er en udvidelse af test af 2 andele, hvor vi kun kan teste 2 kvalitative binære variable (kun 2 udfald fx. mand/kvinde, Iphone/ikke Iphone).
    I Chi i anden testet er nulhypotesen at de 2 variable er uafhængige (ingen sammenhæng), hvis vi forkaster nulhypotesen er der afhængighed (sammenhæng). Hvis der er en sammenhæng, skal denne sammenhæng beskrives ud fra observerede og forventede celleværdier (hvor der er store Chi celle bidrag), det kan fx. være vi finder at kvinder oftere har Iphone.
    Vi tester ved hjælp af Χ2-fordelingen, der er en højreskæv fordeling, bestemt af antallet af frihedsgrader. Hypoteserne kunne generisk skrives som:

    H0: Der er uafhængighed mellem de 2 kvalitative variable
    H1: Der er afhængighed mellem de 2 kvalitative variable

    Klik her for at lære mere om Χ2-tests!

    tests se på hvorledes man tester uafhængighed.

    Quiz

    Quiz sandsynligheder

    Spørgsmål

    Vi inddeler nu skemaet ovenfor, med en variabel, der angiver offerets race.
    Race offer Race tiltalt Dødsdom Ikke dødsdom Total
    Hvid Hvid 53 414 467
    Hvid Afrikansk amerikaner 11 37 48
    Afrikansk amerikaner Hvid 0 16 16
    Afrikansk amerikaner Afrikansk amerikaner 4 139 143
    Total 68 606 674

    Tabel 16.3: Dødsdomme fordelt på både ofrets og den tiltaltes race — datagrundlaget for opgaven om dødsdom og Simpsons paradoks.
    Kilde: Egen tilvirkning.

    1. Hvad er sandsynligheden for at blive dødsdømt, hvis man er hvid tiltalt for at have dræbt en hvid?

    2. Hvad er sandsynligheden for at blive dødsdømt, givet man er sort tiltalt for at have dræbt en hvid?

    3. Hvad er sandsynligheden for at blive dødsdømt, givet man er hvid tiltalt for at have dræbt en sort?

    4. Hvad er sandsynligheden for at blive dødsdømt, når man er sort tiltalt for at have dræbt en sort?

    5. Hvad er sandsynligheden for at blive dødsdømt og ikke blive dødsdømt, når man er hvid?

    6. Hvad er sandsynligheden for at blive dødsdømt eller ikke blive dødsdømt, når man er hvid?

    1. Sandsynligheden for at blive dødsdømt, hvis man er hvid tiltalt for at have dræbt en hvid kan udregnes til: $$ P(Dødsdømt|hvid\ tiltalt\ og\ hvidt\ offer) = \frac{53}{467} = 0,1135 $$ 2. Sandsynligheden for at blive dødsdømt, givet man er sort tiltalt for at have dræbt en hvid kan udregnes til: $$ P(Dødsdømt|sort\ tiltalt\ og\ hvidt\ offer) = \frac{11}{48} = 0,2292 $$ 3. Sandsynligheden for at blive dødsdømt, givet man er hvid tiltalt for at have dræbt en sort kan udregnes til: $$ P(Dødsdømt|hvid\ tiltalt\ og\ sort\ offer) = \frac{0}{16} = 0 $$ 4. Sandsynligheden for at blive dødsdømt, når man er sort tiltalt for at have dræbt en sort kan udregnes til: $$ P(Dødsdømt|sort\ tiltalt\ og\ sort\ offer) = \frac{4}{143} = 0,0280 $$ Vi ser nu at der synes at være større sandsynlighed for dødsdom for sorte end for hvide, denne effekt kommer først frem når vi kontrollerer for offer race. Man kalder dette for Simpsons paradoks.
    5. Sandsynligheden for at blive dødsdømt og ikke blive dødsdømt når man er hvid, er 0, der er ingen hvide der både bliver dødsdømte og ikke dødsdømte. Fællesmængden mellem de 2 hændelser er tom.
    6. Sandsynligheden for at blive dødsdømt eller ikke blive dødsdømt når man er hvid er 1, alle hvide tiltalte bliver enten dødsdømte eller ikke dødsdømte. Foreningsmængden for de 2 hændelser er alle de mulige udfald. Man kan kun blive dødsdømt eller ikke dødsdømt.
    Herunder er angivet tro og utro personer fordelt på højest gennemførte uddannelsesniveau. Data stammer fra en kendt amerikansk undersøgelse om utroskab fra 1969. Man har interviewet 601 respondenter om religiøsitet, antal affærer uddannelsesniveau etc.

    Uddannelseniveauet er stigende, hvor Grundskole er lavest og Phd højest. KVU betyder kortere videregående uddannelse.

    Basis Gymnasie KVU1 KVU2 KVU3 Master Phd. Total
    Antal utro 5 31 119 95 62 79 60 451
    Antal tro 2 13 35 20 27 33 20 150
    Total 7 44 154 115 89 112 80 601

    Tabel 16.4: Antal utro og tro respondenter fordelt på højeste gennemførte uddannelsesniveau.
    Kilde: Amerikansk undersøgelse om utroskab og uddannelsesniveau fra 1969 (601 respondenter), som beskrevet i teksten ovenfor.



    1. Hvad er sandsynligheden for at man er utro?

    2. Hvad er sandsynligheden for man er tro?

    3. Hvad er sandsynligheden for at man er utro eller tro?

    4. Hvad er sandsynligheden for at man er utro og tro?

    5. Hvad er sandsynligheden for at man er utro, givet man har en Phd?

    6. Hvad er sandsynligheden for at man har en Phd?

    7. Hvad er sandsynligheden for at man har en Phd eller Kandidatgrad og er tro?

    8. Hvad er sandsynligheden for at man har en Phd, når man er tro?

    9. Hvad er sandsynligheden for at man har en Phd eller Kandidatgrad, når man er tro?

    10. Hvad er sandsynligheden for at man har en Phd og Kandidatgrad, givet man er tro?

    11. Når man er utro, hvad er da sandsynligheden for, at man har en Kandidatgrad?

    12. Når man er tro, hvad er da sandsynligheden for, at man har en Phd?



    1. Hvad er sandsynligheden for at man er utro?
    Der er 451 utro ud af 601 respondenter 451/601 = 75,04%

    2. Hvad er sandsynligheden for man er tro?
    Der er 150 tro ud af 601 respondenter 150/601 = 24,96%

    3. Hvad er sandsynligheden for at man er utro eller tro?
    Der er 601 utro eller tro ud af 601 respondenter 601/601 = 100%

    4. Hvad er sandsynligheden for at man er utro og tro?
    Der er 0 utro og tro ud af 601 respondenter 0/601 = 0%

    5. Hvad er sandsynligheden for at man er utro, givet man har en Phd?
    Vi ser kun på respondenter med en Phd, der er 60 utro ud af 80 Phd'ere 60/80 = 75%

    6. Hvad er sandsynligheden for at man har en Phd?
    Der er 80 ud af 601 respondenter med en Phd, 80/601 = 13,31%

    7. Hvad er sandsynligheden for at man har en Phd eller Kandidatgrad og er tro?
    Vi ser på tro Phd'ere og kandidater der er 33 + 20 = 53, vi betinger ikke med noget så det er ud af alle respondenter. 53/601 = 8,82%

    8. Hvad er sandsynligheden for at man har en Phd, når man er tro?
    Vi betinger med tro, så vi ser kun på de 150 tro, ud af dem er 20 Phd'ere. 20/150 = 13,33%

    9. Hvad er sandsynligheden for at man har en Phd eller Kandidatgrad, når man er tro?
    Vi betinger med tro, så vi ser kun på de 150 tro, ud af dem er 53 Phd'ere eller kandidater. 53/150 = 35,33%

    10. Hvad er sandsynligheden for at man har en Phd og Kandidatgrad, givet man er tro?
    Uddannelsesniveau er en gensidigt udelukkende kategori, så ingen kan have to forskellige højeste uddannelsesniveauer samtidig. Sandsynligheden for at have både en Phd og en Kandidatgrad er derfor 0%.

    11. Når man er utro, hvad er da sandsynligheden for, at man har en Kandidatgrad?
    Vi betinger med utro, så vi ser kun på de 451 utro, ud af dem er 79 kandidater. 79/451 = 17,52%

    12. Når man er tro, hvad er da sandsynligheden for, at man har en Phd?
    Dette er samme spørgsmål som spørgsmål 8. Vi betinger med tro, så vi ser kun på de 150 tro, ud af dem er 20 Phd'ere. 20/150 = 13,33%

    Du har nu adgang

    Alle kapitler er åbne.