Arktis eller Andes?

Hvor sikker tør du være?

🧭 Videnskaben bag quizzen

Hvordan fungerer det mærkelige pointsystem?

Quizzen tester ikke kun, om du kan gætte Peru eller Grønland. Den tester, om du ved, hvor sikker du bør være. Målet er at få dine sandsynlighedsbud til at passe med virkeligheden.

1. Den grundlæggende idé

Start her

For hvert billede har du 100%, som du skal fordele mellem Peru og Grønland. Du behøver ikke vælge det ene og lade som om du er sikker. Du kan sige 50/50, 60/40, 80/20 eller noget midt imellem.

Når du svarer, afsløres det rigtige land med det samme. Din score afhænger af den sandsynlighed, du gav det land, der viste sig at være rigtigt.

For usikker?
Hvis du virkelig mener, at svaret er 80% Peru, koster det nogle forventede point kun at give Peru 55%. Du lader noget informationsværdi ligge på bordet.
For sikker?
Hvis du mener, at Peru kun er 60% sandsynligt, men giver det 99%, får du en fantastisk belønning, når du tilfældigvis har ret — men en fantastisk straf, når du tager fejl.
Den centrale pointe: selvtillid er ikke det samme som at have ret. Pointsystemet belønner kalibreret selvtillid.

2. Grafen

Hele pointsystemet på én gang

Grafen stiller et hypotetisk spørgsmål: Antag, at dit valgte svar i situationer som denne faktisk ville være rigtigt q af gangene. Hvad sker der så med din gennemsnitlige score, hvis du angiver sandsynligheden p?

q = din faktiske chance for at have ret p = den sandsynlighed du angiver p = q = perfekt kalibrering
Konturplot over gennemsnitlig gevinst som funktion af faktisk chance for at have ret og angivet sandsynlighed
Gennemsnitlig forventet gevinst for et spørgsmål med to muligheder. Den stiplede diagonal er perfekt kalibrering; den tykke kurve viser, hvor den forventede gevinst er nul.
Annoteret graf over gennemsnitlig gevinst med forklaringer af overmod, underkonfidens og kalibrering
Den samme graf med de vigtigste pointer forklaret.
På diagonalen: Hvis du angiver 70%, så er situationer som denne faktisk rigtige omkring 70% af gangene. Det er ærlig sandsynlighedsrapportering.
Over eller under diagonalen: Du angiver systematisk sandsynligheder, som ikke passer med din faktiske succesrate. Jo længere væk du er, desto mere betaler du i forventet score.
Nær 100%: Lidt ekstra selvtillid giver kun en relativt lille ekstra gevinst, når du har ret, men kan gøre tabet enormt, når du tager fejl.
Ved 50/50: Hvis du virkelig intet ved, er din forventede score nul. Du påstår hverken at vide noget, du ikke ved, eller mister point på at lade være med at gætte.

3. Hvordan føles pointene i praksis?

To mulige lande

I et spørgsmål med to muligheder giver sandsynligheden p på et svar 100 × ln(2p) point, hvis det er rigtigt. Hvis det er forkert, er sandsynligheden på det rigtige svar 1 − p, så du får 100 × ln(2(1 − p)) point.

Din sandsynlighedHvis rigtigtHvis forkert
50%00
60%+18−22
70%+34−51
80%+47−92
90%+59−161
99%+68−391

Tallene er afrundet til hele point. Logaritmen er med vilje nådesløs tæt på 0% og 100%.

4. Hvorfor en logaritme?

For de matematisk nysgerrige

Her kommer den smarte del. Antag, at din ægte vurdering af, at et svar er rigtigt, er q, men at du angiver p. Din forventede score er

E(p) = 100 [ q ln(2p) + (1 − q) ln(2(1 − p)) ]

Vi kan så spørge: Hvilken værdi af p giver den højeste forventede score?

dE/dp = 100 [ q/p − (1 − q)/(1 − p) ]

Sæt dette lig med nul:

q/p = (1 − q)/(1 − p)

q(1 − p) = p(1 − q)

p = q

Og den anden afledte er

d²E/dp² = −100 [ q/p² + (1 − q)/(1 − p)² ] < 0

så dette er ikke bare et stationært punkt: det er det entydige maksimum. Med andre ord: Hvis du vil maksimere din forventede score, skal du angive din faktiske sandsynlighed.

🧠 Den ekstra-nørdede informationsteoretiske version

Tabet ved at angive p i stedet for din ægte vurdering q kan skrives som

E(q) − E(p) = 100 [ q ln(q/p) + (1 − q) ln((1 − q)/(1 − p)) ]

Udtrykket i firkanten er Kullback–Leibler-divergensen mellem to Bernoulli-fordelinger:

100 × DKL(Bern(q) ∥ Bern(p))

KL-divergensen er altid ikke-negativ og er kun nul, når p = q. Enhver afvigelse fra din ægte sandsynlighed har altså en målbar forventet omkostning.

Det er derfor, den logaritmiske score kaldes en proper scoring rule: den gør ærlig sandsynlighedsrapportering optimal. Det er ikke den eneste mulige proper scoring rule — Brier-score er en anden — men logaritmen har en særlig direkte forbindelse til information og gør ekstrem overmod meget dyrt.

5. Så hvordan spiller jeg godt?

Praktiske råd
  1. Adskil “hvilken er mest sandsynlig?” fra “hvor sandsynlig er den?”
    Du kan være ret sikker på, at Peru er mere sandsynligt end Grønland og stadig mene, at Peru kun er 65% sandsynligt.
  2. Brug din første fornemmelse, og spørg så hvor ofte den fornemmelse ville tage fejl.
    Det andet spørgsmål er ofte dér, den nyttige usikkerhed dukker op.
  3. Se på nedsiden.
    Hvis et 80%-gæt er forkert, giver det −92 point, mens det kun giver +47, når det er rigtigt. Det er ikke en fejl: Det forhindrer dig i bare at vælge det mest sandsynlige svar med 99% hver gang.
  4. 50/50 er ikke at fejle.
    Hvis billedet reelt ikke indeholder nyttig information, er 50/50 det matematisk fornuftige svar.
  5. Lær din egen kalibrering at kende.
    Statistik-siden viser, om dine forudsigelser på 60%, 70%, 80% og 90% faktisk går i opfyldelse omtrent så ofte.
En person, der får 16 ud af 20 billeder rigtigt, kan godt ende med en dårligere score end en person, der får færre rigtige, men er langt bedre kalibreret. Quizzen belønner kvaliteten af sandsynlighederne, ikke bare antallet af rigtige gæt.

6. Et par praktiske detaljer

For fuldstændighedens skyld

Hvordan vælges billederne?

Hvert forsøg får 10 tilfældige Peru-billeder og 10 tilfældige Grønlands-billeder, blandet sammen.

Kan jeg ændre et svar?

Du kan ændre sandsynlighederne, mens du arbejder på det aktuelle billede. Når du trykker Svar, låses og scores spørgsmålet.

Hvad sker der, hvis jeg giver op?

Dit fremskridt gemmes efter hvert svar. Et afbrudt 4/20-forsøg bliver stående i dataene som en delvis quiz.

Hvad viser den offentlige statistik?

Siden kan vise highscore for gennemførte quizzer, samlede quizstatistikker, kalibreringsstatistik og sværhedsgrad for hvert billede. IP-adresser vises ikke offentligt.