Aanmelden

📊Statistiek: basisbegrippen

Wiskunde (dubbele finaliteit), hoofdstuk 1: steekproef en populatie, steekproefontwerp en misleidende cijfers en grafieken. Met interactieve demo’s, opzoekwerk en quizzen.

Je bekijkt deze pagina niet aangemeld — je kan de oefeningen, het opzoekwerk en de zelftest-quiz pas openen na het aanmelden.
Aanmelden

Overzicht

Werk de onderdelen hieronder in je eigen tempo af: lees de uitleg, doe het opzoekwerk en sluit af met een quizje. Klik een onderdeel open om te starten.

Wat is statistiek, welke soorten variabelen bestaan er en waarom werk je meestal met een steekproef in plaats van met de hele populatie? Met een interactieve steekproef-trekker.

Elke steekproef vertelt een ander verhaal

Statistiek bestudeert een deel van een groep om iets te zeggen over het geheel. Maar dat deel, de steekproef, is nooit precies het geheel. Trek hieronder zelf een paar steekproeven uit dezelfde populatie en kijk wat er gebeurt.

1.1.1 Wat is statistiek?

Statistiek is de wetenschap die data verzamelt, verwerkt, analyseert en interpreteert om er informatie uit te halen. Die rol valt uiteen in drie vormen. Stel dat een onderzoeksbureau wil weten waarom jongeren een studentenjob doen:

Verzamelend

Via een online enquête worden enkele honderden jongeren tussen 16 en 23 jaar bevraagd over hun motivatie. Dit is de fase waarin je data ophaalt.

Beschrijvend

De antwoorden worden samengevat in overzichtelijke diagrammen en kengetallen. Dit is de fase waarin je de verzamelde data voorstelt en samenvat.

Verklarend

Een derde van de ondervraagden doet het voor het geld, dus vermoedelijk geldt dat voor ongeveer een derde van alle Vlaamse jongeren. Dit is de fase waarin je resultaten veralgemeent naar de volledige populatie.

De onderzoekscyclus in acht stappen

Een leerlingengroep onderzoekt de wifi op school. Ze doorlopen daarbij een vaste cyclus:

1
Probleemstelling
2
Onderzoeksvraag & hypothese
3
Onderzoek uitvoeren
4
Data verzamelen
5
Data analyseren
6
Conclusies trekken
7
Antwoord formuleren
8
Reflecteren & communiceren

Concreet: de leerlingen stellen een enquête op in Google Forms (stap 2-3), laten die invullen door medeleerlingen (stap 4), en Google Forms verwerkt de antwoorden meteen in tabellen en grafieken (stap 5). Op basis daarvan formuleren ze een besluit (stap 6-7) en publiceren ze hun bevindingen (stap 8).

Let op

Op basis van de conclusies kan een vervolgonderzoeksvraag ontstaan. De cyclus start dan gewoon opnieuw.

Kwantitatief of kwalitatief?

Een variabele is het kenmerk dat je onderzoekt bij een groep mensen of objecten. Het soort variabele bepaalt het soort data dat je verzamelt.

Kwantitatieve variabele → numerieke data

De massa van een 17-jarige, de leeftijd van een bewoner, het aantal keer dat iemand inlogt op wifi. Altijd getallen waarmee je kan rekenen.

Kwalitatieve variabele → categorische data

De burgerlijke staat van iemand, de tevredenheid over een dienst. Categorieën, geordend (zeer ontevreden → zeer tevreden) of niet (samenwonend, gehuwd, …).

Een dataset is simpelweg de verzameling van alle gegevens uit zo’n onderzoek, vaak voorgesteld met een tabel of grafiek.

1.1.2 Steekproef versus populatie

In de demo bovenaan was de populatie de volledige groep van 60 pasgeborenen. Elke keer dat je op de knop klikte, trok je een steekproef van 10 uit die populatie.

Populatie: omvang N

Het geheel. Alle mensen, dieren of voorwerpen waarover je informatie wil. N is in de praktijk meestal onbekend.

Steekproef: omvang n

Het deel dat je onderzoekt. Het deel van de populatie dat je écht bevraagt of meet, met als doel betrouwbare informatie over de hele populatie te verkrijgen.

Voorbeeld

Deense onderzoekers bestudeerden 176 Japanse honderdjarigen om te ontdekken wat hen zo lang liet leven. In 2022 telde Japan zelf 90.562 honderdjarigen: die allemaal onderzoeken was wegens kostprijs en tijdsgebrek onmogelijk. De 176 onderzochte personen vormen de steekproef, alle Japanse honderdjarigen de populatie.

Waarom niet gewoon de hele populatie onderzoeken?

Drie goede redenen om met een steekproef te werken in plaats van met de hele populatie:

Kosten & tijd

Onderzoek naar de mentale gezondheid van alle 11 miljoen Belgen zou een fortuin en jaren tijd kosten.

Ethiek

Een nieuw medicijn test je eerst veilig bij een kleine groep patiënten, niet meteen bij iedereen die ziek is.

Vernietiging

Om te weten bij welke luchtdruk een nieuw model skippybal ontploft, kun je niet elke bal opblazen tot hij knapt: dan blijft er niets meer over om te verkopen.

Steekproefvariabiliteit

Verschillende steekproeven, uit dezelfde populatie en op dezelfde manier samengesteld, leveren vaak verschillende resultaten op. Dat heb je bij de demo zelf ervaren. Onderzoekers van Kind en Gezin trokken tien steekproeven uit hun geboortedatabank en berekenden telkens het gemiddelde geboortegewicht (in gram):

3.327,5
3.291,0
3.178,5
3.112,5
3.453,0
3.208,0
3.314,0
3.383,0
3.305,0
2.878,0
Gemiddeld geboortegewicht (g) per steekproef. De schaal begint hier bij 2.800 g.

Tien steekproeven, tien verschillende gemiddeldes, van 2.878 g tot 3.453 g, hoewel ze allemaal uit exact dezelfde populatie komen. Dat is geen fout in het onderzoek; het is inherent aan het werken met een steekproef.

🎯 Nu ben jij aan de beurt: 1.1 Steekproef en populatie

Verwerk wat je hierboven las met de onderdelen hieronder. Ze horen bij deze theorie.

Hoe stel je een representatieve steekproef samen? De criteria, aselecte steekproeven en de valkuilen (opportunistische steekproef en vrijwillige respons) die het fout laten gaan.

Wie zit er in jouw steekproef?

Een steekproef die er scheef uitziet, geeft je ook een scheef antwoord. Hieronder zie je een populatie waarin 65% van de mensen tot groep A hoort en 35% tot groep B. Wissel tussen de drie methodes en zie hoe elke manier van steekproeftrekking een ander resultaat oplevert.

1.2.1 Een representatieve steekproef

Het samenstellen van een steekproef, het steekproefontwerp, is cruciaal: je wil op basis van de steekproef betrouwbare besluiten trekken voor de hele populatie. Dat kan alleen als de steekproef representatief is: een goede weerspiegeling van de populatie, maar op kleinere schaal.

Niet representatief?

Dan wijken de waarden in je steekproef systematisch af van de populatie, en kun je geen juiste conclusies trekken.

Voorbeeld: Tienerwoord van het Jaar

Sinds 2019 organiseert een nieuwskanaal voor jongeren een verkiezing voor het “Tienerwoord van het Jaar”. Iedereen die wil, kan online stemmen. De steekproef (alle stemmers) komt hier niet overeen met de beoogde populatie (alle Vlaamse tieners): ook volwassenen kunnen stemmen, enkel wie de oproep zag weet dat hij kan stemmen, en elke tiener beslist zelf of hij een stem uitbrengt. Dat is precies wat je in de demo ziet bij “vrijwillige respons”.

Drie criteria voor representativiteit
1
Voldoende groot

Twee kansarme leerlingen per school bevragen over slaagkansen is te weinig om representatief te zijn.

2
Juiste samenstelling

Bij 250 woonzorgcentra moet elk kenmerk (ligging, grootte, type) even vaak voorkomen als in heel Vlaanderen.

3
Beperkte non-respons

Van 90 uitgenodigde werknemers reageren er maar 9: een responspercentage van 10%, veel te laag.

De aselecte steekproef

Om representatief te zijn, wordt een steekproef vaak aselect samengesteld: op een volledig willekeurige manier, door randomisatie. Het onderzoeksteam mag zelf geen elementen kiezen: geen “gezond verstand”, geen eigen ervaring, gewoon toeval.

Enkelvoudig aselecte steekproef (EAS)

Elk element van de populatie krijgt exact dezelfde kans om geselecteerd te worden. Om bijvoorbeeld 5.000 Vlamingen te selecteren, geef je elke Vlaming een nummer en trek je via de computer willekeurig 5.000 nummers.

Tenzij anders vermeld, mag je aannemen dat een onderzoek van een professioneel peilingbureau met een EAS gebeurde.

1.2.2 Twee valkuilen die representativiteit ondermijnen: de opportunistische steekproef

De onderzoeker kiest elementen die gemakkelijk, snel of goedkoop te bereiken zijn. Moeilijker bereikbare elementen krijgen een kleinere kans, dus is er geen sprake van een aselecte steekproef.

Voorbeeld

Leerlingen bevragen enkel mensen die het lokale winkelcentrum verlaten over mentaal welzijn. Wie ergens anders winkelt of minder koopkrachtig is, krijgt geen kans om in de steekproef terecht te komen.

Ander voorbeeld

Om de massa van boekentassen te meten, kiest een directie willekeurig 1 leerling per klas. Klinkt aselect, maar klassen zijn niet allemaal even groot, dus komt de samenstelling van de steekproef niet overeen met die van de populatie.

Vrijwillige respons

Elementen uit de populatie kiezen zelf of ze meedoen. Vooral mensen met een uitgesproken, vaak extreme, mening nemen de moeite om te reageren.

Voorbeeld

Om te weten hoe inwoners staan tegenover een gemeentefusie, wordt een stemming georganiseerd. Enkel wie zich betrokken voelt, komt opdagen.

Ann Landers versus professioneel onderzoek

Een Amerikaanse rubriekschrijfster vroeg haar lezers ooit of ze, met de kennis van nu, opnieuw kinderen zouden willen. Ze kreeg bijna 10.000 (vrijwillige) reacties: 70% zei spijt te hebben. Een professioneel bureau stelde dezelfde vraag aan 1.373 mensen: slechts 9% had spijt. Het echte percentage ligt dichter bij 9%: Ann Landers kreeg vooral brieven van ouders met problemen, die zelf de moeite namen om te schrijven.

In de praktijk: hoe Imec het wél goed doet

Digimeter, de jaarlijkse peiling van Imec naar media- en ICT-gebruik in Vlaanderen, bevraagt elk jaar zo’n 2.972 Vlamingen van 16 jaar of ouder. Om representatief te zijn, hanteert Imec drie quota: geslacht, leeftijd en opleidingsniveau moeten in de steekproef even vaak voorkomen als in de bevolking. Voor de rekrutering werkt Imec samen met het Rijksregister, net om vrijwillige respons (en de vertekening die daarmee gepaard gaat) te vermijden.

Tussen 2018 en 2021 steeg het percentage Vlaamse gezinnen met minstens drie smart devices van 67% naar 80%. Reken zelf de relatieve stijging uit:

Omdat het om een steekproef gaat, weet je niet met zekerheid of de werkelijke stijging in de hele populatie ook precies dit percentage is: de echte waarde kan lichtjes hoger of lager liggen.

🎯 Nu ben jij aan de beurt: 1.2 Steekproefontwerp

Verwerk wat je hierboven las met de onderdelen hieronder. Ze horen bij deze theorie.

Misleidende grafieken en cijfers herkennen, en het verschil tussen samenhang en causaliteit, met de klassieke voorbeelden (windmolens, mozzarella-doctoraten en meer).

Cijfers liegen niet. Wij worden soms misleid.

Een steekproef, een grafiek, een percentage: overal kan een kleine keuze een groot verschil maken in wat je gelooft. Dit hoofdstuk overloopt de trucs, met dezelfde soort voorbeelden als in de les. Elk statistisch onderzoek doorloopt dezelfde cyclus: je verzamelt data, je verwerkt en stelt ze voor, en je trekt er conclusies uit. Op elk van die drie momenten kan iets misgaan, soms per ongeluk, soms met opzet. Wissel hieronder tussen twee versies van dezelfde grafiek:

1.3.1 Bij het verzamelen: nog voor er één grafiek getekend is

Een onderzoek kan al de mist ingaan lang voor iemand een diagram tekent. Drie klassiekers om op te letten.

Wie zit er precies in je steekproef?

In 2014 kopten verschillende nieuwssites: “Driekwart van de mensen heeft spijt van hun tatoeage.” Klinkt alarmerend, tot je het kleine lettertje leest. Het onderzoek bevroeg enkel mensen die al hadden toegegeven spijt te hebben van minstens één tatoeage. Van die specifieke groep had 78% spijt van maar één tatoeage.

De kop doet dus een uitspraak over iedereen die ooit een tatoeage liet zetten, terwijl het onderzoek alleen ging over mensen die al spijt hadden. Het echte percentage getatoeëerden met spijt ligt wellicht veel lager.

Extra teken aan de wand

Het onderzoek werd besteld door een bedrijf dat… tatoeages verwijdert. Dat bedrijf is gebaat bij een angstaanjagend cijfer.

De vraag bepaalt het antwoord

Stel dat de overheid overweegt om langere, zwaardere vrachtwagens toe te laten op de snelweg. Bekijk twee versies van exact dezelfde enquêtevraag:

Variant 1

“Er komen mogelijk langere en zwaardere vrachtwagens op de snelweg. Bent u voor of tegen?”

Variant 2

“Er komen mogelijk langere en zwaardere vrachtwagens op de snelweg, waardoor er minder voertuigen nodig zijn en de transportkosten dalen. Bent u voor of tegen?”

Bij variant 2 stemt een veel groter deel “voor”: niet omdat mensen plots anders denken, maar omdat de vraag zelf al een argument influistert. Wie een enquête opstelt, kan de uitkomst kleuren, bewust of niet.

Wie betaalt de rekening?

94% van 256 bevraagde vrouwen zou een nieuwe mascara aanraden: een mooi cijfer, tot je ziet dat het onderzoek besteld en betaald werd door de fabrikant zelf. Dat maakt het resultaat niet meteen fout, maar wel een reden voor extra scepsis. Vraag jezelf altijd af: wie had er baat bij dit resultaat?

1.3.1 Grafische voorstelling: een tekening zegt meer dan duizend cijfers

En dat is precies het probleem. Drie manieren waarop een grafiek je voor de gek kan houden.

De verdwenen as

Bekijk de demo bovenaan dit hoofdstuk nog eens. Als 0 een betekenisvolle waarde is voor je as, zoals hier het percentage stemmers, dan hoort die zichtbaar te zijn. Begin je de as pas bij 39%, dan lijkt een verschil van amper drie procentpunt plots dramatisch.

3D verkleint niet, het vervormt

Hetzelfde trucje werkt met cirkeldiagrammen: teken je ze in 3D, dan lijkt het stuk op de voorgrond groter dan een even groot stuk verderop, puur door het perspectief. Een gewoon plat (2D) cirkeldiagram heeft dat probleem niet.

Pictogrammen die liegen over oppervlakte

Een staafdiagram vervangen door leuke pictogrammen (denk aan een koeltoren per land voor energieproductie) oogt aantrekkelijker, maar is riskant. Je oog schat een tekening in op oppervlakte, niet op hoogte alleen.

Land A
2× de productie
Land B
“lijkt” 4× zo groot
Land B produceert maar 2× zoveel als Land A, maar omdat de tekening 2× zo hoog én 2× zo breed werd gemaakt, is de oppervlakte 4× zo groot. Je brein leest die oppervlakte, niet de hoogte alleen.
1.3.1 Numerieke voorstelling: gemiddelde versus mediaan

Los van hoe je iets tekent, kun je met de keuze van je kengetal een heel ander verhaal vertellen. Stel: een bedrijf heeft vier medewerkers die elk €1.000 per week verdienen, en één topverdiener. Verschuif hieronder het loon van die topverdiener en bekijk wat er gebeurt met het gemiddelde en de mediaan. Staat de schuifknop helemaal links, dan verdient iedereen evenveel: dan zijn gemiddelde en mediaan dus ook precies gelijk.

Merk je het? Het gemiddelde springt mee met de topverdiener, de mediaan (het middelste loon) blijft veel stabieler. Daarom gebruiken een directie en een vakbond in hetzelfde debat vaak elk hun eigen kengetal.

Procentpunt versus procent

Een tweede valstrik: het verschil tussen procent en procentpunt. Stijgt een rente van 2% naar 2,5%? Dat is een stijging van 0,5 procentpunt (het absolute verschil), maar van 25% (het relatieve verschil: 0,5 gedeeld door de oorspronkelijke 2%). Beide klinken heel anders, en beide zijn correct. Probeer het zelf:

1.3.2 Samenhang versus causaliteit

Samenhang is een statistisch verband tussen twee variabelen: verandert de ene, dan verandert de andere doorgaans mee. Causaliteit is sterker: de ene variabele veroorzaakt rechtstreeks een verandering in de andere. Elk causaal verband is dus ook samenhang, maar niet elke samenhang is causaal.

Voorbeeld

Tijdens de Amerikaanse presidentsverkiezingen van 2020 vielen de meeste coronadoden net in de regio’s die het sterkst op Trump stemden. Het verband is overduidelijk in de cijfers, maar niemand stemt zich letterlijk dood. Er is samenhang, geen causaliteit.

Er zijn drie klassieke manieren om deze denkfout te maken.

Denkfout 1: omgekeerde oorzakelijke richting

Kristof ergert zich: hij wil buiten badmintonnen, maar de windmolens verderop draaien als een gek. “Door die windmolens waait mijn shuttle steeds weg!” In werkelijkheid draaien de windmolens hard omdat het hard waait, niet omgekeerd. Oorzaak en gevolg zijn hier gewoon verwisseld.

Windmolens draaien hard≠→Het waait hard
Denkfout 2: toevallige samenhang

In de Verenigde Staten loopt de kaasconsumptie van mozzarella al jaren opvallend synchroon met het aantal uitgereikte ingenieursdoctoraten. Twee lijnen die toevallig gelijk op schommelen, zonder enige inhoudelijke connectie. Hoe meer variabelen je naast elkaar legt, hoe groter de kans dat je zo’n toevalstreffer vindt.

Mozzarella-verkoop⌇⌇Ingenieursdoctoraten
Denkfout 3: een verborgen derde variabele

Mensen die meer alcohol drinken, blijken ook een hoger risico op longkanker te hebben. Een sterk verband, tot je ontdekt dat wie meer drinkt, meestal ook meer rookt. Roken is de echte gemeenschappelijke oorzaak: de verborgen variabele achter allebei.

Alcohol←Roken→Longkanker
1.3.2 Kun je causaliteit wél bewijzen?

Wil je een samenhang naar causaliteit tillen, dan telt de opzet van je onderzoek.

Observationeel onderzoek: je meet en noteert, zonder zelf in te grijpen. Je kan een verband vaststellen, maar nooit met zekerheid zeggen dat het causaal is: er kan altijd een ongemeten factor meespelen.

Experimenteel onderzoek: jij bepaalt zelf wie welke behandeling krijgt, meestal door mensen willekeurig te verdelen in een experimentele groep en een controlegroep. Omdat toeval de enige overgebleven verklaring is voor verschillen tussen de groepen, kun je hier wél causaliteit aantonen.

ObservationeelExperimenteel
Wie grijpt in?Niemand: je observeert enkelDe onderzoeker verdeelt zelf de groepen
Causaliteit aantonen?Nee, andere factoren kunnen meespelenJa, mits willekeurige verdeling
VoorbeeldDe coach noteert welke opwarming elke atleet toevallig al deedDe coach verdeelt de atleten zelf, willekeurig, in twee groepen
Voorbeeld uitgewerkt

Een atletiekcoach vermoedt dat een bepaalde opwarming de looptijden verbetert. Noteert hij enkel welke opwarming elke atleet toch al deed, dan is dat observationeel: misschien liepen de snelste atleten toevallig ook al op een beter parcours. Verdeelt hij zijn atleten zelf willekeurig in twee gelijke groepen en laat hij iedereen op hetzelfde moment, hetzelfde parcours lopen, dan is dat experimenteel, en is het opwarmingstype de enige overgebleven verklaring voor een verschil in tijden.

🎯 Nu ben jij aan de beurt: 1.3 Misleidingen en valkuilen

Verwerk wat je hierboven las met de onderdelen hieronder. Ze horen bij deze theorie.