📊Statistiek: basisbegrippen
Wiskunde (dubbele finaliteit), hoofdstuk 1: steekproef en populatie, steekproefontwerp en misleidende cijfers en grafieken. Met interactieve demo’s, opzoekwerk en quizzen.
Overzicht
Werk de onderdelen hieronder in je eigen tempo af: lees de uitleg, doe het opzoekwerk en sluit af met een quizje. Klik een onderdeel open om te starten.
Wat is statistiek, welke soorten variabelen bestaan er en waarom werk je meestal met een steekproef in plaats van met de hele populatie? Met een interactieve steekproef-trekker.
Elke steekproef vertelt een ander verhaal
Statistiek bestudeert een deel van een groep om iets te zeggen over het geheel. Maar dat deel, de steekproef, is nooit precies het geheel. Trek hieronder zelf een paar steekproeven uit dezelfde populatie en kijk wat er gebeurt.
1.1.1 Wat is statistiek?
Statistiek is de wetenschap die data verzamelt, verwerkt, analyseert en interpreteert om er informatie uit te halen. Die rol valt uiteen in drie vormen. Stel dat een onderzoeksbureau wil weten waarom jongeren een studentenjob doen:
Verzamelend
Via een online enquête worden enkele honderden jongeren tussen 16 en 23 jaar bevraagd over hun motivatie. Dit is de fase waarin je data ophaalt.
Beschrijvend
De antwoorden worden samengevat in overzichtelijke diagrammen en kengetallen. Dit is de fase waarin je de verzamelde data voorstelt en samenvat.
Verklarend
Een derde van de ondervraagden doet het voor het geld, dus vermoedelijk geldt dat voor ongeveer een derde van alle Vlaamse jongeren. Dit is de fase waarin je resultaten veralgemeent naar de volledige populatie.
De onderzoekscyclus in acht stappen
Een leerlingengroep onderzoekt de wifi op school. Ze doorlopen daarbij een vaste cyclus:
Probleemstelling
Onderzoeksvraag & hypothese
Onderzoek uitvoeren
Data verzamelen
Data analyseren
Conclusies trekken
Antwoord formuleren
Reflecteren & communiceren
Concreet: de leerlingen stellen een enquête op in Google Forms (stap 2-3), laten die invullen door medeleerlingen (stap 4), en Google Forms verwerkt de antwoorden meteen in tabellen en grafieken (stap 5). Op basis daarvan formuleren ze een besluit (stap 6-7) en publiceren ze hun bevindingen (stap 8).
Op basis van de conclusies kan een vervolgonderzoeksvraag ontstaan. De cyclus start dan gewoon opnieuw.
Kwantitatief of kwalitatief?
Een variabele is het kenmerk dat je onderzoekt bij een groep mensen of objecten. Het soort variabele bepaalt het soort data dat je verzamelt.
Kwantitatieve variabele → numerieke data
De massa van een 17-jarige, de leeftijd van een bewoner, het aantal keer dat iemand inlogt op wifi. Altijd getallen waarmee je kan rekenen.
Kwalitatieve variabele → categorische data
De burgerlijke staat van iemand, de tevredenheid over een dienst. Categorieën, geordend (zeer ontevreden → zeer tevreden) of niet (samenwonend, gehuwd, …).
Een dataset is simpelweg de verzameling van alle gegevens uit zo’n onderzoek, vaak voorgesteld met een tabel of grafiek.
1.1.2 Steekproef versus populatie
In de demo bovenaan was de populatie de volledige groep van 60 pasgeborenen. Elke keer dat je op de knop klikte, trok je een steekproef van 10 uit die populatie.
Populatie: omvang N
Het geheel. Alle mensen, dieren of voorwerpen waarover je informatie wil. N is in de praktijk meestal onbekend.
Steekproef: omvang n
Het deel dat je onderzoekt. Het deel van de populatie dat je écht bevraagt of meet, met als doel betrouwbare informatie over de hele populatie te verkrijgen.
Deense onderzoekers bestudeerden 176 Japanse honderdjarigen om te ontdekken wat hen zo lang liet leven. In 2022 telde Japan zelf 90.562 honderdjarigen: die allemaal onderzoeken was wegens kostprijs en tijdsgebrek onmogelijk. De 176 onderzochte personen vormen de steekproef, alle Japanse honderdjarigen de populatie.
Waarom niet gewoon de hele populatie onderzoeken?
Drie goede redenen om met een steekproef te werken in plaats van met de hele populatie:
Kosten & tijd
Onderzoek naar de mentale gezondheid van alle 11 miljoen Belgen zou een fortuin en jaren tijd kosten.
Ethiek
Een nieuw medicijn test je eerst veilig bij een kleine groep patiënten, niet meteen bij iedereen die ziek is.
Vernietiging
Om te weten bij welke luchtdruk een nieuw model skippybal ontploft, kun je niet elke bal opblazen tot hij knapt: dan blijft er niets meer over om te verkopen.
Steekproefvariabiliteit
Verschillende steekproeven, uit dezelfde populatie en op dezelfde manier samengesteld, leveren vaak verschillende resultaten op. Dat heb je bij de demo zelf ervaren. Onderzoekers van Kind en Gezin trokken tien steekproeven uit hun geboortedatabank en berekenden telkens het gemiddelde geboortegewicht (in gram):
Tien steekproeven, tien verschillende gemiddeldes, van 2.878 g tot 3.453 g, hoewel ze allemaal uit exact dezelfde populatie komen. Dat is geen fout in het onderzoek; het is inherent aan het werken met een steekproef.
Verwerk wat je hierboven las met de onderdelen hieronder. Ze horen bij deze theorie.
🔍 Opzoekwerk — 1.1 Steekproef en populatie
Zoek het antwoord zelf op (internet, cursus, ...) en typ het hieronder. Wordt automatisch bewaard.
Tip: zoek naar "uit onderzoek blijkt" op een nieuwssite en lees het kleine lettertje.
✓ opgeslagenDenk aan: leeftijd, reistijd, tevredenheid, favoriete vak, aantal uren gamen, …
✓ opgeslagen✅ Testjezelf-quiz — 1.1 Steekproef en populatie
Beantwoord alle vragen en klik daarna op "Controleer". Je mag zo vaak opnieuw proberen als je wil.
Hoe stel je een representatieve steekproef samen? De criteria, aselecte steekproeven en de valkuilen (opportunistische steekproef en vrijwillige respons) die het fout laten gaan.
Wie zit er in jouw steekproef?
Een steekproef die er scheef uitziet, geeft je ook een scheef antwoord. Hieronder zie je een populatie waarin 65% van de mensen tot groep A hoort en 35% tot groep B. Wissel tussen de drie methodes en zie hoe elke manier van steekproeftrekking een ander resultaat oplevert.
1.2.1 Een representatieve steekproef
Het samenstellen van een steekproef, het steekproefontwerp, is cruciaal: je wil op basis van de steekproef betrouwbare besluiten trekken voor de hele populatie. Dat kan alleen als de steekproef representatief is: een goede weerspiegeling van de populatie, maar op kleinere schaal.
Dan wijken de waarden in je steekproef systematisch af van de populatie, en kun je geen juiste conclusies trekken.
Sinds 2019 organiseert een nieuwskanaal voor jongeren een verkiezing voor het “Tienerwoord van het Jaar”. Iedereen die wil, kan online stemmen. De steekproef (alle stemmers) komt hier niet overeen met de beoogde populatie (alle Vlaamse tieners): ook volwassenen kunnen stemmen, enkel wie de oproep zag weet dat hij kan stemmen, en elke tiener beslist zelf of hij een stem uitbrengt. Dat is precies wat je in de demo ziet bij “vrijwillige respons”.
Drie criteria voor representativiteit
Voldoende groot
Twee kansarme leerlingen per school bevragen over slaagkansen is te weinig om representatief te zijn.
Juiste samenstelling
Bij 250 woonzorgcentra moet elk kenmerk (ligging, grootte, type) even vaak voorkomen als in heel Vlaanderen.
Beperkte non-respons
Van 90 uitgenodigde werknemers reageren er maar 9: een responspercentage van 10%, veel te laag.
De aselecte steekproef
Om representatief te zijn, wordt een steekproef vaak aselect samengesteld: op een volledig willekeurige manier, door randomisatie. Het onderzoeksteam mag zelf geen elementen kiezen: geen “gezond verstand”, geen eigen ervaring, gewoon toeval.
Elk element van de populatie krijgt exact dezelfde kans om geselecteerd te worden. Om bijvoorbeeld 5.000 Vlamingen te selecteren, geef je elke Vlaming een nummer en trek je via de computer willekeurig 5.000 nummers.
Tenzij anders vermeld, mag je aannemen dat een onderzoek van een professioneel peilingbureau met een EAS gebeurde.
1.2.2 Twee valkuilen die representativiteit ondermijnen: de opportunistische steekproef
De onderzoeker kiest elementen die gemakkelijk, snel of goedkoop te bereiken zijn. Moeilijker bereikbare elementen krijgen een kleinere kans, dus is er geen sprake van een aselecte steekproef.
Leerlingen bevragen enkel mensen die het lokale winkelcentrum verlaten over mentaal welzijn. Wie ergens anders winkelt of minder koopkrachtig is, krijgt geen kans om in de steekproef terecht te komen.
Om de massa van boekentassen te meten, kiest een directie willekeurig 1 leerling per klas. Klinkt aselect, maar klassen zijn niet allemaal even groot, dus komt de samenstelling van de steekproef niet overeen met die van de populatie.
Vrijwillige respons
Elementen uit de populatie kiezen zelf of ze meedoen. Vooral mensen met een uitgesproken, vaak extreme, mening nemen de moeite om te reageren.
Om te weten hoe inwoners staan tegenover een gemeentefusie, wordt een stemming georganiseerd. Enkel wie zich betrokken voelt, komt opdagen.
Een Amerikaanse rubriekschrijfster vroeg haar lezers ooit of ze, met de kennis van nu, opnieuw kinderen zouden willen. Ze kreeg bijna 10.000 (vrijwillige) reacties: 70% zei spijt te hebben. Een professioneel bureau stelde dezelfde vraag aan 1.373 mensen: slechts 9% had spijt. Het echte percentage ligt dichter bij 9%: Ann Landers kreeg vooral brieven van ouders met problemen, die zelf de moeite namen om te schrijven.
In de praktijk: hoe Imec het wél goed doet
Digimeter, de jaarlijkse peiling van Imec naar media- en ICT-gebruik in Vlaanderen, bevraagt elk jaar zo’n 2.972 Vlamingen van 16 jaar of ouder. Om representatief te zijn, hanteert Imec drie quota: geslacht, leeftijd en opleidingsniveau moeten in de steekproef even vaak voorkomen als in de bevolking. Voor de rekrutering werkt Imec samen met het Rijksregister, net om vrijwillige respons (en de vertekening die daarmee gepaard gaat) te vermijden.
Tussen 2018 en 2021 steeg het percentage Vlaamse gezinnen met minstens drie smart devices van 67% naar 80%. Reken zelf de relatieve stijging uit:
Omdat het om een steekproef gaat, weet je niet met zekerheid of de werkelijke stijging in de hele populatie ook precies dit percentage is: de echte waarde kan lichtjes hoger of lager liggen.
Verwerk wat je hierboven las met de onderdelen hieronder. Ze horen bij deze theorie.
🔍 Opzoekwerk — 1.2 Steekproefontwerp
Zoek het antwoord zelf op (internet, cursus, ...) en typ het hieronder. Wordt automatisch bewaard.
Tip: zoek naar de rubriek "methodologie" of "onderzoeksopzet" bij het rapport.
✓ opgeslagenDenk aan online stemmingen, "poll" op Instagram of een straatenquête.
✓ opgeslagen✅ Testjezelf-quiz — 1.2 Steekproefontwerp
Beantwoord alle vragen en klik daarna op "Controleer". Je mag zo vaak opnieuw proberen als je wil.
Misleidende grafieken en cijfers herkennen, en het verschil tussen samenhang en causaliteit, met de klassieke voorbeelden (windmolens, mozzarella-doctoraten en meer).
Cijfers liegen niet. Wij worden soms misleid.
Een steekproef, een grafiek, een percentage: overal kan een kleine keuze een groot verschil maken in wat je gelooft. Dit hoofdstuk overloopt de trucs, met dezelfde soort voorbeelden als in de les. Elk statistisch onderzoek doorloopt dezelfde cyclus: je verzamelt data, je verwerkt en stelt ze voor, en je trekt er conclusies uit. Op elk van die drie momenten kan iets misgaan, soms per ongeluk, soms met opzet. Wissel hieronder tussen twee versies van dezelfde grafiek:
1.3.1 Bij het verzamelen: nog voor er één grafiek getekend is
Een onderzoek kan al de mist ingaan lang voor iemand een diagram tekent. Drie klassiekers om op te letten.
Wie zit er precies in je steekproef?
In 2014 kopten verschillende nieuwssites: “Driekwart van de mensen heeft spijt van hun tatoeage.” Klinkt alarmerend, tot je het kleine lettertje leest. Het onderzoek bevroeg enkel mensen die al hadden toegegeven spijt te hebben van minstens één tatoeage. Van die specifieke groep had 78% spijt van maar één tatoeage.
De kop doet dus een uitspraak over iedereen die ooit een tatoeage liet zetten, terwijl het onderzoek alleen ging over mensen die al spijt hadden. Het echte percentage getatoeëerden met spijt ligt wellicht veel lager.
Het onderzoek werd besteld door een bedrijf dat… tatoeages verwijdert. Dat bedrijf is gebaat bij een angstaanjagend cijfer.
De vraag bepaalt het antwoord
Stel dat de overheid overweegt om langere, zwaardere vrachtwagens toe te laten op de snelweg. Bekijk twee versies van exact dezelfde enquêtevraag:
“Er komen mogelijk langere en zwaardere vrachtwagens op de snelweg. Bent u voor of tegen?”
“Er komen mogelijk langere en zwaardere vrachtwagens op de snelweg, waardoor er minder voertuigen nodig zijn en de transportkosten dalen. Bent u voor of tegen?”
Bij variant 2 stemt een veel groter deel “voor”: niet omdat mensen plots anders denken, maar omdat de vraag zelf al een argument influistert. Wie een enquête opstelt, kan de uitkomst kleuren, bewust of niet.
Wie betaalt de rekening?
94% van 256 bevraagde vrouwen zou een nieuwe mascara aanraden: een mooi cijfer, tot je ziet dat het onderzoek besteld en betaald werd door de fabrikant zelf. Dat maakt het resultaat niet meteen fout, maar wel een reden voor extra scepsis. Vraag jezelf altijd af: wie had er baat bij dit resultaat?
1.3.1 Grafische voorstelling: een tekening zegt meer dan duizend cijfers
En dat is precies het probleem. Drie manieren waarop een grafiek je voor de gek kan houden.
De verdwenen as
Bekijk de demo bovenaan dit hoofdstuk nog eens. Als 0 een betekenisvolle waarde is voor je as, zoals hier het percentage stemmers, dan hoort die zichtbaar te zijn. Begin je de as pas bij 39%, dan lijkt een verschil van amper drie procentpunt plots dramatisch.
3D verkleint niet, het vervormt
Hetzelfde trucje werkt met cirkeldiagrammen: teken je ze in 3D, dan lijkt het stuk op de voorgrond groter dan een even groot stuk verderop, puur door het perspectief. Een gewoon plat (2D) cirkeldiagram heeft dat probleem niet.
Pictogrammen die liegen over oppervlakte
Een staafdiagram vervangen door leuke pictogrammen (denk aan een koeltoren per land voor energieproductie) oogt aantrekkelijker, maar is riskant. Je oog schat een tekening in op oppervlakte, niet op hoogte alleen.
1.3.1 Numerieke voorstelling: gemiddelde versus mediaan
Los van hoe je iets tekent, kun je met de keuze van je kengetal een heel ander verhaal vertellen. Stel: een bedrijf heeft vier medewerkers die elk €1.000 per week verdienen, en één topverdiener. Verschuif hieronder het loon van die topverdiener en bekijk wat er gebeurt met het gemiddelde en de mediaan. Staat de schuifknop helemaal links, dan verdient iedereen evenveel: dan zijn gemiddelde en mediaan dus ook precies gelijk.
Merk je het? Het gemiddelde springt mee met de topverdiener, de mediaan (het middelste loon) blijft veel stabieler. Daarom gebruiken een directie en een vakbond in hetzelfde debat vaak elk hun eigen kengetal.
Procentpunt versus procent
Een tweede valstrik: het verschil tussen procent en procentpunt. Stijgt een rente van 2% naar 2,5%? Dat is een stijging van 0,5 procentpunt (het absolute verschil), maar van 25% (het relatieve verschil: 0,5 gedeeld door de oorspronkelijke 2%). Beide klinken heel anders, en beide zijn correct. Probeer het zelf:
1.3.2 Samenhang versus causaliteit
Samenhang is een statistisch verband tussen twee variabelen: verandert de ene, dan verandert de andere doorgaans mee. Causaliteit is sterker: de ene variabele veroorzaakt rechtstreeks een verandering in de andere. Elk causaal verband is dus ook samenhang, maar niet elke samenhang is causaal.
Tijdens de Amerikaanse presidentsverkiezingen van 2020 vielen de meeste coronadoden net in de regio’s die het sterkst op Trump stemden. Het verband is overduidelijk in de cijfers, maar niemand stemt zich letterlijk dood. Er is samenhang, geen causaliteit.
Er zijn drie klassieke manieren om deze denkfout te maken.
Denkfout 1: omgekeerde oorzakelijke richting
Kristof ergert zich: hij wil buiten badmintonnen, maar de windmolens verderop draaien als een gek. “Door die windmolens waait mijn shuttle steeds weg!” In werkelijkheid draaien de windmolens hard omdat het hard waait, niet omgekeerd. Oorzaak en gevolg zijn hier gewoon verwisseld.
Denkfout 2: toevallige samenhang
In de Verenigde Staten loopt de kaasconsumptie van mozzarella al jaren opvallend synchroon met het aantal uitgereikte ingenieursdoctoraten. Twee lijnen die toevallig gelijk op schommelen, zonder enige inhoudelijke connectie. Hoe meer variabelen je naast elkaar legt, hoe groter de kans dat je zo’n toevalstreffer vindt.
Denkfout 3: een verborgen derde variabele
Mensen die meer alcohol drinken, blijken ook een hoger risico op longkanker te hebben. Een sterk verband, tot je ontdekt dat wie meer drinkt, meestal ook meer rookt. Roken is de echte gemeenschappelijke oorzaak: de verborgen variabele achter allebei.
1.3.2 Kun je causaliteit wél bewijzen?
Wil je een samenhang naar causaliteit tillen, dan telt de opzet van je onderzoek.
Observationeel onderzoek: je meet en noteert, zonder zelf in te grijpen. Je kan een verband vaststellen, maar nooit met zekerheid zeggen dat het causaal is: er kan altijd een ongemeten factor meespelen.
Experimenteel onderzoek: jij bepaalt zelf wie welke behandeling krijgt, meestal door mensen willekeurig te verdelen in een experimentele groep en een controlegroep. Omdat toeval de enige overgebleven verklaring is voor verschillen tussen de groepen, kun je hier wél causaliteit aantonen.
| Observationeel | Experimenteel | |
|---|---|---|
| Wie grijpt in? | Niemand: je observeert enkel | De onderzoeker verdeelt zelf de groepen |
| Causaliteit aantonen? | Nee, andere factoren kunnen meespelen | Ja, mits willekeurige verdeling |
| Voorbeeld | De coach noteert welke opwarming elke atleet toevallig al deed | De coach verdeelt de atleten zelf, willekeurig, in twee groepen |
Een atletiekcoach vermoedt dat een bepaalde opwarming de looptijden verbetert. Noteert hij enkel welke opwarming elke atleet toch al deed, dan is dat observationeel: misschien liepen de snelste atleten toevallig ook al op een beter parcours. Verdeelt hij zijn atleten zelf willekeurig in twee gelijke groepen en laat hij iedereen op hetzelfde moment, hetzelfde parcours lopen, dan is dat experimenteel, en is het opwarmingstype de enige overgebleven verklaring voor een verschil in tijden.
Verwerk wat je hierboven las met de onderdelen hieronder. Ze horen bij deze theorie.
🔍 Opzoekwerk — 1.3 Misleidingen en valkuilen
Zoek het antwoord zelf op (internet, cursus, ...) en typ het hieronder. Wordt automatisch bewaard.
Tip: zoek naar "misleading graphs examples".
✓ opgeslagenTip: zoek naar "Spurious Correlations Tyler Vigen".
✓ opgeslagen✅ Testjezelf-quiz — 1.3 Misleidingen en valkuilen
Beantwoord alle vragen en klik daarna op "Controleer". Je mag zo vaak opnieuw proberen als je wil.
⚠️ Je verliet deze pagina
Je wisselde van tabblad (of verliet de pagina) terwijl je bezig was met een oefening, opdracht of zelftest. Dit werd geregistreerd als het verlaten van de oefening en kan als vals spelen bestempeld worden.