Vul de twee reeksen gegevens in waarvan je het verband wilt onderzoeken, elk gescheiden door puntkomma’s (;). Je krijgt de correlatiecoëfficiënt r, de covariantie en de vergelijking van de regressielijn, en de regressielijn wordt getekend in een spreidingsdiagram.
Inhoudsopgave
-
Wat je op deze pagina kunt doen
-
Waarvoor is deze berekening handig?
-
Zo werkt het
-
Formules en figuren
-
Symbolen en begrippen
-
Handig om vooraf te weten
-
Berekenen met Excel
-
Berekenen met Google Spreadsheets
-
Berekenen met Python
-
De formule in LaTeX en andere wiskundenotaties (om te kopiëren)
-
Zo laat je ChatGPT de berekening doen
-
Kenmerken van DataChef
-
Gerelateerde functies
-
Alle rekenmachines van NumberChef
Wat je op deze pagina kunt doen
- Vul paren \(x\)- en \(y\)-gegevens in (twee variabelen) en je ziet meteen de correlatiecoëfficiënt \(r\) en de covariantie \(s_{xy}\)
- Het gemiddelde, de variantie en de standaardafwijking van \(x\) en van \(y\), en de vergelijking van de regressielijn (kleinste kwadraten) \(y = ax + b\) worden tegelijk berekend
- Er wordt een spreidingsdiagram getekend met de regressielijn en het gemiddelde punt erbovenop, zodat je in één oogopslag ziet hoe de twee reeksen samenhangen (stijgend, dalend of verspreid)
- Je krijgt ook een vuistregel voor de waarde, zoals “sterke positieve correlatie” of “weinig of geen correlatie”
- Een uitleg van de formules in gewone taal en formules om te kopiëren voor Excel, Google Spreadsheets en Python staan ook op deze pagina
Waarvoor is deze berekening handig?
Een klassiek gebruik van de correlatiecoëfficiënt is controleren of “je cijfers omhooggaan als je meer leert” met gegevens in plaats van op gevoel. Bereken \(r\) uit paren van leertijd en score van elke leerling, en één getal laat zien hoe sterk het verband is.
Scholen en bijlesinstituten kijken soms naar de correlatie tussen vakken bij proefwerken (zijn leerlingen die goed zijn in wiskunde ook goed in natuurkunde?) om hun onderwijs bij te sturen. Maar houd in gedachten dat een correlatie de oorzaak niet bewijst, zoals in “als je maar langer leert, gaat je score altijd omhoog”.
De verkoop van ijs en koude dranken heeft bekend een positieve correlatie met de temperatuur, en de verkoop van warme soep en warme chocolademelk een negatieve. Winkels en horecazaken bekijken de correlatie in gegevens uit het verleden over “temperatuur en verkochte aantallen” en passen hun bestellingen en uitstallingen aan op de weersverwachting.
Ga je een stap verder en bepaal je de regressielijn, dan kun je een concrete schatting maken zoals “als de verwachte maximumtemperatuur morgen 30 °C is, verkopen we ongeveer zoveel”.
Bij beleggen is de correlatiecoëfficiënt tussen de koersbewegingen van beleggingen zoals aandelen, obligaties en goud een basisinstrument voor spreiding. Combineer je beleggingen met een lage (of negatieve) correlatie, dan is de kans kleiner dat de ene ook daalt als de andere daalt, en blijven de schommelingen van de hele portefeuille kleiner.
Pensioenfondsen en beleggingsfondsen analyseren altijd de correlaties tussen beleggingen voordat ze besluiten hoe ze hun geld verdelen.
Als er in een fabriek meer defecte producten komen, helpt het om de correlatiecoëfficiënt te bepalen tussen het uitvalpercentage en omstandigheden zoals bewerkingstemperatuur, luchtvochtigheid en draaitijd van de machine. Zo zie je welke omstandigheden samen met de defecten bewegen. Dit is zo’n basismethode dat het spreidingsdiagram ervoor een van de zeven basisinstrumenten van kwaliteitsbeheersing is.
Als je een omstandigheid met een sterke correlatie vindt, is de volgende stap een experiment waarin je die omstandigheid verandert om het causaal verband te bevestigen. Daarna volgen de verbeteringen.
Ook onderzoek naar leefstijl en gezondheid, zoals “beweging en bloeddruk” of “roken en het risico op een ziekte”, begint met het controleren van de correlatie in de gegevens.
Het is ook de plek waar je leert niet van correlatie naar oorzaak te springen. Een bekend voorbeeld is dat de verkoop van ijs en het aantal verdrinkingen een positieve correlatie hebben. Beide nemen gewoon toe door een gemeenschappelijke factor: warm weer. Medisch onderzoek gebruikt veel methoden om het effect van zulke derde factoren weg te halen en dichter bij het echte causaal verband te komen.
Formules en figuren
Symbolen en begrippen
Symbolen
| \(x_i,\ y_i\) | x index i, y index i | De \(x\)-waarde en de \(y\)-waarde van het \(i\)-de paar. (Voorbeeld: de leertijd \(x_3\) en de score \(y_3\) van de 3e leerling.) \(i\) is een letter die vaak voor een index (volgnummer) wordt gebruikt. |
| \(n\) | n | Het aantal paren, van de eerste letter van “aantal”. (Voorbeeld: bij paren van 5 leerlingen is \(n = 5\)) |
| \(\bar{x},\ \bar{y}\) | x-streep, y-streep | De gemiddelden van \(x\) en van \(y\). Een streep boven een letter is de gebruikelijke manier om een gemiddelde aan te geven. |
| \(x_i - \bar{x}\) | x index i min x-streep | De afwijking van \(x\). Ze laat zien hoever elke waarde van het gemiddelde van \(x\) af ligt. \(y_i - \bar{y}\) is de afwijking van \(y\). |
| \(s_{xy}\) | s index x y | De covariantie van \(x\) en \(y\), het gemiddelde van de producten van de afwijkingen. Ze laat de neiging van de twee reeksen zien om samen te bewegen. De letter \(s\) wordt gebruikt voor grootheden uit dezelfde familie als de standaardafwijking. |
| \(s_x,\ s_y\) | s index x, s index y | De standaardafwijkingen van \(x\) en van \(y\) (hoe verspreid elk is). Ze zijn de wortels van de varianties. |
| \(s_x^2,\ s_y^2\) | s index x kwadraat, s index y kwadraat | De varianties van \(x\) en van \(y\), het gemiddelde van de gekwadrateerde afwijkingen (gedeeld door \(n\)). |
| \(r\) | r | De correlatiecoëfficiënt. De letter komt van de \(r\) in “correlatie” of “relatie”. Ze ligt altijd tussen \(-1\) en \(1\). |
| \(\sum\) | sigma (somteken) | Een symbool dat “alles optellen” betekent. \(\sum_{i=1}^{n}\) lees je als “de som van \(i = 1\) tot \(n\)”. |
| \(a,\ b\) | a, b | De richtingscoëfficiënt en het snijpunt met de y-as van de regressielijn \(y = ax + b\). Ze hebben dezelfde rol als \(a\) en \(b\) in een lineaire formule. |
Begrippen
| correlatie | Een lineaire samenhang tussen twee reeksen gegevens, waarbij de ene toeneemt als de andere toeneemt (of afneemt). Hoe sterker ze is, hoe dichter de punten in een spreidingsdiagram bij een rechte lijn liggen. |
| positieve correlatie | De neiging van \(y\) om toe te nemen als \(x\) toeneemt. Het spreidingsdiagram stijgt naar rechts en de correlatiecoëfficiënt is positief. |
| negatieve correlatie | De neiging van \(y\) om af te nemen als \(x\) toeneemt. Het spreidingsdiagram daalt naar rechts en de correlatiecoëfficiënt is negatief. |
| correlatiecoëfficiënt | Eén getal van \(-1\) tot \(1\) dat de sterkte en de richting van een correlatie aangeeft (ook wel de correlatiecoëfficiënt van Pearson). Je vindt het door de covariantie te delen door het product van de standaardafwijkingen van \(x\) en \(y\). Omdat het niet van de eenheden afhangt, kun je de sterkte bij verschillende gegevens met elkaar vergelijken. |
| covariantie | Het gemiddelde van de producten van de afwijkingen van \(x\) en \(y\). Positief betekent een neiging om naar rechts te stijgen, negatief een neiging om naar rechts te dalen. Op deze pagina wordt gedeeld door het aantal paren \(n\) (de populatieversie). |
| spreidingsdiagram | Een grafiek die paargewijze gegevens \((x,\ y)\) als punten in een assenstelsel zet. Aan de ligging van de punten zie je in één oogopslag de richting en de sterkte van een correlatie. |
| variabele | Een grootheid die je als gegeven meet, zoals lengte, score of temperatuur. Deze pagina onderzoekt het verband tussen twee variabelen, \(x\) en \(y\). |
| afwijking | Het verschil tussen een waarde en het gemiddelde. Positief betekent boven het gemiddelde, negatief eronder. De covariantie, de variantie en de standaardafwijking zijn allemaal opgebouwd uit afwijkingen. |
| variantie | Het gemiddelde van de gekwadrateerde afwijkingen. Ze geeft aan hoe groot de spreiding van de gegevens is. Ze komt voor in de noemer van de richtingscoëfficiënt van de regressielijn. |
| standaardafwijking | De wortel uit de variantie. De eenheid is weer dezelfde als die van de gegevens, waardoor ze handig is als maat voor de spreiding. Ze komt voor in de noemer van de correlatiecoëfficiënt. |
| regressielijn | De rechte lijn \(y = ax + b\) die het best past bij de puntenwolk van een spreidingsdiagram. Je gebruikt haar om een \(y\)-waarde te voorspellen uit een \(x\)-waarde. |
| kleinste-kwadratenmethode | Een manier om de richtingscoëfficiënt en het snijpunt van een lijn te kiezen zodat de verticale afstanden (fouten) tussen elk punt en de lijn, gekwadrateerd en opgeteld, zo klein mogelijk zijn. De regressielijn is de lijn die op deze manier is gekozen. |
| uitschieter | Een waarde die ver van de andere punten af ligt. De correlatiecoëfficiënt wordt sterk beïnvloed door uitschieters, dus bekijk haar altijd samen met het spreidingsdiagram. |
| samenhang | Een verband waarbij twee grootheden samen bewegen (als de ene toeneemt, neemt de andere toe of af). Ook bij een correlatie is het ene niet per se de oorzaak van het andere (causaal verband). Er kan gewoon een gemeenschappelijke oorzaak achter beide zitten (een derde factor, ook wel verstorende variabele genoemd). |
| causaal verband (oorzakelijk verband) | Een verband waarbij het ene de oorzaak is en het andere het gevolg. Alleen een samenhang (samen bewegen) laat geen causaal verband zien; er kan gewoon een gemeenschappelijke oorzaak achter beide zitten (een derde factor). |
Handig om vooraf te weten
Dit is wat je helpt om de berekening op deze pagina echt te begrijpen, en niet alleen op de knop te drukken.
Loop je vast, dan is het de snelste weg vooruit om deze onderwerpen te herhalen.
| Het gemiddelde (groep 7-8, 10-12 jaar) |
|
| Negatieve getallen (klas 1, 12-13 jaar) |
|
| Coördinaten en lineaire functies (klas 1-2, 12-14 jaar) |
|
| Wortels (klas 3, 14-15 jaar) |
|
| Statistiek (onderbouw en bovenbouw havo/vwo, 13-17 jaar) |
|
Berekenen met Excel
| x van paar 1 | 1 |
| x van paar 2 | 2 |
| x van paar 3 | 3 |
| x van paar 4 | 4 |
| x van paar 5 | 5 |
| y van paar 1 | 2 |
| y van paar 2 | 4 |
| y van paar 3 | 4 |
| y van paar 4 | 4 |
| y van paar 5 | 6 |
| Covariantie s_xy (delen door n) | =COVARIANTIE.P(B1:B5;B6:B10) |
| (Ter vergelijking) steekproefcovariantie, delen door n−1 | =COVARIANTIE.S(B1:B5;B6:B10) |
| x van paar 1 | 1 |
| x van paar 2 | 2 |
| x van paar 3 | 3 |
| x van paar 4 | 4 |
| x van paar 5 | 5 |
| y van paar 1 | 2 |
| y van paar 2 | 4 |
| y van paar 3 | 4 |
| y van paar 4 | 4 |
| y van paar 5 | 6 |
| Correlatiecoëfficiënt r | =CORRELATIE(B1:B5;B6:B10) |
| (Ter vergelijking) dezelfde waarde met PEARSON | =PEARSON(B1:B5;B6:B10) |
| x van paar 1 | 1 |
| x van paar 2 | 2 |
| x van paar 3 | 3 |
| x van paar 4 | 4 |
| x van paar 5 | 5 |
| y van paar 1 | 2 |
| y van paar 2 | 4 |
| y van paar 3 | 4 |
| y van paar 4 | 4 |
| y van paar 5 | 6 |
| Richtingscoëfficiënt a | =RICHTING(B6:B10;B1:B5) |
| Snijpunt met de y-as b | =SNIJPUNT(B6:B10;B1:B5) |
| x van paar 1 | 1 |
| x van paar 2 | 2 |
| x van paar 3 | 3 |
| x van paar 4 | 4 |
| x van paar 5 | 5 |
| y van paar 1 | 2 |
| y van paar 2 | 4 |
| y van paar 3 | 4 |
| y van paar 4 | 4 |
| y van paar 5 | 6 |
| Gemiddelde van x x̄ | =GEMIDDELDE(B1:B5) |
| Gemiddelde van y ȳ | =GEMIDDELDE(B6:B10) |
| Variantie van x s_x² | =VARP(B1:B5) |
| Standaardafwijking van x s_x | =STDEVP(B1:B5) |
| Variantie van y s_y² | =VARP(B6:B10) |
| Standaardafwijking van y s_y | =STDEVP(B6:B10) |
De covariantie in de eerste tabel is 1,6 (de steekproefcovariantie is 2), de correlatiecoëfficiënt in de tweede tabel is ongeveer 0,8944 en de derde tabel geeft een richtingscoëfficiënt van 0,8 en een snijpunt van 1,6.
Let op: er zijn twee functies voor de covariantie. COVARIANTIE.P is de covariantie die deelt door n (hetzelfde als deze rekenmachine) en COVARIANTIE.S is de steekproefcovariantie die deelt door n − 1. In oude versies van Excel (2007 en eerder) gebruik je COVARIANTIE in plaats van COVARIANTIE.P.
CORRELATIE en PEARSON geven dezelfde correlatiecoëfficiënt (r is hetzelfde of je nu deelt door n of door n − 1, dus er valt niets te kiezen).
RICHTING en SNIJPUNT vragen “het y-bereik, het x-bereik” in die volgorde (let op: x komt niet eerst).
Wil je een ander aantal paren gebruiken, voeg dan rijen met getallen toe (of haal ze weg) en pas “B1:B5” en “B6:B10” in de formules aan naar je eigen gegevensbereiken.
Berekenen met Google Spreadsheets
| x van paar 1 | 1 |
| x van paar 2 | 2 |
| x van paar 3 | 3 |
| x van paar 4 | 4 |
| x van paar 5 | 5 |
| y van paar 1 | 2 |
| y van paar 2 | 4 |
| y van paar 3 | 4 |
| y van paar 4 | 4 |
| y van paar 5 | 6 |
| Covariantie s_xy (delen door n) | =COVARIANTIE(B1:B5;B6:B10) |
| x van paar 1 | 1 |
| x van paar 2 | 2 |
| x van paar 3 | 3 |
| x van paar 4 | 4 |
| x van paar 5 | 5 |
| y van paar 1 | 2 |
| y van paar 2 | 4 |
| y van paar 3 | 4 |
| y van paar 4 | 4 |
| y van paar 5 | 6 |
| Correlatiecoëfficiënt r | =CORRELATIE(B1:B5;B6:B10) |
| x van paar 1 | 1 |
| x van paar 2 | 2 |
| x van paar 3 | 3 |
| x van paar 4 | 4 |
| x van paar 5 | 5 |
| y van paar 1 | 2 |
| y van paar 2 | 4 |
| y van paar 3 | 4 |
| y van paar 4 | 4 |
| y van paar 5 | 6 |
| Richtingscoëfficiënt a | =RICHTING(B6:B10;B1:B5) |
| Snijpunt met de y-as b | =SNIJPUNT(B6:B10;B1:B5) |
In Google Spreadsheets vind je de covariantie die deelt door n met de functie COVARIANTIE (dezelfde definitie als deze rekenmachine; ook de naam COVARIANTIE.P roept dezelfde functie aan). De correlatiecoëfficiënt gebruikt CORRELATIE, net als Excel.
Berekenen met Python
import statistics
xs = [1, 2, 3, 4, 5] # x-gegevens (voorbeeld: leertijd)
ys = [2, 4, 4, 4, 6] # y-gegevens (voorbeeld: punten voor een overhoring)
n = len(xs)
mean_x = statistics.mean(xs) # gemiddelde van x
mean_y = statistics.mean(ys) # gemiddelde van y
# covariantie s_xy (populatieversie: delen door n)
covariance = sum((x - mean_x) * (y - mean_y) for x, y in zip(xs, ys)) / n
sd_x = statistics.pstdev(xs) # standaardafwijking van x (delen door n)
sd_y = statistics.pstdev(ys) # standaardafwijking van y (delen door n)
r = covariance / (sd_x * sd_y) # correlatiecoëfficiënt
slope = covariance / statistics.pvariance(xs) # richtingscoëfficiënt a van de regressielijn
intercept = mean_y - slope * mean_x # snijpunt b van de regressielijn met de y-as
print(f"Covariantie s_xy: {covariance}")
print(f"Correlatiecoëfficiënt r: {r}")
# het snijpunt kan een afrondingsfout van drijvende komma tonen (1.5999...), dus rond af op 10 significante cijfers
print(f"Regressielijn: y = {slope:.10g}x + {intercept:.10g}")
De formule in LaTeX en andere wiskundenotaties (om te kopiëren)
s_xy = {(x₁ − x̄)(y₁ − ȳ) + … + (xₙ − x̄)(yₙ − ȳ)} ÷ n
s_{xy} = \dfrac{1}{n}\sum_{i=1}^{n} (x_i - \bar{x})(y_i - \bar{y})
<math xmlns="http://www.w3.org/1998/Math/MathML" display="block">
<mrow>
<msub><mi>s</mi><mrow><mi>x</mi><mi>y</mi></mrow></msub>
<mo>=</mo>
<mfrac><mn>1</mn><mi>n</mi></mfrac>
<munderover>
<mo>∑</mo>
<mrow><mi>i</mi><mo>=</mo><mn>1</mn></mrow>
<mi>n</mi>
</munderover>
<mrow>
<mo>(</mo><msub><mi>x</mi><mi>i</mi></msub><mo>−</mo><mover><mi>x</mi><mo>¯</mo></mover><mo>)</mo>
<mo>(</mo><msub><mi>y</mi><mi>i</mi></msub><mo>−</mo><mover><mi>y</mi><mo>¯</mo></mover><mo>)</mo>
</mrow>
</mrow>
</math>
s_(xy) = (1/n) sum_(i=1)^n (x_i - bar x)(y_i - bar y)
Covariance[xdata, ydata]*(Length[xdata] - 1)/Length[xdata] (* Covariance deelt door n-1, dus dit rekent om naar de waarde gedeeld door n *)
s_xy := add((x[i] - x_bar)*(y[i] - y_bar), i = 1 .. n)/n;
s_xy = mean((x - mean(x)).*(y - mean(y)));
s_xy = (1/n) ∑_(i=1)^n (x_i − x̄)(y_i − ȳ)
r = s_xy ÷ (s_x × s_y)
r = \dfrac{s_{xy}}{s_x\, s_y}
<math xmlns="http://www.w3.org/1998/Math/MathML" display="block">
<mrow>
<mi>r</mi>
<mo>=</mo>
<mfrac>
<msub><mi>s</mi><mrow><mi>x</mi><mi>y</mi></mrow></msub>
<mrow><msub><mi>s</mi><mi>x</mi></msub><msub><mi>s</mi><mi>y</mi></msub></mrow>
</mfrac>
</mrow>
</math>
r = s_(xy) / (s_x s_y)
Correlation[xdata, ydata]
r := s_xy/(s_x*s_y);
R = corrcoef(x, y); r = R(1, 2);
r = s_xy/(s_x s_y)
y = ax + b, a = s_xy ÷ s_x², b = ȳ − a·x̄
y = ax + b, \quad a = \dfrac{s_{xy}}{s_x^{2}}, \quad b = \bar{y} - a\bar{x}
<math xmlns="http://www.w3.org/1998/Math/MathML" display="block">
<mrow>
<mi>y</mi><mo>=</mo><mi>a</mi><mi>x</mi><mo>+</mo><mi>b</mi>
<mo>,</mo><mspace width="1em"/>
<mi>a</mi><mo>=</mo>
<mfrac>
<msub><mi>s</mi><mrow><mi>x</mi><mi>y</mi></mrow></msub>
<msubsup><mi>s</mi><mi>x</mi><mn>2</mn></msubsup>
</mfrac>
<mo>,</mo><mspace width="1em"/>
<mi>b</mi><mo>=</mo>
<mover><mi>y</mi><mo>¯</mo></mover>
<mo>−</mo>
<mi>a</mi><mover><mi>x</mi><mo>¯</mo></mover>
</mrow>
</math>
y = a x + b, a = s_(xy)/s_x^2, b = bar y - a bar x
lm = LinearModelFit[Transpose[{xdata, ydata}], t, t]; lm["BestFitParameters"]
a := s_xy/s_x^2; b := y_bar - a*x_bar;
p = polyfit(x, y, 1); % p(1) = richtingscoëfficiënt a, p(2) = snijpunt b
y = ax + b, a = s_xy/s_x^2, b = ȳ − ax̄
Zo laat je ChatGPT de berekening doen
Je bent een assistent voor statistische berekeningen. Voer de volgende berekening uit door echt Python-code uit te voeren, en baseer je antwoord alleen op de getallen uit het uitvoerresultaat (geen hoofdrekenen of gokken). Zoek voor de volgende gepaarde gegevens elk van de onderstaande waarden. x: 1, 2, 3, 4, 5 y: 2, 4, 4, 4, 6 1. De gemiddelden van x en y, en hun varianties en standaardafwijkingen met delen door n 2. De covariantie s_xy (de som van de producten van de afwijkingen gedeeld door het aantal paren n; deel niet door n − 1) 3. De correlatiecoëfficiënt r 4. De richtingscoëfficiënt a en het snijpunt b van de regressielijn y = ax + b (kleinste kwadraten) Laat de formules zien die je hebt gebruikt en de getallen uit het uitvoerresultaat.
Zo werkt het
-
1Vul je getallen inTyp de getallen waarmee je wilt rekenen in de invoervelden
-
2BerekenKlik op de knop “Berekenen”
-
3Bekijk het resultaatHet resultaat verschijnt meteen. Op dezelfde pagina vind je ook de uitwerking van de berekening en de uitleg van de formule
Kenmerken van DataChef
Geen voorkennis nodig – intuïtieve en eenvoudige bediening
Zonder persoonlijke gegevens op te geven
Bestand wordt automatisch verwijderd zodra je op "Downloaden" klikt
Geen bronvermelding vereist
Geen toestemming vooraf nodig