Saisissez les deux séries dont vous voulez étudier le lien, chacune avec des points-virgules (;) entre les nombres. Le coefficient de corrélation r, la covariance et l’équation de la droite de régression sont calculés, et la droite est tracée sur le nuage de points.
Table des matières
-
Ce que vous pouvez faire sur cette page
-
À quoi sert ce calcul ?
-
Mode d'emploi
-
Formules et figures
-
Symboles et termes
-
Ce qu’il est utile de savoir avant de commencer
-
Calculer avec Excel
-
Calculer avec Google Sheets
-
Calculer avec Python
-
Écrire la formule en LaTeX et autres langages mathématiques (à copier-coller)
-
Faire faire le calcul par ChatGPT
-
Les atouts de DataChef
-
Fonctions connexes
-
Liste des calculatrices NumberChef
Ce que vous pouvez faire sur cette page
- Entrez des couples de données \((x\,;\,y)\) (deux variables) et obtenez tout de suite le coefficient de corrélation \(r\) et la covariance \(s_{xy}\)
- La moyenne, la variance et l’écart-type de \(x\) et de \(y\), ainsi que l’équation de la droite de régression (moindres carrés) \(y = ax + b\), sont calculés en même temps
- Le nuage de points est tracé avec la droite de régression et le point moyen : vous voyez d’un coup d’œil le lien entre les deux séries (croissant, décroissant ou dispersé)
- Une lecture indicative de la valeur, comme « forte corrélation positive » ou « corrélation faible ou nulle », s’affiche aussi
- Une explication simple des formules et des formules à copier-coller pour Excel, Google Sheets et Python sont réunies sur cette page
À quoi sert ce calcul ?
Un usage classique du coefficient de corrélation : vérifier avec des données, et non au feeling, si « les notes montent quand on travaille plus ». En calculant \(r\) à partir des couples (temps de travail ; note) de chaque élève, un seul nombre indique la force du lien.
Les établissements et les organismes de soutien scolaire regardent parfois la corrélation entre matières aux examens blancs (les élèves bons en maths le sont-ils aussi en physique-chimie ?) pour orienter l’accompagnement. Mais une corrélation ne prouve pas la cause, du type « il suffit de travailler plus longtemps pour que la note monte ».
On sait que les ventes de glaces et de boissons fraîches ont une corrélation positive avec la température, et celles de soupes et de boissons chaudes une corrélation négative. Les magasins et les restaurants examinent la corrélation dans leurs données passées (température ; quantités vendues) et ajustent leurs commandes et leur mise en avant selon la météo.
En allant jusqu’à la droite de régression, on peut faire une estimation concrète comme « s’il fait 30 °C demain, on vendra environ tant d’unités ».
En finance, le coefficient de corrélation entre les variations de prix d’actifs comme les actions, les obligations ou l’or est un outil de base de la diversification. Combiner des actifs peu (ou négativement) corrélés fait que, quand l’un baisse, l’autre a moins de chances de baisser aussi : les hauts et les bas de l’ensemble du portefeuille sont plus petits.
Les caisses de retraite et les fonds de placement analysent toujours les corrélations entre actifs avant de décider de la répartition de leur argent.
Quand les défauts augmentent dans une usine, regarder le coefficient de corrélation entre le taux de défauts et des conditions comme la température de fabrication, l’humidité ou la durée de marche des machines aide à cerner celles qui varient avec les défauts. C’est une méthode si basique que le nuage de points (diagramme de dispersion) fait partie des « 7 outils de la qualité ».
Une fois trouvée une condition fortement corrélée, l’étape suivante est une expérience où l’on change cette condition pour confirmer la causalité, puis viennent les améliorations.
Les études sur le mode de vie et la santé, comme « activité physique et tension artérielle » ou « tabac et risque d’une maladie », commencent elles aussi par vérifier la corrélation dans les données.
C’est aussi là qu’on apprend à ne pas confondre corrélation et cause. Exemple célèbre : les ventes de glaces et le nombre de noyades ont une corrélation positive. Les deux augmentent simplement avec un facteur commun, la chaleur. La recherche médicale utilise de nombreuses méthodes pour éliminer ces facteurs de confusion et se rapprocher d’une vraie causalité.
Formules et figures
Symboles et termes
Symboles
| \(x_i,\ y_i\) | x indice i, y indice i | La valeur de \(x\) et la valeur de \(y\) du \(i\)-ième couple (exemple : le temps de travail \(x_3\) et la note \(y_3\) du 3e élève). \(i\) est une lettre souvent utilisée pour un indice (un numéro). |
| \(n\) | n | Le nombre de couples, initiale de « nombre » (exemple : pour les couples de 5 élèves, \(n = 5\)). |
| \(\bar{x},\ \bar{y}\) | x barre, y barre | Les moyennes de \(x\) et de \(y\). La barre au-dessus d’une lettre est la façon habituelle de noter une moyenne. Le point \(G(\bar{x}\,;\,\bar{y})\) est le point moyen. |
| \(x_i - \bar{x}\) | x indice i moins x barre | L’écart de \(x\) à sa moyenne : il indique à quelle distance chaque valeur se trouve de la moyenne de \(x\). \(y_i - \bar{y}\) est l’écart de \(y\). |
| \(s_{xy}\) | s indice x y | La covariance de \(x\) et \(y\), c’est-à-dire la moyenne des produits des écarts. Elle traduit la tendance des deux séries à varier ensemble. On la note aussi \(\operatorname{cov}(x\,;\,y)\) dans les manuels français. La lettre \(s\) est la lettre habituelle des indicateurs de la même famille que l’écart-type. |
| \(s_x,\ s_y\) | s indice x, s indice y | Les écarts-types de \(x\) et de \(y\) (la taille de leur dispersion). Ce sont les racines carrées des variances. On les note aussi \(\sigma_x\) et \(\sigma_y\). |
| \(s_x^2,\ s_y^2\) | s indice x au carré, s indice y au carré | Les variances de \(x\) et de \(y\) : la moyenne des carrés des écarts (on divise par \(n\)). |
| \(r\) | r | Le coefficient de corrélation. La lettre viendrait du \(r\) de « relation » (ou de l’anglais « correlation »). Il est toujours compris entre \(-1\) et \(1\). |
| \(\sum\) | sigma (symbole de somme) | Un symbole qui veut dire « additionner tout ». \(\sum_{i=1}^{n}\) se lit « somme pour \(i\) allant de 1 à \(n\) ». |
| \(a,\ b\) | a, b | Le coefficient directeur et l’ordonnée à l’origine de la droite de régression \(y = ax + b\). Ce sont les mêmes lettres que pour une fonction affine. |
Termes
| corrélation | Une tendance linéaire entre deux séries, où l’une augmente quand l’autre augmente (ou diminue). Plus elle est forte, plus les points du nuage de points sont proches d’une droite. |
| corrélation positive | La tendance de \(y\) à augmenter quand \(x\) augmente. Le nuage de points monte vers la droite et le coefficient de corrélation est positif. |
| corrélation négative | La tendance de \(y\) à diminuer quand \(x\) augmente. Le nuage de points descend vers la droite et le coefficient de corrélation est négatif. |
| coefficient de corrélation | Un nombre entre \(-1\) et \(1\) qui indique la force et le sens d’une corrélation (on dit aussi coefficient de corrélation linéaire, ou de Pearson). On l’obtient en divisant la covariance par le produit des écarts-types de \(x\) et de \(y\). Comme il ne dépend pas des unités, on peut comparer sa force d’une série à l’autre. |
| covariance | La moyenne des produits des écarts de \(x\) et de \(y\). Positive, elle indique une tendance croissante ; négative, une tendance décroissante. Cette page divise par le nombre de couples \(n\), comme au lycée. |
| nuage de points | Un graphique où chaque couple \((x\,;\,y)\) est placé comme un point dans un repère. La forme du nuage montre d’un coup d’œil le sens et la force d’une corrélation. |
| point moyen | Le point \(G(\bar{x}\,;\,\bar{y})\) dont les coordonnées sont les moyennes de \(x\) et de \(y\). La droite de régression passe toujours par ce point. |
| variable | Une grandeur que l’on mesure, comme une taille, une note ou une température. Cette page étudie le lien entre deux variables, \(x\) et \(y\) (statistique à deux variables). |
| écart | La différence entre une valeur et la moyenne (écart à la moyenne). Positif, il indique une valeur au-dessus de la moyenne ; négatif, en dessous. La covariance, la variance et l’écart-type sont tous construits à partir des écarts. |
| variance | La moyenne des carrés des écarts. Elle mesure la dispersion des données. Elle apparaît au dénominateur du coefficient directeur de la droite de régression. |
| écart-type | La racine carrée de la variance. Il s’exprime dans la même unité que les données, ce qui en fait une mesure de dispersion facile à utiliser. Il apparaît au dénominateur du coefficient de corrélation. |
| droite de régression (droite d’ajustement) | La droite \(y = ax + b\) qui s’ajuste le mieux au nuage de points (on dit aussi droite des moindres carrés). Elle sert à prévoir une valeur de \(y\) à partir d’une valeur de \(x\). |
| méthode des moindres carrés | Une façon de choisir le coefficient directeur et l’ordonnée à l’origine d’une droite pour que la somme des carrés des écarts verticaux (des erreurs) entre les points et la droite soit la plus petite possible. La droite de régression est la droite choisie ainsi. |
| valeur aberrante | Une valeur très éloignée des autres points. Le coefficient de corrélation y est très sensible : vérifiez-le toujours avec le nuage de points. |
| lien statistique | Un lien entre deux grandeurs qui varient ensemble (quand l’une augmente, l’autre augmente ou diminue). Même avec une corrélation, l’une n’est pas forcément la cause de l’autre (causalité) : il peut simplement y avoir une cause commune derrière les deux (un facteur de confusion). |
| causalité (lien de cause à effet) | Un lien où l’une des choses est la cause et l’autre sa conséquence. Un lien statistique (varier ensemble) ne suffit pas à montrer une causalité : il peut simplement y avoir une cause commune derrière les deux (un facteur de confusion). |
Ce qu’il est utile de savoir avant de commencer
Voici ce qui vous aide à utiliser le calcul de cette page en le comprenant vraiment, et pas seulement en appuyant sur le bouton.
Si vous bloquez, revenir sur ces notions est le plus court chemin.
| La moyenne (5e, 12-13 ans) |
|
| Nombres relatifs (5e-4e, 12-14 ans) |
|
| Repère et fonctions affines (4e-3e, 13-15 ans) |
|
| Racines carrées (4e-3e, 13-15 ans) |
|
| Statistique à deux variables (lycée, 16-18 ans) |
|
Calculer avec Excel
| x du couple 1 | 1 |
| x du couple 2 | 2 |
| x du couple 3 | 3 |
| x du couple 4 | 4 |
| x du couple 5 | 5 |
| y du couple 1 | 2 |
| y du couple 2 | 4 |
| y du couple 3 | 4 |
| y du couple 4 | 4 |
| y du couple 5 | 6 |
| Covariance s_xy (÷ n) | =COVARIANCE.PEARSON(B1:B5;B6:B10) |
| (Pour comparer) covariance d’échantillon (÷ (n−1)) | =COVARIANCE.STANDARD(B1:B5;B6:B10) |
| x du couple 1 | 1 |
| x du couple 2 | 2 |
| x du couple 3 | 3 |
| x du couple 4 | 4 |
| x du couple 5 | 5 |
| y du couple 1 | 2 |
| y du couple 2 | 4 |
| y du couple 3 | 4 |
| y du couple 4 | 4 |
| y du couple 5 | 6 |
| Coefficient de corrélation r | =COEFFICIENT.CORRELATION(B1:B5;B6:B10) |
| (Pour comparer) même valeur avec PEARSON | =PEARSON(B1:B5;B6:B10) |
| x du couple 1 | 1 |
| x du couple 2 | 2 |
| x du couple 3 | 3 |
| x du couple 4 | 4 |
| x du couple 5 | 5 |
| y du couple 1 | 2 |
| y du couple 2 | 4 |
| y du couple 3 | 4 |
| y du couple 4 | 4 |
| y du couple 5 | 6 |
| Coefficient directeur a | =PENTE(B6:B10;B1:B5) |
| Ordonnée à l’origine b | =ORDONNEE.ORIGINE(B6:B10;B1:B5) |
| x du couple 1 | 1 |
| x du couple 2 | 2 |
| x du couple 3 | 3 |
| x du couple 4 | 4 |
| x du couple 5 | 5 |
| y du couple 1 | 2 |
| y du couple 2 | 4 |
| y du couple 3 | 4 |
| y du couple 4 | 4 |
| y du couple 5 | 6 |
| Moyenne de x x̄ | =MOYENNE(B1:B5) |
| Moyenne de y ȳ | =MOYENNE(B6:B10) |
| Variance de x s_x² | =VAR.P(B1:B5) |
| Écart-type de x s_x | =ECARTYPEP(B1:B5) |
| Variance de y s_y² | =VAR.P(B6:B10) |
| Écart-type de y s_y | =ECARTYPEP(B6:B10) |
La covariance du premier tableau vaut 1,6 (la covariance d’échantillon vaut 2), le coefficient de corrélation du deuxième environ 0,8944, et le troisième donne un coefficient directeur de 0,8 et une ordonnée à l’origine de 1,6.
Attention, il existe deux fonctions de covariance. COVARIANCE.PEARSON divise par n (comme ce calculateur et comme au lycée), et COVARIANCE.STANDARD divise par n − 1 (covariance d’échantillon). Dans les anciennes versions d’Excel (2007 et avant), utilisez COVARIANCE à la place de COVARIANCE.PEARSON.
COEFFICIENT.CORRELATION et PEARSON donnent le même coefficient de corrélation (r est le même qu’on divise par n ou par n − 1 : il n’y a pas de choix à faire).
PENTE et ORDONNEE.ORIGINE prennent d’abord la plage des y, puis celle des x (attention, x ne vient pas en premier).
Pour un autre nombre de couples, ajoutez (ou supprimez) des lignes de nombres, puis remplacez « B1:B5 » et « B6:B10 » dans les formules par vos vraies plages de données.
Calculer avec Google Sheets
| x du couple 1 | 1 |
| x du couple 2 | 2 |
| x du couple 3 | 3 |
| x du couple 4 | 4 |
| x du couple 5 | 5 |
| y du couple 1 | 2 |
| y du couple 2 | 4 |
| y du couple 3 | 4 |
| y du couple 4 | 4 |
| y du couple 5 | 6 |
| Covariance s_xy (÷ n) | =COVARIANCE(B1:B5;B6:B10) |
| x du couple 1 | 1 |
| x du couple 2 | 2 |
| x du couple 3 | 3 |
| x du couple 4 | 4 |
| x du couple 5 | 5 |
| y du couple 1 | 2 |
| y du couple 2 | 4 |
| y du couple 3 | 4 |
| y du couple 4 | 4 |
| y du couple 5 | 6 |
| Coefficient de corrélation r | =COEFFICIENT.CORRELATION(B1:B5;B6:B10) |
| x du couple 1 | 1 |
| x du couple 2 | 2 |
| x du couple 3 | 3 |
| x du couple 4 | 4 |
| x du couple 5 | 5 |
| y du couple 1 | 2 |
| y du couple 2 | 4 |
| y du couple 3 | 4 |
| y du couple 4 | 4 |
| y du couple 5 | 6 |
| Coefficient directeur a | =PENTE(B6:B10;B1:B5) |
| Ordonnée à l’origine b | =ORDONNEE.ORIGINE(B6:B10;B1:B5) |
La covariance qui divise par n s’obtient avec la fonction COVARIANCE (même définition que ce calculateur). Le coefficient de corrélation utilise COEFFICIENT.CORRELATION, comme dans Excel.
Calculer avec Python
import statistics
xs = [1, 2, 3, 4, 5] # valeurs de x (exemple : temps de travail)
ys = [2, 4, 4, 4, 6] # valeurs de y (exemple : note)
n = len(xs)
mean_x = statistics.mean(xs) # moyenne de x
mean_y = statistics.mean(ys) # moyenne de y
# covariance s_xy (on divise par n, comme au lycée)
covariance = sum((x - mean_x) * (y - mean_y) for x, y in zip(xs, ys)) / n
sd_x = statistics.pstdev(xs) # écart-type de x (on divise par n)
sd_y = statistics.pstdev(ys) # écart-type de y (on divise par n)
r = covariance / (sd_x * sd_y) # coefficient de corrélation
slope = covariance / statistics.pvariance(xs) # coefficient directeur a de la droite de régression
intercept = mean_y - slope * mean_x # ordonnée à l’origine b de la droite de régression
print(f"Covariance s_xy : {covariance}")
print(f"Coefficient de corrélation r : {r}")
# l’ordonnée à l’origine peut présenter une erreur d’arrondi (1.5999...) : on l’arrondit à 10 chiffres significatifs
print(f"Droite de régression : y = {slope:.10g}x + {intercept:.10g}")
Écrire la formule en LaTeX et autres langages mathématiques (à copier-coller)
s_xy = {(x₁ − x̄)(y₁ − ȳ) + … + (xₙ − x̄)(yₙ − ȳ)} ÷ n
s_{xy} = \dfrac{1}{n}\sum_{i=1}^{n} (x_i - \bar{x})(y_i - \bar{y})
<math xmlns="http://www.w3.org/1998/Math/MathML" display="block">
<mrow>
<msub><mi>s</mi><mrow><mi>x</mi><mi>y</mi></mrow></msub>
<mo>=</mo>
<mfrac><mn>1</mn><mi>n</mi></mfrac>
<munderover>
<mo>∑</mo>
<mrow><mi>i</mi><mo>=</mo><mn>1</mn></mrow>
<mi>n</mi>
</munderover>
<mrow>
<mo>(</mo><msub><mi>x</mi><mi>i</mi></msub><mo>−</mo><mover><mi>x</mi><mo>¯</mo></mover><mo>)</mo>
<mo>(</mo><msub><mi>y</mi><mi>i</mi></msub><mo>−</mo><mover><mi>y</mi><mo>¯</mo></mover><mo>)</mo>
</mrow>
</mrow>
</math>
s_(xy) = (1/n) sum_(i=1)^n (x_i - bar x)(y_i - bar y)
Covariance[xdata, ydata]*(Length[xdata] - 1)/Length[xdata] (* Covariance divise par n-1 : on la ramène à la valeur divisée par n *)
s_xy := add((x[i] - x_bar)*(y[i] - y_bar), i = 1 .. n)/n;
s_xy = mean((x - mean(x)).*(y - mean(y)));
s_xy = (1/n) ∑_(i=1)^n (x_i − x̄)(y_i − ȳ)
r = s_xy ÷ (s_x × s_y)
r = \dfrac{s_{xy}}{s_x\, s_y}
<math xmlns="http://www.w3.org/1998/Math/MathML" display="block">
<mrow>
<mi>r</mi>
<mo>=</mo>
<mfrac>
<msub><mi>s</mi><mrow><mi>x</mi><mi>y</mi></mrow></msub>
<mrow><msub><mi>s</mi><mi>x</mi></msub><msub><mi>s</mi><mi>y</mi></msub></mrow>
</mfrac>
</mrow>
</math>
r = s_(xy) / (s_x s_y)
Correlation[xdata, ydata]
r := s_xy/(s_x*s_y);
R = corrcoef(x, y); r = R(1, 2);
r = s_xy/(s_x s_y)
y = ax + b, a = s_xy ÷ s_x², b = ȳ − a·x̄
y = ax + b, \quad a = \dfrac{s_{xy}}{s_x^{2}}, \quad b = \bar{y} - a\bar{x}
<math xmlns="http://www.w3.org/1998/Math/MathML" display="block">
<mrow>
<mi>y</mi><mo>=</mo><mi>a</mi><mi>x</mi><mo>+</mo><mi>b</mi>
<mo>,</mo><mspace width="1em"/>
<mi>a</mi><mo>=</mo>
<mfrac>
<msub><mi>s</mi><mrow><mi>x</mi><mi>y</mi></mrow></msub>
<msubsup><mi>s</mi><mi>x</mi><mn>2</mn></msubsup>
</mfrac>
<mo>,</mo><mspace width="1em"/>
<mi>b</mi><mo>=</mo>
<mover><mi>y</mi><mo>¯</mo></mover>
<mo>−</mo>
<mi>a</mi><mover><mi>x</mi><mo>¯</mo></mover>
</mrow>
</math>
y = a x + b, a = s_(xy)/s_x^2, b = bar y - a bar x
lm = LinearModelFit[Transpose[{xdata, ydata}], t, t]; lm["BestFitParameters"]
a := s_xy/s_x^2; b := y_bar - a*x_bar;
p = polyfit(x, y, 1); % p(1) = coefficient directeur a, p(2) = ordonnée à l’origine b
y = ax + b, a = s_xy/s_x^2, b = ȳ − ax̄
Faire faire le calcul par ChatGPT
Tu es un assistant de calcul en statistique. Fais le calcul suivant en exécutant réellement du code Python, et appuie ta réponse uniquement sur les nombres obtenus à l’exécution (ne réponds pas de tête ni par estimation). Pour la série statistique à deux variables suivante, calcule chacune des valeurs ci-dessous. x : 1 ; 2 ; 3 ; 4 ; 5 y : 2 ; 4 ; 4 ; 4 ; 6 1. Les moyennes de x et de y, et leurs variances et écarts-types en divisant par n 2. La covariance s_xy (somme des produits des écarts divisée par le nombre de couples n ; ne divise pas par n − 1) 3. Le coefficient de corrélation r 4. Le coefficient directeur a et l’ordonnée à l’origine b de la droite de régression y = ax + b (méthode des moindres carrés) Montre les formules utilisées et les nombres obtenus à l’exécution. Réponds en français, avec la virgule comme séparateur décimal.
Mode d'emploi
-
1Saisissez vos nombresTapez les nombres à calculer dans les champs de saisie
-
2CalculezAppuyez sur le bouton « Calculer »
-
3Lisez le résultatLe résultat s’affiche aussitôt. La même page explique aussi le raisonnement et la formule
Les atouts de DataChef
Aucune compétence requise – simple et intuitif
Aucune donnée personnelle nécessaire
Le fichier est supprimé automatiquement après le téléchargement
Aucune mention de crédit nécessaire
Aucune autorisation préalable nécessaire