Signets    
Espérance    
Loi binomiale    
nPr et nCr    
Tables rondes    
Moyenne    
Écart-type    
Quartiles    
Loi normale    
Score z    
p-valeur    
Calcul de %    
% d’erreur    
Calcul TVA    
Taux de marge    
Masse molaire    
Loi d’Ohm    
Code couleur    
Pointures    
Calcul modulo    
Diviseurs    
Second degré    
Puissances    
Logarithmes    
Demi-vie    
Forme trigo.    
Distance 3D    
Distance GPS    
Coniques    
Déterminant    
Cos, sin, tan    
Pythagore    
Similitude    
Aire trapèze    
Aire secteur    
Angle inscrit    
Aire ellipse    
Volume cube    
Aire du cube    
Aire cylindre    
Aire sphère    
Aire calotte    
Aire pyramide    
Volume cône    
Aire du cône    
Aire capsule    
Dans X heures    
Quel jour ?    
Calcul du ROI    
Calcul du TRI    
Calcul du PIB    
Calcul du CTR    
CPA maximum    
Calcul du CAC    
Test A/B    
Trafic SEO    
Calcul IMC    
Calcul TDEE    
Poids idéal    
Masse grasse    
Masse maigre    
Taille future    
Index de golf    
Calcul du 1RM    
FC cible    
Windchill    
kWh en euros    
Calcul béton    
Papier peint    
Distance TV    
Terrasse bois    
Calcul de vis    
Calcul mastic    
Déperditions    
   Ajouter
Probabilités et nombres aléatoires : outils de calcul
Deux événements
Deux événements
Calcul inverse
Calcul inverse
Épreuves répétées
Épreuves répétées
Formule de Bayes
Formule de Bayes
Espérance
Espérance
Loi binomiale
Loi binomiale
nPr et nCr
nPr et nCr
Tables rondes
Tables rondes
Avec répétition
Avec répétition
Nombre aléatoire
Nombre aléatoire
Moyennes et statistiques : outils de calcul
Moyenne
Moyenne
Médiane et mode
Médiane et mode
Écart-type
Écart-type
Quartiles
Quartiles
Tableau des effectifs
Tableau des effectifs
Corrélation (r)
Corrélation (r)
Loi normale
Loi normale
Score z
Score z
Intervalle de confiance
Intervalle de confiance
Taille d’échantillon
Taille d’échantillon
Capture-recapture
Capture-recapture
p-valeur
p-valeur
Pourcentages et proportions : outils de calcul
Calcul de %
Calcul de %
Hausse et baisse %
Hausse et baisse %
Différence en %
Différence en %
% d’erreur
% d’erreur
Calcul de ratio
Calcul de ratio
Réduction en %
Réduction en %
Calcul TVA
Calcul TVA
Taux de marge
Taux de marge
Vitesse : outils de calcul
Calcul de vitesse
Calcul de vitesse
Masse volumique et concentration : outils de calcul
Masse volumique
Masse volumique
Concentration molaire
Concentration molaire
Masse molaire
Masse molaire
Physique et électricité : outils de calcul
Loi d’Ohm
Loi d’Ohm
Watts ↔ ampères
Watts ↔ ampères
Code couleur
Code couleur
Chute de tension
Chute de tension
Conversion d’unités : outils de calcul
Conversion poids
Conversion poids
Pointures
Pointures
Nombres entiers et relatifs : outils de calcul
Division posée
Division posée
Calcul du PPCM
Calcul du PPCM
Calcul du PGCD
Calcul du PGCD
Nombres relatifs
Nombres relatifs
Facteurs premiers
Facteurs premiers
Équation ax+by=c
Équation ax+by=c
Calcul modulo
Calcul modulo
Diviseurs
Diviseurs
Chiffres romains
Chiffres romains
Fractions, décimaux et arrondis : outils de calcul
Calcul de fractions
Calcul de fractions
Fractions mixtes
Fractions mixtes
Simplifier fraction
Simplifier fraction
Fraction en décimal
Fraction en décimal
Décimal en fraction
Décimal en fraction
Calcul d’arrondi
Calcul d’arrondi
Équations et inéquations : outils de calcul
Équation 1er degré
Équation 1er degré
Système linéaire
Système linéaire
Second degré
Second degré
Valeur absolue
Valeur absolue
Inéquation 2d degré
Inéquation 2d degré
Polynômes : outils de calcul
Binôme de Newton
Binôme de Newton
Racines carrées et racines n-ièmes : outils de calcul
Simplifier racine
Simplifier racine
Calcul de racine
Calcul de racine
Puissances et logarithmes : outils de calcul
Puissances
Puissances
Logarithmes
Logarithmes
Nombre de chiffres
Nombre de chiffres
Écriture scientifique
Écriture scientifique
Calcul scientifique
Calcul scientifique
Demi-vie
Demi-vie
Nombres complexes : outils de calcul
Nombres complexes
Nombres complexes
Forme trigo.
Forme trigo.
Formule de Moivre
Formule de Moivre
Fonctions et courbes : outils de calcul
Coefficient directeur
Coefficient directeur
Fonction affine
Fonction affine
Proportionnalité
Proportionnalité
Fonction y = ax²
Fonction y = ax²
Distance 2 points
Distance 2 points
Distance 3D
Distance 3D
Point de partage
Point de partage
Distance point-droite
Distance point-droite
Distance GPS
Distance GPS
Forme canonique
Forme canonique
Équation de cercle
Équation de cercle
Coniques
Coniques
Coordonnées polaires
Coordonnées polaires
Suites : outils de calcul
Suite arithmétique
Suite arithmétique
Suite géométrique
Suite géométrique
Suite de Fibonacci
Suite de Fibonacci
Suite récurrente
Suite récurrente
Vecteurs : outils de calcul
Calcul de vecteurs
Calcul de vecteurs
Produit vectoriel
Produit vectoriel
Matrices : outils de calcul
Calcul matriciel
Calcul matriciel
Déterminant
Déterminant
Matrice inverse
Matrice inverse
Géométrie plane : outils de calcul
Cos, sin, tan
Cos, sin, tan
Degrés ⇔ radians
Degrés ⇔ radians
a sin θ + b cos θ
a sin θ + b cos θ
Calcul triangle
Calcul triangle
Aire d’un triangle
Aire d’un triangle
Triangle rectangle
Triangle rectangle
Pythagore
Pythagore
Angles polygone
Angles polygone
Similitude
Similitude
Droites parallèles
Droites parallèles
Aire rectangle
Aire rectangle
Aire parallélogramme
Aire parallélogramme
Aire trapèze
Aire trapèze
Cercle et disque
Cercle et disque
Aire secteur
Aire secteur
Angle inscrit
Angle inscrit
Aire ellipse
Aire ellipse
Géométrie dans l’espace : outils de calcul
Volume cube
Volume cube
Aire du cube
Aire du cube
Volume pavé droit
Volume pavé droit
Aire pavé droit
Aire pavé droit
Volume cylindre
Volume cylindre
Aire cylindre
Aire cylindre
Volume sphère
Volume sphère
Aire sphère
Aire sphère
Volume calotte
Volume calotte
Aire calotte
Aire calotte
Volume ellipsoïde
Volume ellipsoïde
Aire ellipsoïde
Aire ellipsoïde
Volume pyramide
Volume pyramide
Aire pyramide
Aire pyramide
Volume cône
Volume cône
Aire du cône
Aire du cône
Tronc de cône
Tronc de cône
Aire tronc de cône
Aire tronc de cône
Volume d’un tube
Volume d’un tube
Volume capsule
Volume capsule
Aire capsule
Aire capsule
Dates et heures : outils de calcul
Calcul d’âge
Calcul d’âge
Jours entre dates
Jours entre dates
Calcul de date
Calcul de date
Dans X heures
Dans X heures
Quel jour ?
Quel jour ?
Calcul d’heures
Calcul d’heures
Décalage horaire
Décalage horaire
Heures travaillées
Heures travaillées
Calcul de durée
Calcul de durée
Feuille de temps
Feuille de temps
Finance et économie : outils de calcul
Intérêts composés
Intérêts composés
Intérêts simples
Intérêts simples
Calcul d’épargne
Calcul d’épargne
Calcul financier
Calcul financier
Valeur actuelle
Valeur actuelle
Valeur acquise
Valeur acquise
Calcul du ROI
Calcul du ROI
Calcul du TRI
Calcul du TRI
Délai de récupération
Délai de récupération
Rendement moyen
Rendement moyen
Calcul du PIB
Calcul du PIB
Marketing web et indicateurs publicitaires : outils de calcul
Calcul du CTR
Calcul du CTR
Taux de conversion
Taux de conversion
CPC, CPM et CPA
CPC, CPM et CPA
Calcul du ROAS
Calcul du ROAS
CPA maximum
CPA maximum
Calcul de la LTV
Calcul de la LTV
Calcul du CAC
Calcul du CAC
Taux d’attrition
Taux d’attrition
Test A/B
Test A/B
Échantillon A/B
Échantillon A/B
Trafic SEO
Trafic SEO
Seuil de rentabilité
Seuil de rentabilité
Marge ou marque
Marge ou marque
Calcul du TCAM
Calcul du TCAM
Santé et forme : outils de calcul
Calcul IMC
Calcul IMC
Cycles de sommeil
Cycles de sommeil
Besoins caloriques
Besoins caloriques
Métabolisme de base
Métabolisme de base
Calcul TDEE
Calcul TDEE
Poids idéal
Poids idéal
Masse grasse
Masse grasse
Masse maigre
Masse maigre
Calories brûlées
Calories brûlées
Calcul protéines
Calcul protéines
Calcul des macros
Calcul des macros
Calcul glucides
Calcul glucides
Apport en lipides
Apport en lipides
Taille future
Taille future
Sport : outils de calcul
Index de golf
Index de golf
Calcul d’allure
Calcul d’allure
Calcul du 1RM
Calcul du 1RM
FC cible
FC cible
Météo : outils de calcul
Indice de chaleur
Indice de chaleur
Windchill
Windchill
Point de rosée
Point de rosée
Informatique : outils de calcul
Conversion de base
Conversion de base
Sous-réseau IP
Sous-réseau IP
Téléchargement
Téléchargement
Énergie et budget du foyer : outils de calcul
Coût électricité
Coût électricité
kWh en euros
kWh en euros
kWh/an en euros
kWh/an en euros
Puissance clim
Puissance clim
Coût d’une clim
Coût d’une clim
Coût du chauffage
Coût du chauffage
Gaz ou électricité
Gaz ou électricité
Économies LED
Économies LED
Conversion salaire
Conversion salaire
Budget du foyer
Budget du foyer
Voiture : outils de calcul
Coût carburant
Coût carburant
Coût de recharge
Coût de recharge
Électrique vs essence
Électrique vs essence
Consommation réelle
Consommation réelle
Dimension pneu
Dimension pneu
Solaire et batteries : outils de calcul
Production solaire
Production solaire
Nombre de panneaux
Nombre de panneaux
Rentabilité solaire
Rentabilité solaire
Capacité batterie
Capacité batterie
Maison et bricolage : outils de calcul
Calcul carrelage
Calcul carrelage
Calcul escalier
Calcul escalier
Calcul béton
Calcul béton
Surface des murs
Surface des murs
Papier peint
Papier peint
Calcul peinture
Calcul peinture
Calcul parquet
Calcul parquet
Surface de façade
Surface de façade
Calcul de gravier
Calcul de gravier
Dosage mortier
Dosage mortier
Calcul de pente
Calcul de pente
Débit de bois
Débit de bois
CES et densité
CES et densité
Sol vinyle rouleau
Sol vinyle rouleau
Quantité d’isolant
Quantité d’isolant
Taille rideaux
Taille rideaux
Distance TV
Distance TV
Calcul de terreau
Calcul de terreau
Gazon en rouleau
Gazon en rouleau
Calcul parpaings
Calcul parpaings
Calcul briques
Calcul briques
Terrasse bois
Terrasse bois
Longueur de rampe
Longueur de rampe
Avant-trou de vis
Avant-trou de vis
Débit d’air
Débit d’air
Dilution peinture
Dilution peinture
Calcul plinthes
Calcul plinthes
Mesure de store
Mesure de store
Hauteur tableau
Hauteur tableau
Pente d’évacuation
Pente d’évacuation
Calcul de vis
Calcul de vis
Cubage bois (m³)
Cubage bois (m³)
Calcul clôture
Calcul clôture
Retrait du bois
Retrait du bois
Calcul mastic
Calcul mastic
Déperditions
Déperditions
Passage meuble
Passage meuble
Calcul cartons
Calcul cartons
Capacité rangement
Capacité rangement
Découpe panneaux
Découpe panneaux
Flèche étagère
Flèche étagère

Calcul du coefficient de corrélation et de la covariance (nuage de points et droite de régression)

Saisissez les deux séries dont vous voulez étudier le lien, chacune avec des points-virgules (;) entre les nombres. Le coefficient de corrélation r, la covariance et l’équation de la droite de régression sont calculés, et la droite est tracée sur le nuage de points.

Les valeurs de x et de y vont par couples, dans l’ordre (le 1er x avec le 1er y, le 2e x avec le 2e y, etc.). Entrez-en autant de chaque côté (2 couples ou plus). Les nombres décimaux (3,5) et négatifs sont acceptés.
Résultat et graphique
Saisissez vos données x et y séparées par des points-virgules dans les champs à gauche et appuyez sur « Calculer ». Le résultat et le nuage de points s’affichent ici.

Ce que vous pouvez faire sur cette page

  • Entrez des couples de données \((x\,;\,y)\) (deux variables) et obtenez tout de suite le coefficient de corrélation \(r\) et la covariance \(s_{xy}\)
  • La moyenne, la variance et l’écart-type de \(x\) et de \(y\), ainsi que l’équation de la droite de régression (moindres carrés) \(y = ax + b\), sont calculés en même temps
  • Le nuage de points est tracé avec la droite de régression et le point moyen : vous voyez d’un coup d’œil le lien entre les deux séries (croissant, décroissant ou dispersé)
  • Une lecture indicative de la valeur, comme « forte corrélation positive » ou « corrélation faible ou nulle », s’affiche aussi
  • Une explication simple des formules et des formules à copier-coller pour Excel, Google Sheets et Python sont réunies sur cette page
La covariance et les variances sont calculées comme au lycée, en divisant par le nombre de couples \(n\) (la différence avec la version qui divise par \(n-1\) est expliquée dans la partie Excel). Il faut autant de valeurs de \(x\) que de \(y\), et au moins 2 couples.

À quoi sert ce calcul ?

Vérifier en chiffres le lien entre temps de travail et résultats (éducation)

Un usage classique du coefficient de corrélation : vérifier avec des données, et non au feeling, si « les notes montent quand on travaille plus ». En calculant \(r\) à partir des couples (temps de travail ; note) de chaque élève, un seul nombre indique la force du lien.
Les établissements et les organismes de soutien scolaire regardent parfois la corrélation entre matières aux examens blancs (les élèves bons en maths le sont-ils aussi en physique-chimie ?) pour orienter l’accompagnement. Mais une corrélation ne prouve pas la cause, du type « il suffit de travailler plus longtemps pour que la note monte ».

Décider des commandes selon la température et les ventes (commerce et restauration)

On sait que les ventes de glaces et de boissons fraîches ont une corrélation positive avec la température, et celles de soupes et de boissons chaudes une corrélation négative. Les magasins et les restaurants examinent la corrélation dans leurs données passées (température ; quantités vendues) et ajustent leurs commandes et leur mise en avant selon la météo.
En allant jusqu’à la droite de régression, on peut faire une estimation concrète comme « s’il fait 30 °C demain, on vendra environ tant d’unités ».

Réduire le risque en combinant des actifs qui évoluent différemment (finance et placements)

En finance, le coefficient de corrélation entre les variations de prix d’actifs comme les actions, les obligations ou l’or est un outil de base de la diversification. Combiner des actifs peu (ou négativement) corrélés fait que, quand l’un baisse, l’autre a moins de chances de baisser aussi : les hauts et les bas de l’ensemble du portefeuille sont plus petits.
Les caisses de retraite et les fonds de placement analysent toujours les corrélations entre actifs avant de décider de la répartition de leur argent.

Cerner les causes de défauts à partir des conditions de production (industrie et qualité)

Quand les défauts augmentent dans une usine, regarder le coefficient de corrélation entre le taux de défauts et des conditions comme la température de fabrication, l’humidité ou la durée de marche des machines aide à cerner celles qui varient avec les défauts. C’est une méthode si basique que le nuage de points (diagramme de dispersion) fait partie des « 7 outils de la qualité ».
Une fois trouvée une condition fortement corrélée, l’étape suivante est une expérience où l’on change cette condition pour confirmer la causalité, puis viennent les améliorations.

Un point de départ pour la recherche en santé (médecine et épidémiologie)

Les études sur le mode de vie et la santé, comme « activité physique et tension artérielle » ou « tabac et risque d’une maladie », commencent elles aussi par vérifier la corrélation dans les données.
C’est aussi là qu’on apprend à ne pas confondre corrélation et cause. Exemple célèbre : les ventes de glaces et le nombre de noyades ont une corrélation positive. Les deux augmentent simplement avec un facteur commun, la chaleur. La recherche médicale utilise de nombreuses méthodes pour éliminer ces facteurs de confusion et se rapprocher d’une vraie causalité.

Formules et figures

Covariance \(s_{xy}\)
Figure
Notation mathématique (l’écriture habituelle)
\(s_{xy}\) \(=\) \(\displaystyle\sum_{i=1}^{n}\) \((x_i - \bar{x})\) \((y_i - \bar{y})\) \(\div\) \(n\)
En mots (les symboles remplacés par des mots)
⑤ \(s_{xy}\) : covariance \(=\) ③ \(\displaystyle\sum\) : on additionne tout ① \((x_i - \bar{x})\) : écart de \(x\) ② \((y_i - \bar{y})\) : écart de \(y\) \(\div\) ④ \(n\) : nombre de couples
La formule en mots
① Pour chaque couple, on prend l’écart de \(x\) (la valeur de \(x\) moins la moyenne de \(x\))
② on le multiplie par l’écart de \(y\) (la valeur de \(y\) moins la moyenne de \(y\))
③ puis on additionne tous ces produits \(\displaystyle\sum\)
④ on divise le total par le \(n\) : nombre de couples
⑤ et on obtient la \(s_{xy}\) : covariance
Exemple simple
Si le temps de travail \(x\) (en heures) de 5 élèves vaut 1 ; 2 ; 3 ; 4 ; 5 et leurs notes \(y\) (en points) 2 ; 4 ; 4 ; 4 ; 6 (moyennes \(\bar{x} = 3\) et \(\bar{y} = 4\)), alors
\(s_{xy}\) : covariance \(=\) somme des produits des écarts (8) \(\div\) nombre de couples (5)
\((-2)(-2) + (-1)(0) + (0)(0) + (1)(0) + (2)(2) = 4 + 0 + 0 + 0 + 4 = 8\)
\(s_{xy} = 8 \div 5 = 1{,}6\)
L’idée clé
La covariance traduit en nombre « la tendance de deux séries à varier ensemble ». Si beaucoup de couples ont \(x\) et \(y\) tous les deux au-dessus de leur moyenne (+ × +) ou tous les deux en dessous (− × −), la somme des produits est positive. Si beaucoup de couples ont un seul des deux au-dessus de sa moyenne (+ × −), la somme est négative. Une covariance positive signifie donc « plus \(x\) est grand, plus \(y\) a tendance à l’être » (le nuage de points monte vers la droite), une covariance négative « plus \(x\) est grand, plus \(y\) a tendance à être petit » (il descend), et une covariance proche de 0 « pas de tendance nette ». Comme au lycée, le dénominateur est le nombre de couples \(n\), comme pour la variance. Les logiciels de statistique proposent aussi une covariance « d’échantillon » qui divise par \(n-1\), et Excel les distingue par le nom de la fonction (voir la partie Excel).
Coefficient de corrélation \(r\)
Figure
Notation mathématique (l’écriture habituelle)
\(r\) \(=\) \(s_{xy}\) \(\div\) \((\) \(s_x\) \(\times\) \(s_y\) \()\)
En mots (les symboles remplacés par des mots)
④ \(r\) : coefficient de corrélation \(=\) ① \(s_{xy}\) : covariance \(\div\) \((\) ② \(s_x\) : écart-type de \(x\) \(\times\) ③ \(s_y\) : écart-type de \(y\) \()\)
La formule en mots
① On divise la \(s_{xy}\) : covariance
② par le produit de l’\(s_x\) : écart-type de \(x\)
③ et de l’\(s_y\) : écart-type de \(y\)
④ et on obtient le \(r\) : coefficient de corrélation (\(r\) est toujours compris entre \(-1\) et \(1\))
Exemple simple
Avec le même exemple du temps de travail et des notes (\(s_{xy} = 1{,}6\), \(s_x = \sqrt{2}\), \(s_y = \sqrt{1{,}6}\))
\(r\) : coefficient de corrélation \(=\) covariance (1,6) \(\div\) \((\) \(\sqrt{2}\) \(\times\) \(\sqrt{1{,}6}\) \()\)
\(s_x \times s_y = \sqrt{2} \times \sqrt{1{,}6} = \sqrt{3{,}2} \approx 1{,}789\)
\(r = 1{,}6 \div 1{,}789 \approx 0{,}894\)
L’idée clé
La covariance est utile, mais elle dépend des unités (passer des heures aux minutes suffit à la multiplier par 60). En la divisant par les écarts-types de \(x\) et de \(y\), on obtient un nombre entre \(-1\) et \(1\) qui ne dépend plus des unités : c’est le coefficient de corrélation \(r\). Plus \(r\) est proche de \(1\), plus la corrélation positive est forte (points proches d’une droite qui monte) ; plus il est proche de \(-1\), plus la corrélation négative est forte (droite qui descend) ; plus il est proche de \(0\), plus le lien linéaire est faible. Repères courants : \(0{,}7 \leqslant |r|\) pour une corrélation forte, \(0{,}4 \leqslant |r| < 0{,}7\) pour une corrélation modérée, \(0{,}2 \leqslant |r| < 0{,}4\) pour une corrélation faible et \(|r| < 0{,}2\) pour une corrélation faible ou nulle (les seuils varient selon les domaines). Attention : le coefficient de corrélation ne mesure qu’un lien en ligne droite. Pour un lien en forme de U, \(r\) peut être proche de 0 alors qu’il existe bien un lien. Et une corrélation n’est pas une causalité (l’un n’est pas forcément la cause de l’autre). Il est aussi très sensible aux valeurs aberrantes : regardez toujours le nuage de points.
Droite de régression (moindres carrés) \(y = ax + b\)
Figure
Notation mathématique (l’écriture habituelle)
\(a\) \(=\) \(s_{xy}\) \(\div\) \(s_x^{2}\)
\(b\) \(=\) \(\bar{y}\) \(-\) \(a\,\bar{x}\)
En mots (les symboles remplacés par des mots)
③ \(a\) : coefficient directeur de la droite de régression \(=\) ① \(s_{xy}\) : covariance \(\div\) ② \(s_x^2\) : variance de \(x\)
⑥ \(b\) : ordonnée à l’origine de la droite de régression \(=\) ④ \(\bar{y}\) : moyenne de \(y\) \(-\) ⑤ coefficient directeur \(a\) × moyenne de \(x\) \(\bar{x}\)
La formule en mots
① On divise la \(s_{xy}\) : covariance
② par la \(s_x^2\) : variance de \(x\)
③ et on obtient le \(a\) : coefficient directeur de la droite de régression .
④ À la \(\bar{y}\) : moyenne de \(y\)
⑤ on retranche le produit du coefficient directeur \(a\) par la moyenne de \(x\), \(\bar{x}\)
⑥ et on obtient l’\(b\) : ordonnée à l’origine de la droite de régression
Exemple simple
Avec le même exemple (\(s_{xy} = 1{,}6\), \(s_x^2 = 2\), \(\bar{x} = 3\), \(\bar{y} = 4\))
coefficient directeur \(a\) \(=\) covariance (1,6) \(\div\) variance de \(x\) (2)
\(a = 1{,}6 \div 2 = 0{,}8\)
\(b = 4 - 0{,}8 \times 3 = 1{,}6\)
\(y = 0{,}8x + 1{,}6\)
L’idée clé
La droite de régression est la droite qui s’ajuste le mieux au nuage de points. On la choisit pour que la somme des carrés des écarts verticaux (des erreurs) entre chaque point et la droite soit la plus petite possible. Cette façon de choisir la droite s’appelle la méthode des moindres carrés (les seuls calculs nécessaires sont la division et la soustraction ci-dessus). La droite de régression passe toujours par le point moyen \(G(\bar{x}\,;\,\bar{y})\). Vous pouvez le vérifier sur le nuage de points de cette page. Avec cette droite, on peut faire des prévisions comme « avec 3,5 heures de travail, la note sera d’environ \(0{,}8 \times 3{,}5 + 1{,}6 = 4{,}4\) points ». Mais une prévision qui prolonge la droite loin de la plage des données n’est pas fiable, et quand la corrélation est faible, une prévision tirée de la droite n’a guère de sens. Cette page écrit la droite \(y = ax + b\) (\(a\) : coefficient directeur, \(b\) : ordonnée à l’origine), comme les manuels de lycée et les calculatrices en mode statistique.
Pour trouver le coefficient de corrélation : 1) calculez les moyennes de \(x\) et de \(y\) ; 2) additionnez tous les produits des écarts \((x_i - \bar{x})(y_i - \bar{y})\) et divisez par le nombre de couples \(n\) pour obtenir la covariance \(s_{xy}\) ; 3) divisez la covariance par le produit des écarts-types de \(x\) et de \(y\). \(r\) est toujours compris entre \(-1\) et \(1\) : plus il est proche de \(1\), plus le lien linéaire croissant est fort ; plus il est proche de \(-1\), plus le lien linéaire décroissant est fort.

Symboles et termes

Symboles

\(x_i,\ y_i\) x indice i, y indice i La valeur de \(x\) et la valeur de \(y\) du \(i\)-ième couple (exemple : le temps de travail \(x_3\) et la note \(y_3\) du 3e élève). \(i\) est une lettre souvent utilisée pour un indice (un numéro).
\(n\) n Le nombre de couples, initiale de « nombre » (exemple : pour les couples de 5 élèves, \(n = 5\)).
\(\bar{x},\ \bar{y}\) x barre, y barre Les moyennes de \(x\) et de \(y\). La barre au-dessus d’une lettre est la façon habituelle de noter une moyenne. Le point \(G(\bar{x}\,;\,\bar{y})\) est le point moyen.
\(x_i - \bar{x}\) x indice i moins x barre L’écart de \(x\) à sa moyenne : il indique à quelle distance chaque valeur se trouve de la moyenne de \(x\). \(y_i - \bar{y}\) est l’écart de \(y\).
\(s_{xy}\) s indice x y La covariance de \(x\) et \(y\), c’est-à-dire la moyenne des produits des écarts. Elle traduit la tendance des deux séries à varier ensemble. On la note aussi \(\operatorname{cov}(x\,;\,y)\) dans les manuels français. La lettre \(s\) est la lettre habituelle des indicateurs de la même famille que l’écart-type.
\(s_x,\ s_y\) s indice x, s indice y Les écarts-types de \(x\) et de \(y\) (la taille de leur dispersion). Ce sont les racines carrées des variances. On les note aussi \(\sigma_x\) et \(\sigma_y\).
\(s_x^2,\ s_y^2\) s indice x au carré, s indice y au carré Les variances de \(x\) et de \(y\) : la moyenne des carrés des écarts (on divise par \(n\)).
\(r\) r Le coefficient de corrélation. La lettre viendrait du \(r\) de « relation » (ou de l’anglais « correlation »). Il est toujours compris entre \(-1\) et \(1\).
\(\sum\) sigma (symbole de somme) Un symbole qui veut dire « additionner tout ». \(\sum_{i=1}^{n}\) se lit « somme pour \(i\) allant de 1 à \(n\) ».
\(a,\ b\) a, b Le coefficient directeur et l’ordonnée à l’origine de la droite de régression \(y = ax + b\). Ce sont les mêmes lettres que pour une fonction affine.

Termes

corrélation Une tendance linéaire entre deux séries, où l’une augmente quand l’autre augmente (ou diminue). Plus elle est forte, plus les points du nuage de points sont proches d’une droite.
corrélation positive La tendance de \(y\) à augmenter quand \(x\) augmente. Le nuage de points monte vers la droite et le coefficient de corrélation est positif.
corrélation négative La tendance de \(y\) à diminuer quand \(x\) augmente. Le nuage de points descend vers la droite et le coefficient de corrélation est négatif.
coefficient de corrélation Un nombre entre \(-1\) et \(1\) qui indique la force et le sens d’une corrélation (on dit aussi coefficient de corrélation linéaire, ou de Pearson). On l’obtient en divisant la covariance par le produit des écarts-types de \(x\) et de \(y\). Comme il ne dépend pas des unités, on peut comparer sa force d’une série à l’autre.
covariance La moyenne des produits des écarts de \(x\) et de \(y\). Positive, elle indique une tendance croissante ; négative, une tendance décroissante. Cette page divise par le nombre de couples \(n\), comme au lycée.
nuage de points Un graphique où chaque couple \((x\,;\,y)\) est placé comme un point dans un repère. La forme du nuage montre d’un coup d’œil le sens et la force d’une corrélation.
point moyen Le point \(G(\bar{x}\,;\,\bar{y})\) dont les coordonnées sont les moyennes de \(x\) et de \(y\). La droite de régression passe toujours par ce point.
variable Une grandeur que l’on mesure, comme une taille, une note ou une température. Cette page étudie le lien entre deux variables, \(x\) et \(y\) (statistique à deux variables).
écart La différence entre une valeur et la moyenne (écart à la moyenne). Positif, il indique une valeur au-dessus de la moyenne ; négatif, en dessous. La covariance, la variance et l’écart-type sont tous construits à partir des écarts.
variance La moyenne des carrés des écarts. Elle mesure la dispersion des données. Elle apparaît au dénominateur du coefficient directeur de la droite de régression.
écart-type La racine carrée de la variance. Il s’exprime dans la même unité que les données, ce qui en fait une mesure de dispersion facile à utiliser. Il apparaît au dénominateur du coefficient de corrélation.
droite de régression (droite d’ajustement) La droite \(y = ax + b\) qui s’ajuste le mieux au nuage de points (on dit aussi droite des moindres carrés). Elle sert à prévoir une valeur de \(y\) à partir d’une valeur de \(x\).
méthode des moindres carrés Une façon de choisir le coefficient directeur et l’ordonnée à l’origine d’une droite pour que la somme des carrés des écarts verticaux (des erreurs) entre les points et la droite soit la plus petite possible. La droite de régression est la droite choisie ainsi.
valeur aberrante Une valeur très éloignée des autres points. Le coefficient de corrélation y est très sensible : vérifiez-le toujours avec le nuage de points.
lien statistique Un lien entre deux grandeurs qui varient ensemble (quand l’une augmente, l’autre augmente ou diminue). Même avec une corrélation, l’une n’est pas forcément la cause de l’autre (causalité) : il peut simplement y avoir une cause commune derrière les deux (un facteur de confusion).
causalité (lien de cause à effet) Un lien où l’une des choses est la cause et l’autre sa conséquence. Un lien statistique (varier ensemble) ne suffit pas à montrer une causalité : il peut simplement y avoir une cause commune derrière les deux (un facteur de confusion).

Ce qu’il est utile de savoir avant de commencer

Voici ce qui vous aide à utiliser le calcul de cette page en le comprenant vraiment, et pas seulement en appuyant sur le bouton.
Si vous bloquez, revenir sur ces notions est le plus court chemin.

La moyenne (5e, 12-13 ans)
  • Savoir que moyenne = somme ÷ nombre de valeurs
  • Comprendre que la moyenne donne une idée du centre des données
Nombres relatifs (5e-4e, 12-14 ans)
  • Savoir multiplier des nombres relatifs, comme \((-1) \times 2 = -2\) et \((-2) \times (-2) = 4\)
  • Savoir que le produit de deux nombres négatifs est positif (c’est la base du sens du signe de la covariance)
Repère et fonctions affines (4e-3e, 13-15 ans)
  • Savoir placer un couple \((x\,;\,y)\) comme point dans un repère (un nuage de points est un ensemble de tels points)
  • Savoir que dans une fonction affine \(y = ax + b\), \(a\) est le coefficient directeur et \(b\) l’ordonnée à l’origine (la droite de régression a cette forme)
Racines carrées (4e-3e, 13-15 ans)
  • Comprendre la racine carrée comme « le nombre positif dont le carré donne ce nombre », comme \(\sqrt{9} = 3\)
  • Savoir multiplier des racines carrées, comme \(\sqrt{2} \times \sqrt{1{,}6} = \sqrt{3{,}2}\)
Statistique à deux variables (lycée, 16-18 ans)
  • Savoir ce que représente un écart (la différence entre une valeur et la moyenne)
  • Savoir que la variance et l’écart-type traduisent la dispersion en nombre (vous pouvez les revoir sur la page liée du calcul de l’écart-type)
  • Savoir lire sur un nuage de points si les points montent, descendent ou sont dispersés

Calculer avec Excel

Copiez tout le tableau ci-dessous et collez-le dans la cellule A1 d’Excel. Il fonctionne tel quel.
Tableau pour trouver la covariance s_xy
x du couple 1 1
x du couple 2 2
x du couple 3 3
x du couple 4 4
x du couple 5 5
y du couple 1 2
y du couple 2 4
y du couple 3 4
y du couple 4 4
y du couple 5 6
Covariance s_xy (÷ n) =COVARIANCE.PEARSON(B1:B5;B6:B10)
(Pour comparer) covariance d’échantillon (÷ (n−1)) =COVARIANCE.STANDARD(B1:B5;B6:B10)
Tableau pour trouver le coefficient de corrélation r
x du couple 1 1
x du couple 2 2
x du couple 3 3
x du couple 4 4
x du couple 5 5
y du couple 1 2
y du couple 2 4
y du couple 3 4
y du couple 4 4
y du couple 5 6
Coefficient de corrélation r =COEFFICIENT.CORRELATION(B1:B5;B6:B10)
(Pour comparer) même valeur avec PEARSON =PEARSON(B1:B5;B6:B10)
Tableau pour trouver la droite de régression y = ax + b
x du couple 1 1
x du couple 2 2
x du couple 3 3
x du couple 4 4
x du couple 5 5
y du couple 1 2
y du couple 2 4
y du couple 3 4
y du couple 4 4
y du couple 5 6
Coefficient directeur a =PENTE(B6:B10;B1:B5)
Ordonnée à l’origine b =ORDONNEE.ORIGINE(B6:B10;B1:B5)
Tableau pour trouver les moyennes, les variances et les écarts-types (÷ n)
x du couple 1 1
x du couple 2 2
x du couple 3 3
x du couple 4 4
x du couple 5 5
y du couple 1 2
y du couple 2 4
y du couple 3 4
y du couple 4 4
y du couple 5 6
Moyenne de x x̄ =MOYENNE(B1:B5)
Moyenne de y ȳ =MOYENNE(B6:B10)
Variance de x s_x² =VAR.P(B1:B5)
Écart-type de x s_x =ECARTYPEP(B1:B5)
Variance de y s_y² =VAR.P(B6:B10)
Écart-type de y s_y =ECARTYPEP(B6:B10)
Après le collage, les cellules B1 à B5 reçoivent x, les cellules B6 à B10 reçoivent y, et les cellules en vert et en gras se calculent automatiquement.
La covariance du premier tableau vaut 1,6 (la covariance d’échantillon vaut 2), le coefficient de corrélation du deuxième environ 0,8944, et le troisième donne un coefficient directeur de 0,8 et une ordonnée à l’origine de 1,6.
Attention, il existe deux fonctions de covariance. COVARIANCE.PEARSON divise par n (comme ce calculateur et comme au lycée), et COVARIANCE.STANDARD divise par n − 1 (covariance d’échantillon). Dans les anciennes versions d’Excel (2007 et avant), utilisez COVARIANCE à la place de COVARIANCE.PEARSON.
COEFFICIENT.CORRELATION et PEARSON donnent le même coefficient de corrélation (r est le même qu’on divise par n ou par n − 1 : il n’y a pas de choix à faire).
PENTE et ORDONNEE.ORIGINE prennent d’abord la plage des y, puis celle des x (attention, x ne vient pas en premier).
Pour un autre nombre de couples, ajoutez (ou supprimez) des lignes de nombres, puis remplacez « B1:B5 » et « B6:B10 » dans les formules par vos vraies plages de données.

Calculer avec Google Sheets

Copiez tout le tableau ci-dessous et collez-le dans la cellule A1 de Google Sheets. Il fonctionne tel quel.
Tableau pour trouver la covariance s_xy
x du couple 1 1
x du couple 2 2
x du couple 3 3
x du couple 4 4
x du couple 5 5
y du couple 1 2
y du couple 2 4
y du couple 3 4
y du couple 4 4
y du couple 5 6
Covariance s_xy (÷ n) =COVARIANCE(B1:B5;B6:B10)
Tableau pour trouver le coefficient de corrélation r
x du couple 1 1
x du couple 2 2
x du couple 3 3
x du couple 4 4
x du couple 5 5
y du couple 1 2
y du couple 2 4
y du couple 3 4
y du couple 4 4
y du couple 5 6
Coefficient de corrélation r =COEFFICIENT.CORRELATION(B1:B5;B6:B10)
Tableau pour trouver la droite de régression y = ax + b
x du couple 1 1
x du couple 2 2
x du couple 3 3
x du couple 4 4
x du couple 5 5
y du couple 1 2
y du couple 2 4
y du couple 3 4
y du couple 4 4
y du couple 5 6
Coefficient directeur a =PENTE(B6:B10;B1:B5)
Ordonnée à l’origine b =ORDONNEE.ORIGINE(B6:B10;B1:B5)
Presque les mêmes fonctions que dans Excel fonctionnent telles quelles dans Google Sheets en français. Copiez tout le tableau, collez-le dans la cellule A1 et remplacez B1 à B10 par vos propres nombres.
La covariance qui divise par n s’obtient avec la fonction COVARIANCE (même définition que ce calculateur). Le coefficient de corrélation utilise COEFFICIENT.CORRELATION, comme dans Excel.

Calculer avec Python

import statistics

xs = [1, 2, 3, 4, 5]      # valeurs de x (exemple : temps de travail)
ys = [2, 4, 4, 4, 6]      # valeurs de y (exemple : note)

n = len(xs)
mean_x = statistics.mean(xs)      # moyenne de x
mean_y = statistics.mean(ys)      # moyenne de y

# covariance s_xy (on divise par n, comme au lycée)
covariance = sum((x - mean_x) * (y - mean_y) for x, y in zip(xs, ys)) / n

sd_x = statistics.pstdev(xs)      # écart-type de x (on divise par n)
sd_y = statistics.pstdev(ys)      # écart-type de y (on divise par n)

r = covariance / (sd_x * sd_y)    # coefficient de corrélation

slope = covariance / statistics.pvariance(xs)   # coefficient directeur a de la droite de régression
intercept = mean_y - slope * mean_x             # ordonnée à l’origine b de la droite de régression

print(f"Covariance s_xy : {covariance}")
print(f"Coefficient de corrélation r : {r}")
# l’ordonnée à l’origine peut présenter une erreur d’arrondi (1.5999...) : on l’arrondit à 10 chiffres significatifs
print(f"Droite de régression : y = {slope:.10g}x + {intercept:.10g}")
Fonctionne avec la seule bibliothèque standard (le module statistics). pstdev et pvariance, qui commencent par « p », divisent par n. À l’exécution, cet exemple affiche une covariance de 1,6, un coefficient de corrélation de 0,894… et la droite de régression y = 0,8x + 1,6 (Python écrit les nombres décimaux avec un point). Dans les versions récentes de Python, statistics.correlation(xs, ys) donne le même coefficient de corrélation (r est le même qu’on divise par n ou par n − 1). En revanche, statistics.covariance(xs, ys) divise par n − 1 : pour retrouver la covariance de cette page, calculez-la comme dans l’exemple ci-dessus.

Écrire la formule en LaTeX et autres langages mathématiques (à copier-coller)

Covariance \(s_{xy}\)
s_xy = {(x₁ − x̄)(y₁ − ȳ) + … + (xₙ − x̄)(yₙ − ȳ)} ÷ n
s_{xy} = \dfrac{1}{n}\sum_{i=1}^{n} (x_i - \bar{x})(y_i - \bar{y})
<math xmlns="http://www.w3.org/1998/Math/MathML" display="block">
  <mrow>
    <msub><mi>s</mi><mrow><mi>x</mi><mi>y</mi></mrow></msub>
    <mo>=</mo>
    <mfrac><mn>1</mn><mi>n</mi></mfrac>
    <munderover>
      <mo>&#x2211;</mo>
      <mrow><mi>i</mi><mo>=</mo><mn>1</mn></mrow>
      <mi>n</mi>
    </munderover>
    <mrow>
      <mo>(</mo><msub><mi>x</mi><mi>i</mi></msub><mo>&#x2212;</mo><mover><mi>x</mi><mo>&#x00AF;</mo></mover><mo>)</mo>
      <mo>(</mo><msub><mi>y</mi><mi>i</mi></msub><mo>&#x2212;</mo><mover><mi>y</mi><mo>&#x00AF;</mo></mover><mo>)</mo>
    </mrow>
  </mrow>
</math>
s_(xy) = (1/n) sum_(i=1)^n (x_i - bar x)(y_i - bar y)
Covariance[xdata, ydata]*(Length[xdata] - 1)/Length[xdata]  (* Covariance divise par n-1 : on la ramène à la valeur divisée par n *)
s_xy := add((x[i] - x_bar)*(y[i] - y_bar), i = 1 .. n)/n;
s_xy = mean((x - mean(x)).*(y - mean(y)));
s_xy = (1/n) ∑_(i=1)^n (x_i − x̄)(y_i − ȳ)
Coefficient de corrélation \(r\)
r = s_xy ÷ (s_x × s_y)
r = \dfrac{s_{xy}}{s_x\, s_y}
<math xmlns="http://www.w3.org/1998/Math/MathML" display="block">
  <mrow>
    <mi>r</mi>
    <mo>=</mo>
    <mfrac>
      <msub><mi>s</mi><mrow><mi>x</mi><mi>y</mi></mrow></msub>
      <mrow><msub><mi>s</mi><mi>x</mi></msub><msub><mi>s</mi><mi>y</mi></msub></mrow>
    </mfrac>
  </mrow>
</math>
r = s_(xy) / (s_x s_y)
Correlation[xdata, ydata]
r := s_xy/(s_x*s_y);
R = corrcoef(x, y); r = R(1, 2);
r = s_xy/(s_x s_y)
Droite de régression (moindres carrés) \(y = ax + b\)
y = ax + b,  a = s_xy ÷ s_x²,  b = ȳ − a·x̄
y = ax + b, \quad a = \dfrac{s_{xy}}{s_x^{2}}, \quad b = \bar{y} - a\bar{x}
<math xmlns="http://www.w3.org/1998/Math/MathML" display="block">
  <mrow>
    <mi>y</mi><mo>=</mo><mi>a</mi><mi>x</mi><mo>+</mo><mi>b</mi>
    <mo>,</mo><mspace width="1em"/>
    <mi>a</mi><mo>=</mo>
    <mfrac>
      <msub><mi>s</mi><mrow><mi>x</mi><mi>y</mi></mrow></msub>
      <msubsup><mi>s</mi><mi>x</mi><mn>2</mn></msubsup>
    </mfrac>
    <mo>,</mo><mspace width="1em"/>
    <mi>b</mi><mo>=</mo>
    <mover><mi>y</mi><mo>&#x00AF;</mo></mover>
    <mo>&#x2212;</mo>
    <mi>a</mi><mover><mi>x</mi><mo>&#x00AF;</mo></mover>
  </mrow>
</math>
y = a x + b, a = s_(xy)/s_x^2, b = bar y - a bar x
lm = LinearModelFit[Transpose[{xdata, ydata}], t, t]; lm["BestFitParameters"]
a := s_xy/s_x^2; b := y_bar - a*x_bar;
p = polyfit(x, y, 1);  % p(1) = coefficient directeur a, p(2) = ordonnée à l’origine b
y = ax + b,  a = s_xy/s_x^2,  b = ȳ − ax̄

Faire faire le calcul par ChatGPT 

Tu es un assistant de calcul en statistique. Fais le calcul suivant en exécutant réellement du code Python, et appuie ta réponse uniquement sur les nombres obtenus à l’exécution (ne réponds pas de tête ni par estimation).

Pour la série statistique à deux variables suivante, calcule chacune des valeurs ci-dessous.
x : 1 ; 2 ; 3 ; 4 ; 5
y : 2 ; 4 ; 4 ; 4 ; 6
1. Les moyennes de x et de y, et leurs variances et écarts-types en divisant par n
2. La covariance s_xy (somme des produits des écarts divisée par le nombre de couples n ; ne divise pas par n − 1)
3. Le coefficient de corrélation r
4. Le coefficient directeur a et l’ordonnée à l’origine b de la droite de régression y = ax + b (méthode des moindres carrés)

Montre les formules utilisées et les nombres obtenus à l’exécution. Réponds en français, avec la virgule comme séparateur décimal.

Mode d'emploi
  1. 1
    Saisissez vos nombres
    Tapez les nombres à calculer dans les champs de saisie
  2. 2
    Calculez
    Appuyez sur le bouton « Calculer »
  3. 3
    Lisez le résultat
    Le résultat s’affiche aussitôt. La même page explique aussi le raisonnement et la formule
  Les atouts de DataChef
Simple et gratuit
Conversions gratuites et illimitées
Aucune compétence requise – simple et intuitif
Aucune inscription requise
Utilisable dès l'ouverture de la page
Aucune donnée personnelle nécessaire
Sûr et fiable
Connexion fortement chiffrée (SSL)
Le fichier est supprimé automatiquement après le téléchargement
Rapide
Affichage et conversion rapides, sans attente
Sans filigrane
Aucun filigrane
Aucune mention de crédit nécessaire
Usage commercial autorisé
Usage commercial gratuit
Aucune autorisation préalable nécessaire