Aller au contenu principal

Corrélation, régression et moindres carrés

Ce que ce chapitre apporte

  • Construire et lire un nuage de points pour une série statistique double.
  • Calculer une covariance et un coefficient de corrélation linéaire, et les interpréter.
  • Déterminer la droite de régression par la méthode des moindres carrés.
  • Utiliser la droite pour prédire, en connaissant le domaine de validité.
  • Distinguer corrélation et causalité, et reconnaître une corrélation trompeuse.
  • Mener l'analyse complète sur un jeu de données réel en Python.

Décrire une colonne ne fait pas décider. Une question du type quels jours ouvrir un service de location ? demande de relier deux colonnes : la température et la fréquentation, l'humidité et la fréquentation. Ce chapitre installe les trois outils de la statistique à deux variables. Le nuage de points, qu'on regarde en premier. Le coefficient de corrélation, qui chiffre l'alignement. La droite des moindres carrés, qui permet de prédire. Et il installe surtout les deux réserves qui vont avec : une droite ne vaut que sur la plage où elle a été construite, et une corrélation ne prouve aucune causalité.

Une série double

Quand on observe deux caractères sur les mêmes individus, chaque individu devient un couple (xi,yi)(x_i, y_i). Le nuage de points place ces couples dans un repère : c'est la première chose à tracer, avant tout calcul.

Le point moyen G(xˉ,yˉ)G(\bar{x}, \bar{y}), où xˉ\bar{x} et yˉ\bar{y} sont les moyennes des deux séries, est le centre de gravité du nuage. Il servira de point d'ancrage à toute la suite. Moyenne, variance et écart-type d'une série simple sont posés dans le chapitre sur les statistiques.

On note NN le nombre d'individus, V(X)V(X) la variance de la série des xix_i et σ(X)=V(X)\sigma(X) = \sqrt{V(X)} son écart-type ; de même pour YY.

Le nuage d'abord, les indicateurs ensuite

Tous les indicateurs de ce chapitre supposent une relation linéaire. Sur une relation en cloche ou en marches d'escalier, ils donnent des nombres parfaitement calculables et parfaitement trompeurs. Le nuage est le seul moyen de savoir si l'hypothèse tient, et il coûte une ligne de code.

Le nuage montre. Il ne chiffre pas, et un rapport demande un nombre. Le premier à construire est celui qui dit si les deux colonnes bougent dans le même sens.

Covariance

Définition

La covariance de la série double mesure si XX et YY varient dans le même sens :

cov(X,Y)=1Ni=1N(xixˉ)(yiyˉ)=1Ni=1Nxiyixˉyˉ\operatorname{cov}(X, Y) = \frac{1}{N} \sum_{i=1}^{N} (x_i - \bar{x})(y_i - \bar{y}) = \frac{1}{N} \sum_{i=1}^{N} x_i y_i - \bar{x}\,\bar{y}

En clair, la première forme se lit : « pour chaque individu, multiplier son écart à la moyenne des xx par son écart à la moyenne des yy, puis faire la moyenne de ces produits ». La seconde se lit : « moyenne des produits xiyix_i y_i, moins le produit des deux moyennes ». Les deux donnent le même nombre ; la seconde évite de calculer les moyennes avant de parcourir les données.

Chaque terme de la première forme est positif quand xix_i et yiy_i sont tous deux du même côté de leur moyenne, négatif sinon. La seconde forme est celle qu'on utilise en calcul : un seul passage sur les données. Le signe est ce qui compte : covariance positive, les deux grandeurs augmentent ensemble ; négative, l'une monte quand l'autre descend ; nulle, aucune tendance linéaire.

La covariance ne se compare pas d'un jeu de données à l'autre

Elle porte le produit des unités (des « degrés × locations ») et change si on passe des degrés Celsius aux dixièmes de degré. Une covariance de 65 ne veut rien dire dans l'absolu. C'est précisément pour cela qu'on la normalise.

Coefficient de corrélation linéaire

Définition
r=cov(X,Y)σ(X)×σ(Y)r = \frac{\operatorname{cov}(X, Y)}{\sigma(X) \times \sigma(Y)}

rr est sans unité et toujours compris entre 1-1 et 11.

En clair : « la covariance divisée par le produit des deux écarts-types ». La division est le point important. La covariance porte le produit des deux unités, des « degrés × locations ». Le dénominateur aussi : σ(X)\sigma(X) porte les degrés, σ(Y)\sigma(Y) les locations. La division les élimine, et il reste un nombre pur, comparable d'un jeu de données à l'autre.

Valeur absolue de rrLecture
de 0,95 à 1Points quasiment alignés, ajustement affine excellent
de 0,8 à 0,95Corrélation forte, l'ajustement a du sens
de 0,5 à 0,8Corrélation modérée, la droite ne capte qu'une partie du phénomène
<0,5< 0{,}5Corrélation faible, un ajustement affine n'apporte rien

Le coefficient de détermination r2r^2 s'interprète directement en pourcentage : r=0,9r = 0{,}9 donne r2=0,81r^2 = 0{,}81, soit 81 % de la variance de YY expliquée par la relation linéaire avec XX. C'est le chiffre à écrire dans un rapport, parce qu'il est le seul des deux à se traduire en français.

r=0r = 0 ne veut pas dire « indépendantes »

Les points (2,4)(-2, 4), (1,1)(-1, 1), (0,0)(0, 0), (1,1)(1, 1), (2,4)(2, 4) sont exactement sur la parabole y=x2y = x^2, donc parfaitement liés. Et pourtant r=0r = 0 : la moitié gauche du nuage descend, la moitié droite monte, et les deux tendances s'annulent terme à terme dans la covariance. Le coefficient ne mesure que l'alignement, pas la dépendance. Encore le nuage.

Jusqu'ici, deux nombres qui disent s'il y a une relation linéaire et à quel point elle est nette. Ni l'un ni l'autre ne donne l'équation qui permettrait de prédire une valeur. C'est l'objet de la section suivante.

La droite des moindres carrés

Parmi toutes les droites possibles, la droite de régression de yy en xx est celle qui minimise la somme des carrés des écarts verticaux entre les points et la droite.

La chercher d'abord à la main

La phrase ci-dessus décrit une recherche. La faire, avant de lire les formules qui la court-circuitent.

Chaque carré de la figure a pour côté l'écart vertical entre un point et la droite : son aire est donc le carré du résidu, et le total affiché est exactement la quantité que la méthode rend minimale. Déplacer la droite jusqu'à ce que ce total ne veuille plus descendre, noter la valeur atteinte, puis demander la meilleure droite.

10203040102030température (°C)locations (centaines)
somme des carrés 1 649,12

Le minimum vaut 4,83, soit 1 644,29 de moins qu'ici.

Les huit jours d'observation. Le total affiché est la somme des aires : c'est lui, et rien d'autre, que les formules de la page suivante minimisent. Droite optimale : y = 1,389 x + -0,194, somme 4,83.

Deux choses se remarquent en cherchant, et les formules ne les diront pas.

Le total ne descend pas régulièrement : il chute vite, puis résiste. Sur ces huit points, une pente fausse de 0,300{,}30 donne un total de 38,9 ; ramenée à 0,050{,}05 près, il tombe à 5,8, et le minimum vaut 4,8. Autrement dit, une droite « à peu près bonne » se trouve tout de suite, et les derniers dixièmes se paient cher. C'est exactement ce qui rend un calcul préférable au tâtonnement.

Et les deux réglages sont liés : dès qu'on touche à la pente, la meilleure hauteur se déplace aussi. Ici, 0,050{,}05 de pente en plus déplace la hauteur idéale de près d'une unité. On ne peut donc pas régler l'un puis l'autre et s'arrêter : c'est pourquoi le calcul qui suit traite les deux inconnues ensemble, en annulant deux dérivées partielles, et commence par celle qui se résout seule.

Formules
y=ax+baveca=cov(X,Y)V(X)etb=yˉaxˉy = ax + b \quad \text{avec} \quad a = \frac{\operatorname{cov}(X, Y)}{V(X)} \quad \text{et} \quad b = \bar{y} - a \bar{x}

En clair : la pente aa est « la covariance divisée par la variance des xx », et elle dit de combien yy augmente quand xx augmente d'une unité. L'ordonnée à l'origine bb est « la moyenne des yy moins la pente fois la moyenne des xx » : c'est le réglage vertical qui force la droite à passer par le point moyen. La pente d'abord, la hauteur ensuite.

Trois contrôles qui ne coûtent rien
  1. La droite passe par le point moyen G(xˉ,yˉ)G(\bar{x}, \bar{y}). C'est la conséquence directe de b=yˉaxˉb = \bar{y} - a\bar{x}, et c'est la vérification à faire systématiquement.
  2. aa et rr ont le même signe, puisqu'ils partagent le numérateur cov(X,Y)\operatorname{cov}(X, Y) et que les dénominateurs sont positifs.
  3. Calculer rr avant d'écrire la droite. Si r|r| est faible, la droite existe quand même, elle ne sert simplement à rien, et l'écrire sans le dire est l'erreur classique.

Pourquoi les carrés des écarts ? Parce que la somme des écarts simples s'annule pour une infinité de droites, et parce que la valeur absolue ne se dérive pas partout. Le carré, lui, donne une fonction dérivable dont on annule la dérivée.

Le calcul tient en deux dérivations, et les suivre une fois évite de retenir deux formules par cœur.

La quantité à minimiser est une fonction des deux inconnues aa et bb :

S(a,b)=i=1N(yiaxib)2S(a, b) = \sum_{i=1}^{N} (y_i - ax_i - b)^2

En clair : pour une droite donnée, c'est-à-dire pour un couple (a,b)(a, b), la quantité axi+bax_i + b est ce que la droite prédit au point xix_i, et yiaxiby_i - ax_i - b est donc l'écart entre l'observation et cette prédiction. On élève chaque écart au carré, on les additionne sur les NN points, et le total mesure à quel point cette droite-là rate le nuage. Chercher la meilleure droite, c'est chercher le couple (a,b)(a, b) qui rend SS le plus petit possible.

Son minimum annule ses deux dérivées partielles, chacune calculée en traitant l'autre inconnue comme une constante (voir le chapitre sur les fonctions de plusieurs variables).

Dériver par rapport à bb et annuler donne 2(yiaxib)=0-2\sum (y_i - ax_i - b) = 0, soit yi=axi+Nb\sum y_i = a\sum x_i + Nb. En divisant par NN : yˉ=axˉ+b\bar{y} = a\bar{x} + b, c'est-à-dire b=yˉaxˉb = \bar{y} - a\bar{x}. C'est là, et pas ailleurs, que naît le passage de la droite par le point moyen.

Dériver par rapport à aa et annuler donne 2xi(yiaxib)=0-2\sum x_i(y_i - ax_i - b) = 0. En y remplaçant bb par l'expression qu'on vient d'obtenir et en regroupant, il reste

a=(xixˉ)(yiyˉ)(xixˉ)2=cov(X,Y)V(X)a = \frac{\sum (x_i - \bar{x})(y_i - \bar{y})}{\sum (x_i - \bar{x})^2} = \frac{\operatorname{cov}(X, Y)}{V(X)}

En clair, le numérateur est la somme des produits des deux écarts à la moyenne : c'est le mouvement commun de XX et de YY. Le dénominateur est la somme des carrés des écarts en xx seuls : c'est l'étalement de XX. La pente rapporte donc le premier au second (le second égal s'obtient en divisant numérateur et dénominateur par NN). Les deux formules de l'encadré ne sont donc pas deux définitions à retenir : ce sont les deux conditions d'annulation des dérivées d'une même fonction.

Deux droites, pas une

La régression de yy en xx minimise les écarts verticaux. Celle de xx en yy minimise les écarts horizontaux : x=ay+bx = a'y + b' avec a=cov(X,Y)/V(Y)a' = \operatorname{cov}(X, Y)/V(Y). Les deux droites sont différentes, se croisent au point moyen, et vérifient a×a=r2a \times a' = r^2. Elles se confondent quand r=1|r| = 1. Il faut choisir celle qui correspond à la question : quelle variable prédit-on à partir de quelle autre ?

L'égalité a×a=r2a \times a' = r^2 se vérifie en une ligne, et elle éclaire ce que mesure vraiment rr :

a×a=cov(X,Y)V(X)×cov(X,Y)V(Y)=cov(X,Y)2V(X)V(Y)=r2a \times a' = \dfrac{\operatorname{cov}(X, Y)}{V(X)} \times \dfrac{\operatorname{cov}(X, Y)}{V(Y)} = \dfrac{\operatorname{cov}(X, Y)^2}{V(X)V(Y)} = r^2

Dans le repère habituel, la droite x=ay+bx = a'y + b' a pour pente 1/a1/a'. Puisque a×a=r21a \times a' = r^2 \leq 1, on a a1/a|a| \leq |1/a'| : la droite de xx en yy est toujours au moins aussi raide que celle de yy en xx. Elles se confondent exactement quand r2=1r^2 = 1. Quand r=0r = 0, l'une est horizontale (y=yˉy = \bar{y}) et l'autre verticale (x=xˉx = \bar{x}) : elles sont perpendiculaires. L'écart angulaire entre elles est donc une lecture géométrique directe de la force de la corrélation.

Un calcul complet

Sur huit jours d'observation, la température xx en °C et les locations yy en centaines :

xx811141720232629
yy1215192228313641

Le nuage d'abord, avant tout calcul :

10203040102030température (°C)locations (centaines)
Les huit jours d'observation et leur droite d'ajustement. Les traits rouges sont les résidus, et c'est la somme de leurs carrés que la méthode rend minimale. Droite des moindres carrés : y = 1,389 x − 0,194, avec r = 0,997 et r² = 0,993.

Les points sont visiblement alignés et les résidus minuscules : une droite a du sens, et le calcul peut commencer. C'est cet ordre-là qu'il faut prendre, regarder puis calculer, et jamais l'inverse.

x=148\sum x = 148, y=204\sum y = 204, xy=4299\sum xy = 4299, x2=3116\sum x^2 = 3116, y2=5936\sum y^2 = 5936, N=8N = 8

xˉ=148/8=18,5\bar{x} = 148/8 = 18{,}5 et yˉ=204/8=25,5\bar{y} = 204/8 = 25{,}5

cov(X,Y)=4299/818,5×25,5=537,375471,75=65,625\operatorname{cov}(X, Y) = 4299/8 - 18{,}5 \times 25{,}5 = 537{,}375 - 471{,}75 = 65{,}625

  • V(X)=3116/818,52=389,5342,25=47,25V(X) = 3116/8 - 18{,}5^2 = 389{,}5 - 342{,}25 = 47{,}25, donc σ(X)6,874\sigma(X) \approx 6{,}874
  • V(Y)=5936/825,52=742650,25=91,75V(Y) = 5936/8 - 25{,}5^2 = 742 - 650{,}25 = 91{,}75, donc σ(Y)9,579\sigma(Y) \approx 9{,}579

r=65,625/(6,874×9,579)=65,625/65,850,997r = 65{,}625 / (6{,}874 \times 9{,}579) = 65{,}625 / 65{,}85 \approx 0{,}997 : corrélation quasi parfaite, r20,993r^2 \approx 0{,}993. Le calcul confirme ce que le nuage montrait.

a=65,625/47,251,389a = 65{,}625 / 47{,}25 \approx 1{,}389 et b=25,51,389×18,50,194b = 25{,}5 - 1{,}389 \times 18{,}5 \approx -0{,}194

y=1,389x0,194y = 1{,}389x - 0{,}194

Contrôle : pour x=18,5x = 18{,}5, y=1,389×18,50,19425,5y = 1{,}389 \times 18{,}5 - 0{,}194 \approx 25{,}5 ✓ la droite passe bien par GG, aux arrondis près.

Interprétation métier : chaque degré supplémentaire apporte environ 139 locations. C'est cette phrase qu'on retient, pas le coefficient.

main.py
Sortie
>_ Prêt à exécuter…

Prédire, et jusqu'où

La droite sert à estimer yy pour un xx non observé. C'est son intérêt, et c'est aussi là qu'on se trompe.

Interpolation contre extrapolation
  • À 22 °C (dans la plage observée, de 8 à 29 °C), la droite prédit 1,389×220,19430,41{,}389 \times 22 - 0{,}194 \approx 30{,}4, soit environ 3 040 locations. C'est une interpolation, et la prédiction est légitime.
  • À 40 °C (hors plage), elle prédit 1,389×400,19455,41{,}389 \times 40 - 0{,}194 \approx 55{,}4, soit environ 5 540 locations. C'est une extrapolation. Or à 40 °C les gens ne font pas de vélo : la relation observée entre 8 et 29 °C n'a aucune raison de se prolonger. La droite continue de calculer ; le phénomène, lui, s'est arrêté.

La figure ci-dessous montre ce que fait la droite, et ce que fait le phénomène.

51015202530354045-55101520253035404550556065température (°C)locations (centaines)prédiction légitimeprédiction absurde
f(x) = 1.389 * x - 0.194
Aire algébrique de 8 à 29 : 535,55. Hachures montantes pour ce qui compte positivement, descendantes pour ce qui compte négativement.
La zone teintée est la seule où des données ont été observées. Au-delà, la droite continue de calculer sans que rien ne la contredise.

Ce qu'il faut regarder, c'est la bordure droite de la zone teintée. Rien n'y change : la droite la franchit sans marquer d'arrêt, garde exactement la même pente, et le point à 40 °C se pose dessus comme les autres. Le tracé ne signale donc jamais qu'on vient de sortir des données. C'est au lecteur de savoir où s'arrête la zone, et c'est pour cela qu'on écrit toujours la plage d'observation à côté de l'équation.

Une droite ne vaut que sur son domaine

Écrire toujours la plage sur laquelle l'ajustement a été construit, et refuser explicitement de prédire au-delà. C'est une phrase, et elle distingue un résultat d'un nombre.

La raison est simple : les moindres carrés minimisent l'écart sur les points fournis, et rien d'autre. En dehors, aucun point n'a jamais contredit la droite, donc rien ne l'a jamais corrigée. Son prolongement n'est pas une prédiction faible, c'est une prédiction sans information.

Un rr élevé ne protège pas de l'extrapolation

Le coefficient de corrélation mesure l'alignement des points observés. Un rr de 0,99 sur la plage 8 à 29 °C ne dit strictement rien de ce qui se passe à 40 °C. Aucun indicateur calculé sur ces données ne le dirait : la seule façon de savoir est d'aller observer.

Vérification rapideon peut se reprendre

1.Un coefficient de corrélation de -0,95 signifie…

2.Une corrélation proche de zéro signifie…

3.Pourquoi le quatuor d'Anscombe est-il célèbre ?

4.Le coefficient de détermination r² vaut 0,64. Comment se lit-il ?

5.La droite des moindres carrés passe toujours par un point particulier. Lequel ?

Corrélation n'est pas causalité

Une corrélation forte entre XX et YY admet quatre explications, et une seule est « XX cause YY » :

  1. XX cause YY ;
  2. YY cause XX (le sens est inversé) ;
  3. une troisième variable ZZ cause les deux, c'est le cas le plus fréquent ;
  4. le hasard, sur un petit échantillon ou beaucoup de paires testées.
Sur le jeu de données de vélos

Locations et ventes de glaces sont fortement corrélées. Aucune des deux ne cause l'autre : la température les cause toutes les deux. Prédire les locations à partir des ventes de glaces fonctionnerait pourtant très bien, c'est tout le paradoxe. Une corrélation suffit à prédire ; seule une causalité permet d'agir. Distribuer des glaces gratuites n'augmentera pas les locations de vélos.

Le quatuor d'Anscombe

Estimer avant de calculer

Quatre jeux de onze points suivent. Avant de les lire un par un, les parcourir des yeux et noter quelque part la réponse à deux questions.

  1. Les classer du plus corrélé au moins corrélé.
  2. Pour chacun, risquer une valeur de rr, même approximative, même à 0,2 près.

Deux minutes suffisent, et il faut vraiment écrire les quatre nombres : une estimation qu'on garde en tête s'ajuste toute seule à la réponse, et on croit ensuite avoir vu juste.

Sur chacune des quatre figures, ce sont les résidus, les traits rouges, qu'il faut regarder : leur longueur et surtout la façon dont elle varie le long de la droite.

4681051015xy
I. Un vrai lien affine. Le seul cas où la droite décrit vraiment le nuage. Droite des moindres carrés : y = 0,5 x + 3, avec r = 0,816 et r² = 0,667.

Les résidus sont courts, tantôt au-dessus tantôt en dessous, et sans ordre apparent. C'est exactement ce qu'on attend d'un ajustement honnête, et c'est le seul des quatre jeux où l'on voit cela.

46851015xy
II. Une courbe. Le lien est parfait, mais il n'est pas affine : c'est une parabole. Droite des moindres carrés : y = 0,5 x + 3,001, avec r = 0,816 et r² = 0,666.

Ici les résidus ont un ordre : négatifs aux deux bouts, positifs au milieu. Ce n'est pas du hasard qui se répartit, c'est une forme que la droite n'a pas captée. Dès qu'un résidu se devine à partir de la position du point, il reste un modèle à trouver.

51051015xy
III. Une valeur aberrante. Dix points parfaitement alignés, et un seul qui incline la droite à lui tout seul. Droite des moindres carrés : y = 0,5 x + 3,002, avec r = 0,816 et r² = 0,666.

Un seul résidu est long, tous les autres sont minuscules. C'est la signature d'une valeur aberrante : il faut aller voir d'où vient ce point, et si la droite calculée sans lui n'est pas la vraie réponse.

510101520xy
IV. Un point de levier. Aucune information sur la pente : dix points à x = 8, et un onzième qui décide de tout. Droite des moindres carrés : y = 0,5 x + 3,002, avec r = 0,817 et r² = 0,667.

Cette fois, c'est l'axe des abscisses qu'il faut regarder : dix points occupent la même verticale, un seul est ailleurs. Une pente se mesure entre deux abscisses différentes ; il n'y en a ici que deux en tout, donc la droite relie le nuage vertical au point isolé, et rien d'autre. Déplacer ce point d'un centimètre déplace toute la droite.

Reprendre les quatre estimations

Les quatre jeux ont la même moyenne, la même variance, la même corrélation r0,816r \approx 0{,}816 et la même droite de régression y=0,5x+3y = 0{,}5x + 3, aux arrondis près.

Le classement n'avait donc rien à classer, et c'est tout l'intérêt de l'avoir écrit. Quatre nuages qui n'ont visiblement rien à voir rendent exactement les mêmes indicateurs. Aucun des nombres de ce chapitre ne distingue une droite d'une parabole, ni un vrai lien d'un point isolé qui décide de tout.

D'où la règle qui ouvre le chapitre sur les statistiques, et qui ne souffre pas d'exception : le nuage se regarde avant que l'indicateur se calcule. Un rr de 0,816 rapporté sans figure est une affirmation invérifiable.

Les quatre figures ci-dessus s'affichent instantanément. Le bloc suivant refait le même travail en Python, pour qui veut la manière de le produire plutôt que le résultat.

main.py
Sortie
>_ Prêt à exécuter…
Ce que montre le quatuor

Seul le premier jeu justifie une droite. Les trois autres appellent trois réponses différentes : un modèle du second degré, une enquête sur le point douteux, des observations à d'autres abscisses.

Quatre situations à traiter différemment, et des indicateurs identiques dans les quatre cas. C'est l'argument le plus court en faveur du nuage de points.

Vérification

Vérification rapideon peut se reprendre

1.Pourquoi la droite des moindres carrés minimise-t-elle les carrés des écarts, et non les écarts eux-mêmes ?

2.Prédire une valeur bien au-delà de la plage observée s'appelle…

3.Le graphe des résidus montre une courbure nette. Que conclure ?

4.Une corrélation forte entre deux variables prouve…

L'analyse complète sur le jeu de vélos

Voici la démarche de bout en bout, avec les bibliothèques pandas et scipy (voir le parcours Python). Trois temps : matrice de corrélation pour repérer les variables qui comptent, régression sur celle qui compte le plus, résidus pour vérifier que le modèle tient. Les données sont simulées, mais construites comme un vrai relevé : 240 jours, avec température, humidité, vent et locations.

main.py
Sortie
>_ Prêt à exécuter…

Et le tracé qui accompagne le rapport : le nuage avec sa droite, puis les résidus, c'est-à-dire les écarts entre observations et prédictions.

main.py
Sortie
>_ Prêt à exécuter…
Lire un graphique de résidus

Les résidus doivent former un nuage informe centré sur zéro. S'ils dessinent une courbe, le modèle linéaire est le mauvais modèle. S'ils s'évasent en entonnoir, la dispersion dépend de xx et les prédictions sont bien moins fiables d'un côté que de l'autre. C'est le contrôle qu'on oublie et qui trouve les vrais problèmes.

Le mot « entonnoir » demande à être vu. Sur le nuage ci-dessous, la droite est correcte et le coefficient de corrélation est honorable (r0,91r \approx 0{,}91) ; ce sont les résidus qui trahissent le problème, courts à gauche et longs à droite.

01020300510charge du serveurtemps de réponse (ms)
Une dispersion qui croît avec x. La droite reste la meilleure au sens des moindres carrés, mais elle prédit bien à gauche et mal à droite : une prévision unique ne vaut rien sans son incertitude, et celle-ci n'est pas constante. Droite des moindres carrés : y = 2,188 x − 0,412, avec r = 0,906 et r² = 0,82.
Ce que l'entonnoir interdit

Annoncer « le temps de réponse à charge 12 sera de 26 ms », la valeur que donne la droite, suppose que l'erreur soit la même partout. Ici elle ne l'est pas : à charge faible, de 1 à 4, les résidus ne dépassent pas une demi-milliseconde ; à charge forte, de 9 à 12, ils vont de quatre à plus de six millisecondes. La droite reste utilisable pour décrire une tendance, jamais pour donner une prévision ponctuelle sans intervalle. La parade usuelle consiste à travailler sur le logarithme de la variable expliquée, ce qui stabilise souvent la dispersion.

Exercices type

Interpréter r=0,95r = -0{,}95 entre la température et la consommation de chauffage

Corrélation linéaire négative et très forte : plus il fait chaud, moins on chauffe, et la relation est presque parfaitement affine sur le domaine observé.

r2=0,90r^2 = 0{,}90 : 90 % de la variance de la consommation s'explique par la température. Un ajustement affine est pleinement légitime.

Réserve à écrire : à 35 °C, la droite prédirait une consommation négative. La relation ne vaut que sur la plage observée.

Droite de régression avec xˉ=10\bar{x} = 10, yˉ=25\bar{y} = 25, cov(X,Y)=12\operatorname{cov}(X, Y) = 12, V(X)=8V(X) = 8

a=12/8=1,5a = 12/8 = 1{,}5

b=251,5×10=10b = 25 - 1{,}5 \times 10 = 10

y=1,5x+10y = 1{,}5x + 10

Contrôle : pour x=10x = 10, on obtient y=25y = 25, c'est bien le point moyen ✓

On mesure r=0,6r = 0{,}6. Quelle part de la variance la droite explique-t-elle ?

r2=0,36r^2 = 0{,}36, soit 36 %.

Autrement dit 64 % de la variabilité reste inexpliquée par cette seule variable. Une corrélation qu'on qualifie spontanément de « correcte » laisse en réalité les deux tiers du phénomène de côté.

C'est la raison pour laquelle on rapporte r2r^2 plutôt que rr : « 0,6 » sonne bien, « 36 % » dit la vérité.

Les ventes de crème solaire et les noyades sont corrélées à r=0,9r = 0{,}9. Faut-il interdire la crème solaire ?

Non. La variable cachée est la température, ou plus exactement la fréquentation des plages, qu'elle détermine : quand il fait chaud, on achète de la crème et on se baigne davantage.

C'est le cas 3 des quatre explications : une variable tierce cause les deux. La corrélation est réelle et permet de prédire les noyades à partir des ventes de crème ; elle ne dit rien de ce qui arriverait si on agissait sur les ventes.

Prédire et agir sont deux usages différents d'un même modèle, et un seul des deux exige la causalité.

Sur le jeu de vélos, la corrélation entre le vent et les locations vaut environ 0,040{,}04. Que fait-on de cette variable ?

r20,0015r^2 \approx 0{,}0015 : le vent explique environ 0,15 % de la variance des locations. Autant dire rien.

On l'écarte du modèle, en le disant : « le vent n'a pas d'effet linéaire détectable sur ces données » est un résultat, pas une absence de résultat.

Deux réserves honnêtes. L'absence de corrélation linéaire n'exclut pas un effet en seuil, rien en dessous de 40 km/h et effondrement au-dessus, qu'un nuage de points révélerait. Et la plage d'observation ne contient peut-être aucune journée réellement ventée.

Pourquoi la droite de yy en xx diffère-t-elle de celle de xx en yy ?

Parce qu'elles ne minimisent pas la même quantité : la première minimise les écarts verticaux (les erreurs sur yy), la seconde les écarts horizontaux (les erreurs sur xx).

Leurs pentes vérifient a×a=r2a \times a' = r^2. Quand r=1|r| = 1 les points sont alignés et les deux droites se confondent ; quand rr tend vers 0, elles deviennent perpendiculaires.

En pratique : choisir la droite selon la variable qu'on veut prédire. Pour estimer les locations à partir de la température, c'est la régression de yy en xx.

La méthode

  1. Tracer le nuage. Toujours, et avant tout calcul.
  2. Calculer le point moyen G(xˉ,yˉ)G(\bar{x}, \bar{y}) : il servira de contrôle.
  3. Calculer cov\operatorname{cov}, V(X)V(X), V(Y)V(Y) avec la forme « moyenne des produits moins produit des moyennes ».
  4. Calculer rr avant la droite, et justifier que l'ajustement affine est légitime.
  5. Écrire la droite a=cov/V(X)a = \operatorname{cov}/V(X), b=yˉaxˉb = \bar{y} - a\bar{x}, et vérifier qu'elle passe par GG.
  6. Donner r2r^2 en pourcentage : c'est le chiffre qui parle.
  7. Préciser le domaine de validité et refuser d'extrapoler au-delà.
  8. Ne jamais conclure à une causalité. Écrire explicitement la variable cachée possible.

Synthèse

  • Le nuage de points se trace en premier : le quatuor d'Anscombe montre pourquoi.
  • Covariance cov=(1/N)xiyixˉyˉ\operatorname{cov} = (1/N)\sum x_iy_i - \bar{x}\bar{y}. Le signe compte, la valeur absolue ne se compare pas.
  • Corrélation r=cov/(σxσy)r = \operatorname{cov}/(\sigma _x\sigma _y), entre −1 et 1, sans unité.
  • r2r^2 = part de la variance expliquée. C'est ce qu'on écrit dans un rapport.
  • r=0r = 0 indépendance : rr ne mesure que l'alignement.
  • Moindres carrés : a=cov/V(X)a = \operatorname{cov}/V(X), b=yˉaxˉb = \bar{y} - a\bar{x}. La droite passe par le point moyen.
  • Deux droites différentes selon la variable prédite, avec a×a=r2a \times a' = r^2.
  • Interpoler dans la plage observée, jamais extrapoler au-delà.
  • Corrélation ≠ causalité : quatre explications possibles, une seule est causale.
  • Une corrélation suffit à prédire, jamais à agir.
  • Les résidus doivent être informes. Une structure dans les résidus signale un mauvais modèle.
  • Sur un jeu réel, la démarche complète tient en trois temps : matrice de corrélation, puis régression sur la variable qui compte, puis résidus pour vérifier que le modèle tient.

Et ensuite

La droite prédit une valeur moyenne ; elle ne dit pas quand s'inquiéter. Superviser un système passe aux lois continues et à la question qui en découle : à partir de quel écart déclenche-t-on une alerte, sans noyer l'équipe sous les fausses ?

Mettre en pratique