Corrélation, régression et moindres carrés
Ce que ce chapitre apporte
- Construire et lire un nuage de points pour une série statistique double.
- Calculer une covariance et un coefficient de corrélation linéaire, et les interpréter.
- Déterminer la droite de régression par la méthode des moindres carrés.
- Utiliser la droite pour prédire, en connaissant le domaine de validité.
- Distinguer corrélation et causalité, et reconnaître une corrélation trompeuse.
- Mener l'analyse complète sur un jeu de données réel en Python.
Une série double
Quand on observe deux caractères sur les mêmes individus, chaque individu devient un couple . Le nuage de points place ces couples dans un repère : c'est la première chose à tracer, avant tout calcul.
Le point moyen est le centre de gravité du nuage. Il servira de point d'ancrage à toute la suite.
Covariance
La covariance de la série double mesure si et varient dans le même sens :
La seconde forme est celle qu'on utilise en calcul : un seul passage sur les données. Le signe est ce qui compte : covariance positive, les deux grandeurs augmentent ensemble ; négative, l'une monte quand l'autre descend ; nulle, aucune tendance linéaire.
Coefficient de corrélation linéaire
est sans unité et toujours compris entre et 1.
| Valeur absolue de | Lecture |
|---|---|
0,95 à 1 | Points quasiment alignés, ajustement affine excellent |
0,8 à 0,95 | Corrélation forte, l'ajustement a du sens |
0,5 à 0,8 | Corrélation modérée, la droite ne capte qu'une partie du phénomène |
| Corrélation faible, un ajustement affine n'apporte rien |
Le coefficient de détermination s'interprète directement en pourcentage : donne , soit 81 % de la variance de expliquée par la relation linéaire avec . C'est le chiffre à écrire dans un rapport, parce qu'il est le seul des deux à se traduire en français.
(−2, 4), (−1, 1), (0, 0), (1, 1), (2, 4) : ils sont exactement sur la parabole y = x², donc parfaitement liés, et pourtant r = 0. Le coefficient ne mesure que l'alignement, pas la dépendance. Encore le nuage.
La droite des moindres carrés
Parmi toutes les droites possibles, la droite de régression de en est celle qui minimise la somme des carrés des écarts verticaux entre les points et la droite.
avec et
G(x̄, ȳ). C'est la conséquence directe de b = ȳ − ax̄, et c'est la vérification à faire systématiquement.2.
a et r ont le même signe, puisqu'ils partagent le numérateur cov.3. Calcule
r avant d'écrire la droite. Si |r| est faible, la droite existe quand même, elle ne sert simplement à rien, et l'écrire sans le dire est l'erreur qui coûte des points.
Pourquoi les carrés des écarts ? Parce que la somme des écarts simples s'annule pour une infinité de droites, et parce que la valeur absolue ne se dérive pas partout. Le carré, lui, donne une fonction dérivable dont on annule la dérivée : le calcul aboutit aux deux formules ci-dessus.
y en x minimise les écarts verticaux. Celle de x en y minimise les écarts horizontaux : x = a′y + b′ avec a′ = cov/V(Y). Les deux droites sont différentes, se croisent au point moyen, et vérifient a × a′ = r². Elles se confondent quand |r| = 1. Choisis celle qui correspond à ta question : quelle variable prédit-on à partir de quelle autre ?
Un calcul complet
Sur huit jours d'observation, la température en °C et les locations en centaines :
| 8 | 11 | 14 | 17 | 20 | 23 | 26 | 29 | |
|---|---|---|---|---|---|---|---|---|
| 12 | 15 | 19 | 22 | 28 | 31 | 36 | 41 |
, , , , ,
et ȳ = 25,5
65,625
, donc , donc
0,997 : corrélation quasi parfaite, .
1,389 et
Contrôle : pour , ✓ la droite passe bien par .
Interprétation métier : chaque degré supplémentaire apporte environ 139 locations. C'est cette phrase qu'on retient, pas le coefficient.
Prédire, et jusqu'où
La droite sert à estimer pour un non observé. C'est son intérêt, et c'est aussi là qu'on se trompe.
1,389 × 22 − 0,194 ≈ 30,4, soit environ 3 040 locations. Prédiction légitime.À 40 °C (hors plage) elle prédit 5 536 locations. Or à 40 °C les gens ne font pas de vélo : la relation observée entre 8 et 29 °C n'a aucune raison de se prolonger. La droite continue de calculer ; le phénomène, lui, s'est arrêté.
1.Un coefficient de corrélation de -0,95 signifie…
2.Une corrélation proche de zéro signifie…
3.Pourquoi le quatuor d'Anscombe est-il célèbre ?
Corrélation n'est pas causalité
Une corrélation forte entre et admet quatre explications, et une seule est « cause » :
- cause ;
- cause (le sens est inversé) ;
- une troisième variable cause les deux, c'est le cas le plus fréquent ;
- le hasard, sur un petit échantillon ou beaucoup de paires testées.
Le quatuor d'Anscombe
Quatre jeux de onze points, tous de même moyenne, même variance, même corrélation et même droite de régression . Ils n'ont pourtant rien à voir.
x = 8 et un seul ailleurs, qui décide de tout.Quatre situations à traiter différemment, et des indicateurs identiques dans les quatre cas. C'est l'argument le plus court en faveur du nuage de points.
L'analyse complète sur le jeu de vélos
Voici la démarche de bout en bout : matrice de corrélation pour repérer les variables qui comptent, puis régression sur celle qui compte le plus, puis résidus pour vérifier que le modèle tient.
Et le tracé qui accompagne le rapport : le nuage avec sa droite, puis les résidus, c'est-à-dire les écarts entre observations et prédictions.
x et les prédictions sont bien moins fiables d'un côté que de l'autre. C'est le contrôle qu'on oublie et qui trouve les vrais problèmes.
Exercices type
Interpréter $r = -0{,}95$ entre la température et la consommation de chauffage
Corrélation linéaire négative et très forte : plus il fait chaud, moins on chauffe, et la relation est presque parfaitement affine sur le domaine observé.
: 90 % de la variance de la consommation s'explique par la température. Un ajustement affine est pleinement légitime.
Réserve à écrire : à 35 °C, la droite prédirait une consommation négative. La relation ne vaut que sur la plage observée.
Droite de régression avec $\bar{x} = 10$, `ȳ = 25`, $\operatorname{cov} = 12$, $V(x) = 8$
Contrôle : pour , on obtient , c'est bien le point moyen ✓
On mesure $r = 0{,}6$. Quelle part de la variance la droite explique-t-elle ?
, soit 36 %.
Autrement dit 64 % de la variabilité reste inexpliquée par cette seule variable. Une corrélation qu'on qualifie spontanément de « correcte » laisse en réalité les deux tiers du phénomène de côté.
C'est la raison pour laquelle on rapporte plutôt que : 0,6 sonne bien, 36 % dit la vérité.
Les ventes de crème solaire et les noyades sont corrélées à $r = 0{,}9$. Faut-il interdire la crème solaire ?
Non. La variable cachée est la température, ou plus exactement la fréquentation des plages, qu'elle détermine : quand il fait chaud, on achète de la crème et on se baigne davantage.
C'est le cas 3 des quatre explications : une variable tierce cause les deux. La corrélation est réelle et permet de prédire les noyades à partir des ventes de crème ; elle ne dit rien de ce qui arriverait si on agissait sur les ventes.
Prédire et agir sont deux usages différents d'un même modèle, et un seul des deux exige la causalité.
Sur le jeu de vélos, la corrélation avec le vent est de $-0{,}05$. Que fait-on de cette variable ?
: le vent explique 0,25 % de la variance des locations. Autant dire rien.
On l'écarte du modèle, en le disant : « le vent n'a pas d'effet linéaire détectable sur nos données » est un résultat, pas une absence de résultat.
Deux réserves honnêtes : l'absence de corrélation linéaire n'exclut pas un effet en seuil (rien en dessous de 40 km/h, effondrement au-dessus), qu'un nuage de points révélerait ; et notre plage d'observation ne contient peut-être aucune journée réellement ventée.
Pourquoi la droite de $y$ en $x$ diffère-t-elle de celle de $x$ en $y$ ?
Parce qu'elles ne minimisent pas la même quantité : la première minimise les écarts verticaux (les erreurs sur ), la seconde les écarts horizontaux (les erreurs sur ).
Leurs pentes vérifient . Quand les points sont alignés et les deux droites se confondent ; quand tend vers 0, elles deviennent perpendiculaires.
En pratique : choisis la droite selon la variable que tu veux prédire. Pour estimer les locations à partir de la température, c'est la régression de en .
La méthode
- Trace le nuage. Toujours, et avant tout calcul.
- Calcule le point moyen : il servira de contrôle.
- Calcule , , avec la forme « moyenne des produits moins produit des moyennes ».
- Calcule avant la droite, et justifie que l'ajustement affine est légitime.
- Écris la droite , , et vérifie qu'elle passe par .
- Donne en pourcentage : c'est le chiffre qui parle.
- Précise le domaine de validité et refuse d'extrapoler au-delà.
- Ne conclus jamais à une causalité. Écris explicitement la variable cachée possible.
En résumé
- Le nuage de points se trace en premier : le quatuor d'Anscombe montre pourquoi.
- Covariance . Le signe compte, la valeur absolue ne se compare pas.
- Corrélation , entre −1 et 1, sans unité.
- = part de la variance expliquée. C'est ce qu'on écrit dans un rapport.
- ≠ indépendance : ne mesure que l'alignement.
- Moindres carrés : , . La droite passe par le point moyen.
- Deux droites différentes selon la variable prédite, avec .
- Interpoler dans la plage observée, jamais extrapoler au-delà.
- Corrélation ≠ causalité : quatre explications possibles, une seule est causale.
- Une corrélation suffit à prédire, jamais à agir.
- Les résidus doivent être informes. Une structure dans les résidus signale un mauvais modèle.
Et ensuite ? Ces outils décrivent des données stables. Le chapitre suivant les emmène là où les données arrivent en continu et où il faut réagir : la supervision d'un système d'information, ses lois continues et sa détection d'anomalies.