Terminale · Maths complémentaires · Chapitre 10

Corrélation et causalité

Exercices corrigés — ajustement affine, corrélation et changement de variable.
Ex. 1 — Point moyen et droite d'ajustement Ex. 2 — Coefficient de corrélation Ex. 3 — Corrélation n'est pas causalité Ex. 4 — Loi de Moore Ex. 5 — Distance de freinage
Formules clés : point moyen $G(\overline x\,;\overline y)$ ; $a = \dfrac{\mathrm{cov}(x,y)}{V(x)}$, $b = \overline y - a\overline x$ ; $r = \dfrac{\mathrm{cov}(x,y)}{\sigma(x)\sigma(y)}$ ; modèle exponentiel : $z = \ln y = ax + b$ donne $y = \mathrm{e}^{b}\mathrm{e}^{ax}$.
Exercice 1
Point moyen et droite d'ajustement

Le tableau donne le budget publicitaire $x_i$ (en milliers d'euros) et le chiffre d'affaires $y_i$ (en milliers d'euros) d'une boutique sur cinq mois.

$x_i$246810
$y_i$1519263035
  1. Calculer les coordonnées du point moyen $G$.
  2. On donne $V(x) = 8$ et $\mathrm{cov}(x,y) = 20{,}4$. Déterminer la droite d'ajustement de $y$ en $x$ par la méthode des moindres carrés.
  3. Vérifier que cette droite passe par $G$.
  4. Estimer le chiffre d'affaires pour un budget publicitaire de 12 000 €.

a. On calcule les deux moyennes.

\[ \overline x = \frac{2+4+6+8+10}{5} = 6 \qquad \overline y = \frac{15+19+26+30+35}{5} = \frac{125}{5} = 25 \qquad G(6\,;25) \]

b. On applique les formules des moindres carrés.

\[ a = \frac{20{,}4}{8} = 2{,}55 \qquad b = 25 - 2{,}55\times 6 = 9{,}7 \qquad y = 2{,}55x + 9{,}7 \]

c. On remplace $x$ par $\overline x = 6$.

\[ 2{,}55\times 6 + 9{,}7 = 15{,}3 + 9{,}7 = 25 = \overline y \ \checkmark \]

d. On remplace $x$ par $12$.

\[ y = 2{,}55\times 12 + 9{,}7 = 40{,}3 \]

Chiffre d'affaires estimé : environ 40 300 €. ⚠ C'est une extrapolation (12 est hors des données), à prendre avec prudence.

Exercice 2
Coefficient de corrélation

On reprend les données de l'exercice 1.

  1. Calculer $V(y)$, sachant que $\displaystyle\sum y_i^2 = 3\,387$.
  2. En déduire le coefficient de corrélation linéaire $r$. L'ajustement affine est-il pertinent ?
  3. Interpréter le coefficient directeur $a = 2{,}55$ en termes concrets.

a. On utilise la formule $V(y) = \dfrac1n\sum y_i^2 - \overline y^{\,2}$.

\[ V(y) = \frac{3387}{5} - 25^2 = 677{,}4 - 625 = 52{,}4 \]

b. $r = \dfrac{\mathrm{cov}(x,y)}{\sigma(x)\,\sigma(y)}$ avec $\sigma(x) = \sqrt 8$ et $\sigma(y) = \sqrt{52{,}4}$.

\[ r = \frac{20{,}4}{\sqrt{8}\times\sqrt{52{,}4}} = \frac{20{,}4}{\sqrt{419{,}2}}\approx\frac{20{,}4}{20{,}47}\approx 0{,}996 \]

$r$ est très proche de 1 : les points sont presque alignés, l'ajustement affine est très pertinent.

c. $a$ est l'augmentation de $y$ quand $x$ augmente de 1.

Selon le modèle, chaque millier d'euros supplémentaire de publicité s'accompagne d'environ 2 550 € de chiffre d'affaires en plus. ⚠ « S'accompagne », pas forcément « provoque » : voir l'exercice suivant.

Exercice 3
Corrélation n'est pas causalité

Une étude célèbre (2012) a relevé, pour une vingtaine de pays, la consommation annuelle de chocolat par habitant et le nombre de prix Nobel par million d'habitants. Le coefficient de corrélation obtenu est $r\approx 0{,}79$.

  1. Que signifie ce coefficient ?
  2. Peut-on en conclure que manger du chocolat rend plus intelligent ? Justifier.
  3. Proposer un facteur commun qui pourrait expliquer cette corrélation.
  4. Quel type d'étude permettrait d'établir une causalité ?

a. On interprète le signe et la valeur de $r$.

$r$ est positif et assez proche de 1 : il existe une corrélation linéaire positive marquée. Les pays qui consomment beaucoup de chocolat ont tendance à compter plus de prix Nobel par habitant.

b. On distingue corrélation et causalité.

Non. Une corrélation mesure seulement que deux variables évoluent ensemble ; elle ne dit rien du sens ni de l'existence d'un lien de cause à effet. 🚨 Les données sont d'ailleurs agrégées par pays : elles ne disent rien des individus.

c. On cherche une variable qui influence les deux à la fois.

Le niveau de richesse du pays : les pays riches consomment plus de produits comme le chocolat et financent davantage la recherche et l'enseignement supérieur. La richesse est un facteur de confusion.

d. Il faut contrôler les autres facteurs.

Une étude expérimentale randomisée : deux groupes tirés au sort, l'un consommant du chocolat et l'autre non, toutes choses égales par ailleurs, puis comparaison des performances. Seul le tirage au sort neutralise les facteurs cachés.

Exercice 4
Loi de Moore

Le tableau donne le nombre $N$ de transistors (en millions) sur un type de processeur, $t$ années après sa première version.

$t_i$02468
$N_i$12,13,98,215,8
  1. Pourquoi un ajustement affine de $N$ en $t$ n'est-il pas adapté ?
  2. On pose $z = \ln N$. Calculer les valeurs $z_i$ (au millième).
  3. La calculatrice donne la droite d'ajustement $z = 0{,}344t + 0{,}017$, avec $r\approx 0{,}9997$. En déduire une expression de $N$ en fonction de $t$.
  4. Estimer le temps de doublement du nombre de transistors.
  5. Estimer $N$ pour $t = 12$.

a. On observe les accroissements.

Les accroissements successifs (1,1 ; 1,8 ; 4,3 ; 7,6) ne sont pas constants : ils augmentent. En revanche, $N$ est à peu près multiplié par 2 tous les 2 ans : la croissance est exponentielle, le nuage est courbé.

b. On applique $\ln$ à chaque valeur.

$t_i$02468
$z_i$00,7421,3612,1042,760

c. $N = \mathrm{e}^{z} = \mathrm{e}^{0{,}344t + 0{,}017}$.

\[ N = \mathrm{e}^{0{,}017}\times\mathrm{e}^{0{,}344t}\approx 1{,}02\,\mathrm{e}^{0{,}344t} \]

d. $N$ double quand $\mathrm{e}^{0{,}344\,T} = 2$.

\[ T = \frac{\ln 2}{0{,}344}\approx 2{,}0 \text{ ans} \]

On retrouve la loi de Moore : le nombre de transistors double environ tous les deux ans.

e. On remplace $t$ par 12.

\[ N\approx 1{,}02\,\mathrm{e}^{0{,}344\times 12} = 1{,}02\,\mathrm{e}^{4{,}128}\approx 63 \text{ millions} \]

✔ Cohérent : 2 doublements de plus après $t = 8$ donnent $15{,}8\times 4\approx 63$.

Exercice 5
Distance de freinage

On mesure la distance de freinage $d$ (en m) d'une voiture sur route sèche en fonction de sa vitesse $v$ (en km/h).

$v_i$30507090110
$d_i$5,415,229,849,173,0
  1. Un ajustement affine de $d$ en $v$ donnerait $r\approx 0{,}98$. Pourquoi n'est-ce pourtant pas le meilleur modèle ? On pourra calculer $\frac{d_i}{v_i^2}$.
  2. On pose $X = v^2$. Compléter le tableau des $X_i$.
  3. La calculatrice donne l'ajustement $d = 0{,}006\,035\,X + 0{,}10$ avec $r\approx 0{,}99999$. En déduire $d$ en fonction de $v$.
  4. Estimer la distance de freinage à 130 km/h. Que se passe-t-il quand la vitesse double ?

a. On teste l'hypothèse « $d$ proportionnelle à $v^2$ ».

\[ \frac{5{,}4}{900} = 0{,}0060 \quad \frac{15{,}2}{2500}\approx 0{,}0061 \quad \frac{29{,}8}{4900}\approx 0{,}0061 \quad \frac{49{,}1}{8100}\approx 0{,}0061 \quad \frac{73{,}0}{12\,100}\approx 0{,}0060 \]

Ces quotients sont quasi constants : $d$ est proportionnelle au carré de la vitesse (énergie cinétique $\frac12 mv^2$). Un $r$ élevé ne garantit pas que le modèle affine soit le bon : il faut regarder la forme du nuage, ici courbée.

b. On élève chaque vitesse au carré.

$X_i$9002 5004 9008 10012 100

c. On remplace $X$ par $v^2$.

\[ d\approx 0{,}006\,035\,v^2 + 0{,}10 \]

d. On remplace $v$ par 130.

\[ d\approx 0{,}006\,035\times 16\,900 + 0{,}10\approx 102 \text{ m} \]

💡 Quand la vitesse double, $v^2$ est multiplié par 4 : la distance de freinage est environ multipliée par 4 (de 50 à 100 km/h : de 15 m à 60 m).

© 2026 Pierre Carrée · Nantes — Tous droits réservés