PrécédentCh. 10 — Équations différentielles 📚 Tous les chapitres
Ch. 11 Mathématiques · Terminale Industrielle (TF2/F3)

Statistiques à deux variables

Objectif Général 5 — Statistiques. Nuage de points, point moyen, ajustement affine par la méthode des moindres carrés, covariance, coefficient de corrélation linéaire, interpolation et extrapolation.

1. Série statistique double, nuage de points, point moyen

Définition

Une série statistique double (ou à deux variables) associe à chaque individu i deux valeurs numériques xᵢ et yᵢ, formant n couples (x₁,y₁), (x₂,y₂), …, (xₙ,yₙ). Le nuage de points est la représentation, dans un repère, de l'ensemble des points Mᵢ(xᵢ ; yᵢ).

Point moyen

Le point moyen du nuage est le point G(x̄ ; ȳ), où x̄ et ȳ sont les moyennes respectives des séries (xᵢ) et (yᵢ) :

x̄ = (x₁+x₂+…+xₙ)/n ȳ = (y₁+y₂+…+yₙ)/n
Exemple résolu

On mesure la température x (°C) et la consommation d'énergie y (kWh) d'un atelier sur 5 jours : (10 ; 42), (15 ; 35), (20 ; 30), (25 ; 24), (30 ; 19).

x̄ = (10+15+20+25+30)/5 = 100/5 = 20. ȳ = (42+35+30+24+19)/5 = 150/5 = 30. Point moyen : G(20 ; 30).

2. Ajustement affine — méthode des moindres carrés

Principe

Lorsque le nuage de points a une forme allongée, on peut l'ajuster par une droite d'équation y = ax + b, appelée droite de régression de y en x, qui minimise la somme des carrés des écarts verticaux entre les points et la droite (méthode des moindres carrés).

Formules (admises)

Le coefficient directeur a et l'ordonnée à l'origine b de la droite de régression de y en x sont donnés par :

a = Cov(x,y) / V(x) b = ȳ − a·x̄

où V(x) est la variance de la série (xᵢ) et Cov(x,y) la covariance des deux séries (définies au paragraphe suivant). La droite de régression passe toujours par le point moyen G(x̄ ; ȳ).

Exemple résolu

Sachant a = −1,04 et le point moyen G(20 ; 30) de l'exemple précédent, déterminer b puis l'équation de la droite.

b = ȳ − a·x̄ = 30 − (−1,04)×20 = 30 + 20,8 = 50,8. Équation : y = −1,04x + 50,8.

3. Covariance et coefficient de corrélation linéaire

Covariance

La covariance de la série double (xᵢ, yᵢ) est :

Cov(x,y) = (1/n)·Σ(xᵢ − x̄)(yᵢ − ȳ) = (1/n)·Σ xᵢyᵢ − x̄·ȳ
Coefficient de corrélation linéaire

Le coefficient de corrélation linéaire r mesure la qualité de l'ajustement affine :

r = Cov(x,y) / (σₓ · σᵧ)

où σₓ = √V(x) et σᵧ = √V(y) sont les écarts-types des deux séries.

Interprétation

On a toujours −1 ≤ r ≤ 1. Plus |r| est proche de 1, meilleur est l'ajustement affine (points quasi alignés). Si r > 0, la corrélation est positive (croissante) ; si r < 0, elle est négative (décroissante). En pratique, on considère qu'un ajustement affine est pertinent lorsque |r| ≥ 0,87 environ.

Exemple résolu

Pour une série donnant r = −0,97, peut-on considérer l'ajustement affine comme pertinent ?

|r| = 0,97, très proche de 1 (et supérieur à 0,87) : l'ajustement affine est excellent, la corrélation étant fortement négative (y décroît quand x augmente).

4. Interpolation et extrapolation

Définitions

Une fois la droite de régression y = ax + b établie, on peut estimer une valeur de y pour une valeur de x :

Interpolation : estimer y pour une valeur de x comprise dans l'intervalle des valeurs observées.
Extrapolation : estimer y pour une valeur de x en dehors de cet intervalle (moins fiable, la tendance n'étant pas garantie hors du domaine étudié).

Exemple résolu

Avec l'équation y = −1,04x + 50,8 (valable pour x entre 10 et 30 environ), estimer la consommation pour une température de 18 °C (interpolation), puis pour 5 °C (extrapolation).

Pour x = 18 : y = −1,04×18 + 50,8 = −18,72 + 50,8 = 32,08 kWh (interpolation, x = 18 dans [10;30]).

Pour x = 5 : y = −1,04×5 + 50,8 = −5,2 + 50,8 = 45,6 kWh (extrapolation, x = 5 hors de [10;30] : estimation moins fiable).

🧠 À retenir absolument

  • Point moyen G(x̄ ; ȳ) : la droite de régression passe toujours par G
  • Droite d'ajustement affine : y = ax + b, avec a = Cov(x,y)/V(x) et b = ȳ − a·x̄
  • Covariance : Cov(x,y) = (1/n)Σxᵢyᵢ − x̄ȳ
  • Coefficient de corrélation r = Cov(x,y)/(σₓσᵧ), avec −1 ≤ r ≤ 1 ; |r| proche de 1 ⟹ bon ajustement
  • Interpolation (dans l'intervalle observé) plus fiable que l'extrapolation (hors intervalle)
1

Calcul du point moyen

● Facile

On donne la série double : x : 2, 4, 6, 8, 10 et y : 5, 9, 11, 15, 20. Calculer les moyennes x̄ et ȳ, puis donner les coordonnées du point moyen G.

✅ Correction

x̄ = (2+4+6+8+10)/5 = 30/5 = 6. ȳ = (5+9+11+15+20)/5 = 60/5 = 12.

Point moyen : G(6 ; 12).

2

Équation de la droite de régression

● Facile

Une droite de régression de y en x a pour coefficient directeur a = 2,5 et passe par le point moyen G(6 ; 12) (données de l'exercice 1). Déterminer b puis l'équation de la droite.

✅ Correction

b = ȳ − a·x̄ = 12 − 2,5×6 = 12 − 15 = −3.

Équation de la droite : y = 2,5x − 3.

3

Calcul de covariance

● Moyen

Pour la série de l'exercice 1 (x : 2,4,6,8,10 et y : 5,9,11,15,20, avec x̄=6 et ȳ=12), on donne Σxᵢyᵢ = 2×5+4×9+6×11+8×15+10×20 = 10+36+66+120+200 = 432. Calculer la covariance Cov(x,y).

✅ Correction

Cov(x,y) = (1/n)Σxᵢyᵢ − x̄·ȳ = 432/5 − 6×12 = 86,4 − 72 = 14,4.

4

Coefficient de corrélation et interprétation

● Moyen

Pour la série précédente, on donne Cov(x,y) = 14,4, σₓ = 2,828 et σᵧ = 5,231.

  1. Calculer le coefficient de corrélation linéaire r (arrondi à 10⁻³ près).
  2. L'ajustement affine est-il pertinent ? Justifier.
✅ Correction
  1. r = Cov(x,y)/(σₓ×σᵧ) = 14,4/(2,828×5,231) = 14,4/14,793 ≈ 0,973.
  2. |r| ≈ 0,973, très proche de 1 (largement supérieur à 0,87) : l'ajustement affine est pertinent, la corrélation entre x et y est fortement positive et quasi linéaire.
5

Étude complète d'une série double — problème de synthèse

● Difficile

Le tableau suivant donne le temps de production x (en heures) et le nombre de pièces défectueuses y relevés sur une machine, pour 5 séries de fabrication :

x (heures)12345
y (défauts)35688
  1. Calculer le point moyen G(x̄ ; ȳ).
  2. Sachant que Σxᵢyᵢ = 1×3+2×5+3×6+4×8+5×8 = 103, calculer la covariance Cov(x,y).
  3. Sachant que V(x) = 2, déterminer le coefficient directeur a = Cov(x,y)/V(x) de la droite de régression de y en x, puis b, puis l'équation de la droite.
  4. Estimer, par interpolation, le nombre de défauts pour x = 3,5 heures.
✅ Correction
  1. x̄ = (1+2+3+4+5)/5 = 15/5 = 3. ȳ = (3+5+6+8+8)/5 = 30/5 = 6. G(3 ; 6).
  2. Cov(x,y) = (1/n)Σxᵢyᵢ − x̄·ȳ = 103/5 − 3×6 = 20,6 − 18 = 2,6.
  3. a = Cov(x,y)/V(x) = 2,6/2 = 1,3. b = ȳ − a·x̄ = 6 − 1,3×3 = 6 − 3,9 = 2,1. Équation de la droite : y = 1,3x + 2,1.
  4. Pour x = 3,5 (interpolation, car compris entre 1 et 5) : y = 1,3×3,5 + 2,1 = 4,55 + 2,1 = 6,65, soit environ 7 pièces défectueuses estimées.

QCM — Auto-évaluation

10 questions · Une seule bonne réponse · Correction immédiate

0Score
0/10Répondues
Question 1 / 10

Le point moyen G d'un nuage de points a pour coordonnées :

Question 2 / 10

Pour la série x : 2, 4, 6, la moyenne x̄ vaut :

Question 3 / 10

La droite de régression y = ax + b, obtenue par la méthode des moindres carrés, passe toujours par :

Question 4 / 10

Le coefficient de corrélation linéaire r vérifie toujours :

Question 5 / 10

Un coefficient de corrélation r = −0,95 indique :

Question 6 / 10

La covariance Cov(x,y) d'une série double se calcule par la formule :

Question 7 / 10

Le coefficient directeur a de la droite de régression de y en x est donné par :

Question 8 / 10

Estimer une valeur de y pour un x situé HORS de l'intervalle des valeurs observées s'appelle :

Question 9 / 10

Si la droite de régression a pour équation y = 2x + 3 et passe par G(4 ; ȳ), alors ȳ vaut :

Question 10 / 10

Un ajustement affine est généralement considéré comme pertinent lorsque :