← Exercices et QCM

CoursTerminale maths complémentaires

Tous les cours

Échantillonnage et analyse de données

Densité et fonction de répartition

Une densité $f$ est non négative et l’aire totale sous sa courbe vaut $1$. Dans les exemples, elle est continue, éventuellement par morceaux, sur son support et nulle ailleurs. Pour $u\le v$ :

\[P(u\le X\le v)=\int_u^v f(x)\,\mathrm dx.\]

$P(X=x)=0$ : une borne stricte ou large ne change pas la probabilité. La hauteur $f(x)$ n’est pas une probabilité. Sur un support non borné, l’aire totale se calcule par une limite.

La fonction de répartition $F(x)=P(X\le x)$ est croissante et à valeurs dans $[0;1]$. Pour une variable à densité :

\[P(u\le X\le v)=F(v)-F(u)\quad(u\le v),\qquad P(X>x)=1-F(x).\]
Voir un exemple — Une aire de probabilité

Pour $f(x)=\frac x2$ sur $[0;2]$, nulle ailleurs, $\int_0^2 f=1$. Entre $1$ et $1{,}5$ :

\[P(1\le X\le1{,}5)=\left[\frac{x^2}{4}\right]_1^{1{,}5}=\frac5{16}.\]
Densité triangulaire sur [0,2] et aire de probabilité entre 1 et 1,5.

Espérance et dispersion

Lorsque les moments nécessaires sont finis, les intégrales portent sur tout le support de la loi :

\[\mu=E(X)=\int xf(x)\,\mathrm dx,\qquad V(X)=\int(x-\mu)^2f(x)\,\mathrm dx=\int x^2f(x)\,\mathrm dx-\mu^2,\qquad\sigma(X)=\sqrt{V(X)}.\]

L’espérance est une moyenne théorique ; l’écart type mesure la dispersion, sans prédire une observation particulière.

Comprendre pourquoi — Retrouver la formule de la variance

Les moments considérés existent. Toutes les intégrales portent sur le support de $X$. On pose $\mu=\int xf(x)\,dx$ et on rappelle que $\int f(x)\,dx=1$.

Le développement donne $(x-\mu)^2=x^2-2\mu x+\mu^2$. Par linéarité,

\[\begin{aligned} V(X)&=\int x^2 f(x)\,dx-2\mu\int x f(x)\,dx+\mu^2\int f(x)\,dx\\ &=\int x^2f(x)\,dx-2\mu^2+\mu^2=\int x^2f(x)\,dx-\mu^2. \end{aligned}\]

Loi uniforme continue

Sur $[0;1]$, la densité uniforme vaut $1$, et $0$ ailleurs ; $F(x)=x$ pour $0\le x\le1$, $E(X)=\frac12$ et $V(X)=\frac1{12}$.

Plus généralement, pour $X$ uniforme sur $[a;b]$, avec $a<b$, la densité vaut $\frac1{b-a}$ sur cet intervalle et $0$ ailleurs.

\[F(x)=\begin{cases}0&x<a,\\\frac{x-a}{b-a}&a\le x\le b,\\1&x>b,\end{cases}\qquad E(X)=\frac{a+b}{2},\qquad V(X)=\frac{(b-a)^2}{12}.\]
\[P(u\le X\le v)=\frac{v-u}{b-a}\qquad(a\le u\le v\le b).\]

Des intervalles de même longueur, inclus dans le support, ont la même probabilité.

Loi exponentielle

Pour $\lambda>0$, la loi exponentielle a pour densité :

\[f(t)=\begin{cases}\lambda e^{-\lambda t}&t\ge0,\\0&t<0.\end{cases}\]

$F(t)=0$ pour $t<0$. Pour $t\ge0$ :

\[F(t)=1-e^{-\lambda t},\qquad P(T>t)=e^{-\lambda t},\qquad E(T)=\frac1\lambda.\]

Absence de mémoire : pour $s,t\ge0$, avec $P(T>s)>0$ :

\[P(T>s+t\mid T>s)=P(T>t)=e^{-\lambda t}.\]

La probabilité d’une attente supplémentaire ne dépend pas du temps déjà écoulé.

Comprendre pourquoi — Pourquoi la loi exponentielle est sans mémoire

Pour $s,t\geqslant0$, $\{T>s+t\}\subset\{T>s\}$ et $P(T>s)=e^{-\lambda s}>0$. Le quotient conditionnel vaut $\frac{e^{-\lambda(s+t)}}{e^{-\lambda s}}=e^{-\lambda t}=P(T>t)$.

Nuage, point moyen et régression

Pour $n\ge2$ couples $(x_i;y_i)$, le nuage contient les points de ces coordonnées. Le point moyen est $G(\bar x;\bar y)$, où :

\[\bar x=\frac1n\sum_i x_i,\qquad\bar y=\frac1n\sum_i y_i.\]

La droite des moindres carrés de $y$ en $x$ minimise la somme des carrés des résidus verticaux $e_i=y_i-(ax_i+b)$. Poser les sommes non divisées par $n$ :

\[S_{xx}=\sum_i(x_i-\bar x)^2,\quad S_{yy}=\sum_i(y_i-\bar y)^2,\quad S_{xy}=\sum_i(x_i-\bar x)(y_i-\bar y).\]

Si $S_{xx}>0$, les coefficients sont :

\[a=\frac{S_{xy}}{S_{xx}},\qquad b=\bar y-a\bar x.\]

La droite passe par $G$. Si tous les $x_i$ sont égaux, $S_{xx}=0$ et aucune pente unique n’est déterminée. La calculatrice peut fournir la régression ; contrôler aussi le nuage et les résidus. Le segment vertical de la figure est un résidu.

Nuage, droite y=0,9x+2,3 et résidu vertical en x=4.
Voir un exemple — Calculer une droite de régression et un résidu

Calculer puis contrôler un ajustement affine

Pour cinq couples fictifs $(x_i,y_i)=(1,3),(2,4),(3,5),(4,7),(5,6)$, le point moyen est $G(\bar x;\bar y)=(3;5)$. Les valeurs centrées donnent $S_{xx}=10>0$ et $S_{xy}=9$. La pente des moindres carrés de $y$ en $x$ est $a=\frac{S_{xy}}{S_{xx}}=0{,}9$ et $b=\bar y-a\bar x=2{,}3$.

La droite $y=0{,}9x+2{,}3$ passe par $G$. Pour $x=4$, elle prévoit $5{,}9$ alors que le relevé vaut $7$ ; le résidu vertical est $1{,}1$ unité. Les points ne sont pas tous sur la droite.

Corrélation

Si $S_{xx}>0$ et $S_{yy}>0$, le coefficient de corrélation linéaire est :

\[r=\frac{S_{xy}}{\sqrt{S_{xx}S_{yy}}},\qquad -1\le r\le1.\]

Son signe donne le sens de la liaison linéaire ; plus $|r|$ est proche de $1$, plus cette liaison est marquée. Si une série est constante, $r$ n’est pas défini.

Une corrélation ne prouve pas une causalité. Une corrélation linéaire nulle n’exclut pas une liaison non linéaire.

Comprendre pourquoi — Une relation exacte avec une corrélation nulle

Pour $(-1;1),(0;0),(1;1)$, la relation exacte est $y=x^2$. Pourtant $S_{xx}=2$, $S_{yy}=\frac23$ et $S_{xy}=0$, donc $r=0$. Une corrélation linéaire nulle n’exclut pas une liaison non linéaire.

Trois points liés par y=x², malgré le coefficient de corrélation nul démontré ensuite. La parabole ne représente pas d'autres observations.

Changement de variable et prévision

Pour des données $y_i>0$, un changement $z_i=\ln y_i$ peut rendre le nuage $(x_i;z_i)$ approximativement aligné. Le choix doit être motivé par les données. Après ajustement $z=\alpha x+\beta$, revenir aux variables initiales :

\[\widehat y=e^{\alpha x+\beta}=e^\beta e^{\alpha x}.\]

Les moindres carrés ont été appliqués aux logarithmes, pas aux valeurs initiales : contrôler aussi les écarts après le retour à $y$.

Une interpolation estime une valeur à l’intérieur de l’intervalle des abscisses observées ; une extrapolation en dehors. Ce sont des estimations. L’extrapolation exige de vérifier que la tendance peut encore être utilisée.

Mathos Locos