CoursTerminale maths complémentaires
Échantillonnage et analyse de données
Densité et fonction de répartition
Une densité $f$ est non négative et l’aire totale sous sa courbe vaut $1$. Dans les exemples, elle est continue, éventuellement par morceaux, sur son support et nulle ailleurs. Pour $u\le v$ :
$P(X=x)=0$ : une borne stricte ou large ne change pas la probabilité. La hauteur $f(x)$ n’est pas une probabilité. Sur un support non borné, l’aire totale se calcule par une limite.
La fonction de répartition $F(x)=P(X\le x)$ est croissante et à valeurs dans $[0;1]$. Pour une variable à densité :
Voir un exemple — Une aire de probabilité
Pour $f(x)=\frac x2$ sur $[0;2]$, nulle ailleurs, $\int_0^2 f=1$. Entre $1$ et $1{,}5$ :
Espérance et dispersion
Lorsque les moments nécessaires sont finis, les intégrales portent sur tout le support de la loi :
L’espérance est une moyenne théorique ; l’écart type mesure la dispersion, sans prédire une observation particulière.
Comprendre pourquoi — Retrouver la formule de la variance
Les moments considérés existent. Toutes les intégrales portent sur le support de $X$. On pose $\mu=\int xf(x)\,dx$ et on rappelle que $\int f(x)\,dx=1$.
Le développement donne $(x-\mu)^2=x^2-2\mu x+\mu^2$. Par linéarité,
Loi uniforme continue
Sur $[0;1]$, la densité uniforme vaut $1$, et $0$ ailleurs ; $F(x)=x$ pour $0\le x\le1$, $E(X)=\frac12$ et $V(X)=\frac1{12}$.
Plus généralement, pour $X$ uniforme sur $[a;b]$, avec $a<b$, la densité vaut $\frac1{b-a}$ sur cet intervalle et $0$ ailleurs.
Des intervalles de même longueur, inclus dans le support, ont la même probabilité.
Loi exponentielle
Pour $\lambda>0$, la loi exponentielle a pour densité :
$F(t)=0$ pour $t<0$. Pour $t\ge0$ :
Absence de mémoire : pour $s,t\ge0$, avec $P(T>s)>0$ :
La probabilité d’une attente supplémentaire ne dépend pas du temps déjà écoulé.
Comprendre pourquoi — Pourquoi la loi exponentielle est sans mémoire
Pour $s,t\geqslant0$, $\{T>s+t\}\subset\{T>s\}$ et $P(T>s)=e^{-\lambda s}>0$. Le quotient conditionnel vaut $\frac{e^{-\lambda(s+t)}}{e^{-\lambda s}}=e^{-\lambda t}=P(T>t)$.
Nuage, point moyen et régression
Pour $n\ge2$ couples $(x_i;y_i)$, le nuage contient les points de ces coordonnées. Le point moyen est $G(\bar x;\bar y)$, où :
La droite des moindres carrés de $y$ en $x$ minimise la somme des carrés des résidus verticaux $e_i=y_i-(ax_i+b)$. Poser les sommes non divisées par $n$ :
Si $S_{xx}>0$, les coefficients sont :
La droite passe par $G$. Si tous les $x_i$ sont égaux, $S_{xx}=0$ et aucune pente unique n’est déterminée. La calculatrice peut fournir la régression ; contrôler aussi le nuage et les résidus. Le segment vertical de la figure est un résidu.
Voir un exemple — Calculer une droite de régression et un résidu
Calculer puis contrôler un ajustement affine
Pour cinq couples fictifs $(x_i,y_i)=(1,3),(2,4),(3,5),(4,7),(5,6)$, le point moyen est $G(\bar x;\bar y)=(3;5)$. Les valeurs centrées donnent $S_{xx}=10>0$ et $S_{xy}=9$. La pente des moindres carrés de $y$ en $x$ est $a=\frac{S_{xy}}{S_{xx}}=0{,}9$ et $b=\bar y-a\bar x=2{,}3$.
La droite $y=0{,}9x+2{,}3$ passe par $G$. Pour $x=4$, elle prévoit $5{,}9$ alors que le relevé vaut $7$ ; le résidu vertical est $1{,}1$ unité. Les points ne sont pas tous sur la droite.
Corrélation
Si $S_{xx}>0$ et $S_{yy}>0$, le coefficient de corrélation linéaire est :
Son signe donne le sens de la liaison linéaire ; plus $|r|$ est proche de $1$, plus cette liaison est marquée. Si une série est constante, $r$ n’est pas défini.
Une corrélation ne prouve pas une causalité. Une corrélation linéaire nulle n’exclut pas une liaison non linéaire.
Comprendre pourquoi — Une relation exacte avec une corrélation nulle
Pour $(-1;1),(0;0),(1;1)$, la relation exacte est $y=x^2$. Pourtant $S_{xx}=2$, $S_{yy}=\frac23$ et $S_{xy}=0$, donc $r=0$. Une corrélation linéaire nulle n’exclut pas une liaison non linéaire.
Changement de variable et prévision
Pour des données $y_i>0$, un changement $z_i=\ln y_i$ peut rendre le nuage $(x_i;z_i)$ approximativement aligné. Le choix doit être motivé par les données. Après ajustement $z=\alpha x+\beta$, revenir aux variables initiales :
Les moindres carrés ont été appliqués aux logarithmes, pas aux valeurs initiales : contrôler aussi les écarts après le retour à $y$.
Une interpolation estime une valeur à l’intérieur de l’intervalle des abscisses observées ; une extrapolation en dehors. Ce sont des estimations. L’extrapolation exige de vérifier que la tendance peut encore être utilisée.