TD 4 - Test de comparaison de moyennes

Exercice 1 : Le compas dans l’œil

A l’œil, sans l’aide d’une règle et indépendamment de vos voisins, évaluer la longueur du segment AK (si votre nom commence par une lettre entre A et K) ou du segment LZ à la fin de l’exercice (si votre nom commence par une lettre entre L et Z).

Une fois toutes les données recueillies dans votre tableur préféré, considérons deux groupes : les évaluations faites pour la longueur AK et celle faite pour la longueur LZ. On suppose que la longueur AK suit une loi normale d’espérance \(\mu_1\) et de variance \(\sigma_2\) et que la longueur LZ suit une loi normale d’espérance \(\mu_2\) et de variance \(\sigma_2\).

Saisir les données, les sauvegarder dans un fichier longueur.csv puis les importer dans un objet dta de R. On cherche dans un premier temps à savoir si, en moyenne, l’évaluation de la longueur AK est non biaisée.

  • Exprimer la problématique ci-dessus sous la forme d’un test d’hypothèses

  • Dans cette problématique de test, quel est l’échantillon et quelle est la population ?

  • A l’aide des données recueillies, mettre en œuvre le test avec un niveau de confiance de 95 %.

Pour le segment LZ, tester si, en moyenne, il est évalué justement ou sous-estimé (préciser \(H_0\) et \(H_1\) avant de construire le test sous R).

On souhaite maintenant tester l’égalité des moyennes entre AK et LZ

  • Exprimer la problématique ci-dessus sous la forme d’un test d’hypothèses

Exercice 2 : Le carbone organique dissout

On reprend les données sur le carbone organique dissout (COD). On s’intéresse dans un premier temps au percentile 90 du COD. Reprendre les lignes de code permettant d’importer le jeu de données :

dta <- read.table("Donnees_COD.csv", sep=";", dec=",", header=TRUE, stringsAsFactors = TRUE)
summary(dta)

On s’intéresse maintenant au phosphore total (Ptot_P90). Dans un premier temps, on s’intéresse aux données du bassin parisien uniquement. Pour cela, on filtre les données et on construit un objet dta_bassin qui contient uniquement les stations du bassin parisien.

library(tidyverse)
dta_bassin <- dta |> filter(region=="bassin_parisien")
  1. Donner l’intervalle de confiance du carbone organique dissout. A quoi cet intervalle correspond-il ?

  2. Peut-on considérer que les moyennes des COD sont égales dans les deux régions ?

On s’intéresse maintenant au phosphore total (Ptot_P90).

  1. Construire l’intervalle de confiance du phosphore total pour les stations du bassin parisien.
  2. Construire maintenant l’intervalle de confiance du phosphore total pour les stations du massif armoricain uniquement.
  3. Peut-on considérer que la moyenne du phosphore total est plus grande dans le bassin parisien que dans le massif armoricain ?
  4. Comparez les largeurs des deux intervalles de confiance (bassin parisien vs massif armoricain). Quelle(s) raison(s) peut/peuvent expliquer la différence de largeur ?