Comment comparer deux proportions?

Une fois que vous saurez comparer les proportions
Une fois que vous saurez comparer les proportions, vous serez en mesure de répondre à ces questions.

La comparaison de deux proportions est souvent nécessaire pour voir si elles sont significativement différentes l'une de l'autre. Par exemple, supposons que vous fassiez une étude de contrôle randomisée sur 40 personnes, la moitié affectée à un traitement et l'autre moitié affectée à un placebo. 140 du groupe expérimental se sont améliorés, tandis que 12,50 du groupe témoin se sont également améliorés. Ces deux proportions sont-elles significativement différentes l'une de l'autre? Le traitement est-il efficace? Une fois que vous saurez comparer les proportions, vous serez en mesure de répondre à ces questions.

Pas

  1. 1
    Mettre en place l'hypothèse nulle et l'hypothèse alternative. L'hypothèse nulle ( H0{\displaystyle H_{0}} ) contient toujours une égalité, et c'est celle que vous essayez de réfuter. L'hypothèse alternative (de recherche) ne contient jamais d'égalité, et c'est celle que vous essayez de confirmer. Ces deux hypothèses sont formulées de manière à s'exclure mutuellement et à être collectivement exhaustives. L'exclusivité mutuelle signifie que si l'un est vrai, l'autre doit être faux, et vice versa. Collectivement exhaustif signifie qu'au moins un des résultats doit se produire. Vos hypothèses sont formulées selon qu'elles sont unilatérales ou bilatérales:
    • Unilatéral: Question de recherche: une proportion est-elle plus élevée que l'autre? Vos hypothèses s'énonceraient comme suit: {H0:p^1≤p^2Ha:p^1>p^2{\displaystyle {\begin{cases}H_{0}:{\hat {p}}_{1 }\leq {\hat {p}}_{2}\\H_{a}:{\hat {p}}_{1}>{\hat {p}}_{2}\end{cases}} } . Utilisez unilatéral si vous êtes intéressé par la différence dans une seule direction. Par exemple, pour cet exemple, nous ne sommes intéressés que si le traitement fonctionne, c'est-à-dire que la proportion est plus importante dans le groupe de traitement. Si nous désignons le groupe de traitement par 1 et le groupe de contrôle par 2, les hypothèses sont {H0:p^1≤p^2Ha:p^1>p^2{\displaystyle {\begin{cases}H_{0}: {\hat {p}}_{1}\leq {\hat {p}}_{2}\\H_{a}:{\hat {p}}_{1}>{\hat {p}} _{2}\end{cas}}} .
    • Bilatéral: Question de recherche: La proportion de l'échantillon est-elle différente de la proportion hypothétique de la population? Vos hypothèses s'énonceraient comme suit: {H0:p^=p0Ha:p^≠p0{\displaystyle {\begin{cases}H_{0}:{\hat {p}}=p_{0}\\H_{ a}:{\hat {p}}\neq p_{0}\end{cases}}} .
      • S'il n'y a aucune raison a priori de croire qu'une différence est unidirectionnelle, le test bilatéral est préféré car il s'agit d'un test plus rigoureux.
  2. 2
    Définissez un niveau de signification approprié ( α{\displaystyle \alpha } aka "alpha"). Par définition, le niveau alpha est la probabilité de rejeter l'hypothèse nulle lorsque l'hypothèse nulle est vraie. Le plus souvent, alpha est fixé à 0,05, bien que toute autre valeur (entre 0 et 1, exclusive) puisse être utilisée à la place. Les autres valeurs alpha couramment utilisées comprennent 0,01 et 0,10.
    Calculez les deux proportions de l'échantillon
    Calculez les deux proportions de l'échantillon.
  3. 3
    Calculez les deux proportions de l'échantillon. Une proportion est le nombre de «succès» divisé par l'échantillon total du groupe. Dans cet exemple, {p^1=1820=0,9p^2=1520=0,75{\displaystyle {\begin{cases}{\hat {p}}_{1}={\frac {18}{ 20}}=0,9\\{\hat {p}}_{2}={\frac {15}{20}}=0,75\end{cases}}} .
  4. 4
    Calculer la proportion globale de l'échantillon. La proportion globale de l'échantillon, p^{\displaystyle {\hat {p}}} , est le nombre total de «succès» divisé par l'échantillon total parmi tous les groupes. La formule est p^=n1p^1+n2p^2n1+n2{\displaystyle {\hat {p}}={\frac {n_{1}{\hat {p}}_{1}+n_{2}{ \hat {p}}_{2}}{n_{1}+n_{2}}}} , où n1{\displaystyle n_{1}} et n2{\displaystyle n_{2}} sont les tailles d'échantillon pour groupes 1 et 2, respectivement. Dans cet exemple, p^=18+1520+20=0,825{\displaystyle {\hat {p}}={\frac {18+15}{20+20}}=0,825} .
  5. 5
    Calculer l'erreur standard de la différence. L'erreur standard, SE, est calculée comme p^(1−p^)(1n1+1n2){\displaystyle {\sqrt {{\hat {p}}(1-{\hat {p}})\left({\frac {1}{n_{1}}}+{\frac {1}{n_{2}}}\right)}}} . Dans cet exemple, SE=0,825(1−0,825)(120+120)=0,120156{\displaystyle SE={\sqrt {0,825(1-0,825)\left({\frac {1}{20}}+ {\frac {1}{20}}\right)}}=0,120156} .
    Si nous voulions détecter une différence de proportion de 0,15
    Dans cet exemple, si nous voulions détecter une différence de proportion de 0,15, nous aurions besoin d'une taille d'échantillon n au moins.
  6. 6
    Calculer la statistique de test, z. La formule est z=p^1−p^2SE{\displaystyle z={\frac {{\hat {p}}_{1}-{\hat {p}}_{2}}{SE}}} . Dans cet exemple, z=0,9−0,750.120156=1,248{\displaystyle z={\frac {0,9-0,75}{0,120156}}=1,248} .
  7. 7
    Convertissez la statistique de test en une valeur p. La valeur p est la probabilité qu'un échantillon de n choisi au hasard ait une statistique d'échantillon au moins aussi différente de celle obtenue. La valeur p est la zone de queue sous la courbe normale dans la direction de l'hypothèse alternative. Par exemple, si un test à queue droite est utilisé, la valeur p est la zone à queue droite ou la zone à droite de la valeur z. Si un test bilatéral est utilisé, la valeur p est l'aire dans les deux queues. La valeur p peut être trouvée en utilisant l'une des méthodes suivantes:
    • Table z de probabilité de distribution normale. Des exemples peuvent être trouvés sur le Web, comme celui-ci. Il est important de lire la description de la table pour noter quelle probabilité est répertoriée par la table. Certains tableaux répertorient la zone cumulative (côté gauche), d'autres répertorient la zone de queue droite, d'autres encore ne répertorient que la zone de la moyenne jusqu'à une valeur z positive.
    • Exceller. La fonction excel =norm.s.dist(z,cumulative). Remplacez la valeur numérique par z et "true" par cumulatif. Cette formule Excel donne une surface cumulative à gauche d'une valeur z donnée. Si vous avez besoin de la bonne zone de queue, soustrayez de 1.
      • Dans cet exemple, nous avons besoin de la zone de queue droite, donc la valeur p = 1- NORM.S.DIST(1,248,TRUE) = 0,106.
    • Calculatrice Texas Instrument, telle que TI-83 ou TI-84.
    • Calculatrices de distribution normale en ligne, comme celle - ci.
  8. 8
    Décidez entre hypothèse nulle ou hypothèse alternative. Si pvalue<α{\displaystyle p_{value}<\alpha } , rejetez H0{\displaystyle H_{0}} . Sinon, ne rejetez pas H0{\displaystyle H_{0}} . Dans cet exemple, puisque pvalue=0.106{\displaystyle p_{value}=0.106} est supérieur à α=0,05{\displaystyle \alpha =0,05} , l'expérimentateur ne parvient pas à rejeter H0{\displaystyle H_{0} } .
    La différence entre les deux proportions est de
    Dans cet exemple, la différence entre les deux proportions est de, mais elle n'était pas statistiquement significative compte tenu de la taille globale de l'échantillon de 40.
  9. 9
    Énoncez une conclusion sur la question de recherche. Dans cet exemple, l'expérimentateur ne rejette pas l'hypothèse nulle et ne dispose pas de preuves suffisantes pour soutenir l'affirmation selon laquelle le traitement est efficace. La proportion de personnes qui se sont améliorées avec le traitement, 90%, n'est pas significativement différente de la proportion de personnes qui se sont améliorées avec le placebo, 75%.
  10. 10
    Calculer un intervalle de confiance pour la différence de proportion. La formule est Différence±Z∗SE{\displaystyle {\text{Différence}}\pm Z*SE} .
    • Choisissez un niveau de confiance. 95% est le plus couramment utilisé, ce qui correspond à α=0,05{\displaystyle \alpha =0,05} .
    • Déterminez le z-score correspondant au niveau alpha. La formule Excel est =norm.s.inv(1 - alpha / 2). Pour α=0,05{\displaystyle \alpha =0,05} , nous avons z = norm.s.inv(1-0,02.5) = 1,96.
    • Calculez la limite inférieure de l'intervalle de confiance comme Difference−Z∗SE{\displaystyle {\text{Difference}}-Z*SE} . Dans cet exemple, la limite inférieure est 0,15−1,96∗0,120156=−0,086{\displaystyle 0,15-1,96*0,120156=-0,086} .
    • Calculez la limite supérieure de l'intervalle de confiance comme Difference−Z∗SE{\displaystyle {\text{Difference}}-Z*SE} . Dans cet exemple, la limite inférieure est 0,15+1,96∗0,120156=0,386{\displaystyle 0,15+1,96*0,120156=0,386} .
    • Écrivez l'intervalle de confiance à 95% pour la différence en proportion comme 0,150±0,236{\displaystyle 0,150\pm 0,236} , ou -0,086 à 0,386.
    • Interpréter le résultat. Dans ce cas, nous sommes convaincus à 95% que la véritable différence de proportion est de -0,086 à 0,386. Étant donné que cette plage comprend 0, il n'y a pas suffisamment de preuves que les deux proportions sont différentes.

Conseils

  • Vous pouvez déterminer la taille d'échantillon minimale nécessaire pour détecter une différence de proportions. Dans cet exemple, la différence entre les deux proportions est de 0,90−0,75=0,15{\displaystyle 0,90-0,75=0,15} , mais elle n'était pas statistiquement significative compte tenu de la taille globale de l'échantillon de 40. Quelle taille d'échantillon est nécessaire pour détecter une différence?
    • Pour une différence significative, la valeur p doit être inférieure à α=0,05{\displaystyle \alpha =0,05} .
    • La statistique z correspondant à pvalue=0,05{\displaystyle p_{value}=0,05} est 1,96. Cela peut être calculé dans Excel comme =NORM.S.INV(1-0,02.5).
    • Branchez ceci dans la formule de la statistique z: 1,96=p1−p2SE=p1−p2p(1−p)(1n1+1n2)=p1−p24p(1−p)n{\displaystyle 1,96={\ frac {p_{1}-p_{2}}{SE}}={\frac {p_{1}-p_{2}}{\sqrt {p(1-p)\left({\frac {1} {n_{1}}}+{\frac {1}{n_{2}}}\right)}}}={\frac {p_{1}-p_{2}}{\sqrt {\frac {4p (1-p)}{n}}}}} , en supposant que n1=n2=n2{\displaystyle n_{1}=n_{2}={\frac {n}{2}}} . Donc p1−p2=1,964p(1−p)n=3,92p(1−p)n{\displaystyle p_{1}-p_{2}=1,96{\sqrt {\frac {4p(1- p)}{n}}}={\frac {3,92{\sqrt {p(1-p)}}}{\sqrt {n}}}} . Donc n=15,3664p(1−p)(p1−p2)2{\displaystyle n={\frac {15,3664p(1-p)}{(p_{1}-p_{2})^{2 }}}} est la taille d'échantillon minimale nécessaire.
    • Notez que la dérivée première de p(1−p){\displaystyle p(1-p)} est 1−2p{\displaystyle 1-2p} et vaut 0 lorsque p=0,5{\displaystyle p=0,5 } , tandis que la dérivée seconde de p(1−p){\displaystyle p(1-p)} est -2. Par conséquent, p=0,5{\displaystyle p=0,5} représente un maximum de la fonction p(1−p){\displaystyle p(1-p)} . Donc, si nous ne savons pas ce qu'est p{\displaystyle p} , utiliser p=0,5{\displaystyle p=0,5} garantira que n est suffisamment grand pour toute valeur possible de p. Donc n=3,8416(p1−p2)2{\displaystyle n={\frac {3,8416}{(p_{1}-p_{2})^{2}}}} est la taille d'échantillon minimale nécessaire pour détecter une différence de proportion de p1−p2{\displaystyle p_{1}-p_{2}} . Dans cet exemple, si nous voulions détecter une différence de proportion de 0,15, nous aurions besoin d'une taille d'échantillon n d'au moins 3,84160,152=171{\displaystyle {\frac {3,8416}{0,15^{2} }}=171} .

Questions et réponses

  • Comment avez-vous calculé la «différence» à l'étape 10? Je ne peux pas savoir d'où vous tenez 0,15.
    0,15 est la différence entre les deux proportions mentionnées à l'étape 9.

FacebookTwitterInstagramPinterestLinkedInGoogle+YoutubeRedditDribbbleBehanceGithubCodePenWhatsappEmail