10  Selección del contraste estadístico

Los capítulos anteriores han mostrado cómo diseñar un estudio estadístico: cómo seleccionar la muestra, cómo asignar (o no) la exposición, y en qué momentos recoger los datos. Una vez recogidos los datos según alguno de esos diseños, queda una segunda pregunta, igual de importante: ¿qué contraste de hipótesis es el adecuado para analizarlos?

La respuesta depende, sobre todo, de tres factores:

Esta segunda parte del libro está dedicada precisamente a esta cuestión: cómo elegir, y cómo ejecutar en R, el contraste de hipótesis apropiado en cada situación. A diferencia de la primera parte, aquí el capítulo no se organiza por tipo de diseño de investigación, sino por el número y la naturaleza de las poblaciones o grupos que se comparan, que es el criterio que realmente determina qué contraste utilizar. El diseño del estudio (si los datos proceden de un estudio de cohortes, de un ensayo clínico o de una simple encuesta) influye en qué conclusiones de causalidad pueden extraerse del resultado del contraste, pero no cambia, en general, qué contraste es el adecuado: eso lo determinan el número de variables, su tipo, y si las poblaciones comparadas son independientes o están pareadas.

10.1 Tabla de decisión

La siguiente tabla resume los contrastes de hipótesis más habituales según estos criterios, y sirve como mapa de esta segunda parte del libro. Cada fila indica, para una combinación de variable(s) independiente(s), variable dependiente y objetivo del análisis, cuál es el contraste apropiado y en qué capítulo se desarrolla.

Variables independientes Variable dependiente Objetivo Contraste Capítulo
Ninguna (una población) Cuantitativa Contrastar la normalidad de una variable Kolmogorov-Smirnov (muestras grandes) / Shapiro-Wilk Contrastes para una población
Cuantitativa normal Contrastar si la media poblacional tiene un valor determinado Test t para la media de una población
Ninguna (una población) Cualitativa (2 categorías) Contrastar si la proporción de una categoría tiene un valor determinado Test binomial / Test Z para una proporción
Cualitativa (>2 categorías) Contrastar si las proporciones de las categorías tienen unos valores determinados Test Chi-cuadrado de bondad de ajuste
Una cualitativa con 2 categorías, poblaciones independientes Cuantitativa normal Contrastar si hay diferencias entre las medias de las dos poblaciones Test F de Fisher (varianzas) + Test t de comparación de medias Contrastes para dos poblaciones independientes
Cuantitativa o cualitativa ordinal Contrastar si hay diferencias entre las distribuciones de las dos poblaciones Test U de Mann-Whitney
Cualitativa (2 categorías) Contrastar si hay relación entre las variables o diferencias entre proporciones Test Chi-cuadrado de independencia / Test exacto de Fisher
Cualitativa (>2 categorías) Contrastar si hay relación entre las variables o diferencias entre proporciones Test Chi-cuadrado de independencia
Una cualitativa con >2 categorías, poblaciones independientes Cuantitativa normal (varianzas homogéneas) Contrastar si hay diferencias entre las medias de las poblaciones Levene (varianzas) + ANOVA de un factor + Tukey/Bonferroni
Cuantitativa o cualitativa ordinal Contrastar si hay diferencias entre las distribuciones de las poblaciones Test de Kruskal-Wallis + comparaciones por pares de Wilcoxon
Una cualitativa con 2 categorías, poblaciones pareadas Cuantitativa normal Contrastar si hay diferencias entre las medias de las dos poblaciones pareadas Test t para datos pareados Contrastes para dos poblaciones pareadas
Cuantitativa o cualitativa ordinal Contrastar si hay diferencias entre las distribuciones de las dos poblaciones pareadas Test de Wilcoxon para datos pareados
Cualitativa (2 categorías) Contrastar si hay diferencias entre las proporciones de las dos poblaciones pareadas Test de McNemar
Una cualitativa con >2 categorías, poblaciones relacionadas (medidas repetidas) Cuantitativa normal Contrastar si hay diferencias entre las medidas repetidas ANOVA de medidas repetidas de un factor Contrastes para más de dos poblaciones relacionadas
Cuantitativa o cualitativa ordinal Contrastar si hay diferencias entre las medidas repetidas Test de Friedman
Una cuantitativa normal Cuantitativa normal Contrastar si existe relación lineal / construir un modelo predictivo Correlación de Pearson / Regresión simple Relación y predicción entre dos variables
Cuantitativa o cualitativa ordinal Contrastar si existe relación (de orden) entre las dos variables Correlación de Spearman
Una cuantitativa Cualitativa (2 categorías) Construir un modelo predictivo que explique la variable cualitativa Regresión logística simple
Nota

Esta tabla no agota todas las situaciones posibles. Quedan fuera de esta segunda parte, por ser casos más especializados, los contrastes de concordancia o acuerdo entre dos medidas de un mismo fenómeno (como el coeficiente Kappa de Cohen para variables cualitativas o el coeficiente de correlación intraclase para variables cuantitativas), así como el ANOVA de dos o más factores y sus interacciones. El Manual de Estadística desarrolla además, con mucho más detalle, la correlación y la regresión, y el coeficiente chi-cuadrado y de contingencia entre variables cualitativas, por lo que el último capítulo de esta parte remite a él para profundizar en esos contrastes en lugar de repetir aquí su desarrollo.

10.2 El conjunto de datos de ejemplo

Todos los ejemplos de esta segunda parte utilizan un mismo conjunto de datos, datos-curso.csv, con las calificaciones de 120 alumnos de una asignatura dividida en tres grupos de clase. Se puede descargar desde el repositorio del libro para reproducir los ejemplos.

Código
df <- read_csv("datos/datos-curso.csv")
Rows: 120 Columns: 16
── Column specification ────────────────────────────────────────────────────────
Delimiter: ","
chr (9): sexo, turno, grupo, trabaja, calificacionA, calificacionB, califica...
dbl (7): notaA, notaB, notaC, notaD, notaE, asinaturas.aprobadas, nota.media

ℹ Use `spec()` to retrieve the full column specification for this data.
ℹ Specify the column types or set `show_col_types = FALSE` to quiet this message.
Código
glimpse(df)
Rows: 120
Columns: 16
$ sexo                 <chr> "Mujer", "Hombre", "Hombre", "Hombre", "Hombre", …
$ turno                <chr> "Tarde", "Mañana", "Mañana", "Mañana", "Mañana", …
$ grupo                <chr> "C", "A", "B", "B", "A", "A", "A", "C", "C", "C",…
$ trabaja              <chr> "N", "N", "N", "N", "N", "S", "N", "S", "N", "N",…
$ notaA                <dbl> 5.2, 5.7, 8.3, 6.1, 6.2, 8.6, 6.7, 4.1, 5.0, 5.3,…
$ notaB                <dbl> 6.3, 5.7, 8.8, 6.8, 9.0, 8.9, 7.9, 5.2, 5.0, 6.3,…
$ notaC                <dbl> 3.4, 4.2, 8.8, 4.0, 5.0, 9.5, 5.6, 1.7, 3.3, 4.8,…
$ notaD                <dbl> 2.3, 3.5, 8.0, 3.5, 4.4, 8.4, 4.8, 0.3, 2.7, 3.6,…
$ notaE                <dbl> 2.0, 2.7, 5.5, 2.2, 3.7, 3.9, 4.2, 1.0, 6.0, 2.3,…
$ calificacionA        <chr> "Aprobado", "Aprobado", "Aprobado", "Aprobado", "…
$ calificacionB        <chr> "Aprobado", "Aprobado", "Aprobado", "Aprobado", "…
$ calificacionC        <chr> "Suspenso", "Suspenso", "Aprobado", "Suspenso", "…
$ calificacionD        <chr> "Suspenso", "Suspenso", "Aprobado", "Suspenso", "…
$ calificacionE        <chr> "Suspenso", "Suspenso", "Aprobado", "Suspenso", "…
$ asinaturas.aprobadas <dbl> 2, 2, 5, 2, 3, 4, 3, 1, 2, 2, 3, 2, 3, 3, 3, 4, 4…
$ nota.media           <dbl> 3.8, 4.3, 7.9, 4.5, 5.7, 7.8, 5.8, 2.5, 4.4, 4.5,…

Las variables que contiene son:

Variable Descripción
sexo Sexo del alumno (Hombre / Mujer).
turno Turno en el que cursa la asignatura (Mañana / Tarde).
grupo Grupo de clase al que pertenece (A, B o C).
trabaja Si el alumno compagina los estudios con un trabajo (S / N).
notaA, …, notaE Calificación numérica (0-10) obtenida en cinco pruebas o exámenes distintos de la asignatura.
calificacionA, …, calificacionE Resultado cualitativo (Aprobado / Suspenso) de cada una de esas cinco pruebas.
asinaturas.aprobadas Número de asignaturas aprobadas por el alumno ese curso (0 a 5).
nota.media Nota media del alumno en el curso.

Este conjunto de datos permite ilustrar tanto comparaciones entre poblaciones independientes (por ejemplo, comparar notaA entre hombres y mujeres, dos grupos de individuos distintos) como comparaciones entre poblaciones pareadas o medidas repetidas (por ejemplo, comparar notaA con notaB para los mismos alumnos, o las cinco notas notaA a notaE de cada alumno entre sí).

10.3 Estructura de los capítulos

Los capítulos siguientes están organizados por el número de poblaciones o grupos comparados y por si estos son independientes o están relacionados, siguiendo el orden de la tabla de decisión anterior. Cada contraste se presenta con una estructura fija: el objetivo del contraste, sus requisitos de aplicación, la hipótesis nula que pone a prueba, un ejemplo resuelto sobre el conjunto de datos del curso, y la interpretación del resultado.