5  Estudios de casos y controles

El estudio de casos y controles es un diseño observacional y analítico que, a diferencia del estudio de cohortes, recorre el tiempo en sentido inverso: en lugar de partir de la exposición y esperar a que aparezca el resultado, se parte del resultado, ya ocurrido, y se indaga hacia atrás en busca de la exposición pasada. Por este motivo se trata, casi siempre, de un diseño retrospectivo (véase el capítulo de introducción para la distinción entre los criterios de clasificación de los estudios). Se seleccionan dos grupos de individuos definidos por su estado respecto al resultado (los casos, que presentan la enfermedad o el evento de interés, y los controles, que no lo presentan) y se compara la frecuencia con la que unos y otros estuvieron expuestos en el pasado al factor de estudio.

5.1 Definición y características

Definición 5.1 (Estudio de casos y controles) Un estudio de casos y controles es un estudio observacional, analítico y habitualmente retrospectivo en el que se seleccionan dos grupos de individuos según la presencia (casos) o ausencia (controles) del resultado de interés, y se compara retrospectivamente la proporción de expuestos al factor de estudio en cada uno de los dos grupos.

El diseño se articula en torno a dos decisiones críticas, de las que depende en buena medida la validez del estudio:

  • Selección de los casos. Deben definirse con criterios diagnósticos claros y explícitos, de forma que no haya ambigüedad sobre quién es o no un caso. Es preferible utilizar casos incidentes (de nueva aparición) frente a casos prevalentes (ya existentes en el momento del estudio), porque estos últimos pueden reflejar factores asociados a la supervivencia con la enfermedad más que a su aparición.
  • Selección de los controles. Deben proceder de la misma población de la que surgen los casos (la llamada población base o population at risk), de modo que, si hubieran desarrollado la enfermedad, habrían sido incluidos como casos. Un control mal elegido —que no sea representativo de esa población base— es la fuente de sesgo más frecuente y más difícil de corregir en este tipo de estudios.

Una consecuencia importante de este diseño es que no permite calcular directamente ni la incidencia ni la prevalencia de la enfermedad. El motivo es que el número de casos y de controles no surge de muestrear aleatoriamente la población y observar cuántos enferman, sino que lo fija de antemano el propio investigador (por ejemplo, todos los casos disponibles en un hospital durante un periodo, junto con el doble de controles). Al no respetarse la proporción real de enfermos y sanos en la población, cualquier medida que dependa de esa proporción —como el riesgo relativo o la incidencia acumulada— queda distorsionada. Como se verá más adelante, esta limitación es precisamente la que obliga a recurrir a la odds ratio como medida de asociación propia de este diseño.

5.2 Ventajas e inconvenientes

Ventajas:

  • Son estudios rápidos y baratos de realizar, ya que no requieren seguimiento de los individuos en el tiempo.
  • Son especialmente adecuados para el estudio de enfermedades raras, porque parten de un número fijo de casos ya identificados en lugar de esperar a que aparezcan en una cohorte.
  • Resultan también apropiados cuando el periodo de latencia entre la exposición y la enfermedad es muy largo, ya que evitan años de seguimiento.
  • Permiten estudiar simultáneamente varias exposiciones o factores de riesgo distintos para un mismo resultado.

Inconvenientes:

  • Son susceptibles al sesgo de memoria (recall bias): los casos, al haber sufrido la enfermedad, tienden a recordar y declarar con más detalle exposiciones pasadas que los controles.
  • Son susceptibles al sesgo de selección de controles, si estos no son verdaderamente representativos de la población base de la que proceden los casos.
  • No permiten calcular directamente la incidencia ni la prevalencia de la enfermedad, como se ha explicado.
  • La secuencia temporal entre exposición y resultado, al reconstruirse retrospectivamente, puede ser difícil de establecer con certeza en algunos casos.

5.3 Medidas propias de este diseño

Como la incidencia no puede calcularse en este diseño, no es posible obtener el riesgo relativo tal y como se define en un estudio de cohortes. La medida de asociación propia de los estudios de casos y controles es la razón de momios u Odds Ratio (OR), que compara la odds (el momio) de haber estado expuesto entre los casos con la de haber estado expuesto entre los controles.

Partiendo de una tabla de contingencia \(2\times 2\) que cruza la exposición con la condición de caso o control,

\[ \begin{array}{lrrr} \hline & \mbox{Casos} & \mbox{Controles} & \mbox{Total}\\ \hline \mbox{Expuestos} & a & b & a+b\\ \mbox{No expuestos} & c & d & c+d\\ \hline \mbox{Total} & a+c & b+d & n\\ \hline \end{array} \]

Definición 5.2 (Odds ratio) La odds (o momio) de exposición entre los casos es el cociente entre el número de casos expuestos y el número de casos no expuestos,

\[\mbox{Odds}_{\mbox{casos}} = \frac{a}{c},\]

y la odds de exposición entre los controles es el cociente entre el número de controles expuestos y el número de controles no expuestos,

\[\mbox{Odds}_{\mbox{controles}} = \frac{b}{d}.\]

La Odds Ratio (OR) se define como el cociente entre ambas odds,

\[OR = \frac{\mbox{Odds}_{\mbox{casos}}}{\mbox{Odds}_{\mbox{controles}}} = \frac{a/c}{b/d} = \frac{a\cdot d}{b\cdot c}.\]

Importante

Al ser un cociente de dos cantidades positivas, la odds ratio verifica

\[OR > 0,\]

y \(OR=1\) indica ausencia de asociación entre la exposición y el resultado, ya que en ese caso la odds de exposición es idéntica en casos y en controles.

NotaInterpretación
  • Si \(OR=1\), la exposición no está asociada con la enfermedad.
  • Si \(OR>1\), la exposición está asociada positivamente con la enfermedad: los expuestos tienen una odds mayor de ser casos, por lo que la exposición se comporta como un factor de riesgo.
  • Si \(OR<1\), la exposición está asociada negativamente con la enfermedad: los expuestos tienen una odds menor de ser casos, por lo que la exposición se comporta como un factor protector.
NotaRelación con el riesgo relativo

En un estudio de cohortes la medida natural de asociación es el riesgo relativo (RR), que compara directamente las incidencias (probabilidades) de enfermar entre expuestos y no expuestos. En un estudio de casos y controles no es posible calcular incidencias, por lo que el RR no puede obtenerse directamente. Sin embargo, cuando la enfermedad estudiada es poco frecuente en la población (el llamado supuesto de enfermedad rara, por ejemplo con una prevalencia inferior al 10%), la probabilidad de enfermar es muy pequeña tanto en expuestos como en no expuestos, de modo que la odds de enfermar (probabilidad entre 1 menos probabilidad) se aproxima mucho a la propia probabilidad. En estas condiciones puede demostrarse que la odds ratio calculada en el estudio de casos y controles constituye una buena aproximación del riesgo relativo poblacional, \(OR \approx RR\), lo que permite interpretarla de forma similar aunque los diseños sean muy distintos.

La incertidumbre muestral de la OR se cuantifica mediante su intervalo de confianza. Como la distribución de la OR es muy asimétrica, el intervalo se construye habitualmente sobre su logaritmo, que se aproxima mejor a una distribución normal.

Definición 5.3 (Intervalo de confianza de la odds ratio (método de Woolf)) El error estándar del logaritmo de la odds ratio se estima como

\[SE(\ln OR) = \sqrt{\frac{1}{a}+\frac{1}{b}+\frac{1}{c}+\frac{1}{d}},\]

y el intervalo de confianza al \((1-\alpha)\cdot 100\%\) para la OR, conocido como método de Woolf, se obtiene deshaciendo el logaritmo tras construir el intervalo en escala logarítmica,

\[IC_{(1-\alpha)\cdot100\%} = \exp\left(\ln(OR) \pm z_{1-\alpha/2}\sqrt{\frac{1}{a}+\frac{1}{b}+\frac{1}{c}+\frac{1}{d}}\right).\]

Para un nivel de confianza del 95%, \(z_{0.975}=1.96\).

Ejemplo 5.1 Se quiere estudiar la asociación entre el consumo habitual de tabaco y la aparición de cáncer de pulmón mediante un estudio de casos y controles. Se seleccionan 100 casos (pacientes recién diagnosticados de cáncer de pulmón) y 200 controles (pacientes sin cáncer de pulmón, similares en edad y sexo), y se les pregunta retrospectivamente si han sido fumadores habituales. Los resultados se resumen en la siguiente tabla:

\[ \begin{array}{lrrr} \hline & \mbox{Casos} & \mbox{Controles} & \mbox{Total}\\ \hline \mbox{Fumadores} & 70 & 80 & 150\\ \mbox{No fumadores} & 30 & 120 & 150\\ \hline \mbox{Total} & 100 & 200 & 300\\ \hline \end{array} \]

Con \(a=70\), \(b=80\), \(c=30\) y \(d=120\), la odds ratio es

\[OR = \frac{a\cdot d}{b\cdot c} = \frac{70\cdot 120}{80\cdot 30} = \frac{8400}{2400} = 3.5.\]

Es decir, la odds de haber fumado es 3.5 veces mayor entre los casos (pacientes con cáncer de pulmón) que entre los controles, lo que sugiere que el tabaco se comporta como un factor de riesgo para esta enfermedad. Como se trata de una enfermedad poco frecuente en la población general, esta OR puede interpretarse aproximadamente como el riesgo relativo.

Para calcular el intervalo de confianza al 95%, se obtiene primero el error estándar del logaritmo de la OR,

\[SE(\ln OR) = \sqrt{\frac{1}{70}+\frac{1}{80}+\frac{1}{30}+\frac{1}{120}} = \sqrt{0.0143+0.0125+0.0333+0.0083} = \sqrt{0.0684} = 0.2615,\]

y como \(\ln(3.5) = 1.2528\), el intervalo en escala logarítmica es

\[1.2528 \pm 1.96\cdot 0.2615 = 1.2528 \pm 0.5125 = (0.7403,\ 1.7653),\]

que, deshaciendo el logaritmo, da el intervalo de confianza para la OR

\[IC_{95\%} = (e^{0.7403},\ e^{1.7653}) = (2.10,\ 5.84).\]

Como el intervalo no contiene el valor 1, la asociación entre tabaco y cáncer de pulmón es estadísticamente significativa al 95% de confianza.

5.4 Realización con R

El siguiente código reproduce en R el ejemplo anterior, calculando la OR y su intervalo de confianza al 95% a partir de la tabla \(2\times 2\) para comprobar que coincide con el cálculo manual.

Código
# Tabla 2x2: filas = expuestos/no expuestos, columnas = casos/controles
tabla <- matrix(c(70, 80, 30, 120),
                nrow = 2, byrow = TRUE,
                dimnames = list(
                  Exposicion = c("Fumador", "No fumador"),
                  Grupo = c("Casos", "Controles")
                ))
tabla
            Grupo
Exposicion   Casos Controles
  Fumador       70        80
  No fumador    30       120
Código
a <- tabla["Fumador", "Casos"]
b <- tabla["Fumador", "Controles"]
c_ <- tabla["No fumador", "Casos"]
d <- tabla["No fumador", "Controles"]

# Odds ratio
or <- (a * d) / (b * c_)

# Error estándar del logaritmo de la OR (método de Woolf)
se_log_or <- sqrt(1 / a + 1 / b + 1 / c_ + 1 / d)

# Intervalo de confianza al 95%
z <- qnorm(0.975)
ic_inferior <- exp(log(or) - z * se_log_or)
ic_superior <- exp(log(or) + z * se_log_or)

resultado <- tibble(
  medida = "Odds Ratio",
  estimacion = or,
  ic_95_inferior = ic_inferior,
  ic_95_superior = ic_superior
)
resultado
# A tibble: 1 × 4
  medida     estimacion ic_95_inferior ic_95_superior
  <chr>           <dbl>          <dbl>          <dbl>
1 Odds Ratio        3.5           2.10           5.84

El resultado coincide con el obtenido a mano: \(OR=3.5\) con un intervalo de confianza al 95% de \((2.10,\ 5.84)\).

Una forma habitual de representar gráficamente una odds ratio junto con su intervalo de confianza es el llamado forest plot, que muestra la estimación puntual y su incertidumbre en relación con la línea de referencia \(OR=1\) (ausencia de asociación).

Código
ggplot(resultado, aes(x = or, y = medida)) +
  geom_vline(xintercept = 1, linetype = "dashed", color = "grey40") +
  geom_errorbarh(aes(xmin = ic_95_inferior, xmax = ic_95_superior), height = 0.1) +
  geom_point(size = 3, color = "steelblue") +
  scale_x_log10() +
  labs(
    x = "Odds Ratio (escala logarítmica)",
    y = NULL,
    title = "Tabaco y cáncer de pulmón"
  ) +
  theme_minimal()

Odds ratio del consumo de tabaco y su intervalo de confianza al 95%.

El punto se sitúa claramente a la derecha de la línea de referencia \(OR=1\), y todo el intervalo de confianza queda también por encima de ella, lo que confirma gráficamente que el consumo de tabaco está asociado de forma significativa con un mayor riesgo de cáncer de pulmón en esta muestra.

5.5 Casos y controles apareados

En ocasiones, cada caso se aparea (matching) con uno o varios controles que comparten con él ciertas características que se sabe o se sospecha que actúan como factores de confusión, como la edad, el sexo o el centro de reclutamiento. El objetivo del apareamiento es asegurar que casos y controles sean lo más comparables posible en esas variables, de forma que cualquier diferencia observada en la exposición sea más difícilmente atribuible a ellas. Por ejemplo, a cada caso de 55 años se le podrían asignar dos controles también de 55 años y del mismo sexo.

El apareamiento tiene, sin embargo, un coste analítico: la tabla \(2\times 2\) simple ya no resulta válida para comparar los grupos, porque las observaciones dejan de ser independientes (cada caso está ligado a su control o controles concretos). El análisis de datos apareados requiere métodos estadísticos específicos, como el test de McNemar para el caso de un control por caso, o la regresión logística condicional cuando hay varios controles por caso, que quedan fuera del alcance de este capítulo introductorio.

5.6 Cuándo utilizar este diseño

El estudio de casos y controles es la opción de elección cuando la enfermedad o el evento de interés es raro, cuando su periodo de latencia es muy largo, o cuando se dispone de poco tiempo y presupuesto para completar la investigación. También resulta muy útil como paso exploratorio para generar hipótesis sobre múltiples posibles exposiciones a la vez, antes de invertir en un diseño más costoso. Cuando, por el contrario, es la exposición la que resulta rara en la población (y no la enfermedad), suele ser preferible recurrir a un estudio de cohortes, que garantiza un número suficiente de expuestos y permite además calcular directamente incidencias y riesgos relativos. En la práctica, ambos diseños se consideran complementarios dentro de la investigación epidemiológica observacional.