---
title: Estudios de casos y controles
lang: es
---
```{r setup, include=FALSE}
knitr::opts_chunk$set(echo = TRUE, message = FALSE, warning = FALSE)
library(tidyverse)
```
El estudio de casos y controles es un diseño observacional y analítico que, a diferencia del [estudio de cohortes](04-estudios-cohortes.qmd), recorre el tiempo en sentido inverso: en lugar de partir de la exposición y esperar a que aparezca el resultado, se parte del resultado, ya ocurrido, y se indaga hacia atrás en busca de la exposición pasada. Por este motivo se trata, casi siempre, de un diseño retrospectivo (véase el [capítulo de introducción](01-introduccion.qmd) para la distinción entre los criterios de clasificación de los estudios). Se seleccionan dos grupos de individuos definidos por su estado respecto al resultado (los _casos_, que presentan la enfermedad o el evento de interés, y los _controles_, que no lo presentan) y se compara la frecuencia con la que unos y otros estuvieron expuestos en el pasado al factor de estudio.
## Definición y características
:::{#def-casoscontroles-estudio-casos-controles}
## Estudio de casos y controles
Un _estudio de casos y controles_ es un estudio observacional, analítico y habitualmente retrospectivo en el que se seleccionan dos grupos de individuos según la presencia (_casos_) o ausencia (_controles_) del resultado de interés, y se compara retrospectivamente la proporción de expuestos al factor de estudio en cada uno de los dos grupos.
:::
El diseño se articula en torno a dos decisiones críticas, de las que depende en buena medida la validez del estudio:
- **Selección de los casos.** Deben definirse con criterios diagnósticos claros y explícitos, de forma que no haya ambigüedad sobre quién es o no un caso. Es preferible utilizar casos _incidentes_ (de nueva aparición) frente a casos _prevalentes_ (ya existentes en el momento del estudio), porque estos últimos pueden reflejar factores asociados a la supervivencia con la enfermedad más que a su aparición.
- **Selección de los controles.** Deben proceder de la misma población de la que surgen los casos (la llamada _población base_ o _population at risk_), de modo que, si hubieran desarrollado la enfermedad, habrían sido incluidos como casos. Un control mal elegido —que no sea representativo de esa población base— es la fuente de sesgo más frecuente y más difícil de corregir en este tipo de estudios.
Una consecuencia importante de este diseño es que **no permite calcular directamente ni la incidencia ni la prevalencia** de la enfermedad. El motivo es que el número de casos y de controles no surge de muestrear aleatoriamente la población y observar cuántos enferman, sino que lo fija de antemano el propio investigador (por ejemplo, todos los casos disponibles en un hospital durante un periodo, junto con el doble de controles). Al no respetarse la proporción real de enfermos y sanos en la población, cualquier medida que dependa de esa proporción —como el riesgo relativo o la incidencia acumulada— queda distorsionada. Como se verá más adelante, esta limitación es precisamente la que obliga a recurrir a la _odds ratio_ como medida de asociación propia de este diseño.
## Ventajas e inconvenientes
**Ventajas:**
- Son estudios rápidos y baratos de realizar, ya que no requieren seguimiento de los individuos en el tiempo.
- Son especialmente adecuados para el estudio de enfermedades raras, porque parten de un número fijo de casos ya identificados en lugar de esperar a que aparezcan en una cohorte.
- Resultan también apropiados cuando el periodo de latencia entre la exposición y la enfermedad es muy largo, ya que evitan años de seguimiento.
- Permiten estudiar simultáneamente varias exposiciones o factores de riesgo distintos para un mismo resultado.
**Inconvenientes:**
- Son susceptibles al **sesgo de memoria** (_recall bias_): los casos, al haber sufrido la enfermedad, tienden a recordar y declarar con más detalle exposiciones pasadas que los controles.
- Son susceptibles al **sesgo de selección de controles**, si estos no son verdaderamente representativos de la población base de la que proceden los casos.
- No permiten calcular directamente la incidencia ni la prevalencia de la enfermedad, como se ha explicado.
- La secuencia temporal entre exposición y resultado, al reconstruirse retrospectivamente, puede ser difícil de establecer con certeza en algunos casos.
## Medidas propias de este diseño
Como la incidencia no puede calcularse en este diseño, no es posible obtener el riesgo relativo tal y como se define en un [estudio de cohortes](04-estudios-cohortes.qmd). La medida de asociación propia de los estudios de casos y controles es la _razón de momios_ u _Odds Ratio_ (OR), que compara la _odds_ (el momio) de haber estado expuesto entre los casos con la de haber estado expuesto entre los controles.
Partiendo de una tabla de contingencia $2\times 2$ que cruza la exposición con la condición de caso o control,
$$
\begin{array}{lrrr}
\hline
& \mbox{Casos} & \mbox{Controles} & \mbox{Total}\\
\hline
\mbox{Expuestos} & a & b & a+b\\
\mbox{No expuestos} & c & d & c+d\\
\hline
\mbox{Total} & a+c & b+d & n\\
\hline
\end{array}
$$
:::{#def-casoscontroles-odds-ratio}
## Odds ratio
La _odds_ (o momio) de exposición entre los casos es el cociente entre el número de casos expuestos y el número de casos no expuestos,
$$\mbox{Odds}_{\mbox{casos}} = \frac{a}{c},$$
y la odds de exposición entre los controles es el cociente entre el número de controles expuestos y el número de controles no expuestos,
$$\mbox{Odds}_{\mbox{controles}} = \frac{b}{d}.$$
La _Odds Ratio_ (OR) se define como el cociente entre ambas odds,
$$OR = \frac{\mbox{Odds}_{\mbox{casos}}}{\mbox{Odds}_{\mbox{controles}}} = \frac{a/c}{b/d} = \frac{a\cdot d}{b\cdot c}.$$
:::
:::{.callout-important}
Al ser un cociente de dos cantidades positivas, la odds ratio verifica
$$OR > 0,$$
y $OR=1$ indica ausencia de asociación entre la exposición y el resultado, ya que en ese caso la odds de exposición es idéntica en casos y en controles.
:::
:::{.callout-note title=Interpretación}
- Si $OR=1$, la exposición no está asociada con la enfermedad.
- Si $OR>1$, la exposición está asociada positivamente con la enfermedad: los expuestos tienen una odds mayor de ser casos, por lo que la exposición se comporta como un **factor de riesgo**.
- Si $OR<1$, la exposición está asociada negativamente con la enfermedad: los expuestos tienen una odds menor de ser casos, por lo que la exposición se comporta como un **factor protector**.
:::
:::{.callout-note title="Relación con el riesgo relativo"}
En un [estudio de cohortes](04-estudios-cohortes.qmd) la medida natural de asociación es el riesgo relativo (RR), que compara directamente las incidencias (probabilidades) de enfermar entre expuestos y no expuestos. En un estudio de casos y controles no es posible calcular incidencias, por lo que el RR no puede obtenerse directamente. Sin embargo, cuando la enfermedad estudiada es **poco frecuente** en la población (el llamado _supuesto de enfermedad rara_, por ejemplo con una prevalencia inferior al 10%), la probabilidad de enfermar es muy pequeña tanto en expuestos como en no expuestos, de modo que la odds de enfermar (probabilidad entre 1 menos probabilidad) se aproxima mucho a la propia probabilidad. En estas condiciones puede demostrarse que la odds ratio calculada en el estudio de casos y controles constituye una buena aproximación del riesgo relativo poblacional, $OR \approx RR$, lo que permite interpretarla de forma similar aunque los diseños sean muy distintos.
:::
La incertidumbre muestral de la OR se cuantifica mediante su intervalo de confianza. Como la distribución de la OR es muy asimétrica, el intervalo se construye habitualmente sobre su logaritmo, que se aproxima mejor a una distribución normal.
:::{#def-casoscontroles-ic-odds-ratio}
## Intervalo de confianza de la odds ratio (método de Woolf)
El error estándar del logaritmo de la odds ratio se estima como
$$SE(\ln OR) = \sqrt{\frac{1}{a}+\frac{1}{b}+\frac{1}{c}+\frac{1}{d}},$$
y el intervalo de confianza al $(1-\alpha)\cdot 100\%$ para la OR, conocido como método de Woolf, se obtiene deshaciendo el logaritmo tras construir el intervalo en escala logarítmica,
$$IC_{(1-\alpha)\cdot100\%} = \exp\left(\ln(OR) \pm z_{1-\alpha/2}\sqrt{\frac{1}{a}+\frac{1}{b}+\frac{1}{c}+\frac{1}{d}}\right).$$
Para un nivel de confianza del 95%, $z_{0.975}=1.96$.
:::
:::{#exm-casoscontroles-odds-ratio}
Se quiere estudiar la asociación entre el consumo habitual de tabaco y la aparición de cáncer de pulmón mediante un estudio de casos y controles. Se seleccionan 100 casos (pacientes recién diagnosticados de cáncer de pulmón) y 200 controles (pacientes sin cáncer de pulmón, similares en edad y sexo), y se les pregunta retrospectivamente si han sido fumadores habituales. Los resultados se resumen en la siguiente tabla:
$$
\begin{array}{lrrr}
\hline
& \mbox{Casos} & \mbox{Controles} & \mbox{Total}\\
\hline
\mbox{Fumadores} & 70 & 80 & 150\\
\mbox{No fumadores} & 30 & 120 & 150\\
\hline
\mbox{Total} & 100 & 200 & 300\\
\hline
\end{array}
$$
Con $a=70$, $b=80$, $c=30$ y $d=120$, la odds ratio es
$$OR = \frac{a\cdot d}{b\cdot c} = \frac{70\cdot 120}{80\cdot 30} = \frac{8400}{2400} = 3.5.$$
Es decir, la odds de haber fumado es 3.5 veces mayor entre los casos (pacientes con cáncer de pulmón) que entre los controles, lo que sugiere que el tabaco se comporta como un factor de riesgo para esta enfermedad. Como se trata de una enfermedad poco frecuente en la población general, esta OR puede interpretarse aproximadamente como el riesgo relativo.
Para calcular el intervalo de confianza al 95%, se obtiene primero el error estándar del logaritmo de la OR,
$$SE(\ln OR) = \sqrt{\frac{1}{70}+\frac{1}{80}+\frac{1}{30}+\frac{1}{120}} = \sqrt{0.0143+0.0125+0.0333+0.0083} = \sqrt{0.0684} = 0.2615,$$
y como $\ln(3.5) = 1.2528$, el intervalo en escala logarítmica es
$$1.2528 \pm 1.96\cdot 0.2615 = 1.2528 \pm 0.5125 = (0.7403,\ 1.7653),$$
que, deshaciendo el logaritmo, da el intervalo de confianza para la OR
$$IC_{95\%} = (e^{0.7403},\ e^{1.7653}) = (2.10,\ 5.84).$$
Como el intervalo no contiene el valor 1, la asociación entre tabaco y cáncer de pulmón es estadísticamente significativa al 95% de confianza.
:::
## Realización con R
El siguiente código reproduce en R el ejemplo anterior, calculando la OR y su intervalo de confianza al 95% a partir de la tabla $2\times 2$ para comprobar que coincide con el cálculo manual.
```{r}
# Tabla 2x2: filas = expuestos/no expuestos, columnas = casos/controles
tabla <- matrix(c(70, 80, 30, 120),
nrow = 2, byrow = TRUE,
dimnames = list(
Exposicion = c("Fumador", "No fumador"),
Grupo = c("Casos", "Controles")
))
tabla
```
```{r}
a <- tabla["Fumador", "Casos"]
b <- tabla["Fumador", "Controles"]
c_ <- tabla["No fumador", "Casos"]
d <- tabla["No fumador", "Controles"]
# Odds ratio
or <- (a * d) / (b * c_)
# Error estándar del logaritmo de la OR (método de Woolf)
se_log_or <- sqrt(1 / a + 1 / b + 1 / c_ + 1 / d)
# Intervalo de confianza al 95%
z <- qnorm(0.975)
ic_inferior <- exp(log(or) - z * se_log_or)
ic_superior <- exp(log(or) + z * se_log_or)
resultado <- tibble(
medida = "Odds Ratio",
estimacion = or,
ic_95_inferior = ic_inferior,
ic_95_superior = ic_superior
)
resultado
```
El resultado coincide con el obtenido a mano: $OR=3.5$ con un intervalo de confianza al 95% de $(2.10,\ 5.84)$.
Una forma habitual de representar gráficamente una odds ratio junto con su intervalo de confianza es el llamado _forest plot_, que muestra la estimación puntual y su incertidumbre en relación con la línea de referencia $OR=1$ (ausencia de asociación).
```{r forest-plot-or, fig.cap="Odds ratio del consumo de tabaco y su intervalo de confianza al 95%."}
ggplot(resultado, aes(x = or, y = medida)) +
geom_vline(xintercept = 1, linetype = "dashed", color = "grey40") +
geom_errorbarh(aes(xmin = ic_95_inferior, xmax = ic_95_superior), height = 0.1) +
geom_point(size = 3, color = "steelblue") +
scale_x_log10() +
labs(
x = "Odds Ratio (escala logarítmica)",
y = NULL,
title = "Tabaco y cáncer de pulmón"
) +
theme_minimal()
```
El punto se sitúa claramente a la derecha de la línea de referencia $OR=1$, y todo el intervalo de confianza queda también por encima de ella, lo que confirma gráficamente que el consumo de tabaco está asociado de forma significativa con un mayor riesgo de cáncer de pulmón en esta muestra.
## Casos y controles apareados
En ocasiones, cada caso se _aparea_ (_matching_) con uno o varios controles que comparten con él ciertas características que se sabe o se sospecha que actúan como factores de confusión, como la edad, el sexo o el centro de reclutamiento. El objetivo del apareamiento es asegurar que casos y controles sean lo más comparables posible en esas variables, de forma que cualquier diferencia observada en la exposición sea más difícilmente atribuible a ellas. Por ejemplo, a cada caso de 55 años se le podrían asignar dos controles también de 55 años y del mismo sexo.
El apareamiento tiene, sin embargo, un coste analítico: la tabla $2\times 2$ simple ya no resulta válida para comparar los grupos, porque las observaciones dejan de ser independientes (cada caso está ligado a su control o controles concretos). El análisis de datos apareados requiere métodos estadísticos específicos, como el **test de McNemar** para el caso de un control por caso, o la regresión logística condicional cuando hay varios controles por caso, que quedan fuera del alcance de este capítulo introductorio.
## Cuándo utilizar este diseño
El estudio de casos y controles es la opción de elección cuando la enfermedad o el evento de interés es raro, cuando su periodo de latencia es muy largo, o cuando se dispone de poco tiempo y presupuesto para completar la investigación. También resulta muy útil como paso exploratorio para generar hipótesis sobre múltiples posibles exposiciones a la vez, antes de invertir en un diseño más costoso. Cuando, por el contrario, es la **exposición** la que resulta rara en la población (y no la enfermedad), suele ser preferible recurrir a un [estudio de cohortes](04-estudios-cohortes.qmd), que garantiza un número suficiente de expuestos y permite además calcular directamente incidencias y riesgos relativos. En la práctica, ambos diseños se consideran complementarios dentro de la investigación epidemiológica observacional.