Un estudio de cohortes es un estudio observacional, analítico y longitudinal en el que se parte de un grupo de individuos expuestos a un determinado factor y de un grupo de individuos no expuestos a él, todos ellos libres de la enfermedad o el resultado de interés en el momento inicial, y se les sigue en el tiempo para comprobar quiénes desarrollan dicho resultado. A diferencia del estudio transversal, en el que exposición y resultado se observan en un único instante, en el estudio de cohortes la secuencia temporal entre exposición y resultado queda garantizada por diseño, lo que lo convierte en uno de los diseños observacionales con mayor capacidad para sugerir relaciones causales. Los conceptos generales de estudio observacional, analítico y longitudinal se presentaron en el capítulo de introducción.

4.1 Definición y características

Definición 4.1 (Estudio de cohortes) Un estudio de cohortes es un estudio observacional en el que se identifican dos o más grupos (cohortes) de individuos libres del resultado de interés, definidos según su nivel de exposición a un factor de estudio, y se les sigue durante un periodo de tiempo para comparar la frecuencia con la que desarrollan dicho resultado.

La característica esencial de este diseño es que la formación de los grupos se realiza en función de la exposición, no del resultado: primero se clasifica a los individuos en expuestos y no expuestos, y después se observa la aparición de la enfermedad o evento de interés. Esto contrasta con el estudio de casos y controles, en el que ocurre justo lo contrario.

Según el momento en que se recogen los datos respecto al momento en que se realiza el análisis, se distinguen dos variantes:

Definición 4.2 (Cohorte prospectiva) Una cohorte prospectiva es aquella en la que la exposición se determina en el momento presente y el seguimiento de los individuos se realiza hacia adelante en el tiempo, recogiendo los datos del resultado a medida que van ocurriendo.

Definición 4.3 (Cohorte retrospectiva o histórica) Una cohorte retrospectiva o histórica es aquella en la que tanto la exposición como el seguimiento y la aparición del resultado ya han ocurrido en el pasado en el momento en que se inicia el estudio, de modo que el investigador reconstruye la historia de exposición y resultado a partir de registros u otras fuentes de información existentes.

NotaInterpretación

La diferencia entre una cohorte prospectiva y una retrospectiva no está en la lógica del diseño, que es idéntica en ambos casos (de la exposición hacia el resultado), sino en el momento en que se sitúa el investigador respecto al calendario de los hechos. En la cohorte prospectiva el investigador espera a que ocurran los eventos; en la retrospectiva, los eventos ya ocurrieron y se reconstruyen a partir de historiales clínicos, registros administrativos u otras fuentes documentales.

4.2 Ventajas e inconvenientes

El diseño de cohortes presenta una serie de ventajas frente a otros estudios observacionales:

  • Permite calcular directamente la incidencia de la enfermedad, tanto en expuestos como en no expuestos, ya que se parte de individuos libres de la enfermedad y se observa su aparición a lo largo del tiempo.
  • Es especialmente adecuado para el estudio de exposiciones poco frecuentes, ya que permite seleccionar deliberadamente un número suficiente de individuos expuestos.
  • Al hacer un seguimiento de los individuos, permite estudiar simultáneamente varios resultados o enfermedades asociados a una misma exposición.
  • Al respetar la secuencia temporal exposición-resultado, reduce algunos sesgos que afectan a los estudios transversales y facilita la interpretación causal.

Frente a estas ventajas, el diseño también presenta importantes inconvenientes:

  • Suele requerir un coste económico y una duración elevados, sobre todo en su variante prospectiva, ya que hay que esperar a que se acumulen suficientes casos.
  • Las pérdidas de seguimiento (individuos que abandonan el estudio antes de que finalice) pueden introducir sesgos si no son aleatorias respecto a la exposición o al resultado.
  • No resulta eficiente para el estudio de enfermedades raras, pues sería necesario seguir a un número muy elevado de individuos para observar un número suficiente de casos.

4.3 Medidas propias de este diseño

El objetivo central de un estudio de cohortes es comparar la frecuencia con la que aparece el resultado de interés en el grupo de expuestos frente al grupo de no expuestos. Para ello se emplean tres medidas: la incidencia acumulada, el riesgo relativo y el riesgo atribuible.

4.3.1 Incidencia acumulada

Definición 4.4 (Incidencia acumulada) La incidencia acumulada o riesgo de un grupo es la proporción de individuos que, estando libres de la enfermedad al inicio del seguimiento, la desarrollan a lo largo de un periodo de tiempo fijo. Si \(a\) es el número de casos nuevos que aparecen en un grupo de \(n\) individuos seguidos durante dicho periodo, la incidencia acumulada se define como

\[IA = \frac{a}{n}\]

Importante

Al ser una proporción, la incidencia acumulada cumple

\[0\leq IA \leq 1,\]

y suele expresarse también en tanto por ciento o por cada 1000, 10000, etc. individuos, según la frecuencia del resultado.

4.3.2 Riesgo relativo

Definición 4.5 (Riesgo relativo) El riesgo relativo (RR) es el cociente entre la incidencia acumulada en el grupo de expuestos (\(IA_E\)) y la incidencia acumulada en el grupo de no expuestos (\(IA_{\bar E}\)):

\[RR = \frac{IA_E}{IA_{\bar E}}\]

Importante

El riesgo relativo es un cociente de dos proporciones, por lo que

\[RR \geq 0.\]

NotaInterpretación
  • Si \(RR=1\), la incidencia es igual en expuestos y no expuestos, por lo que no existe asociación entre la exposición y el resultado.
  • Si \(RR>1\), la incidencia es mayor en expuestos, por lo que la exposición se comporta como un factor de riesgo. Un \(RR=3\) indica que el riesgo de desarrollar el resultado es tres veces mayor en expuestos que en no expuestos.
  • Si \(RR<1\), la incidencia es menor en expuestos, por lo que la exposición se comporta como un factor protector.

4.3.3 Riesgo atribuible

Definición 4.6 (Riesgo atribuible) El riesgo atribuible (RA) es la diferencia entre la incidencia acumulada en el grupo de expuestos y la incidencia acumulada en el grupo de no expuestos:

\[RA = IA_E - IA_{\bar E}\]

El riesgo atribuible mide, en términos absolutos, el exceso de incidencia del resultado que puede achacarse a la exposición. Cuando además se calcula la proporción que ese exceso representa sobre la incidencia total de los expuestos, se obtiene la fracción atribuible en expuestos,

\[FAE = \frac{RA}{IA_E} = \frac{IA_E - IA_{\bar E}}{IA_E},\]

que indica qué proporción de los casos que ocurren entre los expuestos se podrían evitar eliminando la exposición.

NotaInterpretación

Mientras que el riesgo relativo informa sobre la fuerza de la asociación (en términos multiplicativos), el riesgo atribuible informa sobre el impacto en salud pública de la exposición: dos exposiciones pueden tener el mismo \(RR\) pero un \(RA\) muy distinto si las incidencias de base son muy diferentes.

4.3.4 Ejemplo numérico

Ejemplo 4.1 Se lleva a cabo un estudio de cohortes prospectivo para investigar la relación entre el hábito de fumar y la aparición de bronquitis crónica. Se reclutan 600 individuos libres de bronquitis crónica, de los cuales 200 son fumadores y 400 no fumadores, y se les sigue durante 10 años. Al finalizar el seguimiento se obtiene la siguiente tabla de frecuencias:

\[ \begin{array}{lrrr} \hline & \mbox{Bronquitis} & \mbox{No bronquitis} & \mbox{Total}\\ \hline \mbox{Fumadores} & 40 & 160 & 200\\ \mbox{No fumadores} & 20 & 380 & 400\\ \hline \end{array} \]

Incidencias acumuladas. La incidencia acumulada en fumadores es

\[IA_E = \frac{40}{200} = 0.2 = 20\%,\]

y la incidencia acumulada en no fumadores es

\[IA_{\bar E} = \frac{20}{400} = 0.05 = 5\%.\]

Riesgo relativo.

\[RR = \frac{IA_E}{IA_{\bar E}} = \frac{0.2}{0.05} = 4.\]

El riesgo de desarrollar bronquitis crónica en los fumadores es 4 veces el riesgo en los no fumadores, por lo que el tabaco se comporta como un claro factor de riesgo.

Riesgo atribuible.

\[RA = IA_E - IA_{\bar E} = 0.2 - 0.05 = 0.15 = 15\%.\]

De cada 100 fumadores, 15 desarrollan bronquitis crónica como consecuencia directa de fumar (los otros 5 de los 20 casos por 100 se habrían producido igualmente por otras causas). La fracción atribuible en expuestos es

\[FAE = \frac{RA}{IA_E} = \frac{0.15}{0.2} = 0.75 = 75\%,\]

es decir, el 75% de los casos de bronquitis crónica que aparecen entre los fumadores podrían evitarse si dejaran de fumar.

4.4 Realización con R

4.4.1 Cálculo de las medidas a partir de la tabla de contingencia

El primer paso es reproducir con R el cálculo manual del ejemplo anterior, construyendo la tabla de contingencia como una matriz y calculando a partir de ella las incidencias acumuladas, el riesgo relativo y el riesgo atribuible.

Código
# Tabla de contingencia: filas = exposición, columnas = resultado (bronquitis, no bronquitis)
tabla <- matrix(c(40, 160, 20, 380),
                 nrow = 2, byrow = TRUE,
                 dimnames = list(Exposicion = c("Fumadores", "No fumadores"),
                                  Resultado = c("Bronquitis", "No bronquitis")))
tabla
              Resultado
Exposicion     Bronquitis No bronquitis
  Fumadores            40           160
  No fumadores         20           380
Código
# Incidencias acumuladas
ia_expuestos <- tabla["Fumadores", "Bronquitis"] / sum(tabla["Fumadores", ])
ia_no_expuestos <- tabla["No fumadores", "Bronquitis"] / sum(tabla["No fumadores", ])
c(IA_expuestos = ia_expuestos, IA_no_expuestos = ia_no_expuestos)
   IA_expuestos IA_no_expuestos 
           0.20            0.05 
Código
# Riesgo relativo
rr <- ia_expuestos / ia_no_expuestos
rr
[1] 4
Código
# Riesgo atribuible y fracción atribuible en expuestos
ra <- ia_expuestos - ia_no_expuestos
fae <- ra / ia_expuestos
c(RA = ra, FAE = fae)
  RA  FAE 
0.15 0.75 

Los resultados, \(IA_E=0.2\), \(IA_{\bar E}=0.05\), \(RR=4\) y \(RA=0.15\), coinciden exactamente con los obtenidos a mano.

4.4.2 Análisis del tiempo hasta el evento con datos de seguimiento

En muchos estudios de cohortes no todos los individuos completan el mismo periodo de seguimiento: algunos abandonan el estudio antes de que termine y otros lo finalizan sin haber desarrollado el resultado. En ambos casos se dice que su tiempo de seguimiento está censurado. El análisis de supervivencia, implementado en el paquete survival, permite tener en cuenta esta censura al comparar la incidencia acumulada entre grupos.

En el siguiente ejemplo se simula una cohorte de 150 individuos, 75 expuestos y 75 no expuestos, con tiempos hasta el evento generados a partir de una distribución exponencial (los expuestos tienen, en promedio, un tiempo hasta el evento menor) y con un tiempo máximo de seguimiento de 10 años que censura a los individuos que no han presentado el evento antes de esa fecha.

Código
set.seed(123)

n_grupo <- 75

cohorte <- tibble(
  id = 1:(2 * n_grupo),
  grupo = rep(c("Expuesto", "No expuesto"), each = n_grupo),
  # Tiempo hasta el evento: mayor tasa (menor tiempo medio) en expuestos
  tiempo_evento = c(rexp(n_grupo, rate = 0.15),
                     rexp(n_grupo, rate = 0.06)),
  tiempo_max = 10,
  tiempo = pmin(tiempo_evento, tiempo_max),
  evento = as.numeric(tiempo_evento <= tiempo_max)
)

cohorte %>%
  group_by(grupo) %>%
  summarise(n = n(),
            casos = sum(evento),
            incidencia_acumulada = mean(evento))
# A tibble: 2 × 4
  grupo           n casos incidencia_acumulada
  <chr>       <int> <dbl>                <dbl>
1 Expuesto       75    58                0.773
2 No expuesto    75    34                0.453

Con los tiempos y el indicador de evento se construye un objeto de superviviencia con Surv() y se ajusta una curva de Kaplan-Meier por grupo con survfit():

Código
ajuste <- survfit(Surv(tiempo, evento) ~ grupo, data = cohorte)
summary(ajuste)$table
                  records n.max n.start events    rmean se(rmean)   median
grupo=Expuesto         75    75      75     58 5.631611 0.4008646 5.665241
grupo=No expuesto      75    75      75     34 7.518551 0.3681156       NA
                   0.95LCL  0.95UCL
grupo=Expuesto    3.924564 7.335592
grupo=No expuesto 7.613148       NA

Para representar gráficamente las curvas se extraen los datos del ajuste con broom::tidy(), que devuelve un data frame con la probabilidad de supervivencia estimada en cada instante y grupo, y se dibuja con ggplot2. La incidencia acumulada de cada grupo es el complementario de la probabilidad de supervivencia (\(1 - S(t)\)):

Código
ajuste_df <- broom::tidy(ajuste) %>%
  mutate(grupo = str_remove(strata, "grupo="),
         incidencia_acumulada = 1 - estimate)

ggplot(ajuste_df, aes(x = time, y = incidencia_acumulada, color = grupo)) +
  geom_step(linewidth = 1) +
  labs(x = "Tiempo de seguimiento (años)",
       y = "Incidencia acumulada estimada",
       color = "Grupo",
       title = "Incidencia acumulada de bronquitis crónica según exposición") +
  scale_y_continuous(labels = scales::percent) +
  theme_minimal()

Las curvas muestran cómo la incidencia acumulada crece más deprisa y alcanza un nivel más alto en el grupo de expuestos que en el de no expuestos a lo largo de todo el periodo de seguimiento, lo que es coherente con un factor de riesgo. A diferencia del cálculo directo de incidencias con una tabla de contingencia, este enfoque aprovecha toda la información disponible de cada individuo, incluida la de quienes son censurados antes de que finalice el seguimiento, en lugar de descartarlos o tratarlos como si no hubieran desarrollado el resultado.

4.5 Cuándo utilizar este diseño

El estudio de cohortes es la opción preferible cuando se dispone de tiempo y recursos suficientes, la exposición de interés es poco frecuente, o se quiere estudiar el efecto de una exposición sobre varios resultados a la vez, ya que permite calcular directamente incidencias, riesgos relativos y riesgos atribuibles. Cuando el resultado de interés es una enfermedad rara, con periodos de latencia muy largos o cuando se necesita una respuesta rápida y con un coste reducido, resulta más eficiente recurrir a un estudio de casos y controles, que parte del resultado en lugar de la exposición. Y cuando ni siquiera se necesita establecer una secuencia temporal entre exposición y resultado, sino simplemente describir su asociación en un momento dado, puede bastar con un estudio transversal, mucho más rápido y barato de ejecutar aunque no permita calcular incidencias ni establecer con claridad la dirección de la relación.