Como se vio en el capítulo de introducción, la finalidad de un estudio puede ser puramente descriptiva o analítica. El estudio descriptivo es el diseño observacional más elemental de todos: no compara grupos, no contrasta hipótesis y no pretende establecer relaciones causales. Su único objetivo es cuantificar y describir con precisión cómo se distribuye un fenómeno (una enfermedad, un hábito, una característica cualquiera) en una población o en un conjunto de individuos, sirviendo habitualmente como primer paso de una investigación más amplia.

2.1 Definición y características

Definición 2.1 (Estudio descriptivo) Un estudio descriptivo es un estudio observacional cuyo único objetivo es cuantificar la frecuencia, la distribución o las características de un fenómeno en una población o en un grupo de individuos, sin comparar grupos de exposición ni plantear hipótesis sobre relaciones causa-efecto.

En la práctica, los estudios descriptivos adoptan habitualmente alguna de estas formas:

  • Reporte de caso (case report): descripción detallada de un único individuo con una característica, enfermedad o evolución clínica de interés, generalmente por su rareza o por presentar rasgos inesperados.
  • Serie de casos (case series): descripción de un conjunto de individuos, todos ellos con una misma característica (por ejemplo, todos los pacientes diagnosticados de una enfermedad en un hospital durante un periodo determinado), sin comparación con ningún grupo que no la presente.
  • Estudio descriptivo de frecuencia poblacional: cuantificación de la presencia de un fenómeno en toda una población o en una muestra representativa de ella, mediante medidas como proporciones o tasas, habitualmente desagregadas por variables como el tiempo, el lugar o las características de las personas (la tríada clásica tiempo-lugar-persona de la vigilancia epidemiológica).

Lo que caracteriza a los tres es la ausencia de un grupo de comparación: no existen individuos “no expuestos” o “sin la característica” frente a los que contrastar los resultados. Por ello, un estudio descriptivo puede informar, por ejemplo, de que el 8 % de una muestra de pacientes ingresados presenta una determinada complicación, pero no puede establecer si esa frecuencia es alta o baja en comparación con otro grupo, ni identificar qué factores la explican, ni mucho menos afirmar que exista una relación de causalidad. Para eso son necesarios los diseños analíticos que se desarrollan en los capítulos siguientes.

2.2 Ventajas e inconvenientes

Ventajas

  • Son rápidos, sencillos y económicos de llevar a cabo en comparación con cualquier diseño analítico o experimental.
  • No requieren un grupo de comparación ni una hipótesis previa, por lo que son ideales para explorar fenómenos sobre los que apenas existe información.
  • Son la herramienta natural para generar nuevas hipótesis que después se pondrán a prueba con diseños analíticos.
  • Constituyen la base de los sistemas de vigilancia epidemiológica, al permitir detectar cambios en la frecuencia de una enfermedad a lo largo del tiempo.
  • Son, con frecuencia, el único diseño posible cuando el fenómeno de estudio es muy poco frecuente (enfermedades raras) o cuando se trata de fenómenos nuevos de los que apenas hay casos documentados.

Inconvenientes

  • No permiten establecer asociaciones entre variables, al carecer de grupo de comparación.
  • No permiten en ningún caso establecer relaciones de causalidad.
  • Los reportes y series de casos suelen basarse en muestras pequeñas y no representativas (a menudo pacientes de un único centro), lo que limita mucho la generalización de los resultados.
  • Son especialmente vulnerables al sesgo de selección, ya que los casos que llegan a describirse suelen ser los más llamativos o los que acuden a centros concretos.
  • No permiten controlar factores de confusión, al no compararse ningún grupo.

2.3 Medidas propias de este diseño

Los estudios descriptivos se apoyan en tres medidas de frecuencia muy sencillas, pero que conviene definir con precisión porque son los ladrillos con los que se construyen prácticamente todas las medidas de los diseños analíticos que se estudiarán en los capítulos siguientes (riesgos, odds, incidencias, etc.).

2.3.1 Razón

Definición 2.2 (Razón) Una razón (ratio) es el cociente entre dos cantidades de naturaleza distinta, no necesariamente relacionadas como parte y todo, es decir, el numerador no está necesariamente incluido en el denominador.

\[R = \frac{a}{b}\]

donde \(a\) y \(b\) son los tamaños de dos grupos o cantidades diferentes.

Importante

Como \(a\) y \(b\) pueden ser cantidades de cualquier magnitud y no existe una relación de inclusión entre ellas, se tiene que

\[R \geq 0,\]

sin que exista, en general, ninguna cota superior.

NotaInterpretación
  • Una razón se interpreta como el número de veces que la cantidad del numerador contiene, o representa, a la cantidad del denominador.
  • Por ejemplo, la razón de masculinidad de una población es el cociente entre el número de hombres y el número de mujeres. Una razón de masculinidad de 0.9 indica que hay 0.9 hombres por cada mujer.

2.3.2 Proporción

Definición 2.3 (Proporción) Una proporción es el cociente entre el número de individuos que presentan una determinada característica y el número total de individuos del grupo, de modo que el numerador está incluido en el denominador.

\[P = \frac{a}{a+b} = \frac{a}{n}\]

donde \(a\) es el número de individuos con la característica de interés y \(n=a+b\) es el tamaño total del grupo.

Importante

Al estar el numerador incluido en el denominador, toda proporción cumple

\[0 \leq P \leq 1,\]

y puede expresarse también como porcentaje multiplicándola por 100.

NotaInterpretación
  • Si \(P=0\) ningún individuo del grupo presenta la característica.
  • Si \(P=1\) todos los individuos del grupo presentan la característica.
  • Cuanto más próxima esté \(P\) a 1, mayor es la frecuencia relativa de la característica en el grupo.

2.3.3 Tasa

Definición 2.4 (Tasa) Una tasa (rate) es una proporción que incorpora explícitamente el tiempo en su denominador, expresado habitualmente en unidades de persona-tiempo (personas-año, personas-mes, etc.), es decir, la suma de los periodos de tiempo que cada individuo permanece en riesgo de que ocurra el fenómeno de interés.

\[T = \frac{\mbox{número de eventos nuevos}}{\mbox{personas-tiempo en riesgo}}\cdot k\]

donde \(k\) es una constante (10, 100, 1,000, 100,000…) que se elige para expresar la tasa con cifras manejables.

Importante

Como el numerador no está incluido en el denominador (que tiene unidades de tiempo y no de individuos), una tasa

\[T \geq 0\]

no está acotada superiormente y, a diferencia de la proporción, no es adimensional: sus unidades son “eventos por persona-tiempo”.

NotaInterpretación
  • La tasa mide la velocidad con la que ocurren nuevos eventos en una población, teniendo en cuenta el tiempo real que cada individuo ha estado expuesto al riesgo.
  • Dos poblaciones pueden tener el mismo número absoluto de eventos y, sin embargo, tasas muy distintas si el tiempo de seguimiento o el tamaño de la población en riesgo difieren.
  • La proporción es adecuada cuando todos los individuos se observan durante el mismo periodo de tiempo; cuando el tiempo de seguimiento varía de un individuo a otro (por incorporaciones tardías, pérdidas de seguimiento o fallecimientos por otras causas), la tasa es la medida correcta porque cada individuo aporta solo el tiempo que realmente estuvo en riesgo.

Ejemplo 2.1 Se sigue durante el año 2026 a 8 personas sanas para observar la aparición de una determinada enfermedad. No todas permanecen en riesgo el año completo: algunas la desarrollan antes de que termine el seguimiento (y dejan de estar en riesgo) y otra abandona el estudio antes de tiempo (pérdida de seguimiento).

\[ \begin{array}{lccc} \hline \mbox{Individuo} & \mbox{Meses en riesgo} & \mbox{¿Caso nuevo?} & \mbox{Motivo de fin de seguimiento}\\ \hline \mbox{Individuo 1} & 12 & \mbox{No} & \mbox{Fin del estudio}\\ \mbox{Individuo 2} & 12 & \mbox{No} & \mbox{Fin del estudio}\\ \mbox{Individuo 3} & 5 & \mbox{Sí} & \mbox{Aparición de la enfermedad}\\ \mbox{Individuo 4} & 12 & \mbox{No} & \mbox{Fin del estudio}\\ \mbox{Individuo 5} & 8 & \mbox{Sí} & \mbox{Aparición de la enfermedad}\\ \mbox{Individuo 6} & 12 & \mbox{No} & \mbox{Fin del estudio}\\ \mbox{Individuo 7} & 3 & \mbox{No} & \mbox{Pérdida de seguimiento}\\ \mbox{Individuo 8} & 12 & \mbox{No} & \mbox{Fin del estudio}\\ \hline \end{array} \]

El total de meses-persona observados es \(12+12+5+12+8+12+3+12=76\) meses-persona, lo que equivale a \(76/12=6.33\) personas-año. El número de casos nuevos es 2 (individuos 3 y 5). La tasa de incidencia es, por tanto,

\[ T = \frac{2}{6.33}\cdot 1\,000 = 315.9 \mbox{ casos por cada } 1\,000 \mbox{ personas-año}. \]

Nótese que el individuo 7, aunque solo se observó durante 3 meses, contribuye igualmente al denominador con esos 3 meses-persona, y que ni él ni los individuos que desarrollan la enfermedad aportan tiempo en riesgo más allá del momento en que dejan de estarlo. (Se trata de un ejemplo con un tamaño muestral reducido con fines exclusivamente ilustrativos; en la práctica las tasas se calculan sobre poblaciones de miles o millones de personas-año).

2.4 Realización con R

Supongamos que un servicio de urgencias hospitalario registra, durante un mes, todos los casos atendidos de una determinada enfermedad infecciosa, anotando la edad, el sexo y la gravedad del cuadro clínico. Se trata de una serie de casos: no hay ningún grupo de comparación, solo se describe la frecuencia con la que se presenta cada característica dentro de la serie.

Código
casos <- tibble(
  id = 1:28,
  edad = c(4, 67, 45, 2, 78, 34, 56, 81, 29, 5,
           72, 41, 19, 63, 8, 55, 39, 74, 47, 3,
           68, 52, 27, 9, 61, 33, 76, 48),
  sexo = c("Mujer", "Hombre", "Mujer", "Mujer", "Hombre", "Hombre", "Mujer", "Mujer",
           "Hombre", "Mujer", "Hombre", "Mujer", "Hombre", "Mujer", "Hombre", "Hombre",
           "Mujer", "Mujer", "Hombre", "Mujer", "Mujer", "Hombre", "Mujer", "Hombre",
           "Hombre", "Mujer", "Mujer", "Hombre"),
  gravedad = c("Leve", "Grave", "Moderada", "Leve", "Grave", "Moderada", "Leve", "Grave",
               "Leve", "Leve", "Moderada", "Leve", "Leve", "Moderada", "Leve", "Moderada",
               "Leve", "Grave", "Moderada", "Leve", "Grave", "Leve", "Leve", "Leve",
               "Moderada", "Leve", "Grave", "Moderada")
)

casos
# A tibble: 28 × 4
      id  edad sexo   gravedad
   <int> <dbl> <chr>  <chr>   
 1     1     4 Mujer  Leve    
 2     2    67 Hombre Grave   
 3     3    45 Mujer  Moderada
 4     4     2 Mujer  Leve    
 5     5    78 Hombre Grave   
 6     6    34 Hombre Moderada
 7     7    56 Mujer  Leve    
 8     8    81 Mujer  Grave   
 9     9    29 Hombre Leve    
10    10     5 Mujer  Leve    
# ℹ 18 more rows

Con dplyr es inmediato calcular la proporción de casos que corresponde a cada categoría de gravedad, la primera medida descriptiva de interés:

Código
proporciones_gravedad <- casos |>
  count(gravedad) |>
  mutate(proporcion = n / sum(n),
         porcentaje = round(100 * proporcion, 1))

proporciones_gravedad
# A tibble: 3 × 4
  gravedad     n proporcion porcentaje
  <chr>    <int>      <dbl>      <dbl>
1 Grave        6      0.214       21.4
2 Leve        14      0.5         50  
3 Moderada     8      0.286       28.6

También puede describirse la razón entre sexos de la serie, y la proporción de casos graves dentro de cada grupo de edad, agrupando previamente la edad en tramos:

Código
# Razón hombres / mujeres en la serie de casos
razon_sexo <- casos |>
  count(sexo) |>
  pivot_wider(names_from = sexo, values_from = n) |>
  mutate(razon_masculinidad = Hombre / Mujer)

razon_sexo
# A tibble: 1 × 3
  Hombre Mujer razon_masculinidad
   <int> <int>              <dbl>
1     13    15              0.867
Código
# Proporción de casos graves por tramo de edad
casos_edad <- casos |>
  mutate(tramo_edad = case_when(
    edad < 15 ~ "0-14 años",
    edad < 65 ~ "15-64 años",
    TRUE ~ "65 o más años"
  )) |>
  group_by(tramo_edad) |>
  summarise(n = n(),
            graves = sum(gravedad == "Grave"),
            proporcion_graves = round(graves / n, 2))

casos_edad
# A tibble: 3 × 4
  tramo_edad        n graves proporcion_graves
  <chr>         <int>  <int>             <dbl>
1 0-14 años         6      0              0   
2 15-64 años       15      0              0   
3 65 o más años     7      6              0.86

Si, además, se conociera cuántos días ha permanecido cada paciente ingresado (por ejemplo, porque los casos graves requieren hospitalización), podría calcularse una tasa de nuevos casos graves por cada 1000 días-paciente de estancia, lo que ilustra cómo la misma lógica de las tasas se aplica también dentro de un estudio descriptivo:

Código
estancias <- casos |>
  filter(gravedad %in% c("Moderada", "Grave")) |>
  mutate(dias_estancia = c(6, 9, 4, 10, 5, 3, 8, 7, 6, 11, 4, 9, 7, 5))

tasa_complicacion <- estancias |>
  summarise(
    dias_persona = sum(dias_estancia),
    casos_graves = sum(gravedad == "Grave"),
    tasa_x1000 = round(1000 * casos_graves / dias_persona, 1)
  )

tasa_complicacion
# A tibble: 1 × 3
  dias_persona casos_graves tasa_x1000
         <dbl>        <int>      <dbl>
1           94            6       63.8

Por último, un diagrama de barras permite visualizar de un vistazo la distribución de la gravedad de los casos, la representación gráfica más habitual de una variable cualitativa en un estudio descriptivo:

Código
ggplot(proporciones_gravedad, aes(x = fct_reorder(gravedad, proporcion, .desc = TRUE),
                                   y = proporcion)) +
  geom_col(fill = "steelblue") +
  geom_text(aes(label = paste0(porcentaje, "%")), vjust = -0.5) +
  scale_y_continuous(labels = scales::percent, limits = c(0, max(proporciones_gravedad$proporcion) * 1.2)) +
  labs(x = "Gravedad del cuadro clínico", y = "Proporción de casos",
       title = "Gravedad de los casos atendidos en urgencias") +
  theme_minimal()

Distribución de la gravedad de los casos registrados en urgencias durante el mes.

Los resultados describen la serie de casos, pero no permiten ir más allá: puede afirmarse que algo más de la mitad de los casos de esta serie fueron leves y que la proporción de cuadros graves es mayor entre los mayores de 65 años, pero no puede concluirse que la edad cause una mayor gravedad, porque no se dispone de ningún grupo de comparación con el que contrastar esa diferencia ni se han controlado otros factores que pudieran explicarla.

2.5 Cuándo utilizar este diseño

Un estudio descriptivo es la elección adecuada cuando todavía se sabe poco sobre un fenómeno y el objetivo prioritario es simplemente cuantificarlo: en las primeras fases de un brote epidemiológico, en la vigilancia rutinaria de enfermedades, al documentar un caso clínico inusual, o al estudiar enfermedades tan raras que reunir un grupo de comparación resulta inviable. Su gran ventaja es la sencillez y la rapidez con la que aporta una primera fotografía del problema, que sirve para generar hipótesis sobre posibles factores asociados. Sin embargo, en cuanto la pregunta de investigación pasa de “¿con qué frecuencia ocurre esto?” a “¿por qué ocurre?” o “¿qué lo explica?”, un diseño descriptivo deja de ser suficiente y es necesario recurrir a un diseño analítico, como el estudio transversal o el estudio de cohortes, que sí incorporan un grupo de comparación frente al que contrastar los resultados.