8  Estudios cuasiexperimentales

Un estudio cuasiexperimental es un tipo de estudio en el que el investigador interviene, es decir, aplica un tratamiento, programa o intervención a los individuos, pero sin asignar aleatoriamente a los sujetos a los grupos de tratamiento y de control. Esta ausencia de aleatorización es la característica que lo distingue de los estudios experimentales, tal y como se introdujo en el capítulo de introducción.

Los estudios cuasiexperimentales surgen habitualmente cuando la aleatorización no es posible, no es ética o no es práctica. Es el caso, por ejemplo, de la evaluación de políticas públicas, programas educativos o intervenciones comunitarias, en los que no se puede asignar al azar qué municipios, colegios o pacientes reciben la intervención y cuáles no, ya sea por razones logísticas, legales o de justicia social.

8.1 Definición y características

En un estudio cuasiexperimental el investigador manipula deliberadamente una variable independiente (la intervención o tratamiento) y mide su efecto sobre una o varias variables dependientes, pero los grupos que reciben o no la intervención se forman por procedimientos distintos del azar: por ejemplo, porque ya existían previamente (dos colegios, dos regiones), porque los propios individuos se autoseleccionan, o porque la intervención se aplica a toda una comunidad sin grupo de comparación disponible.

Existen numerosas variantes de diseño cuasiexperimental, entre las que destacan las tres siguientes.

8.1.1 Diseño de un solo grupo antes-después

También llamado diseño one-group pretest-posttest, consiste en medir una variable de interés en un único grupo de individuos antes de aplicar la intervención y volver a medirla después. Es el diseño cuasiexperimental más sencillo, ya que no requiere ningún grupo de comparación, pero también el más débil desde el punto de vista de la validez interna, porque cualquier cambio observado entre el antes y el después podría deberse a la intervención, pero también a otros factores que hayan actuado simultáneamente sobre los individuos.

8.1.2 Diseño con grupo de control no equivalente

En este diseño se dispone de dos grupos, uno que recibe la intervención (grupo tratado) y otro que no la recibe (grupo de control o de comparación), y se mide la variable de interés en ambos antes y después de la intervención. La diferencia esencial respecto a un experimento es que los dos grupos no se han formado mediante asignación aleatoria, sino que ya existían como tales (dos aulas, dos hospitales, dos regiones), por lo que pueden diferir sistemáticamente en características que también influyan en el resultado. Es el diseño cuasiexperimental más utilizado en la práctica y el que permite construir el estimador de diferencia en diferencias que se presenta más adelante.

8.1.3 Series temporales interrumpidas

En este diseño se realizan múltiples mediciones de la variable de interés sobre la misma unidad de estudio (una población, una región, una organización) tanto antes como después de que se produzca la intervención, que actúa como una interrupción en la serie temporal. Por ejemplo, registrar la tasa de accidentes de tráfico mes a mes durante varios años antes y después de la entrada en vigor de una nueva ley de seguridad vial. La disponibilidad de varias medidas antes y después, en lugar de una sola, permite valorar si el cambio observado tras la intervención rompe con la tendencia previa o si es simplemente una continuación de una tendencia ya existente.

8.2 Ventajas e inconvenientes

Los estudios cuasiexperimentales presentan las siguientes ventajas:

  • Son más factibles, tanto éticamente como en la práctica, que un ensayo controlado aleatorizado, ya que no requieren asignar al azar a los individuos a recibir o no una intervención.
  • Permiten evaluar intervenciones a gran escala, como políticas públicas, leyes o programas comunitarios, que no podrían implementarse de forma aleatorizada.
  • Suelen ser más baratos y rápidos de llevar a cabo que un experimento, al aprovechar grupos o mediciones ya existentes.

Y también los siguientes inconvenientes:

  • Al no existir aleatorización, existe un mayor riesgo de sesgo de selección: los grupos comparados pueden diferir sistemáticamente en características relevantes, y no solo en si reciben o no la intervención.
  • Es más difícil descartar la presencia de factores de confusión que expliquen, total o parcialmente, el cambio observado.
  • Están expuestos a amenazas a la validez interna propias de los diseños con medidas repetidas, como la regresión a la media (los valores extremos tienden a acercarse a la media en mediciones sucesivas, con independencia de la intervención) o la historia (sucesos externos a la intervención, ocurridos entre el antes y el después, que también podrían explicar el cambio).

8.3 Medidas propias de este diseño

En el diseño con grupo de control no equivalente, la medida de efecto más habitual es el estimador de diferencia en diferencias.

Definición 8.1 (Diferencia en diferencias (DiD)) Dado un grupo tratado y un grupo de control no equivalente, en los que se mide una variable de interés antes y después de aplicar una intervención sobre el grupo tratado, siendo \(\bar{Y}_{t,antes}\) y \(\bar{Y}_{t,despues}\) las medias de la variable en el grupo tratado antes y después de la intervención, y \(\bar{Y}_{c,antes}\) y \(\bar{Y}_{c,despues}\) las medias correspondientes en el grupo de control, se define el estimador de diferencia en diferencias como

\[DiD = (\bar{Y}_{t,despues} - \bar{Y}_{t,antes}) - (\bar{Y}_{c,despues} - \bar{Y}_{c,antes})\]

NotaInterpretación

El estimador \(DiD\) representa el efecto atribuible a la intervención una vez descontado el cambio que se habría producido de todos modos, sin necesidad de intervenir. El cambio observado en el grupo de control se utiliza como estimación de la tendencia contrafactual, es decir, de lo que habría ocurrido en el grupo tratado si no hubiera recibido la intervención. Restar ese cambio al cambio observado en el grupo tratado permite aislar el efecto propio de la intervención.

Advertencia

El estimador de diferencia en diferencias solo es válido bajo el supuesto de tendencias paralelas: en ausencia de la intervención, el grupo tratado y el grupo de control habrían evolucionado de forma paralela, es decir, con el mismo cambio medio entre el antes y el después. Si este supuesto no se cumple, la \(DiD\) puede sobrestimar o infraestimar el verdadero efecto de la intervención.

Ejemplo 8.1 Un ayuntamiento implanta un programa de refuerzo escolar en los colegios de su municipio (grupo tratado). Para valorar su efecto, se compara la calificación media de los alumnos en una prueba estandarizada con la de los colegios de un municipio vecino que no recibió el programa (grupo de control), antes y después de su implantación. No es posible asignar aleatoriamente qué municipio recibe el programa, por lo que se trata de un diseño cuasiexperimental con grupo de control no equivalente.

Las calificaciones medias obtenidas son

\[ \begin{array}{lrrr} \hline \mbox{Grupo} & \mbox{Antes} & \mbox{Después} & \mbox{Cambio}\\ \hline \mbox{Tratado (con programa)} & 5.2 & 6.4 & 1.2\\ \mbox{Control (sin programa)} & 5.3 & 5.6 & 0.3\\ \hline \end{array} \]

El cambio en el grupo tratado es

\[\bar{Y}_{t,despues} - \bar{Y}_{t,antes} = 6.4 - 5.2 = 1.2,\]

y el cambio en el grupo de control, que estima la tendencia que habría seguido el grupo tratado sin el programa, es

\[\bar{Y}_{c,despues} - \bar{Y}_{c,antes} = 5.6 - 5.3 = 0.3.\]

Por tanto, el estimador de diferencia en diferencias es

\[DiD = 1.2 - 0.3 = 0.9.\]

Descontada la tendencia común a ambos municipios, el programa de refuerzo escolar habría producido un aumento medio de 0.9 puntos en la calificación de los alumnos.

8.4 Realización con R

8.4.1 Cálculo de la diferencia en diferencias

A continuación se reproduce en R el cálculo del ejemplo anterior a partir de las cuatro medias observadas.

Código
y_t_antes <- 5.2
y_t_despues <- 6.4
y_c_antes <- 5.3
y_c_despues <- 5.6

cambio_tratado <- y_t_despues - y_t_antes
cambio_control <- y_c_despues - y_c_antes
DiD <- cambio_tratado - cambio_control

cambio_tratado
[1] 1.2
Código
cambio_control
[1] 0.3
Código
DiD
[1] 0.9

El resultado coincide con el obtenido a mano: un cambio de 1.2 puntos en el grupo tratado, un cambio de 0.3 puntos en el grupo de control, y una diferencia en diferencias de 0.9 puntos.

El gráfico clásico de diferencia en diferencias representa, para cada grupo, la evolución de la media entre el antes y el después mediante una línea. La divergencia entre ambas líneas tras la intervención es visualmente atribuible al efecto del programa.

Código
datos_did <- tibble(
  grupo = rep(c("Tratado", "Control"), each = 2),
  momento = rep(c("Antes", "Después"), times = 2),
  media = c(y_t_antes, y_t_despues, y_c_antes, y_c_despues)
) |>
  mutate(momento = factor(momento, levels = c("Antes", "Después")))

ggplot(datos_did, aes(x = momento, y = media, group = grupo, color = grupo)) +
  geom_line(linewidth = 1) +
  geom_point(size = 3) +
  labs(
    x = "Momento",
    y = "Calificación media",
    color = "Grupo",
    title = "Diferencia en diferencias del programa de refuerzo escolar"
  ) +
  theme_minimal()

En el gráfico se aprecia que, aunque ambos grupos mejoran ligeramente entre el antes y el después, el grupo tratado lo hace en mayor medida que el grupo de control, y esa distancia adicional es precisamente la \(DiD\) calculada.

8.4.2 Diseño de un solo grupo antes-después

Cuando no se dispone de ningún grupo de control, el diseño más simple consiste en comparar las mediciones de los mismos individuos antes y después de la intervención mediante un contraste de datos pareados. A continuación se simula una muestra de 30 individuos a los que se aplica una intervención (por ejemplo, un programa de entrenamiento cognitivo) y se mide su rendimiento antes y después.

Código
set.seed(123)
n <- 30
antes <- rnorm(n, mean = 50, sd = 8)
despues <- antes + rnorm(n, mean = 4, sd = 5)

datos_pretest_postest <- tibble(
  individuo = 1:n,
  antes = antes,
  despues = despues
)

datos_pretest_postest
# A tibble: 30 × 3
   individuo antes despues
       <int> <dbl>   <dbl>
 1         1  45.5    51.6
 2         2  48.2    50.7
 3         3  62.5    70.9
 4         4  50.6    59.0
 5         5  51.0    59.1
 6         6  63.7    71.2
 7         7  53.7    60.5
 8         8  39.9    43.6
 9         9  44.5    47.0
10        10  46.4    48.5
# ℹ 20 more rows

Para contrastar si el cambio medio observado es estadísticamente significativo se aplica un contraste \(t\) de Student para datos pareados:

Código
t.test(datos_pretest_postest$despues, datos_pretest_postest$antes, paired = TRUE)

    Paired t-test

data:  datos_pretest_postest$despues and datos_pretest_postest$antes
t = 6.4165, df = 29, p-value = 5.115e-07
alternative hypothesis: true mean difference is not equal to 0
95 percent confidence interval:
 3.332482 6.450901
sample estimates:
mean difference 
       4.891692 

El p-valor obtenido es prácticamente cero, muy inferior a 0.05, por lo que se rechaza la hipótesis nula de que no existe cambio medio entre el antes y el después: el rendimiento medio tras la intervención es significativamente superior al previo. Sin embargo, al tratarse de un diseño de un solo grupo, este resultado no permite descartar que el cambio se deba a otros factores distintos de la intervención (maduración de los individuos, práctica en la propia prueba, sucesos externos ocurridos durante el estudio, etc.), que es precisamente la principal limitación de este diseño frente al que incorpora un grupo de control no equivalente.

8.5 Cuándo utilizar este diseño

Un estudio cuasiexperimental es la opción adecuada cuando el investigador puede intervenir aplicando un tratamiento o programa, pero no puede asignar aleatoriamente a los individuos o unidades a los grupos de tratamiento y control, como ocurre con frecuencia en la evaluación de políticas públicas, programas educativos o intervenciones comunitarias. Se diferencia así de los estudios experimentales, que deben preferirse siempre que la aleatorización sea posible y ética, ya que ofrecen un control mucho mayor sobre los factores de confusión. Y se diferencia de los estudios de cohortes en que en estos últimos el investigador no interviene en absoluto, limitándose a observar y seguir en el tiempo a individuos que ya están expuestos o no a un factor por decisión propia o por las circunstancias, sin aplicar ningún tratamiento. En definitiva, el diseño cuasiexperimental ocupa un lugar intermedio entre la observación pura y el experimento controlado, y resulta especialmente útil cuando la pregunta de investigación exige valorar el efecto de una intervención real que no puede aleatorizarse.