Datos

¿Podemos fiarnos del informe PISA?

La manera en la que los jóvenes interactúan con el cuestionario ha cambiado mucho, y esto podría afectar a su validez desde una perspectiva no tan cuantitativa.

25 de septiembre 2026


Hace ya un par de semanas salieron los resultados del informe PISA 2025, un estudio realizado por la OCDE que mide (entre otras muchas cosas) el desempeño en varias materias como matemáticas, lectura o ciencia entre escolares de 15 y 16 años. Como viene siendo habitual en los informes PISA, los resultados han causado un gran revuelo mediático, fundamentado en la caída generalizada que se puede observar en el desempeño en todas las materias y prácticamente todos los países, siendo esta caída en España algo más pronunciada que en el promedio de la OCDE. Si nos fijamos en otros indicadores, podemos ver más resultados llamativos, como que la caída ha sido significativamente mayor entre el estudiantado con mayor nivel socioeconómico (particularmente en el de mucho nivel socioeconómico), o que somos el cuarto país de todos los estudiados donde sus escolares más utilizan la IA con fines académicos. En esto último también hay una brecha de clase: los escolares de mayor nivel socioeconómico utilizan más la IA que los de menor nivel.

image1.png
Dumbbell del uso de la IA generativa con fines escolares en los países del informe PISA 2025 donde más la usan sus escolares. España, con un índice de 0,22, en 4º lugar (chicos 0,20, chicas 0,24; favorecidos 0,31; desfavorecidos 0,13). Fuente: Informe Español, PISA 2025.

Sobre la interpretación de estos resultados y sus implicaciones no puedo añadir nada interesante, ya que no soy experto en educación. Sin embargo, sí que he podido observar algunas inquietudes respecto a la metodología de este informe (o directamente un cuestionamiento de la misma), y como estadístico especializado en muestreo sí que puedo comentar algo más. El informe PISA no es otra cosa que una encuesta. Una encuesta cuya población objetivo son escolares de 15 y 16 años de los países estudiados.

La definición de encuesta no es la de una hoja que te pasan con unas preguntas a responder (eso recibe el nombre de cuestionario), sino que abarca todo el procedimiento de recogida de información de una muestra de una población, desde la concepción de las preguntas que queremos responder hasta la exposición de sus resultados, pasando por el diseño del cuestionario, el diseño de la muestra, el trabajo de campo, la depuración de datos o el ajuste de las estimaciones.

De todas estas tareas, hay dos que son especialmente delicadas: el diseño del cuestionario y el diseño de la muestra. Y en esto hay que ser claros: los estándares de calidad en esta encuesta son muy altos en ambas cosas. Es el mensaje que debe prevalecer. Pero eso no evita que, como en toda encuesta, haya limitaciones.

El cuestionario con el que se mide el desempeño de los escolares se realiza mediante escalas de ítems (algo parecido a los tests que te hacen cuando vas al psicólogo) que se han validado mediante la Teoría de Respuesta al Ítem. Esta teoría establece, a diferencia de la teoría clásica, que cada ítem tiene una dificultad distinta (y se establece por tanto que en cada ítem hay una respuesta correcta, resultando en una variable dicotómica -correcta vs no correcta-) y que en base a esto se puede obtener, para cada individuo que lo hace, un parámetro que representa el nivel de competencia que éste tiene en la materia evaluada. De hecho, más que un parámetro se obtiene una distribución para ese parámetro: un conjunto de posibles valores que podría tomar, cada uno con una probabilidad asociada. En el informe PISA toman una muestra de diez realizaciones de esa distribución para tener una mejor idea de la incertidumbre asociada a la estimación de ese parámetro para cada escolar.

Realmente el problema no es tanto cómo se ha validado sino el hecho de que esta validez se pueda mantener en el tiempo: la batería principal de ítems ha permanecido invariante durante muchas ediciones (permitiendo así las comparaciones entre años), pero el mundo y la manera en la que los jóvenes interactúan con él han cambiado mucho, y esto podría afectar a su validez desde una perspectiva no tan cuantitativa. También sufre otro problema común en los instrumentos de medición: que éstos sean válidos en todas las circunstancias. Muchos docentes han argumentado que la prueba que se hace en PISA no es un examen que cuente para nota, y esto puede provocar que el alumnado se relaje. De ser así, antes de asumir que esta relajación es un motivo de peso para que el rendimiento baje de una edición a otra del informe, tendríamos que preguntarnos si esto ha sucedido siempre o si el nivel de relajación de los escolares al hacer la prueba ha cambiado con el tiempo. En cualquier caso, aunque no explique la caída en rendimiento de este año, sí pondría en duda que los resultados muestren el nivel real del estudiantado.

Respecto al diseño muestral, se ha realizado un muestreo estratificado por conglomerados bietápico. Traducido al castellano: primero se seleccionaban centros educativos, estratificados (separados en grupos diferentes) según sus características, y dentro de cada centro se seleccionaba una muestra aleatoria de escolares. Los centros además se seleccionaban con probabilidades propocionales al tamaño, lo cual generalmente reduce la incertidumbre de las estimaciones. También la reduce la propia estratificación, que se hizo tanto explícita, separando como tal a los centros educativos en estratos, como implícita, ordenando los centros según otras características y seleccionándolos sistemáticamente, dando pasos de cierta longitud en el listado de centros, lo cual hace que esas otras características también queden proporcionalmente representadas.

Sin embargo, el procedimiento de muestrear por conglomerados sí que suele contribuir a aumentar la incertidumbre de los resultados, sobre todo si los centros educativos son muy diferentes entre sí. Este aumento de la incertidumbre se mide con el denominado efecto de diseño, que nos dice cuánto aumenta la variabilidad de la estimación en comparación con un muestreo totalmente aleatorio simple donde todos los escolares del país se eligen con exactamente igual probabilidad.

El efecto de diseño en España es enorme (supera las 10 unidades en todas las características medidas), convirtiendo una muestra de casi 30.000 estudiantes en una muestra efectiva de unos 2.400 – 2.600 estudiantes, dependiendo de la característica medida. Es decir, la muestra de España produce estimaciones con una precisión similar a la de una muestra aleatoria simple de 2.400 estudiantes. Estos enormes efectos de diseño no son exclusivos de España: también en otros países muy poblados o extensos como Indonesia, Argentina, Brasil o Estados Unidos (en este último la cosa es grave: la muestra efectiva se queda en torno a 400 estudiantes). Con 2.400 estudiantes, la precisión es más que suficiente para hacer estimaciones y comparaciones a nivel nacional, pero a nivel subnacional sí que podríamos tener un nivel de incertidumbre bastante más grande. De hecho, en el Informe Español de PISA 2025 se aprecia cierto solapamiento en los intervalos de confianza de competencias educativas por comunidades autónomas, lo cual impide establecer conclusiones tan rimbombantes sobre las diferencias por territorios como las que querrían algunos en el debate público.

Screenshot 2026-09-25 at 11.27.58.png
Tamaños de muestra, efectos de diseño y tamaños de muestra efectivos de la competencia media en ciencias en el Informe PISA 2025 de los países con efectos de diseño superiores a 10 unidades. Fuente: PISA 2025 Technical Report, cap. 14, tabla 14.A.11.

Dicho todo esto, en el trabajo de campo también hubo problemas. No con la falta de respuesta, ya que hubo bastante participación, pero sí con lo que denominamos error de cobertura, es decir, partes de la población que no quedan cubiertas por la encuesta. Concretamente, en Catalunya se tuvo que excluir a un 23% de los estudiantes y en Murcia a un 13%. Según una comunicación de la propia OCDE, en la mayoría de los casos las exclusiones se dieron a nivel de estudiantes individuales (y no de centros, donde sólo se excluyeron 10 de los 959 que se habían seleccionado en la muestra), y dichas exclusiones fueron en su mayoría porque los escolares no alcanzaban las competencias lingüísticas necesarias para poder realizar la prueba. La propia OCDE deja caer que las estimaciones en Murcia podrían estar sesgadas hacia arriba, es decir, que estén sobreestimando las competencias reales del estudiantado, mientras que las de Catalunya directamente recomienda descartarlas. Aunque a la postre la población afectada a nivel nacional no es tantísima, creo que sí que podría tener la importancia suficiente para sesgar un pelín las estimaciones a ese nivel.

Como conclusiones: la encuesta en la que se basa el Informe está diseñada con unos estándares muy altos, lo cual no quita que tengamos que interpretar los resultados con cautela. En lo que se refiere al diseño muestral, la incertidumbre no es tan grave a nivel nacional ni tampoco el sesgo, aunque tenemos que considerar una ligera sobreestimación (y no solamente en España). Es posible comparar nuestros resultados con los de otros países sin preocuparnos mucho de la significación estadística, pero hay que tener cuidado al comparar entre comunidades autónomas, en particular Catalunya y Murcia (con las que yo, personalmente, no extraería ninguna conclusión). En lo que se refiere al diseño de los instrumentos de medida, también hay que reflexionar sobre las circunstancias que rodean a los escolares, tanto en el momento de realizar la prueba en el centro como en sus vidas en general, y también en que la comparación temporal hay que cogerla con más pinzas, especialmente a medida que nos alejamos más en el tiempo. No existen ni la encuesta perfecta, ni la métrica perfecta, ni la estimación perfecta, pero no necesitamos llegar a la perfección estadística para poder distinguir el ruido de la señal. Y creo que el informe PISA, aún con todo lo expuesto, lo consigue.

Sigue a Ramón Ferri (Picanúmeros)

Recibe un email con todos los nuevos artículos de Ramón Ferri (Picanúmeros)


¿Qué opinas?

Sin comentarios
Deja un comentario...
Cargando comentarios…

Únete a la conversación

Para comentar necesitas una suscripción activa. Accede o abónate para participar.




Abónate a sustrato.
Apoya el trabajo de Ramón Ferri (Picanúmeros)

Lee a tus autores favoritos y apoya su trabajo independiente y audaz.

VER PLANES