Definición
Un resultado numérico generado por una evaluación administrada de forma uniforme que ha sido transformado a una escala común para permitir comparaciones entre formas de prueba, administraciones o poblaciones; el término se refiere al valor escalado (equivalado o normado), no al recuento bruto de respuestas correctas.

Principio

Principio
Una puntuación estandarizada permite la comparación sólo en la medida en que los procedimientos de escalado y equivalencia mantienen constante el constructo medido; las diferencias en la puntuación pueden reflejar cambio de constructo, artefactos de escalado, mezcla poblacional o diferencias reales en el rasgo latente medido.

Demostración

Demostración
Escenario ilustrativo → Una prueba de matemáticas produce recuentos brutos de ítems correctos por estudiante; un procedimiento psicométrico (por ejemplo, equivalencia o modelos de respuesta al ítem) convierte esos recuentos en una puntuación de escala para que las puntuaciones de distintas formas de la prueba administradas en años diferentes puedan interpretarse en la misma métrica; los analistas comparan luego las puntuaciones medias entre cohortes.

Aplicación incorrecta

Aplicación incorrecta
Comparar puntuaciones estandarizadas que no comparten el mismo constructo o método de equivalencia: el error semántico es asumir comparabilidad numérica sin verificar que la escala, la operacionalización del constructo y el procedimiento de equivalencia sean consistentes.

Consecuencia

Consecuencia
Las puntuaciones estandarizadas se usan para ubicación, certificación, rendición de cuentas e investigación; dado que las decisiones dependen de dichas puntuaciones, la validez de las consecuencias depende de la validez de constructo del test, su fiabilidad y la idoneidad de los procedimientos de escalado.

Inversión

Inversión
Si el constructo de la evaluación, el banco de ítems, la población o el método de escalado cambian sustancialmente (nuevos estándares, población de diferente idioma, ítems modificados), las puntuaciones nominalmente estandarizadas no son comparables y no sostienen inferencias longitudinales o entre grupos sin revalidación.

Límite

Límite
Claramente dentro: una puntuación de escala producida por un procedimiento documentado de equivalencia o normación para un constructo definido. Caso límite: rangos percentilares derivados de la misma población de prueba — útiles pero distintos de una puntuación de escala. Claramente fuera: recuentos brutos de ítems correctos o clasificaciones normativas que no se han colocado en una escala común.

Tensión semántica

Tensión semántica
Comparabilidad frente a fidelidad del constructo: las puntuaciones ampliamente comparables facilitan decisiones y la investigación, pero producir tal comparabilidad puede requerir compromisos con la fidelidad del test respecto a currículos locales o la pertinencia para subgrupos.

Síntesis

Síntesis
Una puntuación de prueba estandarizada es un artefacto de medición que permite la comparación sólo cuando su escalado y validez de constructo son explícitos; los usuarios deben revisar el modelo de medición y la historia de equivalencia antes de tratar diferencias de puntuación como sustantivas.