Parte 11 — Evaluación y psicometría
Una nota es una inferencia sobre una persona: exige la misma prueba que cualquier otra
🟣 Etapa C — Núcleo profesional docente · salida de la etapa: diseñar, enseñar, evaluar y gestionar un curso completo con evidencia
Clases: 12 (133–144) · Población de referencia: transversal, con foco en instrumentos y decisiones · Conceptos operacionales: 48 · Señales observables: 36
Contenido central: Evaluación diagnóstica, formativa, sumativa y auténtica, construcción de ítems, rúbricas, retroalimentación, validez, confiabilidad, análisis de ítems y teoría clásica e IRT
🎯 De qué trata esta parte
Evaluar es hacer una inferencia: a partir de un desempeño limitado en un momento concreto se afirma algo sobre lo que una persona sabe o puede hacer. Formulado así, queda claro por qué la validez es el concepto central: no es una propiedad del instrumento sino de la interpretación que se hace con sus resultados y del uso que se le da. Una misma prueba puede ser válida para orientar la enseñanza e inválida para decidir la promoción de un estudiante.
La parte enseña a construir instrumentos y a criticarlos con herramientas técnicas: análisis de dificultad y discriminación, consistencia interna y sus límites, funcionamiento diferencial entre grupos, y las nociones básicas de teoría clásica y de teoría de respuesta al ítem. No para convertir al docente en psicometrista, sino para que pueda leer un informe técnico —de una prueba estandarizada, de un sistema nacional— sin que le vendan como precisión lo que es ruido.
El otro eje es la retroalimentación, que es el punto donde la evaluación se convierte en enseñanza. La evidencia es clara en una cosa incómoda: entregar nota y comentario juntos anula el efecto del comentario, porque la atención va a la nota. Y es matizada en otra: la retroalimentación no siempre mejora el desempeño; puede empeorarlo cuando se dirige a la persona en vez de a la tarea. Esa distinción, bien aplicada, cambia más resultados que cualquier rediseño de prueba.
🏫 Caso de la parte
Las doce clases trabajan sobre la misma realidad, para que puedas ver cómo cambia tu diagnóstico a medida que avanzas:
El establecimiento decide repitencias con el promedio final y una prueba de síntesis de 40 preguntas. Dos docentes de la misma asignatura califican el mismo trabajo con dos puntos de diferencia y nadie lo considera un problema técnico.
Artefacto que produces al terminar: sistema de evaluación de asignatura con argumento de validez, análisis de ítems y rúbricas calibradas entre evaluadores.
📚 Resultados de la parte
Al terminar esta parte podrás:
- Construir instrumentos alineados con el objetivo y defender su validez.
- Analizar técnicamente una prueba aplicada y corregir sus ítems defectuosos.
- Diseñar retroalimentación que produzca cambio en el trabajo del estudiante.
- Leer críticamente resultados de evaluaciones estandarizadas nacionales o internacionales.
🗺️ Mapa de la parte
flowchart TB
OB["Objetivo de aprendizaje"] --> PR["Proposito de la evaluacion<br/>diagnostica · formativa · sumativa"]
PR --> IN["Instrumento<br/>items · rubrica · desempeno"]
IN --> AP["Aplicacion"]
AP --> AN["Analisis tecnico<br/>dificultad · discriminacion · consistencia"]
AN --> VAL{{"Validez de la interpretacion<br/>y del uso"}}
VAL --> DEC["Decision<br/>calificar · promover · reensenar"]
AP --> RETRO["Retroalimentacion<br/>sobre la tarea"]
RETRO --> OB
DEC --> PY["Sistema de evaluacion<br/>proyecto integrador"]
🧠 Marco de referencia
- validez como argumento sobre la interpretación y el uso de los puntajes
- confiabilidad, error de medida y sus consecuencias en decisiones individuales
- teoría clásica de los tests y nociones básicas de teoría de respuesta al ítem
- evaluación formativa y retroalimentación efectiva
Autoras y autores que conviene conocer: Samuel Messick, Michael Kane, Lee Cronbach, Paul Black y Dylan Wiliam, John Hattie y Helen Timperley, Georg Rasch, equipos de la Agencia de Calidad de la Educación
📋 Las 12 clases
| # | Clase | Decisión que habilita | Evidencia |
|---|---|---|---|
| 133 | Evaluación diagnóstica | determinar qué prerrequisitos vas a medir y qué harás con cada resultado posible | CONSISTENTE |
| 134 | Evaluación formativa | determinar qué evidencia recogerás y qué decisión de enseñanza modificará | ROBUSTA |
| 135 | Evaluación sumativa | determinar qué evidencia sumativa justifica la decisión que vas a tomar sobre cada estudiante | CONSISTENTE |
| 136 | Evaluación auténtica | determinar qué amenaza a la validez introduce tu tarea auténtica y cómo la controlarás | CONSISTENTE |
| 137 | Construcción de ítems | determinar qué formato de ítem corresponde al desempeño que quieres evaluar | CONSISTENTE |
| 138 | Rúbricas y escalas | determinar el tipo de rúbrica y los descriptores que sostendrán la consistencia de tu evaluación | CONSISTENTE |
| 139 | Retroalimentación efectiva | determinar cuándo y cómo entregarás la retroalimentación para que el estudiante pueda usarla | ROBUSTA |
| 140 | Validez | determinar qué afirmación puedes sostener con los resultados de tu evaluación y cuál no | ROBUSTA |
| 141 | Confiabilidad | determinar si la diferencia de puntaje que estás interpretando supera el error de medida | ROBUSTA |
| 142 | Análisis de dificultad y discriminación | determinar qué ítems de tu prueba deben corregirse o eliminarse y por qué | ROBUSTA |
| 143 | Introducción a teoría clásica e IRT | determinar qué se puede concluir de un informe técnico de una evaluación estandarizada y qué no | ROBUSTA |
| 144 | Proyecto integrador: sistema de evaluación | determinar el conjunto de decisiones de evaluación de tu asignatura y su justificación técnica | CONSISTENTE |
⚠️ Riesgos característicos
- Atribuir validez al instrumento en vez de a la interpretación y al uso.
- Usar el alfa de Cronbach como sello de calidad sin revisar sus supuestos.
- Entregar nota y comentario juntos y esperar que el comentario opere.
- Tomar decisiones de alto impacto con una sola medición.
📕 Lecturas de referencia de la parte
- **AERA, APA & NCME (2014). Standards for Educational and Psychological Testing. — el estándar técnico de referencia internacional; define qué se puede afirmar con un puntaje y qué no. Localizar:** fuente oficial · ficha
- **Messick, S. (1989). Validity. En Educational Measurement. — el capítulo que reorganiza la validez como juicio integrado sobre interpretación y consecuencias. Localizar:** DOI 10.1002/j.2330-8516.1987.tb00244.x · ficha
- **Black, P. & Wiliam, D. (1998). Assessment and Classroom Learning. Assessment in Education, 5(1). — la revisión que instala la evaluación formativa como intervención con efecto y no como discurso. Localizar:** DOI 10.1080/0969595980050102 · ficha
- **Hattie, J. & Timperley, H. (2007). The Power of Feedback. Review of Educational Research, 77(1). — modelo de retroalimentación por niveles; explica por qué el elogio a la persona no mejora el desempeño. Localizar:** DOI 10.3102/003465430298487 · ficha
✅ Evidencia mínima para dar la parte por cerrada
- un instrumento construido con tabla de especificaciones y argumento de validez;
- el análisis técnico de una prueba aplicada con ítems corregidos;
- una rúbrica calibrada entre al menos dos evaluadores;
- un sistema de evaluación de asignatura completo y defendible.
🧭 Práctica y evaluación de la parte
- Rúbrica maestra e instrumentos de autoevaluación
- Casos profesionales para resolver con este marco
- Laboratorios de decisión
- Dónde se archiva la evidencia
| Anterior | Índice | Siguiente |
|---|---|---|
| ← Parte 10 · Didáctica avanzada | Programa · Currículo | Parte 12 · Gestión del aula y convivencia → |