Skip to content

Latest commit

 

History

History
109 lines (78 loc) · 9.24 KB

File metadata and controls

109 lines (78 loc) · 9.24 KB

Parte 11 — Evaluación y psicometría

Una nota es una inferencia sobre una persona: exige la misma prueba que cualquier otra

🟣 Etapa C — Núcleo profesional docente · salida de la etapa: diseñar, enseñar, evaluar y gestionar un curso completo con evidencia

Clases: 12 (133–144) · Población de referencia: transversal, con foco en instrumentos y decisiones · Conceptos operacionales: 48 · Señales observables: 36
Contenido central: Evaluación diagnóstica, formativa, sumativa y auténtica, construcción de ítems, rúbricas, retroalimentación, validez, confiabilidad, análisis de ítems y teoría clásica e IRT

🎯 De qué trata esta parte

Evaluar es hacer una inferencia: a partir de un desempeño limitado en un momento concreto se afirma algo sobre lo que una persona sabe o puede hacer. Formulado así, queda claro por qué la validez es el concepto central: no es una propiedad del instrumento sino de la interpretación que se hace con sus resultados y del uso que se le da. Una misma prueba puede ser válida para orientar la enseñanza e inválida para decidir la promoción de un estudiante.

La parte enseña a construir instrumentos y a criticarlos con herramientas técnicas: análisis de dificultad y discriminación, consistencia interna y sus límites, funcionamiento diferencial entre grupos, y las nociones básicas de teoría clásica y de teoría de respuesta al ítem. No para convertir al docente en psicometrista, sino para que pueda leer un informe técnico —de una prueba estandarizada, de un sistema nacional— sin que le vendan como precisión lo que es ruido.

El otro eje es la retroalimentación, que es el punto donde la evaluación se convierte en enseñanza. La evidencia es clara en una cosa incómoda: entregar nota y comentario juntos anula el efecto del comentario, porque la atención va a la nota. Y es matizada en otra: la retroalimentación no siempre mejora el desempeño; puede empeorarlo cuando se dirige a la persona en vez de a la tarea. Esa distinción, bien aplicada, cambia más resultados que cualquier rediseño de prueba.

🏫 Caso de la parte

Las doce clases trabajan sobre la misma realidad, para que puedas ver cómo cambia tu diagnóstico a medida que avanzas:

El establecimiento decide repitencias con el promedio final y una prueba de síntesis de 40 preguntas. Dos docentes de la misma asignatura califican el mismo trabajo con dos puntos de diferencia y nadie lo considera un problema técnico.

Artefacto que produces al terminar: sistema de evaluación de asignatura con argumento de validez, análisis de ítems y rúbricas calibradas entre evaluadores.

📚 Resultados de la parte

Al terminar esta parte podrás:

  1. Construir instrumentos alineados con el objetivo y defender su validez.
  2. Analizar técnicamente una prueba aplicada y corregir sus ítems defectuosos.
  3. Diseñar retroalimentación que produzca cambio en el trabajo del estudiante.
  4. Leer críticamente resultados de evaluaciones estandarizadas nacionales o internacionales.

🗺️ Mapa de la parte

flowchart TB
    OB["Objetivo de aprendizaje"] --> PR["Proposito de la evaluacion<br/>diagnostica · formativa · sumativa"]
    PR --> IN["Instrumento<br/>items · rubrica · desempeno"]
    IN --> AP["Aplicacion"]
    AP --> AN["Analisis tecnico<br/>dificultad · discriminacion · consistencia"]
    AN --> VAL{{"Validez de la interpretacion<br/>y del uso"}}
    VAL --> DEC["Decision<br/>calificar · promover · reensenar"]
    AP --> RETRO["Retroalimentacion<br/>sobre la tarea"]
    RETRO --> OB
    DEC --> PY["Sistema de evaluacion<br/>proyecto integrador"]
Loading

🧠 Marco de referencia

  • validez como argumento sobre la interpretación y el uso de los puntajes
  • confiabilidad, error de medida y sus consecuencias en decisiones individuales
  • teoría clásica de los tests y nociones básicas de teoría de respuesta al ítem
  • evaluación formativa y retroalimentación efectiva

Autoras y autores que conviene conocer: Samuel Messick, Michael Kane, Lee Cronbach, Paul Black y Dylan Wiliam, John Hattie y Helen Timperley, Georg Rasch, equipos de la Agencia de Calidad de la Educación

📋 Las 12 clases

# Clase Decisión que habilita Evidencia
133 Evaluación diagnóstica determinar qué prerrequisitos vas a medir y qué harás con cada resultado posible CONSISTENTE
134 Evaluación formativa determinar qué evidencia recogerás y qué decisión de enseñanza modificará ROBUSTA
135 Evaluación sumativa determinar qué evidencia sumativa justifica la decisión que vas a tomar sobre cada estudiante CONSISTENTE
136 Evaluación auténtica determinar qué amenaza a la validez introduce tu tarea auténtica y cómo la controlarás CONSISTENTE
137 Construcción de ítems determinar qué formato de ítem corresponde al desempeño que quieres evaluar CONSISTENTE
138 Rúbricas y escalas determinar el tipo de rúbrica y los descriptores que sostendrán la consistencia de tu evaluación CONSISTENTE
139 Retroalimentación efectiva determinar cuándo y cómo entregarás la retroalimentación para que el estudiante pueda usarla ROBUSTA
140 Validez determinar qué afirmación puedes sostener con los resultados de tu evaluación y cuál no ROBUSTA
141 Confiabilidad determinar si la diferencia de puntaje que estás interpretando supera el error de medida ROBUSTA
142 Análisis de dificultad y discriminación determinar qué ítems de tu prueba deben corregirse o eliminarse y por qué ROBUSTA
143 Introducción a teoría clásica e IRT determinar qué se puede concluir de un informe técnico de una evaluación estandarizada y qué no ROBUSTA
144 Proyecto integrador: sistema de evaluación determinar el conjunto de decisiones de evaluación de tu asignatura y su justificación técnica CONSISTENTE

⚠️ Riesgos característicos

  • Atribuir validez al instrumento en vez de a la interpretación y al uso.
  • Usar el alfa de Cronbach como sello de calidad sin revisar sus supuestos.
  • Entregar nota y comentario juntos y esperar que el comentario opere.
  • Tomar decisiones de alto impacto con una sola medición.

📕 Lecturas de referencia de la parte

  • AERA, APA & NCME (2014). Standards for Educational and Psychological Testing. — el estándar técnico de referencia internacional; define qué se puede afirmar con un puntaje y qué no. Localizar: fuente oficial · ficha
  • Messick, S. (1989). Validity. En Educational Measurement. — el capítulo que reorganiza la validez como juicio integrado sobre interpretación y consecuencias. Localizar: DOI 10.1002/j.2330-8516.1987.tb00244.x · ficha
  • Black, P. & Wiliam, D. (1998). Assessment and Classroom Learning. Assessment in Education, 5(1). — la revisión que instala la evaluación formativa como intervención con efecto y no como discurso. Localizar: DOI 10.1080/0969595980050102 · ficha
  • Hattie, J. & Timperley, H. (2007). The Power of Feedback. Review of Educational Research, 77(1). — modelo de retroalimentación por niveles; explica por qué el elogio a la persona no mejora el desempeño. Localizar: DOI 10.3102/003465430298487 · ficha

✅ Evidencia mínima para dar la parte por cerrada

  • un instrumento construido con tabla de especificaciones y argumento de validez;
  • el análisis técnico de una prueba aplicada con ítems corregidos;
  • una rúbrica calibrada entre al menos dos evaluadores;
  • un sistema de evaluación de asignatura completo y defendible.

🧭 Práctica y evaluación de la parte


Anterior Índice Siguiente
← Parte 10 · Didáctica avanzada Programa · Currículo Parte 12 · Gestión del aula y convivencia →