Higham, H., Greig, P., Crabtree, N., Hadjipavlou, G., Young, D., & Vincent, C. (2023). A study of validity and usability evidence for non-technical skills assessment tools in simulated adult resuscitation scenarios. BMC Medical Education, 23, 153. https://doi.org/10.1186/s12909-023-04108-4

Resumen del artículo

El estudio compara tres instrumentos británicos de evaluación de habilidades no técnicas (ANTS, Oxford NOTECHS y OSCAR) aplicados al mismo material: diez videos estandarizados de un escenario simulado de asma grave que evoluciona a paro cardíaco, seleccionados al azar de un banco de 50 grabaciones del proyecto START. Tres anestesiólogos consultores con más de diez años de experiencia en simulación calificaron cada video con cada herramienta, en orden aleatorio. Los autores usaron el marco moderno de validez (estructura interna, proceso de respuesta, relación con otras variables) y añadieron medidas cuantitativas y cualitativas de usabilidad: tiempo de entrenamiento, tiempo de calificación, cuestionario y grupo focal.

Los resultados muestran que la consistencia interna global fue buena en las tres herramientas, pero la fiabilidad interevaluador varió mucho por categoría: desde pobre (gestión de tareas en ANTS, CCI 0,26; conciencia situacional en Oxford NOTECHS, 0,34) hasta muy buena (resolución de problemas en Oxford NOTECHS, 0,81; cooperación 0,84 y conciencia situacional 0,87 en OSCAR). Además, el CCI y el kappa ponderado dieron conclusiones distintas sobre los mismos datos, y se observó efecto techo en ANTS para uno de los evaluadores. ANTS fue la herramienta más rápida de aplicar y OSCAR la más difícil de usar. Los autores concluyen que la falta de estandarización de instrumentos y de formación de evaluadores perjudica a educadores y estudiantes, y recomiendan al menos dos evaluadores con puntuación por consenso en exámenes sumativos.

Ideas clave

  1. Fiabilidad por categoría, no solo global: un instrumento puede tener buen CCI global y al mismo tiempo categorías con acuerdo pobre; la conciencia situacional y la gestión de tareas son las más inestables según la herramienta (p. 1, p. 9).
  2. El estadístico elegido cambia la conclusión: el CCI mostró acuerdo bueno en 9 de 15 categorías, pero el kappa ponderado solo acuerdo justo en 7 de ellas; los autores muestran lo fácil que es malinterpretar la fiabilidad (p. 10).
  3. Entrenamiento de evaluadores como requisito: incluso expertos formados en ANTS obtuvieron acuerdo moderado por falta de recalibración; la aviación civil exige revalidación periódica de sus examinadores y en salud no existe ese requisito (p. 2, p. 11).
  4. Dos evaluadores para decisiones de alto impacto: la recomendación explícita es puntuar por consenso con al menos dos evaluadores en exámenes sumativos (p. 1).
  5. Las escalas conductuales no viajan solas entre dominios ni culturas: la guía sobre escalas ancladas conductualmente advierte que no aplican de un dominio a otro sin adaptación y que el contexto de uso es vital (p. 12).

Citas textuales relevantes

“Intraclass correlation scores of three expert raters ranged from poor (task management in ANTS [0.26] and situation awareness (SA) in Oxford NOTECHS [0.34]) to very good (problem solving in Oxford NOTECHS [0.81] and cooperation [0.84] and SA [0.87] in OSCAR).” (Higham et al., 2023, p. 1)

“Summative or high-stakes examinations using NTS assessment tools should be undertaken with at least two assessors to provide consensus scoring.” (Higham et al., 2023, p. 1)

“These are not intuitive skills, and training is required to use NTS instruments reliably.” (Higham et al., 2023, p. 2)

“Guidance on the use of behaviorally anchored rating scales highlights the need for extensive training in their use (especially for high-stakes settings), that they do not apply across domains and cultures (i.e., aviation to medicine, doctor to nurse) and that understanding of the context of application is vital.” (Higham et al., 2023, p. 12)

Conexión con la tesis de Sandra

Aporte de los autores: evidencia empírica de que tres instrumentos de NTS bien establecidos, aplicados por expertos a los mismos videos, producen fiabilidad muy desigual por categoría, y de que la elección del estadístico y el entrenamiento de los evaluadores condicionan el resultado. Lectura propia para la tesis: este artículo es el sustento metodológico del Cap 3 para decidir cómo se reportará la fiabilidad del PINTS en español. No basta un CCI global; hay que reportar CCI por cada una de las cuatro categorías (conciencia situacional, toma de decisiones, gestión de tareas y liderazgo, trabajo en equipo y comunicación), usar al menos dos evaluadores cegados con sesión de calibración previa y prever que la conciencia situacional será la categoría más difícil de puntuar. También alimenta el Cap 2 al mostrar que las escalas conductuales no se trasladan sin adaptación de un contexto a otro, lo cual justifica la adaptación transcultural del PINTS antes de usarlo con perfusionistas latinoamericanos. Se conecta con n-1-2 (revisión COSMIN de instrumentos), n-1-9 (PINTS original) y n-1-13 (baja fiabilidad de las categorías cognitivas en NOTSS).

Preguntas orientadoras

  1. Si Higham et al. encontraron CCI de 0,26 en gestión de tareas con evaluadores expertos, ¿qué umbral mínimo de fiabilidad por categoría fijará Sandra para aceptar el PINTS en español antes de medir a los 150 perfusionistas?
  2. ¿Cuántas horas de calibración con videos de crisis en CEC necesitarán los evaluadores latinoamericanos, y cómo se documentará ese entrenamiento en el Cap 3?
  3. ¿Conviene reportar CCI y kappa ponderado juntos, como hicieron estos autores, para mostrar la robustez de la fiabilidad del PINTS?
  4. Si en la plataforma de simulación virtual con IA una parte de la evaluación fuera automatizada, ¿cómo se compararía la calificación de la IA con la de los dos evaluadores humanos por consenso?

Conexiones

Ir más a fondo

Mi reflexión

Mi reflexión (transcripción)