Yilmaz, R., Bakhaidar, M., Alsayegh, A., Abou Hamdan, N., Fazlollahi, A. M., Tee, T., Langleben, I., Winkler-Schwartz, A., Laroche, D., Santaguida, C., & Del Maestro, R. F. (2024). Real-time multifaceted artificial intelligence vs in-person instruction in teaching surgical technical skills: A randomized controlled trial. Scientific Reports, 14(1), 15130. https://doi.org/10.1038/s41598-024-65716-8

Resumen del artículo

Ensayo controlado aleatorizado de tres brazos, doble ciego y registrado (NCT05168150), que compara la retroalimentación en tiempo real del sistema ICEMS con la instrucción presencial de un experto y con retroalimentación solo posterior. Participaron 97 estudiantes de medicina de cuatro facultades de Quebec en una sesión única de 90 minutos con cinco repeticiones de una resección subpial en el simulador NeuroVR y una resección realista final sin retroalimentación.

El ICEMS evalúa el desempeño cada 0.2 segundos en cinco métricas y emite instrucciones auditivas cuando detecta un error. En la quinta repetición, el grupo con IA superó tanto al grupo sin retroalimentación en tiempo real (p < .001) como al grupo con experto presencial (p = .005), y obtuvo puntuaciones OSATS de evaluadores ciegos equivalentes a las del grupo experto (4.30 frente a 4.11). El grupo con experto mostró meseta y deterioro en la quinta repetición. Como contrapartida, el grupo con IA reportó mayor carga cognitiva extrínseca, atribuida a la dificultad de interpretar las instrucciones auditivas.

Ideas clave

  1. IA en tiempo real iguala o supera al experto: primer ECA que lo demuestra en destrezas bimanuales simuladas (p. 8).
  2. Límites de la atención humana: el instructor no puede cuantificar fuerza, velocidad o distancia entre instrumentos y se fatiga, lo que explicaría la meseta del grupo experto (p. 8).
  3. Costo en carga cognitiva: la retroalimentación continua elevó la carga extrínseca, un efecto que debe minimizarse para aprender mejor (p. 8).
  4. Correlación ICEMS y OSATS: la puntuación automática correlacionó con la de evaluadores ciegos, lo que abre la puerta a evaluación automatizada (p. 4).
  5. Transferencia limitada: en la tarea realista no hubo diferencias significativas entre grupos, quizá por necesitar más repeticiones (p. 9).

Citas textuales relevantes

“Training with real-time AI feedback (n = 33) resulted in significantly better performance outcomes compared to no real-time feedback (n = 32) and in-person instruction (n = 32).” (Yilmaz et al., 2024, p. 1)

“In this trial, learning from the real-time intelligent instructions resulted in significantly higher extraneous load, suggesting increased cognitive demand experienced by the trainees to understand the real-time auditory instructions and the post hoc video demonstrations.” (Yilmaz et al., 2024, p. 8)

“Although expert consultation was important in the development of the ICEMS, the real-time AI capabilities may surpass the limitations of human judgment and attention.” (Yilmaz et al., 2024, p. 8)

Conexión con la tesis de Sandra

Aporte del autor: evidencia de nivel alto (ECA registrado, evaluadores ciegos) de que la retroalimentación de IA en tiempo real puede enseñar al menos tan bien como un experto presencial en simulación. Lectura propia para la tesis: aunque mide habilidades técnicas y no NTS, este ensayo es la piedra angular para justificar en el Cap 2 que la IA puede asumir la función instruccional dentro de la simulación virtual de Sandra. El hallazgo de mayor carga cognitiva extrínseca es decisivo para el Cap 3: respalda la inclusión del NASA-TLX como covariable (n-5-2, n-5-5) y sugiere que el diseño de la retroalimentación (canal, frecuencia, redacción en español) debe cuidarse para no saturar al perfusionista durante una crisis de CEC. La falta de diferencias en la tarea realista advierte que una sola sesión puede no bastar para transferencia, lo que apoya un programa de varias sesiones. Conecta con n-3-11 (ECA previo del grupo), n-3-3 (marco explicable) y n-3-9 (modelo híbrido).

Preguntas orientadoras

  1. ¿Qué canal de retroalimentación (auditivo, visual, texto) usará la simulación de Sandra durante un escenario de CEC para no aumentar la carga cognitiva extrínseca que este ECA detectó, y cómo lo verificará con el NASA-TLX?
  2. Si la IA superó al experto en destrezas técnicas medibles con sensores, ¿qué señales observables de NTS (comunicación, verbalización, tiempos de decisión) permitirían una retroalimentación en tiempo real equivalente para perfusionistas?
  3. Dado que la transferencia a la tarea realista no fue significativa tras una sesión, ¿cuántas sesiones tendrá la intervención y cómo se medirá la retención con el diseño de lista de espera?

Conexiones

Mi reflexión

Graba tu reflexión de voz o escríbela usando los controles que aparecen abajo.