Obuseh, M., Singh, S., Anton, N. E., Gardiner, R., Stefanidis, D., & Yu, D. (2025). Feasibility of large language models for assessing and coaching surgeons’ non-technical skills. npj Health Systems, 2, 27.
Resumen del artículo
Comunicación breve que pone a prueba si dos modelos de lenguaje de código abierto (Llama 3.1 y Mistral) pueden evaluar habilidades no técnicas de cirujanos a partir de transcripciones de cirugía robótica y, además, redactar retroalimentación de coaching. El punto de partida es que las NTS se expresan sobre todo por vía verbal, lo que hace que la evaluación observacional tradicional sea subjetiva, lenta y costosa en evaluadores entrenados.
Nueve cirujanos de seis subespecialidades fueron grabados en 20 cirugías robóticas; evaluadores humanos aplicaron NOTSS y clasificaron 709 eventos como ejemplares (590) o no ejemplares (119). Con solo ocho ejemplos de entrenamiento, ambos LLM alcanzaron 74 a 75 % de exactitud y F1 macro de 0.61 a 0.62, superando a regresión logística y SVM sobre todo en la detección de conductas no ejemplares (F1 de 0.41 frente a menos de 0.20). Sin haber sido entrenados con retroalimentación humana, los modelos generaron coaching estructurado y coherente con lo que haría un entrenador experto.
Ideas clave
- Evaluación verbal de NTS: como las NTS se manifiestan en la comunicación, el procesamiento de lenguaje natural es una vía plausible para automatizar su valoración (p. 1).
- LLM vs. aprendizaje automático clásico: los LLM ganan justo donde más importa para el coaching, la identificación de conductas deficientes (p. 1).
- Escalabilidad del coaching: la generación autónoma de retroalimentación podría democratizar el entrenamiento de NTS, incluso en contextos con pocos recursos (p. 2).
- Humano en el circuito: los autores insisten en que el LLM es una caja negra y que la supervisión de educadores sigue siendo indispensable (p. 2).
- Pendientes de validación: falta un estudio de usabilidad que mida aceptabilidad, confianza y utilidad percibida antes de desplegar el sistema (p. 2).
Citas textuales relevantes
“Assessing NTS presents unique challenges due to their primary expression through verbal communication, which can be dynamic, nuanced, context-dependent, and susceptible to interpretation bias.” (Obuseh et al., 2025, p. 1)
“Despite not being explicitly trained on human coaching feedback, LLMs demonstrated the ability to generate performance-based feedback for surgeons, offering a scalable alternative to traditional dyadic human coaching, which is often limited by human availability and variability.” (Obuseh et al., 2025, p. 2)
“A human-in-the-loop approach will therefore remain essential throughout the design, development, deployment, and post-deployment monitoring phases.” (Obuseh et al., 2025, p. 2)
Conexión con la tesis de Sandra
Aporte del autor: evidencia de factibilidad de que un LLM lea la comunicación de un profesional durante un procedimiento, la clasifique según un marco de NTS y produzca coaching. Lectura propia para la tesis: este es el mecanismo técnico que sostiene la idea de “retroalimentación adaptativa” en la simulación virtual de Sandra; si el LLM puede analizar las verbalizaciones del perfusionista durante una crisis de CEC (por ejemplo, un fallo de oxigenador), puede devolver retroalimentación sobre comunicación y conciencia situacional sin depender de un evaluador presencial. Para el Cap 2 sustenta el constructo de evaluación automatizada de NTS; para el Cap 3 recuerda que el instrumento humano (PINTS, n-1-9) sigue siendo la medida de resultado y que el LLM es parte de la intervención, no del instrumento. Conecta con n-3-2 (LLM en VR de equipo) y con n-3-13 (ChatGPT vs. consultor).
Preguntas orientadoras
- ¿Qué transcripciones o verbalizaciones se producirán en la simulación de Sandra y en qué idioma deberá trabajar el LLM para analizar la comunicación de perfusionistas hispanohablantes de varios países?
- ¿Cómo se alinearán las categorías de coaching del LLM con las cinco dimensiones del PINTS en español para que la retroalimentación y la medida de resultado hablen el mismo lenguaje?
- Dado que los autores exigen un humano en el circuito, ¿qué rol tendrá Sandra o un tutor en la revisión de la retroalimentación automatizada con n = 150 participantes y grupo de lista de espera?
Conexiones
- Subárea: 3-Simulación virtual IA
- Notas relacionadas: n-3-2, n-3-13, n-3-15, n-1-9
- Autores: Marian Obuseh, Denny Yu, Dimitrios Stefanidis
Ir más a fondo
- Nota subatómica: Obuseh (2025), 13 pasajes subrayados
- Pregúntale a los documentos: cuaderno de NotebookLM con los PDF del corpus (acceso restringido)
Mi reflexión
Graba tu reflexión de voz o escríbela usando los controles que aparecen abajo.