Obuseh (2025) — pasajes subrayados
Nota subatómica
Nivel más profundo del vault: los pasajes subrayados en el PDF con el método de colores del asesor, en el orden del documento y con su página. Sirve para volver al texto original sin abrir el PDF. Nota atómica: n-3-1.
Referencia: Obuseh, M., Singh, S., Anton, N. E., Gardiner, R., Stefanidis, D., & Yu, D. (2025). Feasibility of large language models for assessing and coaching surgeons’ non-technical skills. npj Health Systems, 2, 27.
Pasajes subrayados (13)
Por tipo: 🔵 Definición (1) · 🟡 Idea principal (2) · 🟣 Metodología (2) · 🟢 Evidencia (3) · 🔴 Tensión o vacío (3) · 🟠 Cita para usar (2)
🟡 Idea principal — p. 1
This study demonstrates Large Language models (LLMs) to assess and coach surgeons on their nontechnical skills, traditionally evaluated through subjective and resource-intensive methods.
Comentario del asesor: Tesis central del articulo: los LLM pueden evaluar y retroalimentar NTS, reemplazando metodos subjetivos y costosos. Alineado con la propuesta de Sandra de usar IA para fortalecer PINTS.
🟢 Evidencia — p. 1
Llama 3.1 achieved a macro-averaged F1 score of 0.62 and a prediction accuracy of 74%,whileMistralshowedcomparableperformancewithamacro-averaged F1 score of 0.61 and a prediction accuracy of 75%.
Comentario del asesor: Evidencia empirica de que LLMs open-source logran precision aceptable en clasificacion de NTS. Respalda la viabilidad tecnica del componente IA en la tesis de Sandra.
🔵 Definición — p. 1
these NTS are critical cognitive, social, and interpersonal abilities that are directly linked to adverse events and patient safety outcomes7.
Comentario del asesor: Definicion operativa de NTS: habilidades cognitivas, sociales e interpersonales vinculadas a seguridad del paciente. Directamente aplicable a perfusionistas cardiovasculares en la tesis de Sandra.
🟢 Evidencia — p. 1
For nonexemplar behaviors, which are more challenging to identify, Llama 3.1 achieved a macro-averaged F1 score of 0.41, outperforming LR and SVM, both of which had F1 scores below 0.20.
Comentario del asesor: Los LLMs superan a ML clasico en detectar comportamientos no-ejemplares (donde mas se necesita coaching). Relevante para la deteccion de debilidades PINTS en perfusionistas.
🟠 Cita para usar — p. 1
there is a clear need for more objective, efficient, and scalable methods to assess NTS, ensuring consistent, high-quality training that enhances patient outcomes and strengthens team dynamics.
Comentario del asesor: Frase citable para justificar el problema de investigacion de Sandra: necesidad de metodos objetivos, eficientes y escalables para evaluar NTS.
🔴 Tensión o vacío — p. 2
the underrepresentation of non-exemplar behaviors in the dataset likely contributed to lower performance in this category. In this study, fewer than 17% of observed behaviors were non-exemplar,
Comentario del asesor: Brecha metodologica: desbalance de clases afecta la deteccion de comportamientos deficientes. Sandra debe disenar escenarios de simulacion que generen suficientes eventos no-ejemplares.
🟢 Evidencia — p. 2
Despite not being explicitly trained on human coaching feedback, LLMs demonstrated the ability to generate performance-based feedback for surgeons, offering a scalable alternative to traditional dyadic human coaching, which is often limited by human availability and variability.
Comentario del asesor: Sin entrenamiento explicito en retroalimentacion humana, los LLMs generaron coaching efectivo. Esto valida la hipotesis de Sandra sobre IA como coach autonomo en simulacion clinica.
🟡 Idea principal — p. 2
This scalability could democratize access to high-quality NTS training, benefiting a wide range of surgical teams, including those in resourcelimited settings.
Comentario del asesor: Idea clave: la escalabilidad de LLMs democratiza el entrenamiento en NTS, especialmente en entornos con recursos limitados. Argumento fuerte para el contexto latinoamericano de la tesis.
🟠 Cita para usar — p. 2
The ability to better identify non-exemplar behaviors, where coaching is most needed, combined with the generation of structured, context-specific feedback, makes LLMs preferable in this setting.
Comentario del asesor: Frase citable para el marco teorico: los LLMs son preferibles por detectar debilidades y generar retroalimentacion contextual estructurada.
🔴 Tensión o vacío — p. 2
Additionally, we recognize that LLMs operate as blackbox systems, which presents challenges for interpretability and adoption. A human-in-the-loop approach will therefore remain essential throughout the design, development, deployment, and postdeployment monitoring phases.
Comentario del asesor: Tension clave: opacidad de LLMs requiere supervision humana permanente. La tesis de Sandra debe incorporar un diseno human-in-the-loop para validar retroalimentacion en contexto clinico.
🟣 Metodología — p. 2
Between 2023 and 2024, nine surgeons (4 women [44%]) from six surgical subspecialties across three hospitals in Indiana University Health system, all performing at least one robotic-assisted surgery (RAS) per month, were recruited.
Comentario del asesor: Muestra: 9 cirujanos, 6 subespecialidades, 3 hospitales, cirugia robotica. Estudio piloto pequeno pero multicentrico; Sandra podria replicar con perfusionistas en multiples paises de LATAM.
🔴 Tensión o vacío — p. 2
LLM performance was likely constrained by limited context windows, which restricted the amount of contextual information that could be processed duringtraining13.Inparticular,theshortercontextwindowofMistral
Comentario del asesor: Limitacion tecnica: ventanas de contexto restringen la informacion procesable. Sandra debe considerar modelos con ventanas mas amplias (GPT-4, Claude) para simulaciones clinicas complejas.
🟣 Metodología — p. 3
The raters identified 709 NTS events, with 590 categorized as exemplar behaviors and 119 as non-exemplar. Transcripts of these interactions constitutes the dataset.
Comentario del asesor: Dataset de 709 eventos NTS con desbalance de clases (83% ejemplar). Considerar estrategias de balanceo similares al disenar la simulacion clinica virtual de Sandra.
Colores según el método de subrayado del asesor. Pasajes extraídos automáticamente de las anotaciones del PDF; la página corresponde a la numeración del archivo, que puede diferir de la paginación de la revista.