Wang, C., et al. (2026). The impact of integrating generative artificial intelligence into medical education: A systematic review and meta-analysis of randomized controlled trials. BMC Medical Education, 26, 983. https://doi.org/10.1186/s12909-026-09320-6
Resumen del artículo
Revisión sistemática y metaanálisis (PRISMA 2020, PROSPERO) limitado a ensayos controlados aleatorizados que compararon enseñanza integrada con IA generativa (ChatGPT, DeepSeek, pacientes virtuales basados en LLM) frente a enseñanza tradicional o digital sin IA, en estudiantes de medicina, internos y residentes. Se buscó en seis bases, incluidas CNKI y Wanfang, entre 2020 y febrero de 2026.
Veinte ECA con 1413 participantes entraron al análisis. El conocimiento posintervención fue mayor en los grupos con IA (SMD = 0.99; certeza baja), igual que las habilidades clínicas (SMD = 1.09; certeza moderada) y la retención a seguimiento (SMD = 0.51, cuatro estudios). Sin embargo, el intervalo de predicción del conocimiento cruzó cero, el 80 % de los estudios provenía de China, ninguno tuvo bajo riesgo de sesgo y todos se limitaron al nivel 2 de Kirkpatrick. Los autores concluyen que la IA generativa puede ser un complemento, pero no un reemplazo, hasta contar con ensayos multicéntricos preinscritos.
Ideas clave
- Efectos grandes pero frágiles: los tamaños del efecto son moderados a grandes, pero la heterogeneidad y el riesgo de sesgo obligan a leerlos como señales preliminares (p. 13).
- Nivel 2 de Kirkpatrick como techo: ningún ECA midió transferencia conductual ni resultados en pacientes (p. 5).
- Concentración geográfica: 16 de 20 estudios provienen de un solo país, lo que limita la generalización (p. 13).
- Dependencia del contexto: algunos ECA con IA no superaron a materiales tradicionales bien preparados, así que el efecto depende de cómo se integra la herramienta (p. 2).
- Recomendaciones de implementación: integración curricular deliberada, infraestructura, alfabetización en IA y reconocimiento de las alucinaciones (p. 13).
Citas textuales relevantes
“All outcomes in this review correspond to Kirkpatrick Level 2 (Learning); no included study measured Level 3 (behavioural transfer to practice) or Level 4 (patient outcomes), which is an important limitation of the current evidence base.” (Wang et al., 2026, p. 5)
“These findings are best interpreted as preliminary signals rather than definitive evidence of efficacy.” (Wang et al., 2026, p. 13)
“GenAI may serve as a useful supplement to conventional instruction but should not be adopted as a replacement without evidence from well-powered, pre-registered, multi-centre trials.” (Wang et al., 2026, p. 2)
Conexión con la tesis de Sandra
Aporte del autor: la síntesis cuantitativa más reciente sobre IA generativa en educación médica, con estimaciones de efecto y una evaluación GRADE que tempera el entusiasmo. Lectura propia para la tesis: para el Cap 1 y el Cap 2 esta fuente permite afirmar con respaldo que la IA generativa mejora conocimiento y habilidades a corto plazo, pero que nadie ha demostrado transferencia a la conducta profesional ni ha estudiado profesionales en ejercicio fuera de Asia y Norteamérica. Ahí se sitúa el vacío que Sandra ocupa con perfusionistas de América Latina medidos con PINTS (n-1-9), un instrumento conductual observacional. Para el Cap 3, el tamaño del efecto en habilidades (SMD alrededor de 1) puede servir como referencia optimista para el cálculo de potencia con n = 150, aunque conviene planificar con un efecto más conservador dada la heterogeneidad. Conecta con n-3-5 (mismo diagnóstico de nivel 2) y con n-3-21 (IA generativa en debriefing).
Preguntas orientadoras
- ¿Qué tamaño del efecto esperará Sandra en el PINTS y cómo lo justificará frente a los SMD de este metaanálisis, que miden conocimiento y no NTS?
- Si la evidencia existente proviene sobre todo de China y de estudiantes, ¿cómo argumentará la validez externa de su intervención para perfusionistas en ejercicio en América Latina?
- ¿Qué medidas tomará el diseño con lista de espera para reducir el riesgo de sesgo que los autores encuentran en todos los ECA (cegamiento de evaluadores PINTS, preinscripción del protocolo)?
Conexiones
Ir más a fondo
- Nota subatómica: Wang (2026), 15 pasajes subrayados
- Pregúntale a los documentos: cuaderno de NotebookLM con los PDF del corpus (acceso restringido)
Mi reflexión
Graba tu reflexión de voz o escríbela usando los controles que aparecen abajo.