¿Cómo se está usando la IA en medicina? — Informe semanal
¿Cómo se está usando la IA en medicina?
Informe semanal · lunes 3 de agosto de 2026
Panorama de las últimas 1-2 semanas sobre inteligencia artificial (IA) aplicada a la clínica: estudios primarios, adopción real y regulación/economía. Lo científico va verificado en PubMed con DOI; lo demás se marca cuando no es fuente primaria.
Basado en artículos recuperados de PubMed (para todo lo científico) y en WebSearch (para regulación, mercado y adopción).
Abreviaturas
- IA — inteligencia artificial
- DOI — identificador de objeto digital (digital object identifier)
- ECA — ensayo clínico aleatorizado
- LLM — modelo de lenguaje grande (large language model)
- CNN — red neuronal convolucional (convolutional neural network)
- AUC / AUROC — área bajo la curva (característica operativa del receptor)
- VPP / VPN — valor predictivo positivo / negativo
- IC — intervalo de confianza
- ECG — electrocardiograma
- TBI — lesión cerebral traumática (traumatic brain injury)
- CCR — carcinoma de células renales
- IHQ — inmunohistoquímica
- WSI — imagen de portaobjetos completo (whole-slide image)
- NHS — Servicio Nacional de Salud del Reino Unido (National Health Service)
- UCI — unidad de cuidados intensivos
- FDA — Administración de Alimentos y Medicamentos de EE. UU.
- MDR / IVDR — Reglamento europeo de productos sanitarios / de diagnóstico in vitro
Titular de la semana
No es un modelo más listo: es la semana en que la evidencia y el regulador bajaron el tono. El estudio más honesto de la ventana coge un modelo de IA de propósito general (ChatGPT) y le pide una tarea clínica real —predecir el fallo mecánico de un clavo de fémur— sobre 989 pacientes: falla de forma clínicamente inaceptable, con 45 falsos positivos por cada acierto y una calibración invertida. Los autores concluyen que un modelo general no sirve hoy como sustituto ni apoyo de la vigilancia del cirujano [1]. En paralelo, los modelos específicos con validación externa siguen avanzando de verdad (patología renal [2], electrocardiograma [3], la "hora dorada" del trauma [4]).
Y encima de todo, Europa aplazó los plazos de cumplimiento de la IA de alto riesgo: el paquete "Digital Omnibus" mueve las obligaciones para la IA embebida en productos sanitarios de 2027 a 2 de agosto de 2028 [A]. Menos presión regulatoria inmediata, pero también menos claridad legal para el hospital que quiera adoptar hoy. El patrón de la semana: la auditoría alcanza al bombo.
1. Estudios primarios verificados (dentro de la ventana)
Ventana: publicación en PubMed entre el 20-jul y el 3-ago de 2026. Basado en artículos recuperados de PubMed; cada uno con su DOI.
1.1. Un modelo de IA general es insuficiente para predecir el fallo de un clavo de fémur ⭐
Estudio retrospectivo de exactitud diagnóstica (reportado según la guía STARD) sobre 989 pacientes (683 clavos TFNA, 306 Gamma; edad media 83,8 años; prevalencia del evento "cut-out" 2,5 %). A ChatGPT se le dieron tres radiografías basales y los datos clínicos, y devolvió una predicción binaria de fallo mecánico [1].
- Rendimiento: sensibilidad 68,0 % (IC 95 % 48,4-82,8), especificidad 62,7 %, VPP 4,5 %, VPN 98,7 %, AUC 0,694.
- El problema de fondo: el modelo sobrepredice — 360 falsos positivos frente a 8 falsos negativos (45:1; McNemar p < 0,001) — y la calibración está invertida: daba más "probabilidad" a sus errores (mediana 40 %) que a sus aciertos (9 %).
- Conclusión de los autores: los modelos de IA de propósito general no son adecuados hoy como sustituto ni adjunto de la vigilancia del cirujano en esta complicación; hace falta entrenamiento específico y validación externa.
Lectura clínica: el contrapeso necesario al ruido de "la IA general ya diagnostica". En una tarea concreta y con métricas duras, un LLM generalista es peligroso por exceso de falsas alarmas. Este es el tipo de estudio que hay que citar cuando alguien proponga meter un chatbot general a decidir sobre pacientes. [1]
1.2. Modelo de fundación en patología para un cáncer renal raro, con validación externa
TFE3-DualNet: conjunto de modelos de aprendizaje profundo débilmente supervisados sobre imágenes de portaobjetos completo (WSI) de tinción de rutina, para diagnosticar el carcinoma de células renales (CCR) con reordenamiento de TFE3 —un subtipo raro y agresivo en jóvenes—. Cohorte de dos centros (n = 228; 59 casos), con validación externa independiente (n = 99) [2].
- En la cohorte externa: AUROC 0,932, exactitud 0,879, sensibilidad 0,893, especificidad 0,873.
- Superó a los tres métodos de puntuación por inmunohistoquímica (IHQ) (AUROC 0,793-0,819; p < 0,05) y al modelo de referencia por fusión de rasgos.
- Los "mapas de atención" señalaron regiones tumorales diagnósticamente relevantes (interpretabilidad).
Lectura clínica: apoyo para priorizar qué biopsias van a confirmación molecular cara y revisión del patólogo, con una tinción que ya se hace de rutina. Retrospectivo; la validación externa es lo valioso, falta un estudio prospectivo. [2]
1.3. Un LLM localiza el origen de una arritmia en el ECG, de forma trazable
Estudio retrospectivo de exactitud diagnóstica (157 pacientes) para localizar el origen —izquierdo vs. derecho— de las contracciones ventriculares prematuras a partir de la imagen del ECG de 12 derivaciones, dato útil para planificar la ablación. Comparó un modelo CNN clásico, un LLM "de un disparo" y un LLM con extracción por etapas + reglas deterministas [3].
- El marco por etapas dio una discriminación numéricamente comparable a la CNN (AUC 0,720 vs. 0,712).
- Ventaja frente a la CNN: proceso diagnóstico trazable paso a paso, no una caja negra.
Lectura clínica: interesante no por ganar en cifras, sino por igualar a la CNN aportando explicabilidad. El propio estudio pide validación externa prospectiva del umbral. [3]
1.4. Aprendizaje automático en la "hora dorada": leer el trauma craneal en el aire
Cohorte de 1.025 pacientes de trauma trasladados en helicóptero a un centro urbano. Modelos de aprendizaje automático (ElasticNet, XGBoost) integran datos clínicos y monitorización fisiológica continua durante el vuelo para identificar TBI y fenotipos acompañantes [4].
- AUROC: TBI 0,79; gravedad 0,79; politraumatismo 0,89; coagulopatía 0,77; shock 0,78.
- Los datos clínicos predijeron mejor gravedad y politraumatismo; la fisiología continua mejoró la detección de shock y coagulopatía.
Lectura clínica: triaje prehospitalario más fino con datos que ya se recogen en el traslado. Un centro, retrospectivo; sirve como prueba de concepto para decidir a dónde y con qué prioridad llevar al paciente. [4]
1.5. Adopción real: qué opinan pacientes y personal del NHS de la IA que vigila heridas
Estudio cualitativo (20 pacientes de cirugía cardiaca, 10 profesionales) dentro de un ECA de viabilidad (WISDOM) en dos hospitales del NHS inglés, sobre una plataforma digital con IA que monitoriza heridas quirúrgicas [5].
- Pacientes y personal la vieron aceptable: percibieron más seguridad, mejor acceso y detección precoz de complicaciones, y la posibilidad de monitorizar a escala.
- Reservas explícitas: seguridad de los datos, riesgo de exceso de confianza del personal en la IA y pérdida del contacto humano.
Lectura clínica: el cuello de botella de la IA clínica rara vez es el algoritmo; es la aceptación y el flujo de trabajo. Que pacientes y enfermería lo acepten es condición necesaria —no suficiente— para desplegar. Viabilidad, no eficacia. [5]
2. Hacia dónde apunta la evidencia (revisiones)
Revisiones de la ventana — útiles como panorama, no como prueba de eficacia:
- IA en la UCI pediátrica (revisión): mapea sistemas de apoyo a la decisión, medicina de precisión y predicción en el niño crítico, y subraya que la traslación clínica sigue limitada por datos, validación y confianza. [6]
- Diagnóstico del cáncer de próstata (revisión): la IA y el aprendizaje automático ya mejoran velocidad y consistencia en la detección de lesiones y la segmentación de la glándula sobre resonancia multiparamétrica, pero el propio texto advierte del sobrediagnóstico y la falta de estandarización como riesgos no resueltos. [7]
Patrón común: las dos terminan en la misma nota de 2026 — la potencia del modelo no es el problema; lo son la validación prospectiva, la estandarización y la confianza clínica.
3. Regulación y economía: la semana en que Europa pisó el freno
Movimiento de fondo regulatorio y de mercado. Cifras y fechas de despachos legales y agregadores del listado de la FDA; no verificadas en fuente primaria salvo donde se indica.
- Europa aplaza la IA de alto riesgo ("Digital Omnibus"). El acuerdo político (6-may-2026, confirmado por el Consejo el 13-may) posterga los plazos de cumplimiento: los sistemas autónomos de alto riesgo (Anexo III) pasan al 2-dic-2027 y la IA embebida en productos regulados como los sanitarios (Anexo I, bajo MDR/IVDR) al 2-ago-2028 —más de un año de margen extra—. Además, se estrechó la definición de "componente de seguridad": la IA usada solo para asistencia al usuario, eficiencia o control de calidad deja de ser automáticamente de alto riesgo, salvo que su fallo ponga en peligro la salud. [A] (La fecha exacta de entrada en vigor depende de la publicación en el Diario Oficial; algún medio la dio como finales de julio de 2026, sin confirmación en fuente primaria.)
- La FDA sigue autorizando ~30 algoritmos al mes, y siguen siendo radiología. Según el listado público de dispositivos con IA (último corte 30-mar-2026): 1.524 dispositivos autorizados, de los que 1.163 (76,3 %) son de radiología; ~68 algoritmos nuevos de radiología solo en el primer trimestre de 2026. Ninguna IA generativa de propósito general aprobada para marketing hasta la fecha. [B]
- Debate abierto — el examen no predice la clínica. Un artículo de Nature Medicine ("Toward a Test of Medical AI Superintelligence", 28-jul-2026) señala que los LLM sacan ~92 % en exámenes de licencia médica pero 44,8 % en tareas clínicas reales (referencia BRIDGE): una brecha de ~47 puntos que deja al descubierto que la FDA aún no tiene un estándar de rendimiento por tarea para la IA clínica. Es exactamente la misma lección que el estudio 1.1 de este informe muestra con un caso concreto. [C]
4. Qué me llevo esta semana
- Modelo general ≠ herramienta clínica. En una tarea real con métricas duras, ChatGPT falla por exceso de falsas alarmas (45:1) [1]. Guárdalo para la próxima discusión sobre "chatbots que diagnostican".
- La validación externa es la señal, no el número grande. Lo que avanza de verdad son modelos específicos validados fuera de casa: patología renal [2], ECG [3], trauma [4].
- El freno regulatorio europeo (2028) cambia el calendario, no la responsabilidad [A]: menos prisa legal, misma exigencia clínica antes de desplegar.
Nota de transparencia: lo científico (secciones 1-2) va verificado en PubMed con DOI. Regulación y mercado (sección 3) provienen de búsqueda web y se marcan como reportado. Se descartó una cifra de dispositivos FDA que circulaba como "julio 2026" pero era un corte de julio de 2025. No se inventó nada; lo no confirmable se señaló.
Referencias
Vancouver — científico verificado en PubMed (según PubMed; se incluyen los DOI como enlace):
- Ben Arie G, Warschawski Y, Amzallag N, Gan-Or H, Ben-Tov T, Khoury A, et al. Predictive accuracy of a general-purpose artificial intelligence model for cut-out following proximal femoral nailing. Arch Orthop Trauma Surg. 2026;146(1). doi:10.1007/s00402-026-06447-5. PMID 42541590.
- Chen YH, Xu QH, Yao HH, Liu KZ, Gui CP, Fu LM, et al. TFE3-DualNet: an interpretable foundation model-based deep learning ensemble for diagnosing TFE3-rearranged renal cell carcinoma from whole-slide images in a two-center cohort. Cancer Med. 2026;15(8):e72161. doi:10.1002/cam4.72161. PMID 42543505.
- Matsumoto K, Fujisaki Y, Higuchi S, Narita M, Sasaki W, Naganuma T, et al. Large language model-based localization of premature ventricular contraction origins: a retrospective diagnostic accuracy study. J Cardiovasc Electrophysiol. 2026. doi:10.1111/jce.70464. PMID 42541447.
- Woodward MR, Yang S, Somalinga M, Dalton K, Felix RB, Podell J, et al. Enhancing the golden hour: classification of traumatic brain injury, severity, and concomitant clinical phenotypes using prehospital continuous physiological data during air transport. Physiol Meas. 2026;47(8). doi:10.1088/1361-6579/ae8ca7. PMID 42468566.
- Tanner J, Rochon M, Cariaga K, Harris R, Beckhelling J, Bouttell J, et al. Exploring patient and NHS staff acceptability of artificial intelligence-supported surgical wound monitoring within the WISDOM feasibility study: a multi-centre qualitative interview study. BMJ Open. 2026;16(7):e116323. doi:10.1136/bmjopen-2026-116323. PMID 42538113.
- Fu S, Xu F, Li F, Qian SY. [Current status and challenges of artificial intelligence application in pediatric intensive care unit]. Zhonghua Er Ke Za Zhi. 2026;64(8):848-852. doi:10.3760/cma.j.cn112140-20260309-00195. PMID 42527126.
- Hooda K, Chatterjee M, Sharma AP, Aggarwal N, Sharma J. Present status of prostate cancer diagnosis, limitations, challenges, and future endeavors. Ann Med. 2026;58(1):2659984. doi:10.1080/07853890.2026.2659984. PMID 42544420.
Contexto (web, no primario):
- [A] EU AI Act "Digital Omnibus" — análisis de Gibson Dunn (acuerdo 6-may-2026; Consejo 13-may). Nuevos plazos: Anexo III → 2-dic-2027; Anexo I / productos sanitarios → 2-ago-2028. https://www.gibsondunn.com/eu-ai-act-omnibus-agreement-postponed-high-risk-deadlines-and-other-key-changes/ (acceso 3-ago-2026).
- [B] Listado FDA de dispositivos con IA (corte 30-mar-2026): 1.524 dispositivos, 1.163 radiología (76,3 %). Agregado por IntuitionLabs / The Imaging Wire a partir de la lista pública de la FDA. https://intuitionlabs.ai/articles/fda-ai-medical-device-tracker (acceso 3-ago-2026).
- [C] Nature Medicine, "Toward a Test of Medical AI Superintelligence" (28-jul-2026): ~92 % en exámenes vs. 44,8 % en tareas clínicas reales (BRIDGE). Comentario en Clinical Trial Vanguard. https://www.clinicaltrialvanguard.com/opinion/nature-medicines-2026-medical-ai-superintelligence-framework-signals-what-fda-benchmarking-guidance-has-not-yet-addressed/ (acceso 3-ago-2026).