¿Cómo se está usando la IA en medicina? — Informe semanal
¿Cómo se está usando la IA en medicina?
Informe semanal · lunes 10 de agosto de 2026
Panorama de las últimas 1-2 semanas sobre inteligencia artificial (IA) aplicada a la clínica: estudios primarios, adopción real y gobernanza. Lo científico va verificado en PubMed con DOI; lo demás se marca cuando no es fuente primaria.
Basado en artículos recuperados de PubMed (para todo lo científico) y en WebSearch (para adopción, gobernanza y regulación).
Abreviaturas
- IA — inteligencia artificial
- DOI — identificador de objeto digital (digital object identifier)
- PMID — identificador de PubMed
- LLM — modelo de lenguaje grande (large language model)
- AUC / AUROC — área bajo la curva (característica operativa del receptor)
- IC — intervalo de confianza
- RR — riesgo relativo
- ECA — ensayo clínico aleatorizado
- EP — embolia pulmonar
- EPSS — embolia pulmonar subsegmentaria aislada (subsegmental-only PE)
- ATCP — angiografía pulmonar por tomografía computarizada (CTPA)
- TC — tomografía computarizada
- WSI — imagen de portaobjetos completo (whole-slide image)
- CCR — carcinoma de células renales
- ccCCR / pCCR — carcinoma de células renales de células claras / papilar
- OMS/ISUP — graduación nuclear de la Organización Mundial de la Salud / Sociedad Internacional de Patología Urológica
- ML — aprendizaje automático (machine learning)
- SHAP — explicaciones aditivas de Shapley (Shapley Additive Explanations)
- ADP — adenocarcinoma ductal de páncreas (PDAC)
- RECIST — criterios de evaluación de respuesta en tumores sólidos
- NLR — cociente neutrófilos/linfocitos
- CA 19-9 — antígeno carbohidrato 19-9
- CPP — colecciones peripancreáticas
- mCTSI — índice modificado de gravedad por TC en pancreatitis
- SADC — sistema de apoyo a la decisión clínica (CDSS)
- UCI — unidad de cuidados intensivos
- HCE — historia clínica electrónica
- NHS — Servicio Nacional de Salud del Reino Unido (National Health Service)
- FDA — Administración de Alimentos y Medicamentos de EE. UU.
- MDR / IVDR — Reglamento europeo de productos sanitarios / de diagnóstico in vitro
- RGPD — Reglamento General de Protección de Datos
- FA — fibrilación auricular
Titular de la semana
El modelo no falla: falla fuera de su carril. El estudio más instructivo de la ventana coge un algoritmo ganador de concurso —el segundo clasificado del reto de detección de embolia pulmonar (EP) de la Sociedad Radiológica de Norteamérica (RSNA) 2020— y lo somete a validación externa sobre 1.038 angiografías pulmonares por tomografía computarizada (ATCP) de un hospital que no participó en el reto. El resultado tiene dos caras que hay que leer juntas: AUROC 0,94 para "hay EP o no" y cero embolias centrales pasadas por alto —excelente—, pero AUROC 0,48 (es decir, azar) para la embolia pulmonar subsegmentaria aislada (EPSS), con especificidad de 0,22 [1]. Justo el subgrupo donde el radiólogo más duda es donde el modelo no aporta nada, y los autores lo explican sin adornos: no se entrenó para ese subtipo.
Ese es el patrón de la semana, y se repite a tres escalas. En el laboratorio, los modelos con validación externa multicéntrica sí avanzan de verdad (patología renal a escala de 11.135 portaobjetos [2], volumetría automática en pancreatitis [3], estadificación de cáncer gástrico con analítica de rutina [4]). En la cabecera del paciente, la primera revisión sistemática que agrupa mortalidad con sistemas de apoyo a la decisión clínica (SADC) usados por enfermería encuentra una señal real —RR 0,68 de mortalidad hospitalaria— pero con un intervalo de predicción que incluye "ningún efecto" [6]. Y en la gerencia del hospital, un informe publicado el 6 de agosto pone el número que resume todo: más del 90 % de los sistemas de salud ya tiene IA de terceros desplegada, pero solo el 44 % tiene un entorno donde probarla [A].
La pregunta de la semana no es "¿funciona la IA?". Es "¿funciona en mi carril, y tengo dónde comprobarlo antes de encenderla?".
1. Estudios primarios verificados (dentro de la ventana)
Ventana: entrada en PubMed entre el 27-jul y el 10-ago de 2026. Basado en artículos recuperados de PubMed; cada uno con su DOI.
1.1. Un algoritmo ganador de concurso, validado fuera de casa: bien en lo fácil, azar en lo difícil ⭐
Validación externa del algoritmo que quedó segundo en el reto RSNA 2020 de detección de EP, aplicado retrospectivamente a 1.038 ATCP (2015-2022) etiquetadas por un radiólogo con más de 5 años de experiencia según presencia, localización (central / lobar-segmentaria / subsegmentaria aislada) y lado [1]. Muestra: 136 EP centrales, 375 periféricas (303 lobares/segmentarias, 72 EPSS) y 527 pacientes sin EP.
| Tarea | Sensibilidad | Especificidad | AUROC |
|---|---|---|---|
| Cualquier EP | 0,80 | 0,97 | 0,94 |
| EP central | 0,94 | 0,97 | 0,99 |
| EP periférica | 0,77 | 0,75 | 0,74 |
| EPSS (subsegmentaria aislada) | 0,94 | 0,22 | 0,48 |
- Acertó la presencia de EP en 921/1.038 pacientes (88,7 %) y no se le escapó ninguna EP central.
- Se le escaparon 100 de 375 EP periféricas (26,7 %).
- Rindió mejor en el pulmón derecho que en el izquierdo (AUROC 0,95 vs. 0,92; p < 0,05) — una asimetría que nadie pidió y que no tiene explicación clínica.
- En EPSS, sensibilidad 0,94 con especificidad 0,22 significa que "marca casi todo": no discrimina, alarma.
Lectura clínica: este es el estudio que hay que tener a mano cuando un proveedor enseñe un AUROC de 0,94. El número global es cierto y es engañoso: la utilidad de un detector de EP se decide en el subsegmentario y en el hemitórax izquierdo, no en el tromboembolismo central que ya se ve a ojo. Regla práctica: exige la métrica desagregada por subgrupo clínicamente relevante, no la agregada. Y ojo con el sesgo de concurso — un algoritmo optimizado para ganar un leaderboard está optimizado para la distribución del leaderboard. [1]
1.2. Patología renal "de pila completa": la escala a la que sí conviene mirar
Marco de IA para tumor renal que hace cuatro cosas seguidas —detección de región tisular, clasificación de subtipo, graduación nuclear y predicción de supervivencia— construido sobre el modelo fundacional Prov-GigaPath combinando aprendizaje supervisado y aprendizaje multiinstancia débilmente supervisado. 11.135 WSI de 7.033 pacientes, de cuatro centros médicos más dos cohortes públicas, con validación externa [2].
- Caracterización tisular: tejido normal AUC 0,990; tumoral 0,982; necrosis 0,994; diferenciación sarcomatoide 0,967; pseudocápsula 0,990.
- Nueve subtipos de CCR: AUC 0,956-0,998 en cohortes de validación multicéntrica.
- Graduación nuclear OMS/ISUP (ccCCR y pCCR): AUC 0,867 — el punto flojo, y el más subjetivo también para el patólogo humano.
- Puntuación de riesgo derivada del portaobjetos completo: predijo supervivencia global de forma independiente y superó significativamente a la graduación OMS/ISUP en estratificación pronóstica (p < 0,001).
Lectura clínica: lo relevante no es que acierte, es el tamaño y la procedencia de los datos: 7.033 pacientes en 6 fuentes es otra liga que los estudios de un centro que dominan la literatura. Y una nota honesta de los propios autores: falta el estudio prospectivo en flujo de trabajo real para saber si mejora el rendimiento del patólogo, no solo si iguala su etiqueta. Esa es la frontera de 2026 en patología digital. [2]
1.3. Volumetría automática en pancreatitis aguda: la IA como cronómetro, no como oráculo
Herramienta de aprendizaje profundo para segmentar y medir automáticamente el volumen de colecciones peripancreáticas (CPP) en TC con contraste, y usarlo para estratificar riesgo precoz. 394 pacientes de tres hospitales: desarrollo (n = 198), prueba interna (n = 105) y prueba externa (n = 91) [3].
- Concordancia con la segmentación manual verificada por dos radiólogos: Dice 0,89 (IC 95 % 0,87-0,90); Pearson r = 0,99.
- Fallo orgánico: AUC 0,82 con el volumen automático de CPP frente a 0,73 del mCTSI. Infección: 0,79 frente a 0,72.
- El volumen automático de CPP (por cada 100 mL) se asoció de forma independiente a fallo orgánico e infección en las dos cohortes de prueba (todos p ≤ 0,006).
- Velocidad: 25,2 segundos frente a 12,4 minutos por paciente de segmentación manual (p < 0,001). Y superó la clasificación binaria subjetiva de los radiólogos (carga alta vs. baja de CPP).
Lectura clínica: el caso de uso más defendible de toda la ventana. No sustituye juicio: mide lo que nadie tiene tiempo de medir a mano y convierte una impresión ("mucha colección") en un número con AUC superior a la escala que usamos hoy. Ese es el patrón de la IA que se sostiene: automatizar la medición tediosa y dejar la decisión al médico. [3]
1.4. Estadificar el cáncer gástrico con la analítica de rutina (y admitir dónde se equivoca)
Modelo de ML interpretable para diagnóstico por estadios a lo largo de la cascada de Correa (control sano → gastritis no atrófica → gastritis atrófica → metaplasia intestinal → cáncer gástrico) usando solo indicadores de laboratorio de rutina. 2.180 pacientes con estado conocido de Helicobacter pylori en dos centros; 1.784 incluidos tras excluir los de más del 25 % de datos faltantes; 27 rasgos finales; 6 algoritmos comparados [4].
- CatBoost fue el mejor: validación interna con exactitud 80,91 %, sensibilidad 78,57 %, especificidad 95,27 %.
- Validación externa en dos cohortes (Hospital Provincial del Pueblo de Guangdong y Hospital Central de Shengli Oilfield): exactitudes 79,96 % y 83,37 %; sensibilidades 76,82 % y 84,91 %; especificidades 93,14 % y 95,73 %; AUC 0,94 y 0,97.
- Dónde se equivoca (lo dicen ellos): la matriz de confusión muestra que es fiable en los extremos (sano y cáncer) y que los errores se concentran entre estadios intermedios adyacentes. Calibración y puntuación de Brier correctas; el análisis de curva de decisión confirma beneficio neto clínico.
- Rasgos más influyentes por SHAP: monocitos %, cociente albúmina/globulina, basófilos %, amplitud de distribución plaquetaria, bilirrubina, neutrófilos, edad, linfocitos, creatinina y aspartato-aminotransferasa. Publicaron una herramienta web (Streamlit).
Lectura clínica: interesante para entornos con poca endoscopia y mucho hemograma. Pero leed la letra pequeña: distinguir "gastritis atrófica" de "metaplasia intestinal" es exactamente donde falla, y es exactamente donde uno querría que acertara para decidir seguimiento. Sirve como triaje hacia endoscopia, no como sustituto de la biopsia. [4]
1.5. Pseudoprogresión en páncreas: un modelo que dice "no cambies la quimio"
No es aprendizaje profundo —es un modelo pronóstico multivariable clásico, y lo señalo para no inflarlo—, pero resuelve un problema clínico caro. RECIST captura mal la biología del adenocarcinoma ductal de páncreas (ADP), sobre todo la pseudoprogresión radiológica por fibrosis del estroma. La puntuación cPD (chemotherapy Progression Decision) integra cuatro predictores independientes —NLR, CA 19-9 basal, tasa de cambio del diámetro máximo tumoral y aparición de lesiones nuevas— en un entero de 8 a 13 puntos que estratifica en buen, mal y crítico pronóstico. Estudio multicéntrico retrospectivo, 616 pacientes en tres cohortes (entrenamiento n = 155; validación 1 n = 263; validación 2 n = 198) [5].
- Discriminación y calibración robustas, con diferencias de supervivencia significativas entre grupos en todas las cohortes.
- El hallazgo que importa: identificó un subgrupo (buen y mal pronóstico) en el que continuar la quimioterapia original dio supervivencia significativamente mejor que cambiar de esquema, incluso cuando RECIST clasificaba la enfermedad como progresiva.
Lectura clínica: un modelo cuyo entregable es no actuar. Poco glamuroso y clínicamente valioso: cambiar de línea en un ADP por una pseudoprogresión quema la única ventana terapéutica que le queda al paciente. Retrospectivo y necesita validación prospectiva antes de tocar protocolos. [5]
2. La IA que ya está en la cabecera del paciente
2.1. Primera señal de mortalidad con IA en manos de enfermería — con el freno puesto ⭐
Revisión sistemática (PRISMA 2020, protocolo preregistrado, ocho bases y registros de ensayos, 2010 → 1-ene-2026) de SADC con IA en los que enfermería es el usuario primario, en cuidados agudos y críticos. Siete estudios, unos 75.000 pacientes [6].
- Mortalidad hospitalaria (3 estudios agrupados): RR 0,68 (IC 95 % 0,53-0,87; I² = 24 %) — a favor de la IA.
- El matiz que los autores no esconden: el intervalo de predicción incluye la posibilidad de ningún efecto. Es decir, la señal es prometedora pero no concluyente.
- Estancia hospitalaria y adherencia a protocolo mejoraron cuando la herramienta estaba embebida en el flujo de trabajo de enfermería (no como pantalla aparte).
- Contextos: salas de agudos, UCI, sepsis, deterioro clínico, prevención de delirium; algo de domicilio y paliativos.
- Punto ciego declarado: los desenlaces reportados por enfermería son escasos. Recomiendan priorizar diseño centrado en enfermería, carga de alertas, equidad y monitorización de seguridad antes de escalar.
Lectura clínica: el dato más importante de la semana para un hospital público. Es la primera vez que veo un RR de mortalidad agrupado en IA de enfermería, y el mecanismo tiene sentido clínico: quien detecta el deterioro y escala es la enfermera, no el modelo. Pero 7 estudios y un intervalo de predicción que roza el cero no es base para comprar nada: es base para pedir un piloto con medición. [6]
2.2. LLM extrayendo dosis de la historia clínica: 93 % de exactitud (y por qué eso no basta)
Validación de un marco con LLM para extraer sistemáticamente la dosificación de medicamentos de datos de HCE. Anotación manual de 4.295 medicamentos en nueve clases terapéuticas; cinco LLM públicos probados (Mistral-small, Llama 3-70B, Nova lite, DeepSeek y Claude 3.5 Sonnet) con ingeniería de instrucciones iterativa; 2.146 muestras de entrenamiento y 2.149 de prueba [7].
- Claude 3.5 Sonnet en prueba: R = 99,74 %, exactitud de clasificación 93,45 %. DeepSeek: R = 95,58 %, exactitud 91,73 %.
- La optimización de instrucciones mejoró mucho a los modelos flojos (Mistral-small +39,03 puntos de R; Llama +12,65; Nova lite +9,23) y poco a los buenos (Claude +0,42 de exactitud).
- Concordancia entre modelos solo modesta: correlación intraclase 0,73 (IC 0,72-0,74).
Lectura clínica: dos lecturas y las dos importan. La buena: para conciliación medicamentosa e investigación sobre datos reales, extraer dosis automáticamente ahorra un trabajo enorme. La mala: 93 % de exactitud en dosis es 1 error cada 15 fármacos, y una correlación intraclase de 0,73 entre modelos significa que el modelo que elijas cambia el resultado. Sirve para poblar un conjunto de datos con revisión humana; no para escribir una orden médica. [7]
2.3. ¿La IA hace que sigamos mejor las guías? Solo existen seis estudios que lo hayan mirado
Revisión narrativa estructurada (alineada con SANRA) de la evidencia empírica sobre si las herramientas de IA dirigidas al clínico mejoran la adherencia a guías de práctica clínica, y si sus recomendaciones concuerdan con la decisión médica. PubMed/MEDLINE, Embase, Scopus, Web of Science y Google Scholar, enero 2020 → mayo 2026 [8].
- Solo seis estudios revisados por pares cumplieron los criterios: uno de vía clínica integrada en HCE en mundo real, uno de medición de adherencia por procesamiento de lenguaje natural, un ensayo aleatorizado de simulación con un SADC de árbol de decisión y tres comparativos IA-vs-médico. Tres preprints de 2026 se resumieron aparte, sin mezclarlos con el núcleo revisado por pares.
- Resultados favorables en tareas acotadas y embebidas en el flujo de trabajo o en escenarios estructurados. Evidencia más débil para decisiones complejas del mundo real.
- Varios estudios no evaluaron desenlaces en pacientes en absoluto.
Lectura clínica: después de tres años de despliegue masivo, la literatura que responde "¿esto hace que el médico haga lo correcto?" cabe en seis papers. Ese vacío, no la capacidad del modelo, es el cuello de botella de 2026. Y confirma la geometría del asunto: la IA clínica funciona en tareas acotadas dentro del flujo; se desdibuja en cuanto la decisión se parece a la medicina de verdad. [8]
2.4. Educación médica: pacientes simulados por IA, no inferiores (con muestra pequeña)
ECA simple ciego en estudiantes de años clínicos iniciales aprendiendo enfermedad litiásica biliar. Diseño para 90 % de potencia con margen de no inferioridad del 20 %: 36 aleatorizados a paciente simulado por IA o a recursos educativos habituales; 27 completaron el estudio; evaluación estandarizada de habilidades clínicas [9].
- No inferioridad estadística: 13,1 frente a 12,1 puntos (p = 0,11).
- Menos notas límite y significativamente más matrículas de honor en el grupo de IA (6 frente a 1; p = 0,037).
- Datos cualitativos: satisfacción y entusiasmo generalizados.
Lectura clínica: con 27 estudiantes que terminan y un solo centro, esto es una señal, no una conclusión. Pero es el nicho donde la IA generativa tiene menos que perder: el paciente simulado no se muere si el modelo alucina, y el estudiante practica razonamiento sin gastar un paciente real. Los autores lo dicen bien: papel suplementario; el paciente real sigue siendo el patrón. [9]
2.5. Enfermería y LLM: la revisión que pone las condiciones
Revisión narrativa de aplicaciones, beneficios, límites y gobernanza de ChatGPT y los LLM en enfermería a través de educación, práctica clínica y gestión del flujo de trabajo (Medline vía PubMed, Scopus y arXiv; enero 2019 → marzo 2026) [10].
- Educación: útil como andamiaje cognitivo adaptativo, con riesgo real para la integridad académica y para el desarrollo del razonamiento clínico independiente si se usa sin regular.
- Práctica clínica: ayuda en valoración preliminar de síntomas y material educativo para pacientes, pero el rendimiento se deteriora marcadamente en escenarios complejos o con datos escasos, y las tasas de alucinación siguen siendo clínicamente significativas.
- Flujo de trabajo: promete reducir carga documental, pero las obligaciones de privacidad (RGPD) limitan el despliegue real.
- Cuatro condiciones que proponen: tratar todo contenido generado por IA como borrador que exige verificación humana; priorizar despliegues empresariales de circuito cerrado sobre plataformas públicas; alfabetización en IA en el currículo de grado y en la formación continuada; e investigación longitudinal de seguridad del paciente tras el despliegue real.
2.6. Aceptabilidad en el NHS: la IA vigilando heridas quirúrgicas
Estudio cualitativo multicéntrico dentro del ensayo de factibilidad WISDOM (dos hospitales de cirugía cardiaca en Inglaterra; 20 pacientes y 10 profesionales entrevistados, marco teórico de aceptabilidad) sobre una plataforma digital con IA para monitorizar heridas quirúrgicas [11].
- Pacientes y personal la apoyaron: percibieron más seguridad, más acceso y más eficiencia, con detección y tratamiento precoz de complicaciones y posibilidad de monitorizar a todos los pacientes, no solo a los de riesgo.
- Tres reservas explícitas: riesgos de seguridad de los datos, dependencia excesiva del personal en la IA y pérdida de interacción humana.
2.7. El "paciente educado por IA" — un concepto para nombrar lo que ya pasa en consulta
Artículo conceptual que argumenta que la consulta previa a IA generativa es un salto cualitativo respecto a la era del "Dr. Google": los LLM sintetizan la información en narrativas coherentes y enmarcadas en guías, subiendo el conocimiento base con el que el paciente entra a la consulta. Proponen el término "paciente educado por IA" y el marco de "responsabilidad blanda" (soft accountability): la presión informal que aparece cuando un paciente bien informado llega con expectativas estructuradas [12].
- Los autores marcan explícitamente sus mecanismos como hipótesis pendientes de comprobación empírica, no como hallazgos.
- Riesgos que enumeran: alucinaciones, falsa confianza del paciente, inequidad en el acceso y la alfabetización en IA, carga de trabajo del clínico y privacidad.
Lectura clínica: poner nombre a algo lo hace manejable. En consulta ya se nota: el paciente no llega con un foro, llega con una síntesis ordenada y una lista de preguntas. La "responsabilidad blanda" es real y no es mala en sí — obliga a justificar la decisión. El problema es la inequidad: quien tiene la IA llega preparado y quien no, no. [12]
2.8. Lo que se está construyendo ahora mismo (protocolo, sin resultados)
CHAT-AF-S: ECA de 3 meses, asignación 1:1, con 480 adultos con fibrilación auricular (FA) documentada, que compara una intervención de IA conversacional para autocuidado frente a atención habitual. Desenlace principal: puntuación global de la escala AFEQT (efecto de la FA en la calidad de vida); principio de intención de tratar, analistas ciegos, evaluación de proceso incorporada y entrevistas cualitativas. Registrado (ACTRN12623000850673) y con aprobación ética [13].
Anótalo para dentro de un año. Es el diseño que faltaba: IA conversacional evaluada contra calidad de vida, no contra exactitud diagnóstica. Los resultados dirán algo que 300 estudios de benchmark no pueden decir.
3. Adopción y gobernanza: el número que resume el año
Sección reportada por búsqueda web; cifras de informes de la industria y análisis legales. No verificadas en fuente primaria salvo donde se indica.
- Más del 90 % despliega IA; menos de la mitad tiene dónde probarla. Informe "Validation and Trust: The Governance of AI Solutions at Health Systems" del Center for Connected Medicine (UPMC) y KLAS Research, publicado el 6-ago-2026: más del 90 % de los sistemas de salud tiene IA de terceros implementada; los usos dominantes son documentación clínica (52 %) y ciclo de ingresos / codificación / facturación (36 %); el 92 % dice evaluar las herramientas antes de desplegarlas, pero solo el 44 % dispone de un entorno de pruebas dedicado; el 63 % describe su estrategia de IA como "en desarrollo o ad hoc, más que plenamente establecida"; y no existe consenso sobre cómo medir el retorno ni el valor clínico. Barreras: recursos, tiempo y falta de talento especializado. [A]
- El 2 de agosto de 2026 pasó sin pena ni gloria. Esta fecha era, en el diseño original del Reglamento Europeo de IA, el día en que se volvían exigibles las obligaciones para la IA de alto riesgo. No ocurrió: el paquete "Digital Omnibus" —aprobado por el Parlamento Europeo en junio y adoptado por el Consejo el 29-jun-2026— movió los plazos a 2-dic-2027 para el alto riesgo autónomo (Anexo III) y a 2-ago-2028 para la IA embebida en productos regulados como los sanitarios (Anexo I, bajo MDR/IVDR). [B]
- La FDA sigue en radiología y sigue sin aprobar IA generativa. Listado público de dispositivos con IA, corte 30-mar-2026: 1.524 dispositivos autorizados, entre el 95 % y el 97 % por la vía 510(k) (no De Novo ni aprobación previa a comercialización). Y el dato que conviene repetir cada semana: a marzo de 2026 no había ningún dispositivo autorizado que funcione con IA generativa o esté impulsado por un LLM. [C]
Cómo leer esta sección junto a la anterior. El 90 % de adopción [A] frente a los seis estudios que miden si la IA mejora la adherencia a guías [8] es la tensión central de la IA médica en 2026: el despliegue va por delante de la evidencia y de la gobernanza, no de la tecnología. Y el aplazamiento europeo [B] no reduce la exigencia clínica: solo retira la fecha límite que obligaba a organizarse.
4. Qué me llevo esta semana
- Pide la métrica desagregada, no el AUROC global. 0,94 para "hay EP" y 0,48 para la subsegmentaria son el mismo modelo [1]. La pregunta al proveedor es: "¿cómo rinde en el subgrupo donde yo dudo?".
- La IA que se sostiene mide, no decide. Volumetría automática de colecciones peripancreáticas: 25 segundos frente a 12 minutos, y AUC 0,82 vs. 0,73 del índice que usamos hoy [3]. Ese es el molde a copiar.
- Antes de encender nada, monta el entorno de pruebas. Solo el 44 % de los sistemas de salud lo tiene [A], y la literatura que responde si la IA mejora la práctica cabe en seis estudios [8]. El piloto con medición no es burocracia: es la única evidencia que vas a tener.
Nota de transparencia: las secciones 1 y 2 van verificadas en PubMed con DOI y PMID (según PubMed). La sección 3 proviene de búsqueda web y se marca como reportado. Se descartaron dos ítems por fecha no confirmable o fuera de ventana: la lista anual de riesgos de ECRI (fuentes discrepantes: agosto de 2026 vs. marzo de 2026) y el 62,6 % de adopción de IA ambiental en hospitales Epic (dato de junio de 2025, publicado en febrero de 2026). No se inventó nada; lo no confirmable se señaló o se omitió.
Referencias
Vancouver — científico verificado en PubMed (según PubMed; se incluyen los DOI como enlace):
- Hahlbohm P, Starke S, Schön F, Misera L, Erdmann M, Hoffmann RT, et al. External validation of a top-ranked model from the RSNA pulmonary embolism detection challenge: assessment of generalizability. Sci Rep. 2026;16(1). doi:10.1038/s41598-026-65551-z. PMID 42570951.
- Xiong Y, Xi W, Zhang G, Luo X, Xiao L, Gao J, et al. Artificial intelligence empowers full-stack histopathological diagnosis and prognosis of renal cell tumor: a multi-center study with external validation. BMC Med. 2026;24(1). doi:10.1186/s12916-026-05110-5. PMID 42547870.
- Ouyang S, Fan Y, Liu F, Jiang Q, Lan Y, Yang L, et al. Automated CT volumetry of peripancreatic collections for risk stratification in acute pancreatitis: a multicenter retrospective study. Acad Radiol. 2026. doi:10.1016/j.acra.2026.07.036. PMID 42567794.
- Tang J, Chen H, Zhang W, Tay ACY, Marshall BJ, Ma C, et al. Development and validation of an interpretable machine learning model for staging-initiated intestinal-type gastric cancer in the Correa cascade: cross-sectional study. J Med Internet Res. 2026;28:e94837. doi:10.2196/94837. PMID 42567199.
- Zhang Y, Sun Z, Ding H, Zou C, Dong L, Xu Q, et al. A chemotherapy progression decision score for treatment selection after initial assessment in pancreatic ductal adenocarcinoma. MedComm (2020). 2026;7(8):e70903. doi:10.1002/mco2.70903. PMID 42568817.
- Almagharbeh WT, Alkubati SA, Alasmari AA, Alharbi AA, Alfanash HA, Abuadas FH, et al. Harnessing artificial intelligence to strengthen acute and critical care nursing practice: a systematic review. Nurs Crit Care. 2026;31(5):e70606. doi:10.1111/nicc.70606. PMID 42563433.
- Weaver M, Petry NJ, Cauwels J, Lupu RA, Massmann A. Prompt engineering of large language models for medication dose calculation. Clin Pharmacol Ther. 2026. doi:10.1002/cpt.70421. PMID 42572160.
- Kalantar R, Dodangeh S, Khalagi K, Larijani B. Clinician-facing artificial intelligence and guideline adherence: a structured narrative review of comparative and interventional evidence. J Diabetes Metab Disord. 2026;25(2):226. doi:10.1007/s40200-026-02030-2. PMID 42571079.
- Baraza W, Staples G, Wells C, Barbier L, Tonga I, Singh P, et al. Artificially intelligent simulated patients in undergraduate surgical teaching: a single blinded randomized controlled study. Clin Teach. 2026;23(5):e70486. doi:10.1111/tct.70486. PMID 42528332.
- Uchmanowicz I, Aldossary HM, Lee CS, Figura M, Jędrzejczyk M, De Maria M, et al. ChatGPT and large language models in contemporary nursing. J Clin Nurs. 2026. doi:10.1111/jocn.70490. PMID 42568338.
- Tanner J, Rochon M, Cariaga K, Harris R, Beckhelling J, Bouttell J, et al. Exploring patient and NHS staff acceptability of artificial intelligence-supported surgical wound monitoring within the WISDOM feasibility study: a multi-centre qualitative interview study. BMJ Open. 2026;16(7):e116323. doi:10.1136/bmjopen-2026-116323. PMID 42538113.
- Hack S, Attal R, Karni RJ. The AI-educated patient. Digit Health. 2026;12:20552076261477201. doi:10.1177/20552076261477201. PMID 42572538.
- Laranjo L, Zeng A, O'Hagan E, Trivedi R, Sathiaraj R, Thomas S, et al. Conversational artificial intelligence HeAlth supporT in Atrial Fibrillation Self-Management (CHAT-AF-S): rationale and randomised controlled trial design. BMJ Open. 2026;16(8):e120834. doi:10.1136/bmjopen-2026-120834. PMID 42567638.
Contexto (web, no primario):
- [A] Center for Connected Medicine (UPMC) y KLAS Research. Validation and Trust: The Governance of AI Solutions at Health Systems (6-ago-2026). Reseña consultada en MedicalXpress. https://medicalxpress.com/news/2026-08-ai-health-outpacing-infrastructure-strategy.html (acceso 10-ago-2026). No se accedió al informe original.
- [B] Reglamento Europeo de IA — "Digital Omnibus on AI": aprobado por el Parlamento Europeo en junio de 2026 y adoptado por el Consejo el 29-jun-2026. Nuevos plazos: Anexo III → 2-dic-2027; Anexo I / productos sanitarios (MDR/IVDR) → 2-ago-2028. Análisis de Gibson Dunn. https://www.gibsondunn.com/eu-ai-act-omnibus-agreement-postponed-high-risk-deadlines-and-other-key-changes/ (acceso 10-ago-2026).
- [C] Listado público de dispositivos con IA de la FDA (corte 30-mar-2026): 1.524 dispositivos; 95-97 % vía 510(k); ningún dispositivo autorizado impulsado por IA generativa o LLM a marzo de 2026. Agregado por IntuitionLabs a partir de la lista pública de la FDA. https://intuitionlabs.ai/articles/fda-ai-medical-device-tracker (acceso 10-ago-2026).
Generado por Dr. Juan Camilo Paris · Informe semanal automatizado · IA en medicina · 10 de agosto de 2026