¿Cómo se está usando la IA en medicina? — Informe semanal
¿Cómo se está usando la IA en medicina?
Informe semanal · lunes 17 de agosto de 2026
Panorama de las últimas 1-2 semanas sobre inteligencia artificial (IA) aplicada a la clínica: estudios primarios, adopción real y gobernanza. Lo científico va verificado en PubMed con DOI; lo demás se marca cuando no es fuente primaria.
Basado en artículos recuperados de PubMed (para todo lo científico) y en WebSearch (para adopción, gobernanza y regulación).
Abreviaturas
- IA — inteligencia artificial
- DOI — identificador de objeto digital (digital object identifier)
- PMID — identificador de PubMed
- LLM — modelo de lenguaje grande (large language model)
- AUC / AUROC — área bajo la curva (característica operativa del receptor)
- IC — intervalo de confianza
- HR — cociente de riesgos instantáneos (hazard ratio)
- RIC — rango intercuartílico
- TDC — tasa de detección de cáncer (cancer detection rate)
- TIA — tasa de interpretación anormal (abnormal interpretation rate)
- PACS — sistema de archivo y comunicación de imágenes
- VPP / VPN — valor predictivo positivo / negativo
- DSVI — disfunción sistólica del ventrículo izquierdo
- MCH — miocardiopatía hipertrófica
- ETT — ecocardiograma transtorácico
- ECG — electrocardiograma
- EP — embolia pulmonar
- ATCP — angiografía pulmonar por tomografía computarizada
- PERT — equipo de respuesta a la embolia pulmonar (pulmonary embolism response team)
- VPPB — vértigo posicional paroxístico benigno
- MPPP — mareo perceptual postural persistente
- cfDNA — ADN libre circulante (cell-free DNA)
- ULP-WGS — secuenciación de genoma completo de cobertura ultrabaja
- FT — fracción tumoral
- SLP — supervivencia libre de progresión
- CPNM — cáncer de pulmón no microcítico
- IMS / IMS-A — inestabilidad de microsatélites / de alto grado
- WSI — imagen de portaobjetos completo (whole-slide image)
- MIL — aprendizaje de instancias múltiples (multiple instance learning)
- NICE — Instituto Nacional para la Excelencia en Salud y Atención del Reino Unido
- DMG — glioma difuso de línea media
- cDICE — coeficiente de Dice continuo
- SEM — servicios de emergencias médicas
- PBMI — países de bajos y medianos ingresos
- FDA — Administración de Alimentos y Medicamentos de EE. UU.
- MDR / IVDR — Reglamento europeo de productos sanitarios / de diagnóstico in vitro
- DOUE — Diario Oficial de la Unión Europea
Titular de la semana
Lo que entró en vigor esta quincena no es lo que casi nadie estaba vigilando. El 2 de agosto de 2026 empezaron a aplicarse las obligaciones de transparencia del artículo 50 del Reglamento europeo de IA —avisar al usuario de que está hablando con una máquina, marcar el contenido generado— junto con el régimen sancionador (hasta 15 millones de euros o el 3 % de la facturación mundial) y las autoridades nacionales de vigilancia. Y lo hicieron exactamente al revés de como se anunció durante dos años: lo pesado —los requisitos de alto riesgo para IA embebida en productos sanitarios— quedó aplazado a 2 de agosto de 2028 por el «Digital Omnibus» (Reglamento (UE) 2026/1744, publicado en el DOUE el 24-jul-2026) [A]. Traducción para un hospital: el chatbot que le habla al paciente ya está regulado; el algoritmo que lee la placa, todavía no.
Y esto ocurre la misma quincena en que Hartford HealthCare confirma que invitará a más de un millón de pacientes adultos a usar su asistente conversacional antes de que termine 2026 [B]. El calendario regulatorio y el calendario de despliegue se cruzaron esta semana, y se cruzaron en el punto de contacto con el paciente.
En la evidencia, el patrón de la quincena es más sobrio y más útil: lo que gana no es la inteligencia, es el reloj. Los tres estudios con resultados más limpios miden tiempo y flujo, no diagnóstico heroico: la mamografía asistida por IA duplica la tasa de detección sin alargar la lectura (22,3 frente a 11,5 por 1.000; 65,0 s frente a 64,3 s) [1]; la alerta automática sobre la angiografía pulmonar baja el tiempo hasta el diagnóstico de embolia de 72,5 a 40 minutos [3]; el ECG con IA evita ecocardiogramas de vigilancia con valor predictivo negativo del 100 % [4]. Ninguno de los tres pretende sustituir el juicio; los tres recortan la espera.
Y en el otro platillo, tres avisos que conviene leer juntos: un modelo de patología cae de AUC 0,88 en casa a 0,73 en el hospital de al lado [6]; una auditoría con LLM descubre que el conjunto de referencia con el que se evalúan los modelos de codificación clínica tiene un 76,3 % de subcodificación [8]; y una carta en BMC Medicine desmonta la validación de un modelo generativo de crecimiento tumoral pediátrico con 13 pacientes externos [13]. Es decir: parte del progreso que celebramos se mide contra reglas torcidas.
La pregunta de la semana: ¿su institución sabe qué herramienta de IA habla hoy con sus pacientes — y si esa herramienta ya cumple el artículo 50?
1. Estudios primarios verificados (dentro de la ventana)
Ventana: entrada en PubMed entre el 3-ago y el 17-ago de 2026. Basado en artículos recuperados de PubMed; cada uno con su DOI.
1.1. Mamografía con IA en la consulta real: más cánceres detectados, misma velocidad de lectura ⭐
El diseño es lo mejor de este estudio: en lugar de un ensayo de laboratorio, los autores encendieron y apagaron la IA mes a mes en la práctica rutinaria de cuatro radiólogos, durante un año (agosto de 2023 a julio de 2024), sobre 4.577 mamografías digitales de dos proyecciones (edad media 51,7 ± 10,4 años). El tiempo de lectura se extrajo del registro del PACS, no de un cronómetro observado [1].
| Desenlace | Con IA | Sin IA | p |
|---|---|---|---|
| Tasa de detección de cáncer (por 1.000) | 22,3 | 11,5 | 0,005 |
| Tasa de interpretación anormal — cribado | 9,5 % | 8,4 % | 0,293 (n. s.) |
| Tasa de interpretación anormal — diagnóstica | 18,7 % | 12,1 % | 0,026 |
| Tiempo medio de lectura (s) | 65,0 | 64,3 | 0,723 (n. s.) |
Lo que importa. La IA no ralentizó la consulta —el miedo número uno del radiólogo con volumen— y casi duplicó la detección global. Pero el efecto colateral está localizado con precisión: en el estudio diagnóstico (no en el de cribado) la tasa de interpretación anormal subió del 12,1 % al 18,7 %. Es decir, cuando la paciente ya venía con un síntoma o un hallazgo, la IA empujó a llamar «anormal» con más frecuencia. Los propios autores concluyen que el uso diagnóstico «debe aplicarse con cuidado».
Limitaciones honestas: un solo centro, cuatro lectores, diseño de meses alternos (no aleatorización por paciente), y el análisis de tiempos se restringió a 2.917 estudios con lectura ≤ 5 min para descartar interrupciones. La tasa de detección se mide sobre un año, con los intervalos de confianza que eso implica.
1.2. Un agente conversacional de LLM en la consulta de vértigo: 80 % de concordancia, prospectivo y multicéntrico ⭐
Este es, con diferencia, el estudio de LLM más serio de la quincena, porque tiene lo que casi ninguno tiene: evaluación prospectiva en flujo clínico real, en cinco centros de China [2].
Dos fases:
- Fase de historias estáticas (retrospectiva): 10 LLM y 5 otorrinolaringólogos sénior revisaron 227 historias estructuradas de vértigo. Los mejores modelos (Gemini-2.5-pro y o1) alcanzaron 69,6 % de acierto en el primer diagnóstico (IC 95 % 63,2-75,5). Ningún modelo superó significativamente al voto mayoritario del panel de especialistas (63,9 %; IC 95 % 57,3-70,1; McNemar p > 0,10 en todos).
- Fase prospectiva: 176 pacientes ambulatorios con vértigo o mareo. Un agente en tableta, asistido por enfermería y desplegado localmente (DeepSeek-R1, dentro de la infraestructura del hospital), hizo la anamnesis multiturno. Recibió solo la historia: ni exploración física ni pruebas complementarias. Los clínicos estaban cegados al resultado del agente.
| Diagnóstico | Concordancia con el diagnóstico de referencia |
|---|---|
| Global | 79,55 % (140/176; IC 95 % 72,8-85,2) |
| VPPB | 97,73 % (43/44; IC 95 % 88,0-99,9) |
| Enfermedad de Ménière | 90,00 % (27/30; IC 95 % 73,5-97,9) |
| Migraña vestibular | 71,11 % (32/45; IC 95 % 55,7-83,6) |
| Mareo perceptual postural persistente | 67,86 % (19/28; IC 95 % 47,6-84,1) |
Lo que importa. Tres lecturas, en orden de utilidad. Primera: el gradiente de concordancia reproduce exactamente la dificultad clínica real —clava el VPPB, flojea en migraña vestibular y en el mareo funcional, que son justo los diagnósticos que exigen contexto longitudinal y descarte. Segunda, y los autores lo subrayan ellos mismos: el 79,55 % es el rendimiento del flujo «enfermera + agente», no del agente solo. Tercera: el despliegue local, dentro del hospital, resuelve de un plumazo el problema de mandar la historia de un paciente a una nube ajena.
Limitaciones: un LLM que solo recibe anamnesis no es un diagnosticador; es un tomador de historia estructurado. Y la pregunta que este estudio no responde —lo dicen los autores— es si eso cambia decisiones, reduce pruebas innecesarias o mantiene la seguridad en otros idiomas y sistemas de salud.
1.3. Añadir IA a la vía de la embolia pulmonar: 32 minutos menos hasta el diagnóstico
Revisión retrospectiva de un centro único (julio 2018 - marzo 2025) sobre 124 pacientes analizados con embolia pulmonar que recibieron trombectomía mecánica o trombolisis, divididos en cohorte pre-IA (n = 42) y post-IA (n = 82) según la implantación institucional de Viz.ai PE —plataforma autorizada por la FDA que detecta la embolia automáticamente en la angiografía pulmonar y dispara una alerta al PERT [3].
| Desenlace (mediana, RIC) | Pre-IA | Post-IA | p |
|---|---|---|---|
| Tiempo hasta el diagnóstico | 72,5 min (44,5-93,3) | 40 min (28-68,2) | 0,00005 |
| Tiempo hasta anticoagulación | 76 min (48,3-99,8) | 61,5 min (46,8-110) | 0,824 (n. s.) |
| Tiempo hasta la intervención | 1.360 min (1.075,5-1.790,2) | 1.224 min (601,6-1.563) | 0,036 |
Lo que importa. El mecanismo es transparente y no tiene nada de mágico: en la era pre-IA el reloj del diagnóstico se detenía cuando salía el informe final del radiólogo; en la post-IA, cuando suena la alerta automática. Eso es lo que se está midiendo. Que la anticoagulación no mejorara sugiere que el cuello de botella se movió: ya no está en detectar, está en el proceso posterior.
Limitaciones serias: retrospectivo, un solo centro, comparación histórica (2018-2022 frente a 2022-2025) con todo lo que cambió en el hospital en ese lapso además de la IA. Hubo 2 muertes intrahospitalarias, ambas en la cohorte pre-IA, pero los propios autores advierten que el estudio no tiene potencia para detectar diferencias de mortalidad. No se debe leer como «la IA salvó vidas».
1.4. ECG con IA para vigilar el ventrículo izquierdo en miocardiopatía hipertrófica: el valor está en el negativo
Los pacientes con miocardiopatía hipertrófica obstructiva tratados con mavacamtén necesitan ecocardiogramas frecuentes para vigilar la disfunción sistólica del ventrículo izquierdo. Eso es caro, incómodo, y en zonas rurales o desatendidas, sencillamente un obstáculo de acceso. Este trabajo evaluó si un ECG interpretado por IA (ECG-Vision) puede servir de filtro: 147 pacientes, 453 pares ECG-ETT, un solo centro (Morristown Medical Center / Atlantic Health), junio 2022 - junio 2025 [4].
Con umbral de probabilidad del 20 %, para fracción de eyección < 50 %:
| Métrica | Valor (IC 95 %) |
|---|---|
| AUC | 0,94 (0,90-0,98) |
| Sensibilidad | 100 % (68-100) |
| Valor predictivo negativo | 100 % (99-100) |
| Especificidad | 75 % (69-82) |
| Valor predictivo positivo | 7 % (3-11) |
Concordancia a nivel de paciente: 127/147 (86 %); 17/147 inconcluyentes (12 %); 3/147 discordantes (2 %).
Lo que importa. Este es un ejemplo de manual de para qué sirve realmente un modelo cribador. Con un VPP del 7 %, si el ECG dice «positivo», 93 de cada 100 veces se equivoca: no sirve para diagnosticar. Pero con un VPN del 100 %, si dice «negativo», se puede razonablemente aplazar el eco. La herramienta no reemplaza el ecocardiograma: decide a quién no hace falta hacérselo hoy.
Limitación que los autores no esconden: solo hubo 8 eventos de disfunción en 453 observaciones. Con 8 eventos, un IC de sensibilidad del 68 % al 100 % es lo que hay. Ellos mismos lo llaman «cohorte exploratoria» y piden validación prospectiva multicéntrica. Está en el nivel de «señal prometedora», no de «cambie su protocolo».
1.5. Detectar cáncer en sangre con secuenciación barata: el truco fue entrenar por estratos
La secuenciación de genoma completo de cobertura ultrabaja sobre ADN libre circulante es atractiva porque es barata, y frustrante porque la señal es escasísima cuando la fracción tumoral es baja —es decir, precisamente en los tumores tempranos, que son los que interesa detectar. Este trabajo aplica un transformador con aprendizaje de instancias múltiples y, sobre todo, un ajuste fino secuencial por estratos de fracción tumoral [5].
| Cohorte | Rendimiento |
|---|---|
| Muestras de fracción tumoral baja, con ajuste secuencial | AUC 0,884 (frente a 0,652 entrenando solo con fracción alta: +35,6 % relativo) |
| Cohorte de prueba independiente (17 tipos de cáncer) | AUC 0,930 |
| Validación externa, plataforma de secuenciación distinta | AUC 0,929 · sensibilidad 0,78 · especificidad 0,92 |
Y el dato con contenido clínico: en pacientes con cáncer de pulmón no microcítico avanzado bajo quimioinmunoterapia, ser negativo por el modelo se asoció a mejor supervivencia libre de progresión (HR 0,49; IC 95 % 0,29-0,82) tras ajuste multivariable.
Lo que importa. Que el AUC se mantenga (0,930 → 0,929) al cambiar de plataforma de secuenciación es la parte difícil y es la que aquí sí se hizo. Compárese con 1.6.
Advertencia de lectura: el trabajo procede de la empresa desarrolladora (Geneseeq), y la validación clínica es sobre supervivencia libre de progresión en enfermedad avanzada, no sobre cribado poblacional en asintomáticos. No es «un análisis de sangre para detectar el cáncer antes».
1.6. Inestabilidad de microsatélites desde la biopsia digitalizada: la caída al salir de casa
Modelo de aprendizaje de instancias múltiples con autodestilación fenotípica para predecir inestabilidad de microsatélites en cáncer colorrectal a partir de portaobjetos digitalizados, sin anotación manual píxel a píxel [6].
| Conjunto | n | AUC | Exactitud |
|---|---|---|---|
| TCGA-CRC (entrenamiento/prueba interna, partición fija 70/30) | 360 (65 IMS-A / 295 estables) | 0,8846 | 0,84 |
| Hospital Popular de Tangshan (validación externa) | 472 (56 IMS-A / 426 estables) | 0,7258 | 0,70 |
Lo que importa. Trece puntos de AUC evaporados entre el conjunto público y un hospital real. Ese delta —0,88 → 0,73— es el número más honesto de la quincena, y merece leerse junto al 1.5: cuando un equipo diseña explícitamente para la generalización (ajuste por estratos, validación entre plataformas), el rendimiento aguanta; cuando se entrena sobre TCGA y se prueba fuera, cae. La diferencia no está en el tipo de red: está en si alguien se ocupó del cambio de dominio.
Sigue siendo un resultado valioso: 0,73 en un hospital ajeno no es ruido, y la promesa de sacar información molecular de la tinción de rutina, sin gastar un panel, es real. Pero es un prefiltro, no un sustituto de la prueba molecular.
1.7. Convertir las guías NICE en un modelo ejecutable, automáticamente
Las guías clínicas viven en prosa. Convertirlas en algo que un ordenador pueda ejecutar sobre un paciente concreto ha sido siempre un trabajo artesanal, caro y no escalable. Este equipo del Imperial College propone una transformación por pasos con LLM que produce artefactos intermedios inspeccionables por humanos en cada etapa —no una caja negra que escupe reglas— aplicada a las guías NICE de cáncer de páncreas y de pulmón [7].
- Revisión por expertos humanos: fuerte alineación entre la guía en lenguaje natural y el modelo ejecutable generado; la mayoría de las recomendaciones se tradujeron correctamente.
- La mayoría de discrepancias fueron omisiones parciales de detalles, no lógica incorrecta. Reglas alucinadas o fundamentalmente erróneas: raras.
- Ejecutado sobre 20 viñetas de pacientes con cáncer de páncreas: F1 del 82,5 %.
Lo que importa. El diseño resuelve el problema de confianza por construcción: si cada paso deja un artefacto legible y modificable, el clínico puede auditar dónde se torció la traducción en vez de discutir con el modelo. Es la diferencia entre «el LLM decide» y «el LLM redacta un borrador que un humano firma».
Limitación evidente: 20 viñetas y dos guías. Prueba de concepto sólida, no despliegue.
1.8. La auditoría incómoda: el conjunto de referencia estaba mal
Este es el hallazgo que más consecuencias tiene, y el que menos titulares se llevará. Un equipo construyó una tubería interpretable de codificación clínica (LLM para extraer evidencia y verificar códigos + clasificador multiclase) y, en vez de usarla para presumir de rendimiento, la usó como herramienta de auditoría: tres codificadores profesionales revisaron con ella dos conjuntos de datos anotados por humanos que se usan de referencia en todo el campo [8].
| Conjunto de referencia | Problema detectado |
|---|---|
| MDACE | 76,3 % de tasa estimada de subcodificación |
| CodiEsp | 29,7 % de tasa de error |
Al reevaluar los modelos existentes sobre los conjuntos corregidos, el rendimiento mejoró de forma consistente en todas las métricas en MDACE, y en sensibilidad en CodiEsp.
Lo que importa. Durante años, los modelos de codificación clínica se han estado penalizando por acertar códigos que el anotador humano había omitido. Es decir: parte de la «tasa de error» de la IA era en realidad error del patrón oro. La conclusión de los autores es la que hay que llevarse: el campo tiene que desplazar el foco de lo centrado en el modelo a lo centrado en el dato. Publican modelos y resultados en abierto, en la medida en que los requisitos de privacidad de los datos lo permiten.
2. Revisiones y síntesis de la quincena
2.1. LLM en el trabajo en equipo sanitario: 20 estudios, y solo 4 miden seguridad
Revisión de alcance (PRISMA-ScR, registrada en el Open Science Framework) sobre cómo se usan los LLM para apoyar la comunicación y el trabajo en equipo en sanidad. De 3.865 títulos cribados y 127 textos completos revisados, quedaron 20 estudios [9].
| Qué se mide | Estudios |
|---|---|
| Exactitud y calidad | 15 / 20 |
| Legibilidad o empatía | 5 / 20 |
| Seguridad | 4 / 20 |
| Eficiencia del flujo de trabajo | 3 / 20 |
| Modos de fallo | 2 / 20 |
Lo que importa. El desequilibrio es el hallazgo. Tres de cada cuatro estudios preguntan «¿acierta?» y solo uno de cada cinco pregunta «¿es seguro?». Dos de veinte se molestan en caracterizar cómo falla cuando falla —que es lo único que permite diseñar una red de seguridad. Además, predominan los diseños cuantitativos y de simulación, con evaluaciones in situ escasas: se mide el modelo, no la dinámica del equipo humano en el que se inserta.
2.2. IA prehospitalaria: promesa alta, validación externa casi ausente
Dos revisiones de alcance coincidieron en la ventana, y cuentan la misma historia desde dos ángulos.
La primera mapea la IA en servicios de emergencias médicas prehospitalarios: 37 estudios, mayoritariamente de 2020-2024, en cinco dominios (patología tiempo-dependiente, emergencias complejas, despacho y coordinación de transporte, analítica predictiva, eficiencia organizativa). Veredicto: en su mayoría observacionales o pruebas de concepto, y la mayoría de los sistemas carecen de validación externa e implantación real [11].
La segunda es más interesante para nuestro contexto, porque se centra en países de bajos y medianos ingresos y en la «hora dorada» del trauma. La tesis de las autoras es que en el Sur global la IA no funciona como optimizador de un sistema maduro, sino como sustituto estructural que permite saltarse barreras que nunca se construyeron [10]:
- Clínico: modelos de aprendizaje automático (Random Forest, LightGBM) superaron consistentemente a escalas manuales como el Kampala Trauma Score, con AUC de 0,91 a 0,94. Modelos bayesianos en Tanzania usaron variables de retraso prehospitalario para predecir mortalidad.
- Operativo: plataformas como Flare (Kenia) navegan vías no cartografiadas con lógica de aplicaciones de transporte; optimización robusta en Bangladés redujo el tiempo medio de respuesta de 162 a 13 minutos.
- Técnico: hardware de IA en el borde y procesamiento de lenguaje natural para transcribir audio informal alcanzaron 95 % de exactitud en entornos ruidosos y sin conectividad.
Pero el freno es institucional, no técnico: persiste una brecha de preparación —Indonesia con un índice de madurez de IA en salud de 52 sobre 100— y las autoras señalan un vacío de política pública sobre responsabilidad legal como el riesgo principal para estas innovaciones.
Lectura para Colombia: el cuello de botella descrito —registros nacionales de datos y claridad jurídica sobre responsabilidad, antes que modelos— es transferible casi literalmente.
2.3. Audífonos, ChatGPT y Gemini: claros los dos, pero ninguno estable
Comparación cara a cara sobre 44 preguntas frecuentes de manejo de audífonos en siete categorías, evaluadas por tres audiólogos con los manuales oficiales del fabricante como patrón oro, más una medida objetiva de repetibilidad por similitud del coseno [12].
- Claridad: excelente en ambos (mediana 5,00; RIC 0,00), sin diferencias significativas en ninguna categoría.
- Exactitud médica y técnica: Gemini significativamente superior en conjunto (p < 0,001), destacando en «Emparejamiento» y «Antes de usar un audífono» (p = 0,03 en ambas).
- Repetibilidad: alta pero imperfecta en los dos (mediana de similitud del coseno: ChatGPT 0,91; Gemini 0,93), sin diferencia significativa entre ellos (p = 0,30).
Conclusión de los autores, textual en su espíritu: como ninguno de los dos modelos demuestra estabilidad diagnóstica completa ni reproducibilidad perfecta, no pueden recomendarse hoy como asistentes digitales independientes. Sirven de apoyo a la educación del paciente, con supervisión profesional.
El dato que hay que interiorizar es el de la repetibilidad: 0,91 de similitud del coseno significa que la misma pregunta no obtiene siempre la misma respuesta. En educación al paciente, eso es exactamente lo contrario de un folleto.
3. La crítica metodológica de la semana
En BMC Medicine apareció una carta Matters Arising que conviene leer entera si a alguien le tienta la IA generativa en oncología. Comenta un modelo de difusión guiada para predecir espacialmente el crecimiento tumoral en resonancia en glioma difuso de línea media pediátrico [13].
Los tres reparos:
- Cambio de dominio biológico: entrenar el modelo de difusión y el regresor de tamaño tumoral sobre datos agrupados de glioblastoma de adulto y glioma de alto grado pediátrico ignora diferencias en impulsores moleculares, distribución anatómica, cinética de crecimiento y respuesta al tratamiento.
- Anidamiento estadístico: aunque la partición se hizo correctamente a nivel de paciente, las estimaciones de rendimiento por corte exageran la precisión, porque múltiples cortes bidimensionales correlacionados están anidados dentro de muy pocos pacientes.
- Referencia clínica equivocada: la utilidad debería evaluarse contra los criterios que importan en radioterapia —delineación del volumen diana, márgenes de expansión isotrópica, fallo geográfico, exposición de tejido sano.
Y el número que lo resume: cohorte de validación externa de 13 pacientes, con rendimiento en la región de crecimiento —lo que el modelo dice predecir— de cDICE mediano ≈ 0,22 (rango 0,071-0,376), frente a ≈ 0,81 para el tumor completo (rango 0,439-0,877).
Lo que importa. El modelo es bueno redibujando el tumor que ya se ve, y prácticamente inútil prediciendo por dónde crecerá — que era el punto. Es el mismo error de encuadre del informe de la semana pasada: una métrica global excelente escondiendo un fracaso en el subgrupo que motivaba el trabajo. Vale la pena registrar también lo positivo: el sistema funcionó. El artículo se publicó, otros investigadores lo leyeron con lápiz y la crítica salió en la misma revista, en cuestión de meses.
4. Regulación y gobernanza
4.1. El 2 de agosto de 2026: entró lo ligero, se aplazó lo pesado
Es el hecho regulatorio de la ventana y conviene tenerlo exacto [A]:
| Qué | Cuándo aplica |
|---|---|
| Artículo 50 — transparencia (avisar de que se interactúa con IA, marcar contenido generado, notificar reconocimiento de emociones o categorización biométrica) | Ya: 2-ago-2026, sin aplazamiento |
| Autoridades nacionales de vigilancia del mercado + régimen sancionador | Ya: 2-ago-2026 (hasta 35 M € o 7 % de facturación mundial en prácticas prohibidas; hasta 15 M € o 3 % en el resto, incluido el art. 50) |
| Alto riesgo — sistemas autónomos del Anexo III | Aplazado a 2-dic-2027 |
| Alto riesgo — IA embebida en productos regulados del Anexo I (productos sanitarios MDR/IVDR) | Aplazado a 2-ago-2028 |
El instrumento es el «Digital Omnibus» — Reglamento (UE) 2026/1744, publicado en el DOUE el 24-jul-2026 y en vigor desde el 27-jul-2026. El motivo declarado del aplazamiento es práctico y no ideológico: las normas armonizadas, las especificaciones comunes y las guías de la Comisión no están listas. Los fabricantes de productos sanitarios con evaluación por organismo notificado ganan doce meses sobre el plazo original de agosto de 2027. Según los análisis consultados, el texto adoptado eliminó las condiciones de activación, de modo que son fechas de calendario fijas que no pueden volver a moverse sin un nuevo procedimiento legislativo.
Lo que un hospital tiene que entender. La asimetría es contraintuitiva y es la trampa: la parte del reglamento que ya está viva y sancionable es la que toca el software que habla con el paciente —chatbots, informes generados, avatares, contenido sintético—, mientras que los requisitos duros sobre el algoritmo que lee la imagen están a dos años. Cualquier institución europea que tenga un asistente conversacional en su portal está hoy dentro del ámbito del artículo 50; muchas todavía razonan como si tuvieran hasta 2027.
Nota de honestidad: la interpretación de arriba procede de análisis jurídicos secundarios (Gibson Dunn, Cloud Security Alliance, boletines especializados), no de una lectura directa del texto consolidado en EUR-Lex. Para decisiones de cumplimiento, verificar contra el articulado.
4.2. Lo que sigue sin moverse
- FDA: no se identificó ninguna autorización relevante de un dispositivo con IA dentro de esta ventana concreta. El contexto de fondo, sin cambios respecto a informes previos: más de 1.500 dispositivos con IA/aprendizaje automático autorizados, en torno al 95-97 % por la vía 510(k) —es decir, por equivalencia sustancial con un predicado, sin ensayo clínico propio.
- OMS: no se detectó guía nueva en la ventana. La referencia vigente sigue siendo el documento de junio de 2026 sobre IA y política sanitaria basada en evidencia, cuyo principio rector —la IA debe aumentar, no automatizar; el humano sigue siendo responsable de formular la pregunta, juzgar la calidad de la evidencia e interpretar en contexto— envejece bien.
5. Adopción y despliegue (reportado, no primario)
- Hartford HealthCare (Connecticut, EE. UU.): se propone invitar a más de un millón de pacientes adultos a usar su asistente conversacional (PatientGPT, con K Health) antes de que acabe 2026 — uno de los mayores despliegues de IA de cara al paciente en Norteamérica. Salvaguardas descritas: sistema multiagente auditable con agentes revisores independientes que contrastan las respuestas contra guía clínica precargada; no diagnostica, no prescribe, no opera de forma autónoma; escala a un clínico humano cuando persiste ambigüedad o riesgo; limitado a mayores de 18 años en Connecticut [B]. (El lanzamiento en sí es de marzo de 2026 — fuera de ventana; lo que entra aquí es la cifra de escalado, publicada el 12-ago-2026.)
- MUSC Health: su agente telefónico «Emily» gestiona más de 624.000 llamadas anuales de agendamiento y consultas no clínicas [B].
- Contrapeso: según un estudio de Deloitte citado en la misma pieza, menos de un tercio de los directivos sanitarios está enfocado en accesos «virtual-first orquestados por IA». La práctica sigue siendo emergente, no dominante.
- Corea del Sur ⚠️ no verificado en fuente primaria: se reporta la adopción en agosto de 2026 de una «Estrategia Básica de IA en Salud» de alcance gubernamental (apoyo a atención primaria en centros de salud pública: interpretación de radiografías, registro automático de notas clínicas, manejo de crónicos), y un memorando de entendimiento del 17-ago-2026 entre KT y el Hospital Universitario Nacional de Seúl para una plataforma unificada de IA médica. No se pudo acceder a las fuentes oficiales (redirecciones en korea.net, HTTP 403 en los agregadores): tratar como señal, no como dato.
- El número que explica los fracasos ⚠️ reportado: se estima que entre el 70 % y el 80 % de los pilotos de IA hospitalaria no llegan a escalar, principalmente por fragmentación de datos entre historia clínica electrónica, archivo de radiología, laboratorio y plataformas de enfermería, más vacíos de gobernanza. Cifra citada en análisis del sector, sin acceso al estudio original.
6. Qué me llevo a la consulta
- Si va a comprar IA, compre reloj antes que cerebro. Los tres resultados más sólidos de la quincena son de tiempo y flujo: −32 minutos hasta el diagnóstico de embolia [3], misma velocidad de lectura con más detección en mamografía [1], ecocardiogramas de vigilancia evitados [4]. Son medibles la semana siguiente a instalar la herramienta y no exigen que nadie confíe ciegamente en un modelo.
- Pregunte siempre por el valor predictivo positivo, no por el AUC. El caso del ECG con IA lo enseña en una línea: AUC 0,94 suena magnífico, VPP 7 % dice para qué sirve de verdad [4]. Un cribador se justifica por lo que descarta.
- Exija el número de fuera de casa. 0,88 dentro, 0,73 fuera [6]. Si un proveedor solo enseña la métrica interna, ese es el dato que falta, no un detalle metodológico.
- Revise hoy qué IA habla con sus pacientes. El artículo 50 ya se aplica y ya es sancionable [A]. Si hay un chatbot en el portal, la pregunta no es si cumple los requisitos de alto riesgo —eso es 2028—, es si avisa de que es una máquina.
- Desconfíe de la reproducibilidad, no solo de la exactitud. Similitud del coseno de 0,91 [12] significa que el mismo paciente que pregunta dos veces recibe dos respuestas distintas. Para educación al paciente eso es un defecto de fábrica, no un matiz.
- Y una para el gremio: cuando un modelo «falla», compruebe primero contra qué se le está midiendo. Un 76,3 % de subcodificación en el patrón oro [8] es un recordatorio de que la IA a veces acierta y el evaluador se equivoca.
Lo que NO pude verificar
Por transparencia, y para que nadie repita estas cifras citando este informe:
- Estrategia de IA en salud de Corea del Sur y memorando KT-SNUH: solo a través de agregadores y resúmenes de búsqueda. korea.net devolvió un bucle de redirecciones y los agregadores, HTTP 403. Marcado como señal.
- «70-80 % de los pilotos de IA hospitalaria fracasan»: cifra ampliamente repetida en prensa sectorial esta quincena, sin acceso al estudio primario que la origina.
- Ausencia de autorizaciones de la FDA en la ventana: es un «no encontré», no un «no ocurrió». La lista pública de la FDA se actualiza por lotes y con retraso.
- Interpretación del Reglamento europeo de IA: basada en análisis jurídicos secundarios, no en el texto consolidado de EUR-Lex.
Referencias
Vancouver — científico verificado en PubMed (según PubMed; se incluyen los DOI como enlace):
- Lee SE, Heo SJ, Shin HJ, Kim EK. Impact of AI assistance on reading time, cancer detection rate, and abnormal interpretation rate in screening and diagnostic mammography: a prospective alternating-month study. Eur Radiol. 2026. doi:10.1007/s00330-026-12793-0. PMID 42593499.
- Lu C, Zhang R, Jiang H, Yu Y, Zhang S, Lin Q, et al. Conversational large language models for vestibular diagnosis in outpatient clinics: prospective multicenter diagnostic accuracy study. J Med Internet Res. 2026;28:e100442. doi:10.2196/100442. PMID 42572244.
- Austin E, Reichard A, Muck P, Fellner A. Adding artificial intelligence to the PERT improves time to diagnosis and treatment of pulmonary embolism. J Vasc Surg Venous Lymphat Disord. 2026:102598. doi:10.1016/j.jvsv.2026.102598. PMID 42570761.
- Bavishi A, Fritzlen J, Soutar M, Nazif K, Kurnides M, Speer H, et al. Utility of ECG-Vision for surveillance of left ventricular dysfunction in patients with hypertrophic cardiomyopathy initiated on mavacamten. Circ Heart Fail. 2026:e014177. doi:10.1161/CIRCHEARTFAILURE.126.014177. PMID 42572891.
- Xu Y, Wang S, Sun G, Shen Y, Chang S, He P, et al. Generalizable cancer detection from ultra-low-pass WGS via deep contextual modeling of cfDNA sequences. Mol Biomed. 2026;7(1). doi:10.1186/s43556-026-00538-w. PMID 42584731.
- Wang Z, Liu Y, Xiong W, Wang L, Xi S, Lu C, et al. Prediction of microsatellite instability in colorectal cancer based on tissue phenotypes inferred from pathological whole slide images using self-distillation. Pathol Res Pract. 2026;286:156637. doi:10.1016/j.prp.2026.156637. PMID 42546403.
- Gupta A, Prociuk D, Russo A, Delaney BC. Automatic conversion of NICE guidelines to an executable computational model using large language models. Learn Health Syst. 2026;10(4):e70114. doi:10.1002/lrh2.70114. PMID 42602885.
- Khadka S, Jiang X, Palade V. LLM-assisted clinical coding audit through an interpretable coding pipeline. Int J Med Inform. 2026;220:106605. doi:10.1016/j.ijmedinf.2026.106605. PMID 42570566.
- Super I, Rezaeian O, Asan O. How large language models can be used for teamwork and communication in healthcare settings: a scoping review. Int J Med Inform. 2026;220:106648. doi:10.1016/j.ijmedinf.2026.106648. PMID 42561766.
- Widiyawati K, Deviantony F. Artificial intelligence in the Golden Hour: a scoping review of prehospital trauma triage and implementation feasibility in LMICs. Int J Med Inform. 2026;220:106638. doi:10.1016/j.ijmedinf.2026.106638. PMID 42566988.
- Di Nardo Di Maio N, Carducci A, Dante A. Mapping artificial intelligence applications for clinical and operational decision support in prehospital emergency medical services: a scoping review. Int Emerg Nurs. 2026;88:101887. doi:10.1016/j.ienj.2026.101887. PMID 42561610.
- Batuk IT, Karakuluk-Celebi I. Evaluating the efficacy of artificial intelligence in audiology: a head-to-head comparison of ChatGPT and Gemini on hearing aid management. Int J Med Inform. 2026;220:106633. doi:10.1016/j.ijmedinf.2026.106633. PMID 42571769.
- Li W, Sun X, Pei S. Biological domain shift and statistical nesting concerns in generative AI-based spatial tumor growth prediction for pediatric diffuse midline glioma. BMC Med. 2026;24(1). doi:10.1186/s12916-026-05141-y. PMID 42587294.
Contexto (web, no primario):
- [A] Reglamento europeo de IA — calendario tras el «Digital Omnibus», Reglamento (UE) 2026/1744 (DOUE 24-jul-2026, en vigor 27-jul-2026). Aplicación del artículo 50 y del régimen sancionador desde el 2-ago-2026; alto riesgo Anexo III → 2-dic-2027; Anexo I / productos sanitarios → 2-ago-2028. Análisis consultados: Sparta.care, https://www.sparta.care/en/post/ai-act-2-august-2026-deadline-postponed-2028-b4k7; Gibson Dunn, https://www.gibsondunn.com/eu-ai-act-omnibus-agreement-postponed-high-risk-deadlines-and-other-key-changes/; Cloud Security Alliance, https://labs.cloudsecurityalliance.org/research/csa-research-note-eu-ai-act-high-risk-deadline-omnibus-20260/ (acceso 17-ago-2026). No se consultó el texto consolidado en EUR-Lex.
- [B] HealthTech Magazine. Moving toward a more seamless patient experience with AI (12-ago-2026). Cifras de Hartford HealthCare (>1 millón de pacientes invitados antes de fin de 2026), MUSC Health («Emily», >624.000 llamadas anuales) y el dato de Deloitte. https://healthtechmagazine.net/article/2026/08/moving-toward-more-seamless-patient-experience-ai (acceso 17-ago-2026).
- [C] Hartford HealthCare y K Health. Nota de prensa del lanzamiento de PatientGPT (26-mar-2026) — fuera de ventana, consultada solo para las salvaguardas descritas. https://www.prnewswire.com/news-releases/hartford-healthcare-and-k-health-launch-patientgpt-a-new-247-ai-bridge-to-the-clinical-care-team-302725573.html (acceso 17-ago-2026).
- [D] ⚠️ No verificado. Estrategia Básica de IA en Salud de Corea del Sur (ago-2026) y memorando KT–Hospital Universitario Nacional de Seúl (17-ago-2026). Solo a través de resúmenes de búsqueda de korea.net, MLex, Digital Watch y Tech Times; el acceso directo falló (redirecciones y HTTP 403).
Generado por Dr. Juan Camilo Paris · Informe semanal automatizado · IA en medicina · 17 de agosto de 2026