¿Cómo se está usando la IA en medicina? — Informe semanal
¿Cómo se está usando la IA en medicina? — Informe semanal
Semana: 8–22 de junio de 2026 · Fecha del informe: 22 de junio de 2026
Modo: mixto (médico + web) · Carriles: PubMed (MCP) para estudios + WebSearch para regulación/herramientas
Disciplina de fuentes: se prioriza la fuente primaria (paper, organismo oficial). Lo que solo se sostiene en prensa secundaria queda marcado como tal. Nada se afirma sin cita.
Atribución obligatoria: parte de los estudios se localizaron vía PubMed (National Library of Medicine). Cada estudio lleva su DOI y, cuando aplica, PMID.
Abreviaturas
| Sigla | Término completo |
|---|---|
| IA | Inteligencia artificial |
| LLM | Modelo de lenguaje grande (large language model) |
| ECA | Ensayo clínico aleatorizado |
| FDA | Administración de Alimentos y Medicamentos de EE. UU. (Food and Drug Administration) |
| EMA | Agencia Europea de Medicamentos (European Medicines Agency) |
| EHR | Historia clínica electrónica (electronic health record) |
| HCE | Historia clínica electrónica (equivalente en español) |
| CDS | Soporte a la decisión clínica (clinical decision support) |
| AMA | Asociación Médica Americana (American Medical Association) |
| HAI | Instituto de IA Centrada en lo Humano de Stanford (Human-Centered AI) |
| CVQ | Vista Crítica de Calidad (Critical View of Quality), métrica de calidad quirúrgica |
| UCA | Aplicación de Cultivo de Orina (Urine Culture Application), de BD Kiestra |
| MASAI | Mammography Screening with Artificial Intelligence (ensayo sueco) |
| ARPA-H | Agencia de Proyectos de Investigación Avanzada para la Salud de EE. UU. |
| OMS | Organización Mundial de la Salud |
1. Resumen ejecutivo
- El titular de la semana: un estudio en Nature Medicine (mediados de junio de 2026) encontró que tres LLM de propósito general (GPT-5.2, Gemini 3.1 Pro y Claude Opus 4.6) superaron a dos herramientas de IA clínica especializadas (OpenEvidence y UpToDate Expert AI) en las tres pruebas usadas; las herramientas clínicas no rindieron mejor que el resumen con IA de una búsqueda de Google [1,2].
- En microbiología clínica, una aplicación de IA para leer cultivos de orina (BD Kiestra UCA) mostró 95,9 % de concordancia frente al técnico humano en el umbral de triaje y permitiría auto-clasificar ~30 % de los cultivos; pero comete falsos positivos al identificar el germen, lo que obliga a supervisión humana [3].
- En cirugía, un modelo de visión por computador evaluó de forma automática la calidad de la linfadenectomía en gastrectomía distal sobre vídeo quirúrgico, con precisión media de hasta 91,5 % [4].
- En educación médica, un ECA en medicina reproductiva (50 residentes) mostró que el aprendizaje basado en casos asistido por IA + aula invertida mejoró conocimiento y razonamiento clínico frente a la clase magistral [5].
- En síntesis de evidencia, el marco REFLECTIVE-TIAB optimizó prompts de LLM para el cribado de títulos/resúmenes de revisiones sistemáticas; el precio del modelo no predijo el rendimiento (Gemini 3 Flash fue el mejor y 25× más barato que GPT-5.2) [6].
- Debate de seguridad de la semana: los escribas clínicos ambientales (IA que redacta la nota a partir de la conversación) ya documentan para ~1/3 de los médicos en EE. UU., pero persisten preguntas sin respuesta sobre tasa de alucinación y hallazgos fabricados; la adopción va por delante de la evidencia [7,8].
- Contexto regulatorio (no de esta semana, pero vigente): el recuento acumulado de dispositivos médicos habilitados con IA autorizados por la FDA superó los ~1.451 a cierre de 2025, con radiología como ~77 % del total [9]; en enero de 2026 la FDA relajó parte de su supervisión sobre herramientas de soporte a la decisión clínica [10], y FDA + EMA publicaron diez principios conjuntos de "Buenas Prácticas de IA" en el desarrollo de medicamentos [11].
2. Hallazgos por subpregunta
2.1 ¿Qué dice la evidencia clínica revisada por pares publicada estas dos semanas?
LLM de propósito general vs. herramientas clínicas especializadas (el estudio clave).
Un equipo evaluó dos herramientas de IA clínica —OpenEvidence y UpToDate Expert AI— frente a tres LLM de frontera —GPT-5.2, Gemini 3.1 Pro y Claude Opus 4.6— en tres etapas: 500 preguntas de MedQA (conocimiento médico), 500 ítems de HealthBench (alineación con criterio clínico) y un banco de 100 consultas clínicas reales y desidentificadas hechas por médicos en un entorno clínico en vivo. Los LLM de frontera ganaron en las tres evaluaciones, y las herramientas clínicas no superaron al resumen con IA de Google. El mensaje de los autores: muchas herramientas de IA "clínica" llegan a la práctica con poca validación independiente [1,2]. Confianza: alta (publicado en Nature Medicine, con DOI; ahora bien, son benchmarks, no desenlaces en pacientes).
IA para leer cultivos de orina (microbiología).
Estudio en un laboratorio centralizado: la BD Kiestra Urine Culture Application leyó 1.304 cultivos. Concordancia exacta en cuatro categorías de crecimiento: 86,2 %; con un umbral de triaje (<10⁵ unidades formadoras de colonias/L) la concordancia global fue 95,9 % (concordancia positiva 89,9 %, negativa 98,9 %). En ese dataset, el 30,5 % de los cultivos cumplían el umbral para posible auto-liberación o revisión por lote. Limitación clara: identificación presuntiva del germen con falsos positivos frecuentes (crecimiento azul claro fino mal etiquetado), por lo que sigue siendo imprescindible la validación local y la supervisión humana [3]. Confianza: alta (estudio primario con datos, J Clin Microbiol).
Visión por computador para calidad quirúrgica.
En 260 pacientes con gastrectomía distal (laparoscópica o robótica) con vídeo intraoperatorio completo, se validó la Vista Crítica de Calidad (CVQ) como medida de la calidad de la linfadenectomía y se desarrolló un modelo de visión por computador para puntuarla de forma automática. El CVQ correlacionó con el número de ganglios extraídos (r de Pearson 0,485) y la clasificación automática alcanzó precisión media de hasta 91,5 % [4]. Confianza: alta (estudio primario, Annals of Surgery); retrospectivo y de un solo grupo de centros.
ECA de educación médica asistida por IA.
ECA en el Primer Hospital de la Universidad de Jilin: 50 residentes de ginecología y obstetricia asignados a aprendizaje basado en casos asistido por IA + aula invertida (con pacientes virtuales estandarizados) frente a clase magistral. El grupo con IA obtuvo mejores puntajes teóricos, mejor competencia clínica (Mini-CEX) y mejor examen clínico objetivo estructurado, además de mayor motivación y razonamiento clínico [5]. Confianza: media-alta (ECA, pero muestra pequeña y de un solo centro).
LLM para acelerar revisiones sistemáticas.
El marco REFLECTIVE-TIAB usó un optimizador de prompts por reflexión para el cribado de títulos y resúmenes. Nueve LLM cribaron 8.520 registros; la optimización mejoró la sensibilidad (recall) en todos (+3,7 % a +37,1 %). Gemini 3 Flash Preview rindió mejor (91 % de exactitud, F1 81,6 %) costando 25 veces menos por resumen que GPT-5.2, que quedó entre los peores. Conclusión: el precio del modelo no predijo el rendimiento, y el coste total de optimización fue de 6,36 USD [6]. Confianza: alta (estudio primario con metodología y costes reportados).
2.2 ¿Qué se movió en regulación y políticas (FDA / EMA)?
- Inventario FDA de dispositivos con IA: a cierre de 2025 la FDA contabilizaba ~1.451 dispositivos médicos habilitados con IA autorizados desde que lleva registro; radiología es la categoría dominante (~77 %), y la vía 510(k) concentra ~95–97 % de las autorizaciones [9]. Dato de contexto, no de esta semana.
- Relajación de la supervisión (enero de 2026): la FDA actualizó su guía sobre herramientas de soporte a la decisión clínica, de modo que varias herramientas de IA generativa que sugieren diagnósticos o toman la historia podrían llegar a la clínica sin revisión previa de la FDA [10]. Marca: cambio relevante de política, fuente de divulgación profesional; conviene leer la guía primaria de la FDA antes de citarla como definitiva.
- Principios FDA + EMA (enero de 2026): ambos organismos publicaron diez principios conjuntos de "Buenas Prácticas de IA" para el desarrollo de medicamentos, una de las primeras posiciones regulatorias coordinadas a ambos lados del Atlántico [11]. Contexto, no de esta semana.
- ARPA-H — programa ADVOCATE: la agencia estadounidense prevé seleccionar equipos hacia junio de 2026 para financiar (1) un agente de IA orientado al paciente capaz de ajustar de forma autónoma citas, medicación, dieta y ejercicio, y (2) un agente "supervisor" que vigile la seguridad de los agentes desplegados [12]. Marca: programa anunciado; reportado por prensa especializada.
2.3 ¿Cuáles son los debates de seguridad abiertos?
- Escribas clínicos ambientales: ya redactan documentación para aproximadamente un tercio de los médicos en EE. UU. y se expanden a enfermería. Reportan tasas de error global bajas (~1–3 %), pero con modos de fallo propios —alucinaciones, omisiones críticas, atribución errónea— y en una historia clínica incluso un porcentaje pequeño de error puede tener consecuencias graves. Quedan sin respuesta pública: tasa documentada de alucinación, frecuencia de hallazgos de exploración fabricados y cuántas notas modifica el clínico antes de firmar [7,8]. Un análisis del 19 de junio de 2026 insiste en que la tecnología avanza más rápido que la evidencia que la respalda [7].
- Beneficio operativo medido frente a riesgo: en el lado positivo, un estudio en cinco centros académicos (citado en prensa como publicado en JAMA) atribuyó a los escribas ambientales una reducción de ~13,4 minutos de tiempo total en la historia clínica electrónica y ~16 minutos de tiempo de documentación por encuentro [13]. Marca: no verificado contra el artículo primario en esta corrida; tratar como dato secundario hasta confirmar el DOI.
- Adopción declarada por médicos: según la AMA, más del 80 % de los médicos declara usar IA en su trabajo (el doble que en 2023) y más de tres cuartas partes dice que mejora su capacidad de atender pacientes; las principales preocupaciones siguen siendo la privacidad del paciente y la integridad de la relación médico-paciente [14]. Marca: dato de encuesta de organismo profesional.
2.4 ¿Y en imagen / oncología (contexto reciente fuera de la ventana estricta)?
- Cribado mamográfico con IA (ensayo MASAI): los resultados completos del primer ECA poblacional de IA en un programa nacional de cribado (Suecia, >100.000 mujeres) se publicaron en The Lancet en enero de 2026: el cribado con apoyo de IA logró ~12 % menos de cánceres de intervalo y ~27 % menos de cánceres agresivos, sin aumentar los falsos positivos [15]. Marca: importante pero anterior a la ventana de esta semana; se incluye como referencia de contexto, con su fecha.
3. Conflictos y nivel de confianza
| Afirmación | A favor | Matiz / en contra | Confianza |
|---|---|---|---|
| Los LLM de propósito general baten a las herramientas de IA clínica especializadas | Estudio Nature Medicine en 3 benchmarks [1,2] | Son benchmarks y consultas, no desenlaces clínicos en pacientes reales; resultados dependen de versiones concretas de modelo | Alta (para benchmarks) / Media (para extrapolar a la cabecera del paciente) |
| La IA puede triar con seguridad cultivos de orina con poco/ningún crecimiento | 95,9 % de concordancia en el umbral de triaje [3] | Falsos positivos en identificación de germen; exige validación local y revisión humana | Alta (con supervisión) |
| Los escribas ambientales ahorran tiempo de documentación | Estudio multicéntrico citado (-13,4 min HCE) [13] | Riesgo de alucinación/omisión documentado; falta transparencia de tasas [7,8] | Media (beneficio operativo) / Baja en seguridad sin auditoría |
| La política de la FDA se está relajando para CDS | Guía de enero de 2026 [10] | Fuente de divulgación; conviene leer la guía primaria de la FDA | Media |
4. Vacíos / lo que no se pudo verificar esta semana
- Estudio "JAMA escribas ambientales" [13]: localizado solo vía prensa secundaria; no se confirmó el DOI/artículo primario en esta corrida. Tratar como pista, no como evidencia citable hasta verificar.
- **Día exacto de publicación del estudio de Nature Medicine [1,2]:** las fuentes secundarias dan fechas entre el 12 y el 17 de junio de 2026; el DOI es firme, la fecha exacta queda como aproximada ("mediados de junio").
- Aprobaciones FDA/EMA nuevas y concretas de los últimos 14 días: no se identificó una autorización individual nueva y verificable dentro de la ventana; lo hallado es inventario acumulado y cambios de política previos (enero de 2026). No se infiere ninguna aprobación que no esté documentada.
- Datos de seguridad cuantitativos de escribas ambientales: las propias fuentes señalan que la tasa pública de alucinación/fabricación sigue sin reportarse de forma transparente [7].
5. Referencias
5.1 Científicas (estilo Vancouver)
- Vishwanath K, et al. General-purpose large language models outperform specialized clinical AI tools on medical benchmarks. Nat Med. 2026. doi:10.1038/s41591-026-04431-5. (Fuente: Nature Medicine / vía PubMed.)
- General-purpose chatbots outperform clinical AI tools on physicians' real-world questions [comentario asociado]. Nat Med. 2026. doi:10.1038/s41591-026-04457-9.
- van der Walt P, Naidu P, Avoledo S, Mak C, Starko F. Evaluation of the BD urine culture application for artificial intelligence-assisted urine culture interpretation. J Clin Microbiol. 2026:e0027026. doi:10.1128/jcm.00270-26. PMID: 42324609.
- Kim J, Asselmann D, Wolf T, Kong SH, Park DJ, Lee HJ, et al. Automated Assessment of Surgical Quality in Distal Gastrectomy: Development of a Novel Computer Vision Model Based on the Critical View of Quality (CVQ). Ann Surg. 2026. doi:10.1097/SLA.0000000000007130. PMID: 42319158.
- Wang Q, Hu C, Li Y, Zhang T, Zhang S. AI-assisted case-based learning and flipped classroom to improve clinical decision-making: a randomized controlled trial in reproductive medicine. Med Educ Online. 2026;31(1):2670047. doi:10.1080/10872981.2026.2670047. PMID: 42200362.
- Józwiak Á, Imre A, Hagymásy J, Tittmann J, Nagy Á, Kovács S, et al. REFLECTIVE-TIAB: cost-effective prompt optimization for large language model-based title and abstract screening in literature reviews. Expert Rev Pharmacoecon Outcomes Res. 2026:1-9. doi:10.1080/14737167.2026.2691995. PMID: 42311049.
- Hernández L, et al. Interval cancer, sensitivity, and specificity comparing AI-supported mammography screening with standard double reading without AI in the MASAI study: a randomised, controlled, non-inferiority, single-blinded, population-based, screening-accuracy trial. Lancet. 2026. (Publicado enero de 2026.) doi:10.1016/S0140-6736(25)02464-X.
5.2 Web / regulatorias (tabla con fecha de acceso 22-jun-2026)
| # | Título | Sitio / organismo | Tier | URL | Fecha pub. |
|---|---|---|---|---|---|
| 7 | The ambient AI scribe illusion: Doctors need to pay attention | American Bazaar | 2 (opinión profesional) | https://americanbazaaronline.com/2026/06/19/the-ambient-ai-scribe-illusion-doctors-need-to-pay-attention-483125/ | 19-jun-2026 |
| 8 | Beyond human ears: navigating the uncharted risks of AI scribes in clinical practice | npj Digital Medicine | 1 | https://www.nature.com/articles/s41746-025-01895-6 | 2025 |
| 9 | AI-Enabled Medical Devices (lista oficial) | FDA | 0 | https://www.fda.gov/medical-devices/software-medical-device-samd/artificial-intelligence-enabled-medical-devices | actualizado 2026 |
| 10 | FDA loosens AI oversight: what clinicians need to know about the 2026 guidance | KevinMD | 2 | https://kevinmd.com/2026/01/fda-loosens-ai-oversight-what-clinicians-need-to-know-about-the-2026-guidance.html | ene-2026 |
| 11 | Reflection paper / EMA-FDA principles for Good AI Practice | EMA | 0 | https://www.ema.europa.eu/en/use-artificial-intelligence-ai-medicinal-product-lifecycle-scientific-guideline | ene-2026 |
| 12 | 2026 AI news in healthcare (ARPA-H ADVOCATE) | Crescendo AI (agregador) | 3 (pista) | https://www.crescendo.ai/news/ai-in-healthcare-news | 2026 |
| 13 | JAMA ambient scribe (–13,4 min HCE) — referido por agregador | Crescendo AI / blueBriX | 3 (pista; sin DOI verificado) | https://bluebrix.health/articles/ai-reset-a-new-era-for-healthcare-policy | 2026 |
| 14 | Augmented intelligence in medicine (encuesta de adopción) | American Medical Association | 1 | https://www.ama-assn.org/practice-management/digital-health/augmented-intelligence-medicine | 2026 |
| — | The 2026 AI Index Report — Medicine | Stanford HAI | 1 | https://hai.stanford.edu/ai-index/2026-ai-index-report/medicine | 2026 |
| — | Clinical AI has boomed (State of Clinical AI) | Stanford Medicine | 1 | https://medicine.stanford.edu/news/current-news/standard-news/clinical-ai-has-boomed.html | 2026 |
Generado por Dr. Juan Camilo Paris