Dr. Juan Camilo Paris IA en medicina · informes semanales
← Todos los informes

¿Cómo se está usando la IA en medicina? — Informe semanal

22 de junio de 2026 · 7 estudios citados

¿Cómo se está usando la IA en medicina? — Informe semanal

Semana: 8–22 de junio de 2026 · Fecha del informe: 22 de junio de 2026

Modo: mixto (médico + web) · Carriles: PubMed (MCP) para estudios + WebSearch para regulación/herramientas

Disciplina de fuentes: se prioriza la fuente primaria (paper, organismo oficial). Lo que solo se sostiene en prensa secundaria queda marcado como tal. Nada se afirma sin cita.

Atribución obligatoria: parte de los estudios se localizaron vía PubMed (National Library of Medicine). Cada estudio lleva su DOI y, cuando aplica, PMID.

Abreviaturas

SiglaTérmino completo
IAInteligencia artificial
LLMModelo de lenguaje grande (large language model)
ECAEnsayo clínico aleatorizado
FDAAdministración de Alimentos y Medicamentos de EE. UU. (Food and Drug Administration)
EMAAgencia Europea de Medicamentos (European Medicines Agency)
EHRHistoria clínica electrónica (electronic health record)
HCEHistoria clínica electrónica (equivalente en español)
CDSSoporte a la decisión clínica (clinical decision support)
AMAAsociación Médica Americana (American Medical Association)
HAIInstituto de IA Centrada en lo Humano de Stanford (Human-Centered AI)
CVQVista Crítica de Calidad (Critical View of Quality), métrica de calidad quirúrgica
UCAAplicación de Cultivo de Orina (Urine Culture Application), de BD Kiestra
MASAIMammography Screening with Artificial Intelligence (ensayo sueco)
ARPA-HAgencia de Proyectos de Investigación Avanzada para la Salud de EE. UU.
OMSOrganización Mundial de la Salud

1. Resumen ejecutivo


2. Hallazgos por subpregunta

2.1 ¿Qué dice la evidencia clínica revisada por pares publicada estas dos semanas?

LLM de propósito general vs. herramientas clínicas especializadas (el estudio clave).

Un equipo evaluó dos herramientas de IA clínica —OpenEvidence y UpToDate Expert AI— frente a tres LLM de frontera —GPT-5.2, Gemini 3.1 Pro y Claude Opus 4.6— en tres etapas: 500 preguntas de MedQA (conocimiento médico), 500 ítems de HealthBench (alineación con criterio clínico) y un banco de 100 consultas clínicas reales y desidentificadas hechas por médicos en un entorno clínico en vivo. Los LLM de frontera ganaron en las tres evaluaciones, y las herramientas clínicas no superaron al resumen con IA de Google. El mensaje de los autores: muchas herramientas de IA "clínica" llegan a la práctica con poca validación independiente [1,2]. Confianza: alta (publicado en Nature Medicine, con DOI; ahora bien, son benchmarks, no desenlaces en pacientes).

IA para leer cultivos de orina (microbiología).

Estudio en un laboratorio centralizado: la BD Kiestra Urine Culture Application leyó 1.304 cultivos. Concordancia exacta en cuatro categorías de crecimiento: 86,2 %; con un umbral de triaje (<10⁵ unidades formadoras de colonias/L) la concordancia global fue 95,9 % (concordancia positiva 89,9 %, negativa 98,9 %). En ese dataset, el 30,5 % de los cultivos cumplían el umbral para posible auto-liberación o revisión por lote. Limitación clara: identificación presuntiva del germen con falsos positivos frecuentes (crecimiento azul claro fino mal etiquetado), por lo que sigue siendo imprescindible la validación local y la supervisión humana [3]. Confianza: alta (estudio primario con datos, J Clin Microbiol).

Visión por computador para calidad quirúrgica.

En 260 pacientes con gastrectomía distal (laparoscópica o robótica) con vídeo intraoperatorio completo, se validó la Vista Crítica de Calidad (CVQ) como medida de la calidad de la linfadenectomía y se desarrolló un modelo de visión por computador para puntuarla de forma automática. El CVQ correlacionó con el número de ganglios extraídos (r de Pearson 0,485) y la clasificación automática alcanzó precisión media de hasta 91,5 % [4]. Confianza: alta (estudio primario, Annals of Surgery); retrospectivo y de un solo grupo de centros.

ECA de educación médica asistida por IA.

ECA en el Primer Hospital de la Universidad de Jilin: 50 residentes de ginecología y obstetricia asignados a aprendizaje basado en casos asistido por IA + aula invertida (con pacientes virtuales estandarizados) frente a clase magistral. El grupo con IA obtuvo mejores puntajes teóricos, mejor competencia clínica (Mini-CEX) y mejor examen clínico objetivo estructurado, además de mayor motivación y razonamiento clínico [5]. Confianza: media-alta (ECA, pero muestra pequeña y de un solo centro).

LLM para acelerar revisiones sistemáticas.

El marco REFLECTIVE-TIAB usó un optimizador de prompts por reflexión para el cribado de títulos y resúmenes. Nueve LLM cribaron 8.520 registros; la optimización mejoró la sensibilidad (recall) en todos (+3,7 % a +37,1 %). Gemini 3 Flash Preview rindió mejor (91 % de exactitud, F1 81,6 %) costando 25 veces menos por resumen que GPT-5.2, que quedó entre los peores. Conclusión: el precio del modelo no predijo el rendimiento, y el coste total de optimización fue de 6,36 USD [6]. Confianza: alta (estudio primario con metodología y costes reportados).

2.2 ¿Qué se movió en regulación y políticas (FDA / EMA)?

2.3 ¿Cuáles son los debates de seguridad abiertos?

2.4 ¿Y en imagen / oncología (contexto reciente fuera de la ventana estricta)?


3. Conflictos y nivel de confianza

AfirmaciónA favorMatiz / en contraConfianza
Los LLM de propósito general baten a las herramientas de IA clínica especializadasEstudio Nature Medicine en 3 benchmarks [1,2]Son benchmarks y consultas, no desenlaces clínicos en pacientes reales; resultados dependen de versiones concretas de modeloAlta (para benchmarks) / Media (para extrapolar a la cabecera del paciente)
La IA puede triar con seguridad cultivos de orina con poco/ningún crecimiento95,9 % de concordancia en el umbral de triaje [3]Falsos positivos en identificación de germen; exige validación local y revisión humanaAlta (con supervisión)
Los escribas ambientales ahorran tiempo de documentaciónEstudio multicéntrico citado (-13,4 min HCE) [13]Riesgo de alucinación/omisión documentado; falta transparencia de tasas [7,8]Media (beneficio operativo) / Baja en seguridad sin auditoría
La política de la FDA se está relajando para CDSGuía de enero de 2026 [10]Fuente de divulgación; conviene leer la guía primaria de la FDAMedia

4. Vacíos / lo que no se pudo verificar esta semana


5. Referencias

5.1 Científicas (estilo Vancouver)

  1. Vishwanath K, et al. General-purpose large language models outperform specialized clinical AI tools on medical benchmarks. Nat Med. 2026. doi:10.1038/s41591-026-04431-5. (Fuente: Nature Medicine / vía PubMed.)
  2. General-purpose chatbots outperform clinical AI tools on physicians' real-world questions [comentario asociado]. Nat Med. 2026. doi:10.1038/s41591-026-04457-9.
  3. van der Walt P, Naidu P, Avoledo S, Mak C, Starko F. Evaluation of the BD urine culture application for artificial intelligence-assisted urine culture interpretation. J Clin Microbiol. 2026:e0027026. doi:10.1128/jcm.00270-26. PMID: 42324609.
  4. Kim J, Asselmann D, Wolf T, Kong SH, Park DJ, Lee HJ, et al. Automated Assessment of Surgical Quality in Distal Gastrectomy: Development of a Novel Computer Vision Model Based on the Critical View of Quality (CVQ). Ann Surg. 2026. doi:10.1097/SLA.0000000000007130. PMID: 42319158.
  5. Wang Q, Hu C, Li Y, Zhang T, Zhang S. AI-assisted case-based learning and flipped classroom to improve clinical decision-making: a randomized controlled trial in reproductive medicine. Med Educ Online. 2026;31(1):2670047. doi:10.1080/10872981.2026.2670047. PMID: 42200362.
  6. Józwiak Á, Imre A, Hagymásy J, Tittmann J, Nagy Á, Kovács S, et al. REFLECTIVE-TIAB: cost-effective prompt optimization for large language model-based title and abstract screening in literature reviews. Expert Rev Pharmacoecon Outcomes Res. 2026:1-9. doi:10.1080/14737167.2026.2691995. PMID: 42311049.
  7. Hernández L, et al. Interval cancer, sensitivity, and specificity comparing AI-supported mammography screening with standard double reading without AI in the MASAI study: a randomised, controlled, non-inferiority, single-blinded, population-based, screening-accuracy trial. Lancet. 2026. (Publicado enero de 2026.) doi:10.1016/S0140-6736(25)02464-X.

5.2 Web / regulatorias (tabla con fecha de acceso 22-jun-2026)

#TítuloSitio / organismoTierURLFecha pub.
7The ambient AI scribe illusion: Doctors need to pay attentionAmerican Bazaar2 (opinión profesional)https://americanbazaaronline.com/2026/06/19/the-ambient-ai-scribe-illusion-doctors-need-to-pay-attention-483125/19-jun-2026
8Beyond human ears: navigating the uncharted risks of AI scribes in clinical practicenpj Digital Medicine1https://www.nature.com/articles/s41746-025-01895-62025
9AI-Enabled Medical Devices (lista oficial)FDA0https://www.fda.gov/medical-devices/software-medical-device-samd/artificial-intelligence-enabled-medical-devicesactualizado 2026
10FDA loosens AI oversight: what clinicians need to know about the 2026 guidanceKevinMD2https://kevinmd.com/2026/01/fda-loosens-ai-oversight-what-clinicians-need-to-know-about-the-2026-guidance.htmlene-2026
11Reflection paper / EMA-FDA principles for Good AI PracticeEMA0https://www.ema.europa.eu/en/use-artificial-intelligence-ai-medicinal-product-lifecycle-scientific-guidelineene-2026
122026 AI news in healthcare (ARPA-H ADVOCATE)Crescendo AI (agregador)3 (pista)https://www.crescendo.ai/news/ai-in-healthcare-news2026
13JAMA ambient scribe (–13,4 min HCE) — referido por agregadorCrescendo AI / blueBriX3 (pista; sin DOI verificado)https://bluebrix.health/articles/ai-reset-a-new-era-for-healthcare-policy2026
14Augmented intelligence in medicine (encuesta de adopción)American Medical Association1https://www.ama-assn.org/practice-management/digital-health/augmented-intelligence-medicine2026
The 2026 AI Index Report — MedicineStanford HAI1https://hai.stanford.edu/ai-index/2026-ai-index-report/medicine2026
Clinical AI has boomed (State of Clinical AI)Stanford Medicine1https://medicine.stanford.edu/news/current-news/standard-news/clinical-ai-has-boomed.html2026

Generado por Dr. Juan Camilo Paris