¿Cómo se está usando la IA en medicina?
¿Cómo se está usando la IA en medicina?
Informe semanal — 8 de junio de 2026 · Dr. Juan Camilo Paris
Aviso de recencia (honesto): la búsqueda dirigida a la ventana 25-may → 8-jun-2026 no arrojó desarrollos primarios fechados dentro de ese rango. Lo que sigue es el estado del arte verificado más reciente (ago-2025 a abr-2026), filtrado a fuentes primarias/oficiales. Donde una afirmación no se pudo verificar, se marca.
Método: 5 ángulos · 24 fuentes leídas · 98 afirmaciones extraídas · 25 verificadas de forma adversarial (3 votos c/u) → 23 confirmadas, 2 refutadas → 3 hallazgos sintetizados. IA (Inteligencia Artificial); LLM (Large Language Model, modelo de lenguaje grande); RCT (Randomized Controlled Trial, ensayo clínico aleatorizado).
1. Escribas ambientales de IA: el beneficio depende del producto
Los "escribas ambientales" (ambient AI scribes) que transcriben y redactan la nota clínica son la aplicación con evidencia más sólida, pero el efecto varía mucho según la herramienta:
- RCT stepped-wedge, 66 profesionales (NEJM AI, nov-2025): redujo el agotamiento (burnout) −0.44 (IC95% −0.62 a −0.25; P<0.001), pero no mejoró la realización profesional (+0.14; P=0.04, por debajo del umbral 0.025 del Stanford Professional Fulfillment Index). [1]
- RCT paralelo, 238 médicos (DAX vs Nabla vs control) (NEJM AI): Nabla redujo el tiempo por nota 9.5% (P=0.02); DAX no fue significativo (−1.7%; P=0.66). [2]
- Estudio time-motion, Singapore General Hospital (Note Buddy) (JMIR Medical Informatics 2026;e85580, mar-2026): −15.0% en documentación (P=.04) y +10.6% en contacto visual con el paciente (P=.009). [3]
Lectura clínica: ayudan al bienestar y a la documentación, pero el rango de resultados (de no-significativo a −15%) obliga a evaluar cada producto antes de adoptarlo.
2. Diagnóstico conversacional: iguala al médico en calidad, pierde en aplicabilidad
- AMIE (IA diagnóstica conversacional sobre Gemini 2.5), estudio de viabilidad de un solo brazo en atención primaria (Beth Israel, NCT06911398), 98 casos: incluyó el diagnóstico correcto en el 90% (top-7), 75% (top-3), 56% (top-1). Sin diferencia frente a médicos en calidad (p=0.6), adecuación (p=0.1) ni seguridad (p=1.0); pero los médicos fueron mejores en practicidad (p=0.003) y costo (p=0.004). [4]
- Benchmark Mass General Brigham (JAMA Network Open, abr-2026, 21 LLM): acertaron el diagnóstico final en >90% con información completa, pero todos fallaron el diagnóstico diferencial en >80% de las veces. [5]
Lectura clínica: buenos para sugerir un diagnóstico final con datos completos; débiles en el razonamiento diferencial, que es el corazón del juicio clínico. Soporte, no reemplazo.
3. Seguridad, regulación y oncología
- Alucinación ante datos falsos (Mount Sinai / Communications Medicine–Nature, ago-2025): 6 LLM × 300 viñetas con un dato fabricado → tasa de alucinación 65.9% (rango 50–82.7%; hasta 83% sin salvaguardas). Una advertencia simple en el prompt la baja del 66% al 44% (P<0.001); GPT-4o pasó de 53% a 23%. [6]
- ECRI (21-ene-2026): el mal uso de chatbots (ChatGPT, Claude, Copilot, Gemini, Grok) es el riesgo sanitario nº 1 de 2026. [7]
- FDA y EMA (14-ene-2026): publicaron diez principios de Buenas Prácticas de IA en el desarrollo de medicamentos. [8][9]
- Oncología — mieloma múltiple (Frontiers in AI, dic-2025): el sistema agéntico HopeAI fue el mejor (82.0%) sobre o1-preview (64.7%), Myelo (58.7%), Claude 3.5 Sonnet (50.0%) y Gemini 1.5 Pro (48.0%); pero solo el 25.3% fue utilizable sin modificación. (El 82% es exactitud, no usabilidad.) [10]
Lectura clínica: la IA repite con seguridad la desinformación que recibe; una salvaguarda en el prompt ayuda pero deja ~44% de error residual. La regulación (FDA/EMA) avanza hacia buenas prácticas comunes.
Afirmaciones refutadas (transparencia)
El proceso de verificación descartó dos afirmaciones que circulan pero la fuente no respalda con esa contundencia:
- "El estudio del Mass General Brigham concluye que la IA no puede reemplazar el razonamiento del médico y exige 'humano en el bucle'." → Refutada (1-2): el dato verificable es el fallo del diferencial (>80%); la atribución de "anti-reemplazo" es interpretación, no afirmación del estudio.
- "En despliegues reales la IA médica cae 15-30% frente a su benchmark." → Refutada (1-2): no se sostuvo con la fuente citada.
Vacíos y preguntas abiertas
- ¿Hubo desarrollos primarios fechados entre el 25-may y el 8-jun-2026? Convendría una búsqueda dirigida en PubMed/FDA por ese rango exacto.
- ¿Qué arquitecturas bajan la alucinación por debajo del ~44% residual a niveles clínicamente seguros?
- Limitaciones: predominan estudios de viabilidad o muestra pequeña (AMIE n=100, un brazo; Singapur 9 clínicos; NEJM 66 profesionales). Algunos editores devolvieron HTTP 403; lo verificado se confirmó vía PMC/medRxiv.
Referencias (fuentes primarias/oficiales)
- NEJM AI 2025 — RCT escribas ambientales (burnout). https://ai.nejm.org/doi/abs/10.1056/AIoa2500945
- NEJM AI 2025 — RCT paralelo DAX vs Nabla. https://ai.nejm.org/doi/abs/10.1056/AIoa2501000
- JMIR Medical Informatics 2026;e85580 — Note Buddy, Singapore General Hospital. https://medinform.jmir.org/2026/1/e85580
- arXiv 2603.08448v2 — AMIE, estudio de viabilidad (BIDMC + Google). https://arxiv.org/html/2603.08448v2
- Mass General Brigham — benchmark de razonamiento clínico (JAMA Network Open, abr-2026). https://www.massgeneralbrigham.org/en/about/newsroom/press-releases/ai-chatbot-lacks-clinical-reasoning
- Communications Medicine (Nature) / Mount Sinai, ago-2025 — alucinación ante datos falsos. https://pmc.ncbi.nlm.nih.gov/articles/PMC12318031/
- ECRI, 21-ene-2026 — mal uso de chatbots, riesgo nº 1. https://home.ecri.org/blogs/ecri-news/misuse-of-ai-chatbots-tops-annual-list-of-health-technology-hazards
- FDA — Guiding Principles of Good AI Practice in Drug Development. https://www.fda.gov/about-fda/artificial-intelligence-drug-development/guiding-principles-good-ai-practice-drug-development
- EMA — EMA & FDA set common principles for AI in medicine development. https://www.ema.europa.eu/en/news/ema-fda-set-common-principles-ai-medicine-development-0
- Frontiers in AI, dic-2025 — IA agéntica en mieloma múltiple (HopeAI). https://pmc.ncbi.nlm.nih.gov/articles/PMC12722510/
- OMS/WHO — guía de modelos multimodales grandes en salud. https://www.who.int/publications/i/item/9789240084759
- medRxiv 2025.08.23.25334280 — preprint de seguridad (confirmación). https://www.medrxiv.org/content/10.1101/2025.08.23.25334280.full.pdf
Generado por Dr. Juan Camilo Paris · investigación verificada de forma adversarial.