Inicio›Blog›Bioestadística clínica
Un marco de cinco fases para evaluar la IA médica y un estudio con cuatro modelos de lenguaje en 20.277 informes radiológicos de columna.
Dra. Marta María Dolcet Negre·17 de septiembre de 2026·7 min de lectura

Un modelo puede obtener métricas altas y seguir sin estar preparado para un circuito asistencial. Dos trabajos publicados en 2026 en npj Digital Medicine permiten mirar ese desfase desde dos lados. Ye y colaboradores proponen un marco de evaluación en cinco fases para la inteligencia artificial diagnóstica y predictiva. Liu y colaboradores comparan cuatro grandes modelos de lenguaje en el diagnóstico a partir de 20.277 informes radiológicos de columna de tres hospitales docentes de China. Mi propuesta es leerlos juntos: el primero ofrece un mapa y el segundo sirve de ejemplo para practicar cómo se sitúa un estudio en él.
Ye y colaboradores parten de una constatación que comparto: el camino del rendimiento en laboratorio al beneficio clínico demostrable está fragmentado y se define de forma desigual. Las evaluaciones existentes se apoyan sobre todo en pruebas retrospectivas y en métricas centradas en el algoritmo, y las guías actuales ponen el acento en cómo comunicar los resultados más que en qué validación corresponde a cada etapa de madurez del modelo.
Su propuesta ordena cinco fases: validación técnica, validación de la robustez operativa, validación en interacción controlada, validación de la evidencia clínica y validación de la integración en la práctica real. Entre una fase y la siguiente hay criterios de paso, y el marco prevé mecanismos para volver a fases anteriores cuando aparece deriva, cambia la versión del sistema o surgen señales de seguridad.
La primera fase comprueba si un modelo ya cerrado mantiene su rendimiento en datos independientes y heterogéneos, de otras instituciones y otras poblaciones, y su método de referencia es la validación externa retrospectiva en varios centros, que el marco presenta como la primera puerta de entrada al recorrido de evaluación clínica. La segunda ya se juega dentro del flujo de trabajo real del hospital, con los datos tal como llegan. El marco coloca en un mismo recorrido estudios que solemos discutir por separado, desde las pruebas en modo sombra (el sistema funciona en paralelo, sin que su resultado llegue a quien decide) hasta los ensayos aleatorizados, y cada uno responde a una pregunta distinta.
Los autores lo describen como un estudio multicéntrico de cohorte con 20.277 informes radiológicos reales de columna. Conviene precisar la tarea. Los modelos no interpretan imágenes: reciben la parte del informe que describe los hallazgos y, a partir de ese texto, proponen un diagnóstico. Ese diagnóstico se compara con la conclusión que el mismo radiólogo escribió en el informe. Los modelos evaluados fueron GPT-4o, Claude-4, Qwen-3 Max y DeepSeek-V3.1, en nueve combinaciones de técnica de imagen y región anatómica, y con dos formas de entrada: con una lista de opciones y sin ella.
Todos los modelos obtuvieron un rendimiento global alto, con una especificidad superior al 90 % y un valor predictivo negativo superior al 96 %. La sensibilidad se mantuvo estable entre los tres hospitales, con coeficientes de variación de entre el 0,7 % y el 5,0 %. El valor predictivo positivo, en cambio, bajó entre 10 y 14 puntos en uno de ellos, y los autores lo relacionan con las diferencias en la composición del espectro de enfermedades entre hospitales. Los autores señalan dos matices. El primero, que el rendimiento fue desigual según la enfermedad. Con la lista de opciones, en las condiciones frecuentes el valor predictivo positivo (lo que en aprendizaje automático se llama precision) estuvo entre el 70,47 % y el 84,76 %, y la sensibilidad entre el 86,95 % y el 92,53 %. En las condiciones con una prevalencia inferior al 5 %, el valor predictivo positivo bajó entre 19 y 42 puntos porcentuales y la sensibilidad, entre 23 y 29, siempre respecto a las condiciones frecuentes. El segundo matiz, que la forma de entrada y la redacción de la instrucción (el prompt) cambiaron el comportamiento diagnóstico de manera distinta en cada modelo.
Su conclusión es prudente: estos modelos podrían servir como herramienta de apoyo en el diagnóstico basado en informes, pero su despliegue tendría que tener en cuenta la prevalencia de cada enfermedad, la dependencia de la instrucción y la necesidad de ajustarlos al dominio.
Aquí conviene detenerse. El valor predictivo positivo depende de la prevalencia. Con la misma sensibilidad y la misma especificidad, cuanto menos frecuente es una condición, menor es la proporción de verdaderos positivos entre todos los casos que el sistema marca como positivos. Es aritmética del teorema de Bayes. Por la misma razón, y como principio general, un valor predictivo negativo alto es lo esperable siempre que la condición buscada sea poco frecuente en los casos analizados.
Si solo hubiera caído el valor predictivo positivo, habría que preguntarse cuánto de esa caída es efecto de la prevalencia. Pero en este estudio también cae la sensibilidad, y la sensibilidad no se calcula sobre la frecuencia de la enfermedad, sino sobre los casos que la tienen. Una caída de entre 23 y 29 puntos en las condiciones poco frecuentes indica que los modelos reconocen peor esos casos, que encaja con lo que los autores llaman un déficit persistente en esa parte del espectro. Bayes explica una parte de lo que ocurre con los positivos, y así se entiende también lo del tercer hospital, donde bajó el valor predictivo positivo y no la sensibilidad; la otra parte es un rendimiento peor del modelo.
Para quien vaya a usar una herramienta así, las dos cosas suman: en una condición poco frecuente se escaparán más casos y una parte mayor de los positivos serán falsos, algo que las métricas globales no dejan ver.
El patrón de referencia es la conclusión del propio informe, redactada por el radiólogo que lo firmó, y no una relectura independiente de las imágenes por un panel experto. Los autores lo reconocen entre sus limitaciones. En términos estadísticos, lo que se mide es el acuerdo del modelo con el radiólogo que describió el caso, no su acierto frente a la enfermedad real. Si la descripción de los hallazgos es incompleta, el modelo no tiene forma de corregirla.
Tampoco sabemos, por este estudio, si los resultados se trasladan a otros entornos. Que la sensibilidad varíe tan poco entre tres hospitales es una buena señal, pero son hospitales docentes de un mismo país, y los informes estaban escritos en chino, una limitación que los propios autores señalan. Si el modelo se comporta igual con otras plantillas de informe y otra forma de redactar es una pregunta que este trabajo no responde.
Este ejercicio es mío, no de los autores. Por su diseño, el trabajo de Liu y colaboradores corresponde al tipo de estudio de la primera fase del marco: datos independientes de varios centros y una comparación entre instituciones. Pero el marco pide más en esa fase: fijar de antemano la versión del modelo, sus parámetros y sus umbrales, y, en los estudios retrospectivos, un patrón de referencia confirmado por anatomía patológica o por consenso de expertos, separado del diagnóstico clínico inicial. Liu y colaboradores usan como referencia precisamente ese diagnóstico inicial, la conclusión del informe. Además, Ye y colaboradores advierten de que su marco necesita adaptarse a los modelos generativos, así que aplicarlo a modelos de lenguaje ya es, en sí, una extensión. Las pruebas con la forma de entrada y con la redacción de la instrucción las leo como pruebas de robustez. Nada de lo que describen los autores corresponde todavía a las fases de interacción controlada, evidencia clínica o integración en la práctica.
También hay un detalle que conecta con el mecanismo de vuelta atrás del marco. Los propios autores advierten de que no pueden garantizar el mismo rendimiento ante futuras actualizaciones de los modelos hechas sin aviso. Para Ye y colaboradores, cualquier modificación convierte el sistema en un modelo nuevo que hay que volver a evaluar.
De la lectura conjunta saco cuatro criterios para evaluar una herramienta así antes de proponer su uso clínico:
Ninguno frena la adopción de herramientas útiles: aseguran que, cuando una llega a la práctica, se sabe qué se ha demostrado y qué no.
Directora Científica · INSECAB
Doctora e investigadora en Bioestadística y Biotecnología, docente en la Universidad de Salamanca. Dirige el trabajo científico del Instituto.
El equipo científico del Instituto revisa la metodología y el análisis antes de que lleguen a la práctica o a una revista.