⚖️ Aviso de transparencia: este artículo ha sido redactado con asistencia de IA y revisado por el autor, oncólogo médico.
La pregunta antes de empezar
Una paciente con cáncer de mama recién diagnosticado va a recibir tratamiento neoadyuvante. Antes de la primera infusión surge la pregunta incómoda: ¿responderá? ¿Llegará a una respuesta patológica completa (pCR) — es decir, que en la pieza quirúrgica no quede rastro de tumor — o estaremos meses de quimioterapia para un beneficio incierto?
Saberlo antes de tratar permitiría personalizar el régimen, escalar el tratamiento en subtipos agresivos y desescalar en aquellos casos donde haya más margen de maniobra. El problema es que la pCR solo se confirma en el quirófano, cuando ya es tarde para modificar la estrategia. Por ello, existe un interés creciente en modelos que puedan anticipar este resultado utilizando datos disponibles en la consulta inicial.
Es precisamente lo que aborda este trabajo de Huang et al., publicado en BMC Cancer: un modelo de machine learning interpretable que combina datos clínicos, analíticos y de ecografía (con y sin contraste) para predecir la pCR antes de iniciar la neoadyuvancia.
Qué han hecho
Se trata de un estudio retrospectivo con 309 pacientes consecutivas con cáncer de mama tratadas con terapia neoadyuvante seguida de cirugía. La cohorte se dividió en entrenamiento y test (80/20) mediante un muestreo estratificado por estado de pCR.
El diseño metodológico es robusto:
- Selección de variables: Se utilizó regresión LASSO únicamente en la cohorte de entrenamiento para evitar el “fuga de datos” (data leakage).
- Comparativa de algoritmos: Se evaluaron cinco clasificadores: CatBoost, LightGBM, XGBoost, SVM y CART.
- Evaluación integral: Se analizaron métricas de discriminación (AUC con IC95%, precisión, sensibilidad, especificidad, F1, G-mean), de calibración (Brier score) y de utilidad clínica (curvas de decisión o DCA).
- Interpretabilidad: Se aplicó el método SHAP para identificar qué variables aportan más peso al modelo, evitando que este funcione como una “caja negra”.
Las variables de entrada incluyen los parámetros habituales en la práctica clínica (características clinicopatológicas, índices hematológicos y descriptores de ecografía convencional) y ecografía con contraste (CEUS), una técnica que permite evaluar la vascularización tumoral.
Resultados
La pCR se alcanzó en el 29,8% (92/309) de las pacientes.
La regresión LASSO identificó 8 predictores clave: CEA, estadio clínico T, receptores ER y PR, HER2, Ki-67, halo hiperecoico en ecografía y expansión de rango en CEUS (dos signos de imagen que reflejan la reacción peritumoral y la vascularización).
| Métrica (cohorte test) | CatBoost |
|---|---|
| AUC | 0,8295 (IC95% 0,7166–0,9231) |
| Accuracy | 0,8065 |
| Especificidad | 0,8182 |
| Precisión | 0,6364 |
| Brier score | 0,1595 |
El modelo CatBoost resultó ser el más eficaz de los cinco evaluados: mostró una buena capacidad de discriminación, una calibración aceptable y un beneficio neto favorable en el análisis de curvas de decisión para umbrales de probabilidad clínicamente relevantes.
¿Qué ve la IA?
El análisis SHAP identifica a los principales contribuyentes: estado de HER2, CEA, estadio clínico T y halo hiperecoico.
Que HER2 sea el predictor más potente tiene sentido biológico: con los esquemas actuales de bloqueo dual anti-HER2, los tumores HER2+ alcanzan tasas de pCR muy altas. El CEA y el estadio T reflejan la carga tumoral. El halo hiperecoico es un signo ecográfico de reacción peritumoral que puede correlacionar con el microambiente inflamatorio —y sabemos que la inflamación tumoral condiciona la respuesta a la neoadyuvancia.
Aquí está el valor del enfoque: no es solo un “score” opaco, sino un modelo que devuelve razones comprensibles, alineadas con la biología conocida del tumor.
Por qué importa al clínico
- La pCR es uno de los predictores pronósticos más potentes en subtipos agresivos de mama; anticiparla ayuda a estratificar el riesgo antes de iniciar el tratamiento.
- Utiliza datos rutinarios (analítica, receptores, Ki-67, ecografía) —sin biopsias adicionales ni costes extra invasivos.
- Un modelo interpretable puede informar la discusión en el comité multidisciplinar: la probabilidad de pCR es una pieza más del rompecabezas, no un oráculo.
🧐 Pero con cautela
- Validación solo interna: la cohorte de test es de ~62 pacientes y el IC95% del AUC es amplio (0,72–0,92). Falta validación externa, el estándar de oro para cualquier modelo clínico.
- Diseño retrospectivo y probablemente unicéntrico: la casuística y la técnica de CEUS pueden no ser generalizables a otros centros.
- Heterogeneidad de regímenes neoadyuvantes no controlada: no se especifica qué esquema recibió cada paciente, y esto condiciona drásticamente la pCR.
- La precisión de 0,64 advierte: habrá falsos positivos. Un modelo con estos parámetros no debe usarse para denegar tratamientos, sino para calibrar la conversación clínica.
- La CEUS no es una técnica universal en la práctica diaria; su implementación requiere una curva de aprendizaje específica.
La reflexión
Este trabajo refleja la dirección correcta en IA clínica: uso de datos de rutina, comparación honesta de algoritmos, métricas completas (no solo AUC) e interpretabilidad obligatoria. Lo que falta es el siguiente paso: validación externa multicéntrica y, si supera ese examen, un estudio prospectivo que demuestre que el uso del modelo modifica las decisiones clínicas y mejora los resultados.
Hasta entonces, modelos como este son una excelente herramienta de discusión —no de sustitución— en el comité de mama.
Takeaway: un modelo CatBoost interpretable con variables de rutina (analítica, receptores, Ki-67 y ecografía con contraste) predice la pCR antes del tratamiento neoadyuvante con un AUC de 0,83 —prometedor, pero requiere validación externa antes de integrarse en la práctica clínica habitual.
Referencia
Huang D, Chen Y, Chen W, et al. A predictive model for pathological complete response in neoadjuvant-treated breast cancer: integrating pretreatment clinicopathologic and contrast-enhanced ultrasound characteristics via interpretable machine learning. BMC Cancer. 2026. DOI: 10.1186/s12885-026-16452-x · PMID: 42399808