LLMs para pronóstico oncológico: cuando la nota clínica vale más que el estadio

La pregunta Cada día generamos cantidades ingentes de texto clínico no estructurado — historias, evolutivos, interconsultas — que rara vez se traduce…

Blog · ppj.es

LLMs para pronóstico oncológico: cuando la nota clínica vale más que el estadio

Publicado el 10 de julio de 2026

La pregunta

Cada día generamos cantidades ingentes de texto clínico no estructurado — historias, evolutivos, interconsultas — que rara vez se traduce en datos cuantitativos para los modelos pronósticos. ¿Podría un LLM extraer información pronóstica útil de esas notas, sin entrenamiento específico, y mejorar lo que ya sabemos por TNM?

El estudio

Kiermeyer y col. recogieron notas clínicas reales (pre-tratamiento) de 2.708 pacientes con NSCLC y 814 con cáncer de colon de un centro oncológico integral. Aplicaron LLMs auto-alojados (self-hosted) para extraer, en zero-shot (sin entrenamiento previo en la tarea), factores pronósticos clave: comorbilidades, localización de metástasis, y descriptores cualitativos del estado del paciente.

Resultados clave

Modelo NSCLC (C-Index) Colon (C-Index)
TNM staging alone 0.64 0.59
TNM + LLM-derived features 0.72 0.70

Datos que impactan:

  • El modelo con features del LLM reclasificó al 61.4% de pacientes con NSCLC y al 68.3% de cáncer de colon en grupos de riesgo distintos al TNM
  • Los factores extraídos por el LLM (como el estado físico general expresado en el lenguaje natural de la nota) modulaban sustancialmente el impacto pronóstico del TNM
  • El modelo con LLM superó también a los modelos basados en text embeddings tradicionales

¿Qué hace el LLM que no haga un análisis manual?

La clave está en la escala: un humano no puede leer 3.500 historias clínicas para extraer variables pronósticas de forma estructurada. El LLM sí. Y lo hace:

  • En zero-shot — sin necesidad de curar un dataset de entrenamiento etiquetado
  • En texto real — no en notas estructuradas idealizadas
  • Auto-alojado — los datos nunca salen del hospital, clave para privacidad y RGPD

Lo fascinante es que capta señales cualitativas que los códigos diagnósticos pierden: «paciente con buen estado general pese a metástasis hepáticas», «ingresos repetidos por infecciones» — matices que cambian el pronóstico individual.

🧐 Lectura crítica

Fortalezas:

  • Muestra grande (3.522 pacientes), dos tipos tumorales
  • Datos reales de práctica clínica, no de ensayos seleccionados
  • Zero-shot → aplicable directamente sin entrenamiento costoso
  • Self-hosted → privacidad garantizada

Limitaciones:

  • Un solo centro (aunque con N grande)
  • Extracción de factores pronósticos: ¿qué factores exactos? Depende de lo que el LLM «vea» en el texto
  • No se reporta si hubo revisión humana de la calidad de la extracción
  • El C-Index mejora, pero no alcanza lo que modelos multimodales (imagen + clínica + genómica) pueden lograr

💡 Por qué importa

Este paper demuestra algo práctico: el texto clínico que ya escribimos contiene información pronóstica infrautilizada. Un LLM self-hosted puede extraerla sin coste adicional de recogida de datos, sin etiquetado manual, y sin comprometer la privacidad.

Aplicaciones directas:

  • Estratificación de riesgo para ensayos clínicos
  • Identificación precoz de pacientes que se desvían de la trayectoria esperada
  • Alimentar modelos de predicción de toxicidad tipo TOXMON con datos de historia clínica

Referencia

Kiermeyer N, Lenfers T, Dada A, Friedrich J, Khattab S, et al. Large language models enable prognostic stratification of cancer patients using real-world clinical notes. PLOS Digit Health. 2026. DOI: 10.1371/journal.pdig.0001546

Aviso: este artículo tiene carácter divulgativo e informativo y refleja la opinión personal del autor. No constituye consejo médico ni sustituye la valoración de un profesional sanitario. Si tienes un problema de salud, consulta con tu médico.