Un modelo, tres funciones: cómo los modelos fundacionales están transformando el proceso de descubrimiento de fármacos
Una revisión de PMC sometida a evaluación por pares muestra que los equipos pequeños de biología computacional ahora pueden ejecutar la identificación de dianas terapéuticas, la generación molecular y la predicción de toxicidad a través de un único flujo de trabajo de inteligencia artificial, una tarea que antes requería grupos especializados por separado.
Imagina una operación de investigación farmacéutica de hace cinco años: un equipo buscando proteínas diana sobre las que actuar farmacológicamente, un segundo generando moléculas candidatas, un tercero realizando pruebas de toxicidad, y un gestor de proyectos cuya descripción de trabajo completa consistía en asegurarse de que esos tres grupos se comunicaran entre sí al menos una vez a la semana. Ahora imagina un pequeño grupo de biología computacional en 2025, ejecutando los tres flujos de trabajo a través de un único pipeline de modelo fundacional antes del almuerzo. Esa compresión no es una fantasía de presentación comercial. Es lo que la revisión sometida a revisión por pares "From Lab to Clinic: How Artificial Intelligence (AI) Is Reshaping Drug Discovery Timelines and Industry Outcomes," publicada en PubMed Central del NIH (PMC12298131), posiciona como la trayectoria actual del descubrimiento de fármacos en etapas tempranas asistido por IA. Para cualquier persona que esté construyendo una carrera en la intersección del aprendizaje automático y la biomedicina, vale la pena detenerse en esto con cuidado, no porque la IA esté haciendo toda la ciencia ahora (no es así), sino porque la lógica organizativa del descubrimiento temprano de fármacos está siendo reescrita, y los conjuntos de habilidades que mejor se adaptan están cambiando con ella.
Lo que los modelos fundacionales realmente hacen en un pipeline de descubrimiento de fármacos
La expresión "modelo fundacional" se usa con tanta frecuencia y de manera tan imprecisa que vale la pena ser exactos. Los modelos fundacionales son redes neuronales de gran escala, preentrenadas, que aprenden representaciones generalizables a partir de fuentes de datos diversas. En el descubrimiento de fármacos específicamente, como detalla Arctoris en su análisis del campo, estos modelos se entrenan con estructuras de moléculas pequeñas, secuencias de proteínas, datos de ensayos biológicos y perfiles ómicos. Una vez entrenados, pueden ajustarse para una variedad de tareas posteriores: identificación de dianas, cribado virtual, diseño molecular de novo y optimización de candidatos. La palabra clave es ajuste fino: no se entrena un nuevo modelo desde cero para cada tarea; se adapta una base representacional compartida. Si eso te suena familiar, tiene sentido: es el mismo movimiento conceptual que hizo que los grandes modelos de lenguaje fueran útiles en tareas de texto muy diferentes (resumen, traducción, generación de código), excepto que ahora el vocabulario son átomos y afinidades de unión en lugar de palabras y sintaxis.
Lo que hace que esta arquitectura sea particularmente interesante para el descubrimiento de fármacos es la naturaleza de las tareas que se unifican. La identificación de dianas pregunta: ¿qué molécula biológica, si se bloquea o activa, abordaría esta enfermedad? La generación molecular pregunta: ¿qué estructura química interactuaría eficazmente con esa diana? La predicción de toxicidad pregunta: ¿dañará este compuesto al paciente antes de ayudarle? Históricamente, estas preguntas requerían distintas modalidades de datos, distintas áreas de experiencia y, a menudo, pilas de software completamente diferentes mantenidas por personas completamente diferentes. Un modelo fundacional entrenado con suficiente amplitud puede desarrollar representaciones relevantes para los tres aspectos, lo que constituye una forma genuinamente diferente de organizar la fase de investigación temprana: menos como una carrera de relevos, y más como un generalista muy bien formado que corre las tres etapas simultáneamente.
La historia de la compresión del flujo de trabajo, respaldada por evidencia
La revisión de PMC (PMC12298131) es la fuente de referencia aquí, y vale la pena explicar por qué: está sometida a revisión por pares, está alojada en el NIH y cubre específicamente la dimensión de aprendizaje automático aplicado en los plazos de descubrimiento de fármacos y los resultados de la industria. Sitúa la IA no como un complemento especulativo, sino como una fuerza estructural activa en cómo se organiza la investigación en etapas tempranas. El enfoque de la revisión coincide con lo publicado por Frontiers in Bioinformatics bajo el título "Artificial intelligence in drug discovery from advanced molecular representation to pipeline applications," que igualmente cubre la IA a lo largo de todo el arco, desde la representación molecular hasta el despliegue a nivel de pipeline. Ambas publicaciones apuntan en la misma dirección: la historia interesante no es que alguna herramienta de IA individual sea más rápida en alguna tarea individual; es que un modelo suficientemente capaz puede servir como tejido conectivo entre tareas que antes estaban compartimentadas.
La plataforma BioNeMo de NVIDIA es una ilustración concreta de esta dirección en la práctica. Según la documentación propia de NVIDIA sobre la plataforma, los últimos modelos fundacionales de BioNeMo pueden analizar secuencias de ADN, predecir cómo una molécula farmacológica modificará la forma de una proteína, y determinar la función de una célula a partir de su ARN, capacidades que abarcan lo que tradicionalmente se considerarían disciplinas experimentales y computacionales separadas. NVIDIA también ha anunciado que los modelos de BioNeMo están disponibles como microservicios a través de NVIDIA NIM, y que los modelos pronto serán accesibles en AWS HealthOmics, descrito por NVIDIA como un servicio diseñado específicamente para ayudar a organizaciones de salud y ciencias de la vida a almacenar, consultar y analizar datos biológicos. La historia de la infraestructura y la historia de los modelos están convergiendo: las APIs accesibles sobre poderosos modelos fundacionales biológicos reducen la barrera para que equipos más pequeños operen con un alcance que antes requería grandes recursos institucionales.
Dónde están los límites (y por qué son importantes para quienes están aprendiendo)
Nada de esto significa que el pipeline esté completamente automatizado o que la experiencia en el dominio sea opcional. Los modelos fundacionales en el descubrimiento de fármacos heredan limitaciones reales de sus datos de entrenamiento. El informe Stanford CRFM "On the Opportunities and Risks of Foundation Models" (Bommasani et al.), que sigue siendo una referencia fundamental sobre la categoría más amplia, analiza cómo los modelos presentan limitaciones ligadas a los datos con los que fueron entrenados, y en contextos de descubrimiento de fármacos, eso incluye la distribución histórica de qué compuestos y dianas se han estudiado realmente. Un modelo que ha visto diez mil variantes de una clase de proteína y cincuenta ejemplos de otra no las tratará de igual manera, independientemente de lo que requiera la biología de la enfermedad. Comprender dónde la confianza de un modelo está bien calibrada frente a dónde está extrapolando es una habilidad genuinamente importante para cualquier persona que despliegue estas herramientas en un entorno de investigación, y no es una habilidad que el modelo te enseña automáticamente.
El artículo de Frontiers in Bioinformatics sobre IA en el descubrimiento de fármacos desde la representación molecular avanzada hasta las aplicaciones en pipeline aborda esto directamente en su alcance: pasar de la representación molecular al despliegue en el pipeline implica decisiones deliberadas sobre curación de datos, selección de modelos y criterios de evaluación que un profesional debe tomar de manera activa. La compresión de los flujos de trabajo de múltiples equipos en un pipeline unificado no elimina la necesidad del juicio científico; reubica dónde debe aplicarse ese juicio. En lugar de tres equipos especializados negociando traspasos, tienes un equipo más pequeño que necesita comprender suficientemente los tres dominios para detectar errores que antes se habrían detectado en el punto de traspaso. Se trata de un perfil de habilidades diferente, no más simple.
Lo que esto significa si estás construyendo una carrera en ML para biotecnología
La implicación práctica para quienes están aprendiendo es que el panorama de contratación de 2025-2026 en biología computacional y quimioinformática está cada vez más moldeado por personas capaces de trabajar en los puntos de intersección. Los especialistas en quimioinformática pura que no pueden razonar sobre arquitecturas de modelos, y los ingenieros de ML puro que no pueden interpretar un resultado de ensayo, son ambos menos útiles que antes, cuando los flujos de trabajo estaban lo suficientemente separados como para mantenerse en carriles separados.
La revisión de PMC (PMC12298131) y la literatura de apoyo sugieren colectivamente que las personas más valiosas en este espacio ahora mismo son las que comprenden suficiente química para verificar razonablemente un resultado de generación molecular, suficiente biología para evaluar un resultado de identificación de dianas, y suficiente ML para depurar un pipeline de ajuste fino cuando se desvía. Eso es mucho pedir, lo cual también explica por qué la brecha es real y la oportunidad es real.
Si eres un estudiante trazando un plan de estudios para este campo, el artículo de Frontiers in Bioinformatics sobre representación molecular y aplicaciones en pipeline es un mapa técnico útil de dónde se encuentran actualmente los métodos. La revisión de PMC es la visión a nivel institucional de hacia dónde se dirige la industria. NVIDIA BioNeMo es una plataforma activa que vale la pena explorar para adquirir familiaridad práctica con el aspecto real de los microservicios de modelos fundacionales para biología en la práctica. Y el informe Stanford CRFM sobre modelos fundacionales sigue siendo una lectura valiosa para comprender el marco conceptual más amplio del cual estas herramientas de descubrimiento de fármacos son un ejemplo.
El campo avanza lo suficientemente rápido como para que leer seis meses de literatura te sitúe por delante de una fracción sorprendentemente grande de personas que ya tienen títulos de trabajo en este campo. Esa brecha se cierra, pero aún no se ha cerrado.