Estructuras químicas y diagramas moleculares en una pantalla digital con secciones resaltadas en círculos rojos, verdes y azules

Modelos de inteligencia artificial para la química: trazando el panorama en las ciencias de los materiales y de la vida

Resumen ejecutivo

En el panorama de la investigación científica moderna, la inteligencia artificial (IA) ha surgido como una fuerza transformadora, alterando fundamentalmente la forma en que los investigadores conceptualizan, llevan a cabo y validan su trabajo. La convergencia de la potencia computacional, los algoritmos avanzados y los vastos conjuntos de datos ha llevado a la inteligencia artificial de la posibilidad teórica a la necesidad práctica en todas las disciplinas científicas.

Esta revolución aborda varios desafíos de larga data que han limitado el progreso científico: el volumen abrumador de datos generados en campos como la genómica, la medicina y la ciencia de los materiales; el extenso tiempo y los costes de procesos como el descubrimiento de fármacos; y las limitaciones cognitivas en la generación de hipótesis. La inteligencia artificial ofrece vías nuevas y prometedoras para superar estos desafíos y encontrar avances más rápidos en muchas disciplinas científicas.

Por ejemplo, en las ciencias biomédicas, la inteligencia artificial ha revolucionado la predicción de la estructura de las proteínas, acelerado el proceso de descubrimiento de fármacos, y permitido la medicina personalizada. Del mismo modo, en las ciencias de los materiales, la inteligencia artificial está acelerando el descubrimiento de nuevos materiales. Estos avances han allanado el camino para laboratorios autónomos y marcos de diseño inverso, que están cambiando el método científico en sí. La inteligencia artificial también ha avanzado significativamente en la optimización de procesos al permitir el ajuste experimental en tiempo real para mejorar el rendimiento y la eficiencia, al tiempo que reduce los residuos y los costes.

Is your R&D data ready for the future? The CAS Intelligence Hub is a powerful integrated solution that transforms fragmented scientific R&D data into a harmonized, AI-ready knowledge environment.

Realizamos un análisis cuantitativo de la CAS Content CollectionTM, la mayor recopilación de información científica catalogada por expertos, para comprender la implementación y el impacto de estos avances tecnológicos en el descubrimiento científico. Analizamos sistemáticamente más de 310.000 artículos de revistas y patentes de la CAS Content Collection que abarcan los años 2015-2025, empleando técnicas analíticas avanzadas para identificar las publicaciones relacionadas con la inteligencia artificial y sus metodologías, instituciones y dominios de investigación asociados.

Nuestro estudio explora la distribución de los métodos de inteligencia artificial en los campos científicos con análisis profundos de dos dominios críticos: las ciencias biomédicas y la ciencia de los materiales. Estos análisis detallan conceptos dominantes, patrones de coocurrencia de métodos de inteligencia artificial y clases de sustancias notables. Además, investigamos el papel de la inteligencia artificial en la optimización de procesos industriales y aplicaciones emergentes.  

Estos hallazgos proporcionan información esencial sobre el estado actual y la trayectoria de la integración de la inteligencia artificial en la investigación científica, ofreciendo una orientación valiosa para investigadores, instituciones y responsables de políticas a la hora de comprender los patrones de adopción tecnológica, identificar oportunidades de colaboración y tomar decisiones estratégicas informadas sobre futuras inversiones en inteligencia artificial y direcciones de investigación.

El panorama de los modelos de inteligencia artificial en la ciencia  

Para comprender el contexto en el que se seleccionan determinados modelos y su impacto, realizamos un análisis exhaustivo de publicaciones científicas, incluyendo revistas y familias de patentes, que han incorporado métodos basados en inteligencia artificial. La visualización de todo el panorama destaca la creciente integración de estas tecnologías en todas las disciplinas científicas a medida que se desarrollan más modelos y funcionalidades (véase la Figura 1).

Diagram titled "AI methods in science" categorizing techniques like neural networks, NLP, LLMs, and clustering. Includes a legend showing publication volume using colored dots from 1–10 to 1000+.
Figura 1: Panorama de los métodos de inteligencia artificial aplicados en todas las disciplinas científicas. Los datos incluyen publicaciones en revistas y patentes para el período 2015-2025, con datos de 2025 que abarcan de enero a marzo. Fuente: Contenido CAS.

Las ramas principales de esta visualización incluyen:  

Modelos de clasificación, regresión y agrupación

Los modelos de clasificación están diseñados para predecir etiquetas o categorías discretas y son especialmente eficaces en el manejo de datos de alta dimensión y en la obtención de resultados interpretables. Los modelos comunes incluyen los árboles de decisión (DT), un modelo que clasifica los resultados dividiendo los datos de forma recursiva en ramas. El bosque aleatorio (RF) es un conjunto de árboles de decisión que reduce el sobreajuste promediando las predicciones. Otro modelo común, la máquina de vectores de soporte (SVM), encuentra el límite óptimo entre clases, mientras que los K-vecinos más cercanos (KNN) clasifican la clase mayoritaria de los vecinos más cercanos.  

Estos modelos se aplican ampliamente a conjuntos de datos etiquetados (aprendizaje supervisado) con resultados categóricos, como datos de espectroscopia, microscopía u ómicos con clases conocidas. Algunos ejemplos de aplicaciones incluyen la clasificación de tipos de enfermedades a partir de datos de expresión génica o de imágenes, la predicción de clases de materiales y la clasificación de compuestos según su toxicidad o reactividad.

Los modelos de regresión predicen valores numéricos continuos, lo que los hace ideales para la previsión y la optimización. Algunos de los modelos de regresión observados en las publicaciones son la regresión lineal, la regresión logística, la regresión de vectores de soporte (SVR) y la regresión simbólica. Estos modelos son adecuados para datos numéricos procedentes de experimentos, simulaciones o datos de series temporales de sensores o instrumentos. Las aplicaciones incluyen la predicción de niveles de energía, tasas de desintegración o trayectorias de partículas, la estimación de rendimientos de reacción, propiedades moleculares, modelado de temperatura, precipitaciones, predicción de conductividad, dureza y bandas prohibidas.

A diferencia de la clasificación y la regresión, los modelos de agrupación descubren agrupaciones naturales en datos no etiquetados, revelando estructuras ocultas y apoyando el análisis exploratorio (aprendizaje no supervisado). Estos modelos son eficaces para conjuntos de datos de alta dimensión y no etiquetados, como datos de imágenes, espectrales y moleculares. Los datos científicos adecuados para este grupo incluyen, entre otros, la agrupación de genes o muestras en función de perfiles de expresión y el descubrimiento de nuevas familias de materiales a partir de datos estructurales.

Redes neuronales artificiales (ANN)

Las RNA son una clase de modelos de aprendizaje automático (ML) diseñados para aprender patrones complejos a través de capas interconectadas de neuronas artificiales. Son potentes para modelar relaciones intrincadas y no lineales en los datos. Como resultado, constituyen la base del aprendizaje profundo y son el fundamento de la inteligencia artificial moderna, con arquitecturas especializadas como las Redes Neuronales Recurrentes (RNN) para datos secuenciales, la Memoria a Corto y Largo Plazo (LSTM), una RNN mejorada que captura mejor las dependencias a largo plazo, y las Unidades Recurrentes Cerradas (GRU), que son una versión simplificada de las LSTM con menos parámetros.  

Estos modelos son adecuados para datos de secuencias y series temporales, como la expresión génica, las secuencias proteicas, las señales fisiológicas, los datos climáticos, la física de partículas y los datos de redes de sensores. A menudo mejoran la alineación imagen-texto aprovechando los mapas de conocimiento —representaciones estructuradas de conceptos específicos de un dominio y sus relaciones—, lo que ayuda a cerrar la brecha semántica entre los datos visuales (como las imágenes médicas) y las descripciones textuales (como las notas clínicas o los informes de diagnóstico). Su adopción ha aumentado considerablemente en áreas como el descubrimiento y desarrollo de fármacos, la medicina de precisión, la imagenología médica, el descubrimiento y diseño de materiales, el almacenamiento de energía, la fabricación y el control de calidad.

Métodos hibridados

La comparación entre las RNA y los modelos de ML convencionales, como la clasificación, la regresión y la agrupación, no consiste simplemente en determinar cuál es mejor, sino en comprender sus funciones complementarias. Las RNA predominan cuando los datos son complejos y no estructurados, cuando existen grandes conjuntos de datos de entrenamiento y cuando se requiere el aprendizaje de representaciones. Por el contrario, el ML convencional sigue siendo sólido cuando los datos son escasos, los problemas de investigación requieren una interpretación estricta y las entradas poseen relaciones estadísticas bien comprendidas y requieren una cuantificación de la incertidumbre.

Modelos específicos de dominio

Aunque los modelos específicos de dominio tienen menos publicaciones, incluyen trabajos innovadores como AlphaFold, un enfoque de aprendizaje profundo que logró una precisión casi experimental en la predicción de la estructura de las proteínas. ESMFold es otro modelo interesante que aprovecha directamente el modelado del lenguaje de las proteínas para generar predicciones estructurales de alta calidad directamente a partir de secuencias proteicas individuales.

Procesamiento del lenguaje natural (PLN)

El PLN se utiliza para analizar, comprender, interpretar y generar lenguaje humano. Implica tareas como la tokenización (descomponer el texto en unidades más pequeñas llamadas tokens, normalmente palabras o subpalabras) que pueden ser procesadas por algoritmos. Un método común para representar texto es el modelo de Bolsa de Palabras (BoW), que convierte el texto en vectores numéricos basados en la frecuencia de las palabras, ignorando la gramática y el orden de las mismas. Otra técnica clave es el Reconocimiento de Entidades Nombradas (NER), que identifica y clasifica entidades como nombres de personas, organizaciones y ubicaciones dentro del texto.

Existen amplias aplicaciones de los modelos de PLN en la minería de textos biomédicos y la extracción de conocimiento, que van desde modelos lingüísticos especializados preentrenados en bibliografía biomédica (es decir, BioBERT, BioGPT) y el análisis de registros médicos electrónicos (EHR) hasta la extracción automatizada de características de enfermedades a partir de registros clínicos y la creación de nuevos candidatos a fármacos mediante modelos lingüísticos. En ciencia de materiales y química, el PLN se ha utilizado para la extracción de protocolos de síntesis, la predicción de propiedades de materiales, la construcción de bases de conocimiento y el diseño inverso.  

Modelos de lenguaje extensos (LLM)

Esta clase transformadora de sistemas de inteligencia artificial ha revolucionado el PLN y ha encontrado amplias aplicaciones en todos los dominios científicos. Los LLM son sistemas basados en redes neuronales que se entrenan con grandes cantidades de datos de texto para aprender patrones estadísticos del lenguaje. Se utilizan en la extracción de información, el resumen, la construcción de grafos de conocimiento, la integración entre dominios y las aplicaciones generativas.

Los LLM ampliamente adoptados incluyen el Transformador Generativo Preentrenado (GPT), que impulsa ChatGPT y GPT-3.5 y GPT-4. Las Representaciones de Codificador Bidireccional de Transformadores (BERT) siguen siendo un modelo de lenguaje de primer nivel, manteniendo un fuerte interés académico debido a su comprensión contextual bidireccional y su rendimiento superior en la respuesta a preguntas y el análisis de sentimientos.  

BLOOM, un modelo multilingüe, ha surgido como un contribuyente significativo al panorama de la investigación. Nuevos modelos como GEMINI, desarrollado por Google DeepMind, y LLAMA, de Meta AI, también se están volviendo populares, al igual que Claude, desarrollado por Anthropic. La última generación de modelos Gemma, Falcon, Mistral, Qwen y DeepSeek, lanzados entre 2023 y 2025, muestran una gran promesa para futuros desarrollos.

Varios LLM especializados en química, ciencias de la vida y ciencia de materiales también están teniendo un impacto, como chemLLM, PharmaGPT y MatSciBERT.

Las tendencias de publicación muestran el impacto de la inteligencia artificial en la ciencia

Como se ha señalado, analizamos 310.000 documentos en la Contenido CAS relacionados con la inteligencia artificial en la investigación científica durante el período 2015-2025. Observamos un crecimiento constante durante todo el período, con un crecimiento destacado en los últimos cinco años (véase la Figura 2). El creciente número de familias de patentes sugiere además que la inteligencia artificial está evolucionando de una tecnología emergente a una herramienta de investigación esencial en diversas industrias.

Bar graph titled "Figure 2" showing journal articles (blue) and patent families (yellow) from 2015–2025. Both increase over time, peaking in 2025; data for 2025 is for January through March.
Figura 2: Tendencias anuales de artículos de revistas y familias de patentes. Los datos incluyen publicaciones para el período 2015-2025, con los datos de 2025 que abarcan de enero a marzo. Fuente: Contenido CAS.

  • Distribución por país/región y organización: China lidera en volumen de publicaciones (revistas y patentes), mientras que EE. UU., India, Corea del Sur y Japón también muestran un crecimiento constante en las publicaciones (véase la Figura 3). En general, los datos subrayan el surgimiento de Asia como el nuevo epicentro de la innovación científica global en inteligencia artificial, con los países occidentales ahora rezagados en términos de producción cuantitativa.
Bar chart titled "Figure 3" comparing journal articles (blue) and patent families (yellow) across seven countries. China leads in both, followed by the U.S.; others show lower publication counts.
Figura 3: Países/regiones líderes por volumen de publicaciones relacionadas con la inteligencia artificial.
  • Distribución en familias de patentes: Analizamos además las tendencias de publicación de revistas y patentes de los cinco principales países. China e India contribuyen conjuntamente a más del 75% de las patentes globales en este campo; las 15 principales instituciones en términos de solicitudes de patentes son de China e India. Las universidades chinas dominan en términos de volumen de publicación en revistas, con un recuento de citas promedio para la mayoría de ellas que oscila entre 10 y 20. Por el contrario, el MIT y Stanford cuentan con recuentos de citas promedio significativamente más altos, de 32 y 66, respectivamente. Esto sugiere que, aunque China sobresale en cantidad, las universidades estadounidenses lideran en términos de calidad e impacto de sus artículos de revistas en el campo de la inteligencia artificial.
  • Distribución en publicaciones particulares: Analizamos el volumen de publicación y el impacto de las citas de las principales revistas científicas que publican investigaciones basadas en inteligencia artificial. El volumen de publicación está dominado por Scientific Reports, Applied Sciences, y PLoS One. Sin embargo, al considerar el promedio de citas por artículo, Proceedings of the National Academy of Sciences (PNAS) destaca, demostrando una influencia excepcional con casi 50 citas por publicación, a pesar de tener un volumen de publicación relativamente modesto. Otras revistas como el Journal of Chemical Information and Modelling (JCIM), Bioinformatics, y Nature Communications también muestran un promedio de citas notable, superando significativamente a las revistas con un gran volumen. Este patrón sugiere que, si bien las revistas de amplio alcance como Scientific Reports publican la mayor parte de la investigación relacionada con la inteligencia artificial, las revistas especializadas o prestigiosas como PNAS, JCIM, y Nature Communications publican trabajos más influyentes que generan un mayor impacto científico.  
  • Tendencias por campo científico: Numerosos campos se han visto muy afectados por la inteligencia artificial, pero varios destacan por un crecimiento exponencial en las publicaciones (véase la Figura 4):
Figura 4: Tendencias de publicación por disciplina entre 2015 y 2024 para (A) artículos de revista y (B) familias de patentes. Fuente: CAS Content Collection.

Entre todas las disciplinas, la química industrial e ingeniería química demuestra el crecimiento más espectacular en publicaciones de revistas, con una trayectoria que alcanza aproximadamente el 8% del total de documentos para 2024. Este crecimiento excepcional refleja probablemente las amplias aplicaciones del campo en la fabricación, la optimización de procesos y la innovación industrial, así como su papel fundamental en el desarrollo de procesos industriales sostenibles y soluciones de química verde.  

La química analítica emerge como el segundo campo de más rápido crecimiento en términos de publicaciones de revistas, con la línea azul oscuro mostrando un crecimiento sólido durante todo el período a partir de 2019. Este fuerte patrón de crecimiento muestra la importancia fundamental del campo en todas las áreas de la química y su papel en el desarrollo de nuevas técnicas de medición, instrumentación y métodos analíticos que apoyan la investigación en múltiples disciplinas.

La tecnología energética y la química medioambiental demuestran un crecimiento sólido, ocupando conjuntamente el tercer lugar entre los campos de más rápido crecimiento junto con la bioquímica. Esto refleja el enfoque global urgente en el cambio climático, los desafíos de la sostenibilidad medioambiental y los eventos emergentes.

Las disciplinas restantes, que incluyen la química física, la farmacología, la toxicología y los productos farmacéuticos, la química orgánica, la química inorgánica, los productos naturales y los polímeros sintéticos, demuestran aumentos modestos pero constantes en el volumen de publicaciones. Estos campos representan áreas maduras de investigación científica donde los principios fundamentales están bien establecidos, aunque la investigación continua produce avances y refinamientos incrementales.

Los datos de las familias de patentes presentan un panorama sorprendentemente diferente en comparación con las publicaciones de revistas, con patrones de innovación muy variados y concentrados en lugar del crecimiento uniforme observado en la producción académica. Este contraste destaca la diferencia fundamental entre la productividad de la investigación académica y la innovación comercialmente viable, donde las fuerzas del mercado, las aplicaciones prácticas y los incentivos económicos desempeñan papeles decisivos a la hora de determinar qué avances científicos se traducen en propiedad intelectual patentable.

Entre las patentes, la bioquímica muestra un crecimiento casi exponencial, alcanzando aproximadamente el 8% para 2024 y eclipsando por completo a todas las demás disciplinas. El panorama de las patentes de bioquímica está dominado por métodos biomédicos y moldeado por innovaciones que fusionan la ciencia molecular con tecnologías sanitarias avanzadas. Los dominios clave incluyen la detección de enfermedades, la imagen médica, la monitorización mediante dispositivos portátiles y el apoyo a la toma de decisiones clínicas, todo ello aprovechando los marcadores bioquímicos. La bioquímica también impulsa el progreso en interfaces neurológicas, genómica, descubrimiento de biomarcadores, procesamiento de señales, guía quirúrgica y fabricación biomédica, destacando su papel central en la innovación biomédica moderna. Esta espectacular actividad de patentes refleja el intenso interés comercial y la inversión en la investigación de las ciencias de la vida en general, impulsada aún más en respuesta a la pandemia de COVID, donde la investigación comercial recibió una financiación significativa.

Basándonos en nuestro análisis, descubrimos que la mayoría de las publicaciones relacionadas con la inteligencia artificial están vinculadas a la investigación biomédica y a la ciencia de los materiales. Por lo tanto, llevamos a cabo un análisis en profundidad de estas áreas de investigación clave, ya que estos campos dominan el conjunto de datos, exhiben una rápida adopción de la inteligencia artificial con tasas de crecimiento anual notables y producen mayores impactos de citación, lo que indica su relevancia científica.

Aplicaciones de los modelos de inteligencia artificial en la investigación biomédica

Descripción general

La investigación biomédica se ha enfrentado a desafíos continuos en cuanto a complejidad y costes que la inteligencia artificial puede abordar ahora. Por ejemplo, la decodificación de estructuras e interacciones proteicas complejas, los altos costes y tasas de fracaso asociados al desarrollo de fármacos, y las complejidades de la comprensión de los mecanismos de enfermedades multifactoriales se prestan a enfoques basados en la inteligencia artificial.  

Data integrity for AI-powered scientific research. AI’s capacity for data and its computational speed surpass what humans are capable of and the technology will continue to redefine what is possible. But data integrity and harmonization are critical components of any successful application of AI in science.

La razón de ser de este análisis fue garantizar un muestreo representativo de las áreas de investigación más significativas mediante el uso de la frecuencia de documentos como métrica objetiva para identificar conceptos clave. Específicamente, identificamos conceptos que han generado un interés científico y una inversión en investigación sustanciales utilizando varios métodos de inteligencia artificial/aprendizaje automático dentro del campo biomédico (véase la Figura 5).

Each category lists specific items and is color-coded to show frequency from blue for low to red for high.
Figura 5: Panorama conceptual de las publicaciones de investigación biomédica impulsadas por la inteligencia artificial de 2015 a 2025, organizado en cinco dominios distintos: bioquímica, modelado y diseño de fármacos, diagnóstico, enfermedades y terapia. Cada dominio abarca 15 conceptos representativos, empleando una codificación de color desde el rojo (más alto) hasta el azul (más bajo) que indica la frecuencia de los documentos. Fuente: CAS Content Collection.

En el dominio de la bioquímica, las secuencias y estructuras proteicas, los genes y la expresión génica, así como el ADN y la genómica, han surgido como los conceptos más estudiados, utilizando diversos enfoques de inteligencia artificial. Los modelos de aprendizaje automático prosperan en estas áreas debido a la abundancia y estandarización de los datos, especialmente en sistemas complejos como las jerarquías proteicas y las redes de regulación génica. El aprendizaje automático sobresale en tareas como el mapeo de secuencia-función, la clasificación de familias de proteínas, la predicción de dominios, el análisis de estructura-función, la selección de características tumorales, la predicción de interacciones génicas en el cáncer y la agrupación de genes por patrones de expresión en oncología, aprovechando datos de expresión de alta dimensión con miles de genes medidos simultáneamente, relaciones no lineales complejas entre genes y fenotipos, y la organización jerárquica de las redes reguladoras genéticas.

Modelos avanzados de aprendizaje automático como AlphaFold y BERT se utilizan para la predicción de estructuras proteicas mediante el aprendizaje a partir de secuencias de aminoácidos y patrones evolutivos para predecir el plegamiento 3D y los dominios funcionales. Estos modelos manejan eficazmente relaciones espaciales complejas y entradas secuenciales con dependencias de largo alcance.

En el dominio del modelado y diseño de fármacos, el modelado QSAR domina este campo. Utiliza métodos de aprendizaje automático para extraer descriptores moleculares (es decir, propiedades fisicoquímicas, huellas dactilares) de estructuras químicas para predecir actividades biológicas y puntos finales de toxicidad mediante enfoques de aprendizaje supervisado. Estos métodos destacan con descriptores moleculares ricos en características, relaciones estructura-actividad y puntos finales cuantitativos adecuados para tareas de regresión.

El acoplamiento molecular, el segundo concepto más frecuente, utiliza enfoques de aprendizaje profundo (CNN y GNN) en datos estructurales 3D y grafos moleculares para predecir las poses y afinidades de unión proteína-ligando, aprovechando las conformaciones espaciales, los paisajes energéticos y las interacciones moleculares. La farmacocinética sigue como la siguiente área de enfoque, utilizando el aprendizaje automático para aprender de descriptores moleculares, parámetros fisiológicos y datos de series temporales para predecir ADMET (Absorción, Distribución, Metabolismo, Excreción, Toxicidad) y las tasas de eliminación de fármacos.

Biomarcadores dominan el ámbito del diagnóstico donde los métodos de aprendizaje automático analizan datos genómicos, proteómicos y metabolómicos de alta dimensión para identificar firmas moleculares discriminatorias que distinguen los estados patológicos de los controles sanos mediante la selección de características y la clasificación. Los métodos de inteligencia artificial también se utilizan en la investigación pronóstica para analizar los datos clínicos y el historial de tratamiento de los pacientes con el fin de predecir los tiempos de supervivencia y la progresión de la enfermedad mediante técnicas de análisis de supervivencia.  

La imagenología médica contiene datos de radiografías, tomografías computarizadas, resonancias magnéticas e información espacial estructurada que resulta ideal para los métodos de aprendizaje profundo. Las redes neuronales convolucionales (CNN) se utilizan ampliamente para analizar imágenes radiológicas con el fin de detectar tumores, identificar fracturas, clasificar enfermedades y determinar afecciones patológicas mediante el reconocimiento automatizado de patrones. La imagenología también puede beneficiarse de la capacidad del aprendizaje profundo para extraer características multiescala y realizar tareas de segmentación, particularmente en el diagnóstico del cáncer donde ayuda en la detección de tumores, su clasificación, la evaluación de la malignidad y la predicción de riesgos.

En el ámbito de las enfermedades, la investigación sobre el cáncer ha recibido la mayor atención, aplicándose diversos modelos de aprendizaje automático en función de los tipos de datos. Los datos genómicos y transcriptómicos se suelen analizar utilizando modelos de bosques aleatorios (RF) y máquinas de vectores de soporte (SVM) para la clasificación de subtipos de cáncer y la predicción de tratamientos. Estas tareas se benefician de la integración de datos multiómicos, que capturan diversas capas moleculares, y del modelado de la complejidad de los microentornos tumorales heterogéneos.

Se utilizan diversos algoritmos en la investigación de la diabetes para predecir las complicaciones diabéticas y optimizar los protocolos de tratamiento aprovechando los datos de seguimiento longitudinal, las interacciones complejas entre los factores del estilo de vida y la genética, y los problemas de predicción de series temporales para los niveles de glucosa. En Enfermedad de Alzheimer, los modelos RF y SVM se utilizan ampliamente para la predicción temprana mediante el análisis de puntuaciones de pruebas neuropsicológicas, niveles de biomarcadores (beta-amiloide, proteínas tau) y datos demográficos para clasificar a los pacientes en categorías de salud o deterioro cognitivo leve.

En el ámbito de la terapia, los agentes antitumorales recibieron la mayor atención investigadora, empleando métodos de inteligencia artificial para el cribado de fármacos y la predicción de actividad mediante el análisis de descriptores moleculares y propiedades químicas para identificar compuestos con potencial actividad anticancerígena. En quimioterapia, estos métodos predicen las respuestas al tratamiento y la toxicidad mediante el análisis de datos clínicos de los pacientes, perfiles genéticos y características tumorales para personalizar la selección de fármacos y los protocolos de dosificación. De manera similar, estos modelos apoyan la inmunoterapia mediante el análisis de perfiles inmunitarios de los pacientes, la carga mutacional tumoral y las expresiones de biomarcadores para predecir la respuesta y optimizar los resultados terapéuticos, abordando la complejidad de las interacciones inmunitarias y las dinámicas temporales.  

Coocurrencias de modelos de inteligencia artificial y conceptos biomédicos

Nuestro análisis explora los patrones de coocurrencia entre conceptos biomédicos y diversos métodos de inteligencia artificial/aprendizaje automático, dilucidando sus aplicaciones estratégicas en los cinco dominios (ver Figura 6).

Sankey diagram titled "Figure 6A" showing how machine learning methods (e.g., SVM, Random Forest) are applied across biomedical fields like biochemistry, drug design, diagnosis, disease, and therapy, with flow widths indicating usage frequency.

Sankey diagram titled "Figure 6B" linking machine learning methods (e.g., Random Forest, SVM) to biomedical applications in biochemistry, drug design, diagnosis, disease, and therapy, with flow widths indicating usage frequency.
Figura 6 A y B: Diagrama de Sankey que ilustra la coocurrencia de métodos de inteligencia artificial y conceptos biomédicos de (A) 2015-2019 y (B) 2020-2024. Fuente: Contenido CAS.

Bosque aleatorio (RF) ha surgido como el método de inteligencia artificial dominante en la investigación biomédica, mostrando un crecimiento notable y superando a la máquina de vectores de soporte (SVM) entre ambos periodos. RF muestra una fuerte coocurrencia con conceptos en todos los dominios de las ciencias biomédicas, particularmente en bioquímica, diagnóstico e investigación relacionada con enfermedades. RF se utiliza para la predicción y clasificación de la función proteica mediante el análisis de la composición de aminoácidos, motivos de secuencia y propiedades fisicoquímicas para clasificar proteínas en familias funcionales. En el descubrimiento de biomarcadores, RF se utiliza para analizar datos genómicos, proteómicos y metabolómicos de alta dimensión.

Máquina de vectores de soporte (SVM) aunque creció de manera constante entre los periodos, mantiene una presencia significativa con proteínas, expresión génica, ADN y genómica, biomarcadores, pronóstico, imágenes médicas e investigación sobre el cáncer. En los estudios de proteínas, SVM se utiliza para la clasificación y anotación funcional de proteínas mediante el análisis de secuencias de aminoácidos, características estructurales y propiedades fisicoquímicas. También predice la localización subcelular e identifica clases de enzimas utilizando el mapeo de espacios de características de alta dimensión basado en núcleos.  

En la expresión génica, SVM identifica genes involucrados en procesos bioquímicos específicos, clasifica rutas metabólicas y predice genes que codifican enzimas basándose en sus patrones de expresión a través de diferentes condiciones bioquímicas y estados celulares. Para la clasificación de variantes genómicas, SVM procesa características y anotaciones de secuencias de ADN para distinguir mutaciones patogénicas de benignas e identificar regiones genómicas asociadas a enfermedades mediante el análisis de características de alta dimensión de patrones de nucleótidos y contexto genómico.  

En la investigación de biomarcadores, SVM apoya la identificación, clasificación y validación mediante la integración de múltiples biomarcadores en modelos predictivos para el diagnóstico, la respuesta al tratamiento, la evaluación del riesgo de progresión de la enfermedad y la estratificación de pacientes para enfoques de medicina personalizada. SVM se utiliza en la investigación del cáncer para distinguir entre tejidos cancerosos y normales, clasificar tipos de cáncer e identificar subtipos moleculares dentro de cánceres específicos. También se utiliza para el pronóstico del cáncer y la predicción del tratamiento mediante la integración de parámetros clínicos, perfiles de biomarcadores y características genómicas para predecir los resultados de supervivencia del paciente, las respuestas al tratamiento, los patrones de resistencia a los fármacos y el riesgo de recurrencia. La figura 6B revela que SVM mantuvo su fortaleza en el modelado QSAR y SAR, mientras que sus conexiones con el análisis de proteínas se debilitaron en relación con RF en el periodo posterior.

Regresión logística (LR) es un método estadístico interpretable y ampliamente utilizado en la investigación biomédica, que a menudo coocurre con conceptos clave como proteínas, expresión génica, biomarcadores, pronóstico, imágenes médicas, cáncer y COVID-19. En la predicción de la función proteica, LR analiza la composición de aminoácidos, las características de la secuencia y las propiedades estructurales para clasificar las proteínas en categorías funcionales o estructurales. La ventaja clave del modelo es que proporciona coeficientes interpretables que indican la contribución relativa de cada característica a la decisión de clasificación, lo que permite a los investigadores identificar qué propiedades de los aminoácidos o características estructurales influyen con mayor fuerza en las predicciones.  

Esta interpretabilidad es igualmente valiosa en la clasificación de la expresión génica, donde LR ayuda a identificar genes expresados diferencialmente. Para la validación de biomarcadores y el diagnóstico, los modelos LR predicen resultados binarios, como enfermedad/salud o respondedor/no respondedor, y proporcionan razones de momios (odds ratios) clínicamente significativas para la toma de decisiones diagnósticas. En el modelado pronóstico, LR utiliza una predicción de resultados binarios similar, evaluando parámetros clínicos, perfiles de biomarcadores y datos demográficos de los pacientes para pronosticar resultados como mortalidad/supervivencia, recurrencia/remisión de la enfermedad y pronóstico favorable/desfavorable.

LR se utiliza en el diagnóstico, la predicción de la gravedad y la mortalidad por COVID-19 mediante la integración de comorbilidades, signos vitales y biomarcadores, lo que respalda la estratificación del riesgo y la toma de decisiones clínicas. Estas diversas aplicaciones subrayan la fuerte alineación de LR con los temas centrales de la investigación biomédica, convirtiéndola en una herramienta fundamental para el modelado interpretable y clínicamente relevante. La figura 6B ilustra la mayor adaptabilidad de la regresión logística, probablemente debido a la capacidad para la clasificación multiclase y los resultados basados en probabilidades, a diferencia de la regresión lineal, que se limita a predicciones continuas.  

Como se observa en la figura 6B, el periodo 2020-2024 fue testigo del surgimiento de enfoques especializados de aprendizaje profundo apenas presentes anteriormente, tales como AlphaFold. Este periodo también vio un aumento en el uso de redes neuronales gráficas (GNN) para el modelado de interacciones moleculares, redes generativas antagónicas (GAN) para la generación de datos sintéticos y Reconocimiento de patrones para aplicaciones de imagen y desafíos diagnósticos.  

Otro cambio importante en los últimos años es la integración de técnicas de PNL en la investigación biomédica, destacada por el auge de modelos como BERT para la minería de informes clínicos y el análisis de textos biomédicos. Esta especialización refleja la maduración del campo más allá de la aplicación de métodos de inteligencia artificial genéricos hacia el desarrollo de enfoques adaptados a desafíos biomédicos específicos.

Las prioridades de investigación cambiaron sustancialmente entre ambos periodos. El análisis de secuencias y estructuras de proteínas y el análisis de la expresión génica crecieron significativamente en 2020-2024 (figura 6B). El descubrimiento de biomarcadores y las aplicaciones de imagen también experimentaron un crecimiento espectacular, mientras que la investigación específica sobre enfermedades se expandió considerablemente, con el COVID-19 emergiendo como un foco principal y la investigación sobre el cáncer diversificándose en múltiples subtipos.  

Sustancias en la investigación biomédica

Esta comparación proporciona una perspectiva estratégica sobre oportunidades terapéuticas poco exploradas y destaca clases de sustancias que podrían beneficiarse de una mayor inversión en investigación o de enfoques innovadores para cerrar la brecha entre el descubrimiento científico y la aplicación clínica (ver Figura 7). Tenga en cuenta que "clases de sustancias" se refiere a categorías de sustancias indexadas por CAS con aplicaciones terapéuticas potenciales reconocidas.  

Figure 7 shows two stacked bar graphs (A and B) compare journal articles and patent families from 2015–2024 across categories like small molecules, polymers, proteins, and alloys. Each category is color-coded in the bars.
La Figura 7 muestra dos gráficos de barras apiladas (A y B) que comparan artículos de revistas y familias de patentes de 2015 a 2024 en categorías como moléculas pequeñas, polímeros, proteínas y aleaciones. Cada categoría está codificada por colores en las barras.

Fármacos de moléculas pequeñas continúan dominando la investigación y el desarrollo farmacéutico, con tecnologías de inteligencia artificial acelerando su descubrimiento. El cribado virtual basado en aprendizaje automático (ML), modelado QSAR para la predicción farmacocinética y los sistemas de aprendizaje profundo que optimizan las rutas sintéticas son ahora parte integral de este proceso. Estas innovaciones se basan en las ventajas inherentes de las moléculas pequeñas, incluidas las rutas de síntesis establecidas, una farmacocinética bien caracterizada, la biodisponibilidad oral y una fabricación rentable.

Terapias de proteínas/péptidos constituyen la segunda categoría más investigada. Herramientas como AlphaFold han revolucionado la predicción de la estructura de las proteínas, permitiendo el diseño y la optimización de proteínas terapéuticas como la insulina para la diabetes, el activador tisular del plasminógeno para accidentes cerebrovasculares y anticuerpos monoclonales para el cáncer y enfermedades autoinmunes. Los modelos de aprendizaje automático mejoran aún más este campo al predecir las interacciones proteína-proteína y optimizar la estabilidad de los péptidos.  

Compuestos con sales se benefician de algoritmos de optimización de formulación impulsados por inteligencia artificial que predicen la solubilidad, la biodisponibilidad y la estabilidad, lo que refleja la importancia de la formulación de fármacos y la optimización de la biodisponibilidad. Los polímeros, que a menudo sirven como sistemas de administración terapéutica cruciales, se están mejorando mediante formulaciones de nanopartículas diseñadas por inteligencia artificial, propiedades de hidrogel optimizadas por aprendizaje automático y modelos predictivos para la administración dirigida de fármacos, mejorando la eficacia terapéutica y la especificidad tisular.  

Compuestos de coordinación son otra clase prometedora, donde la inteligencia artificial ayuda en el diseño de ligandos y la optimización de estructuras metal-orgánicas (MOF). Estos compuestos se están refinando mediante química computacional y modelos de inteligencia artificial que predicen las interacciones metal-ligando y la bioactividad.

Aplicaciones de los modelos de inteligencia artificial en la ciencia de materiales

Descripción general  

En ciencia de los materiales, comprender y predecir las complejas relaciones entre la composición de los materiales, las características estructurales y las propiedades es esencial para acelerar el descubrimiento de materiales. Los datos implicados suelen ser multidimensionales, jerárquicos, heterogéneos y generados a través de procesos de alto rendimiento e intensivos en datos. La inteligencia artificial, particularmente el aprendizaje automático, está revolucionando el campo al permitir el análisis de estos complejos conjuntos de datos. Analizamos la CAS Content Collection para identificar conceptos clave de la ciencia de los materiales donde se aplican métodos de inteligencia artificial y evaluamos su importancia en el descubrimiento de materiales y la predicción de propiedades (véase la Figura 8).

Figure 8. Chart for materials science areas like materials, structure, properties, phenomena, devices, modeling methods, and applications. Each category lists specific items and is color-coded to show frequency from blue for low to red for high.
Figura 8: Panorama conceptual de las publicaciones sobre ciencia de los materiales impulsadas por inteligencia artificial, categorizadas en siete categorías. Cada categoría incluye conceptos representativos, con una codificación de colores de rojo (más alto) a azul (más bajo) que indica la frecuencia de publicación. Fuente: CAS Content Collection.

El almacenamiento de energía es el área de investigación más intensiva en inteligencia artificial en Aplicaciones, lo que refleja la necesidad mundial de tecnologías de baterías avanzadas y soluciones energéticas sostenibles. Las técnicas de aprendizaje automático se han convertido en herramientas potentes para la innovación en materiales para baterías, con investigadores que utilizan tres estrategias principales: predicciones directas de propiedades, potenciales de aprendizaje automático y diseño inverso. La alta concentración de investigación en inteligencia artificial en este campo se debe a la compleja naturaleza multiescala de los sistemas de baterías, donde los enfoques experimentales tradicionales a menudo no logran optimizar las intrincadas relaciones entre la composición del material, la estructura y el rendimiento electroquímico.

En las categorías de Materiales y Dispositivos , la importante actividad de inteligencia artificial en cerámica, piezocerámica, sensores y transistores de efecto de campo refleja la naturaleza sofisticada de estos materiales y sus dispositivos. Estos materiales avanzados a menudo exhiben complejas relaciones estructura-propiedad que son candidatas ideales para enfoques de aprendizaje automático.  

En Características estructurales, descubrimos que las redes neuronales convolucionales (CNN, por sus siglas en inglés), junto con la visión artificial, se utilizan para el análisis microestructural al permitir la clasificación, segmentación y extracción de características automatizadas a partir de imágenes de microscopía. Estas herramientas están ayudando a descubrir relaciones estructura-propiedad que antes eran difíciles de cuantificar. En metalurgia, los enfoques de inteligencia artificial dirigidos están impulsando el desarrollo de superaleaciones, mientras que sistemas como CAMEO (Exploración y Optimización Autónoma de Materiales de Bucle Cerrado) permiten la metalurgia combinatoria al integrar la inteligencia artificial con la experimentación de alto rendimiento. Además, las herramientas de aprendizaje automático para datos de tomografía 3D están mejorando el análisis de materiales porosos, lo que permite un modelado más preciso de propiedades como la permeabilidad y la resistencia mecánica.

La constante dieléctrica y la conductividad eléctrica son los conceptos principales en Propiedades, mientras que la piezoelectricidad lidera en Fenómenos. En Simulación y modelado, el modelado computacional muestra una alta adopción de inteligencia artificial, lo que se alinea con la compatibilidad natural del aprendizaje automático con las tareas de análisis de datos.

Las áreas de actividad moderada de inteligencia artificial representadas por las regiones de color púrpura y colores mezclados en la Figura 7 son campos donde la adopción de inteligencia artificial se está acelerando, pero tienen margen de mejora. Por ejemplo, la baja actividad en algunas áreas de materiales, mostrada predominantemente en azul, representa algunos de los dominios más establecidos y fundamentales de la ciencia, creando una situación paradójica donde los campos más maduros muestran la menor integración de inteligencia artificial. Los materiales compuestos y los polímeros son ejemplos destacados de esta categoría.  

Sin embargo, se están desarrollando modelos de inteligencia artificial especializados para abordar desafíos específicos. El modelo polyBERT trata las estructuras de polímeros como un lenguaje químico, lo que permite un modelado más eficaz de sistemas poliméricos complejos. Para materiales cristalinos, modelos como MEGNet, CGCNN y SchNet incorporan la simetría cristalina y las interacciones cuánticas, mientras que ALIGNN captura interacciones atómicas de orden superior esenciales para la predicción precisa de las propiedades de las aleaciones.

Coocurrencias de modelos de inteligencia artificial y conceptos de ciencia de materiales

Al igual que con nuestro análisis biomédico, examinamos de cerca los métodos de inteligencia artificial y los conceptos coocurrentes en la ciencia de materiales. Descubrimos que los modelos de aprendizaje automático tradicionales, como Random Forest (RF), Support Vector Machine (SVM), Gradient Boosting Machines (GBM) y Decision Trees (DT), se utilizan ampliamente para la predicción y el análisis de la importancia de las características, en gran parte debido a los datos de alta dimensión con relaciones no lineales que son comunes en la informática de materiales (véase la Figura 9).

Flow diagram Figure 9A linking machine learning methods (e.g., SVM, Random Forest) to materials science topics like materials, structure, properties, phenomena, devices, computational models, and applications, with colored lines indicating connections.

Sankey diagram titled "Figure 9B" linking machine learning models (e.g., Random Forest, SVM) to materials science categories like structure, properties, devices, and applications. Flow widths reflect usage frequency.
Figura 9: Diagrama de Sankey que ilustra la coocurrencia de métodos de inteligencia artificial y conceptos de ciencia de materiales de (A) 2015-2019 y (B) 2020-2024. Fuente: CAS Content Collection.

Modelos RF se utilizan y distribuyen ampliamente en todas las áreas conceptuales. Junto con modelos GBM, muestran una fuerte coocurrencia con materiales complejos y heterogéneos debido a su capacidad para modelar relaciones no lineales y manejar tipos de datos mixtos. A menudo se utilizan para compuestos heterogéneos, la predicción de propiedades mecánicas y el análisis de fallos al capturar las complejas interacciones entre la matriz y el refuerzo.  

Observamos que estos coocurren con aleaciones, donde RF se utiliza para mapear relaciones no lineales en composiciones de aleaciones, ayudando en el diseño de aleaciones de alta entropía, la predicción del fortalecimiento por precipitación y la optimización del tratamiento térmico. GB se aplica cada vez más para el ajuste preciso de propiedades, como la optimización del límite elástico o la resistencia a la corrosión.

SVM se utiliza con mayor frecuencia en materiales que tienen relaciones estructura-propiedad bien definidas. Este tipo de modelo es eficaz para clasificar tipos de aleaciones y umbrales utilizando vectores de características de dimensión fija. Las propiedades dependientes de la temperatura también suelen seguir patrones no lineales y dependen de la composición, el historial de procesamiento y las condiciones ambientales, lo cual los métodos basados en árboles y las SVM capturan eficazmente.

Para características estructurales como la microestructura, se emplean modelos de conjunto para identificar características a partir de imágenes complejas; clasificar límites de grano, fases y defectos; y predecir estructuras cristalinas, a menudo tratadas como problemas de clasificación que requieren modelos que tengan en cuenta la simetría. Las propiedades superficiales, que abarcan desde escalas atómicas hasta macroscópicas, implican patrones complejos en la energía superficial y la reactividad. Estas aplicaciones exigen el preprocesamiento de datos de imagen, la extracción de características multiescala y la codificación de la simetría y la periodicidad, especialmente para estudios de catálisis, corrosión y adhesión, que a menudo requieren la integración con el modelado molecular.

Los dominios de aplicación se han expandido considerablemente, y la investigación en baterías muestra un crecimiento espectacular. Las figuras 9A y 9B confirman la fuerte correlación de RF con los procesos electroquímicos, manejando interacciones complejas para la predicción de la capacidad de las baterías, la selección de materiales de electrodos y los procesos dependientes del tiempo.  

La aparición de aplicaciones relacionadas con la energía (almacenamiento de energía, generación de energía) en el período 2020-2024 demuestra la diversificación del campo. La memoria a largo y corto plazo (LSTM) captura la dinámica temporal, que es crucial para la predicción de la degradación de las baterías y la previsión del rendimiento del ciclo. Otra correlación emergente es el aprendizaje por refuerzo (RL), que es capaz de optimizar los protocolos de carga y el uso de materiales, y puede utilizarse en sistemas de gestión de baterías. Los filtros de Kalman también se observan en baterías y baterías secundarias, los cuales se utilizan para realizar un seguimiento del estado del material durante el procesamiento y pronosticar la estimación del estado de salud de la batería y la predicción de la vida útil restante.  

Los transformadores se utilizan para extraer procedimientos de síntesis y propiedades de los materiales de la bibliografía científica y capturar dependencias de largo alcance en descripciones complejas de materiales. Las redes neuronales convolucionales (CNN) y las GAN automatizan la extracción de características a partir de estructuras 2D/3D y respaldan la predicción de propiedades y el reconocimiento de patrones. A pesar de su potencia, requieren más datos y computación y ofrecen una menor interpretabilidad, por lo que complementan en lugar de reemplazar a los modelos tradicionales. Las redes neuronales se utilizan cada vez más en el análisis basado en imágenes y el diseño generativo, mientras que los métodos tradicionales mantienen ventajas en el mapeo composición-propiedad con conjuntos de datos limitados. Esta es otra razón por la que las redes neuronales y los modelos tradicionales se utilizan en combinación. Otro desarrollo son las arquitecturas de CNN específicas para materiales que incorporan simetría y restricciones físicas, mientras que las GNN están ganando terreno para estructuras atómicas y moleculares.  

Sustancias en ciencia de materiales

Volviendo a las categorías de sustancias indexadas por CAS, analizamos el número de publicaciones relacionadas con estas sustancias en ciencia de materiales (véase la Figura 10).

Figure 10 includes two bar graphs (A and B) showing journal articles and patent families from 2015–2024, categorized by material types like polymers, alloys, and minerals. Both graphs show rising publication trends.
Figura 10: Representación en gráfico de barras de las clases de sustancias clave en ciencia de materiales, basada en la frecuencia de publicación para (A) revistas y (B) patentes. Fuente: CAS Content Collection.

El predominio de moléculas pequeñas orgánicas/inorgánicas en la investigación impulsada por inteligencia artificial refleja las ventajas computacionales y la abundancia de datos del campo al manejar estructuras pequeñas en términos de coste computacional frente a sistemas complejos más grandes, como los polímeros. Con aproximadamente 6.500 artículos de revista, esta categoría se beneficia de décadas de bases de datos químicas acumuladas.  

Las moléculas pequeñas son especialmente adecuadas para los enfoques de aprendizaje automático porque sus propiedades pueden codificarse eficazmente mediante descriptores moleculares, huellas dactilares y representaciones basadas en grafos. El gran volumen de investigación en esta área también indica la fuerte inversión de las industrias farmacéutica y química en inteligencia artificial para el descubrimiento de fármacos, el diseño de catalizadores y la predicción de propiedades moleculares.  

Elementos, que ocupan el segundo lugar con alrededor de 5.500 artículos, se benefician de manera similar de extensas bases de datos y de la relativa simplicidad de sus estructuras, lo que los convierte en candidatos ideales para la predicción de propiedades y el descubrimiento de materiales mediante inteligencia artificial.

Materiales inorgánicos tabulares, con aproximadamente 4.500 artículos de revista, representan otra área donde la inteligencia artificial ha encontrado aplicaciones sustanciales. Estos materiales —que incluyen cerámicas, óxidos y otros compuestos inorgánicos estructurados— se benefician de bases de datos cristalográficas y mediciones sistemáticas de propiedades que proporcionan los grandes conjuntos de datos necesarios para un aprendizaje automático eficaz. La naturaleza estructurada de estos materiales permite una ingeniería de características consistente basada en la estructura cristalina, la composición y las características de enlace. La prominencia de esta categoría en la investigación de inteligencia artificial probablemente refleja el enfoque de la comunidad de ciencia de materiales en el descubrimiento de nuevos materiales funcionales para el almacenamiento de energía, la catálisis y las aplicaciones electrónicas y magnéticas.

La investigación sobre polímeros muestra una adopción moderada de la inteligencia artificial con alrededor de 1.800 artículos de revista, lo que puede parecer bajo dada la importancia industrial de los polímeros. Esto probablemente refleja los desafíos únicos que presentan los polímeros para las aplicaciones de inteligencia artificial, incluyendo sus complejas estructuras de cadena, distribuciones de peso molecular y propiedades dependientes del procesamiento. Sin embargo, el creciente volumen de investigación sugiere un éxito cada vez mayor en la aplicación de la inteligencia artificial a la predicción de propiedades, la síntesis y la optimización del procesamiento de polímeros.

Otro hallazgo importante de nuestro análisis es cómo las familias de patentes representan solo una fracción de los artículos de revista en todas las categorías de ciencia de materiales. La disparidad entre el número de revistas y patentes sugiere que gran parte de la investigación en inteligencia artificial en ciencia de materiales permanece en la etapa fundamental o exploratoria, con importantes retrasos entre los descubrimientos académicos y las aplicaciones prácticas dignas de protección mediante patente en la etapa comercial.

El número relativamente pequeño de patentes también puede reflejar el desafío de traducir los descubrimientos de materiales impulsados por inteligencia artificial en tecnologías comercialmente viables, ya que muchas aplicaciones de inteligencia artificial en este campo se centran en la predicción de propiedades y la comprensión fundamental en lugar de en invenciones inmediatamente patentables. La proporción consistente en los diferentes tipos de materiales indica que el desafío de la traducción de lo académico a lo comercial es universal en toda la ciencia de materiales, en lugar de ser específico para clases de materiales concretas.

La inteligencia artificial en la gestión de procesos

La inteligencia artificial está transformando la gestión de procesos al permitir una toma de decisiones más inteligente, rápida y adaptable. Analizar el papel de la inteligencia artificial en este dominio revela cómo la automatización, el análisis predictivo y la optimización en tiempo real pueden impulsar la excelencia operativa en todas las industrias (véase la Figura 11).

Framework illustrating the role of artificial intelligence in modernizing research, development, and operational processes across scientific domains.
Figura 11: Marco que ilustra el papel de la inteligencia artificial en la modernización de los procesos de investigación, desarrollo y operativos en todos los dominios científicos.

La optimización impulsada por inteligencia artificial se utiliza ampliamente en la fabricación aditiva, las industrias petroquímicas, el procesamiento de plásticos, la metalurgia, la química de flujo, los procesos catalíticos y el descubrimiento y síntesis de fármacos. Los modelos utilizados habitualmente incluyen la metodología de superficie de respuesta (RSM), el diseño de experimentos junto con técnicas de aprendizaje automático como las redes neuronales artificiales (ANN), modelos híbridos, redes neuronales informadas por la física (PINN), modelos de lenguaje extensos (LLM) y enfoques de aprendizaje por refuerzo. Exploremos algunas otras tecnologías que están extendiendo el modelado predictivo a la toma de decisiones y la automatización en tiempo real:

  • Monitorización en tiempo real: estos sistemas analizan datos en flujo utilizando aprendizaje automático para detectar patrones, tendencias y señales de advertencia temprana, facilitando la previsión dinámica y la toma de decisiones proactiva. Las innovaciones clave incluyen la toma de decisiones autónoma, donde los parámetros se ajustan automáticamente en función de las entradas en tiempo real; el mantenimiento predictivo, que anticipa los fallos antes de que ocurran; y los modelos de autoaprendizaje que se ajustan a las condiciones cambiantes. Además, la visualización de datos en tiempo real y los sistemas de alerta inteligentes están transformando la forma en que los operadores interactúan con los datos de procesos en vivo. Estos avances se están aplicando en industrias como los sistemas de cromatografía automatizados y la monitorización de reacciones farmacológicas en la fabricación farmacéutica. También estamos viendo su uso en la optimización de propiedades en la producción de polímeros, el análisis de residuos sólidos en la gestión de residuos, la monitorización medioambiental, la gestión de energía y recursos para la producción de hidrógeno a gran escala y la gestión energética basada en la nube para infraestructuras envejecidas.
  • Sensores blandos: Utilizando datos en tiempo real de sensores físicos, estos aprovechan la inteligencia artificial y los modelos estadísticos para estimar variables que son difíciles o costosas de medir directamente. Se aplican ampliamente en diversos sectores, incluido el control de bioprocesos y la monitorización de la calidad del aire y de las aguas residuales. En el control de procesos químicos, los sensores blandos se utilizan para monitorizar la flotación compleja de minerales de sulfuro, la isomerización, la destilación reactiva y la mezcla de gasolina.
  • Gemelos digitales: Estas innovaciones son réplicas virtuales de sistemas físicos que evolucionan rápidamente con la integración de la inteligencia artificial para permitir la optimización en tiempo real, el análisis predictivo y las operaciones autónomas. La inteligencia artificial mejora los gemelos digitales al aprender de datos históricos y en tiempo real para simular estados futuros, detectar anomalías y predecir fallos, transformándolos de modelos estáticos en sistemas resilientes y auto-optimizables. En la fabricación, los gemelos digitales impulsados por inteligencia artificial predicen fallos en los equipos, optimizan los procesos de producción y detectan problemas de calidad mediante sensores e imágenes. En el ámbito sanitario, simulan las condiciones de los pacientes, apoyan la medicina personalizada, modelan enfermedades, simulan ensayos clínicos y optimizan la inmunoterapia. En los ámbitos medioambiental y de sostenibilidad, los gemelos digitales basados en inteligencia artificial se aplican al almacenamiento geológico de carbono, al procesamiento de residuos minerales y a la gestión de recursos. También apoyan la ciencia de materiales, permitiendo el descubrimiento automatizado, el análisis de defectos y el diseño molecular inverso.

Desafíos para el uso de la inteligencia artificial en la investigación científica

La inteligencia artificial ha realizado claramente muchas contribuciones positivas a todos los campos de la investigación científica, y seguirá haciéndolo a medida que avance. Sin embargo, estas innovaciones no están exentas de desafíos que los investigadores y los científicos de datos deben abordar para garantizar que la inteligencia artificial alcance su máximo potencial en la ciencia. Algunos de los desafíos más urgentes incluyen:

  • Privacidad y seguridad de los datos: Garantizar la privacidad y la seguridad de los datos es uno de los mayores desafíos en la implementación de la inteligencia artificial, ya que requiere un gran volumen de datos sensibles para su entrenamiento y funcionamiento. Los problemas surgen cuando se recopila y utiliza información sensible sin el permiso adecuado, o cuando dicha información se filtra o es robada de los sistemas de inteligencia artificial. Los conjuntos de datos científicos pueden contener resultados experimentales no publicados, estructuras de compuestos novedosos y métodos de síntesis patentados que representan importantes ventajas estratégicas. Cuando los investigadores utilizan plataformas de inteligencia artificial basadas en la nube o participan en entornos de investigación colaborativa, se enfrentan a riesgos sustanciales de exposición de la propiedad intelectual. Para combatir este riesgo, algunas empresas están implementando salvaguardas para proteger la información de los clientes y mantener la confianza, con nuevas empresas encontrando nichos de mercado para protegerse contra las amenazas externas de la inteligencia artificial.
  • Calidad y sesgo de los datos: Los conjuntos de datos sufren frecuentemente de sesgos sistemáticos que pueden propagarse a través de los modelos de inteligencia artificial, lo que conduce a predicciones sesgadas y potencialmente refuerza las desigualdades de investigación existentes. Los sesgos históricos en los datos de reacción publicados, donde las reacciones exitosas están sobrerrepresentadas y los experimentos fallidos no se reportan, pueden perjudicar significativamente la capacidad de los modelos de aprendizaje automático para explorar nuevos espacios químicos, particularmente para materiales inorgánicos. Este "sesgo de publicación" crea un ciclo de autorrefuerzo donde los sistemas de inteligencia artificial recomiendan preferentemente compuestos similares a los ya bien estudiados. Los modelos de inteligencia artificial generativa presentan preocupaciones adicionales, ya que pueden manipular los datos existentes y alucinar para satisfacer las solicitudes de los clientes a expensas de la evidencia real.
  • Transparencia: La naturaleza de "caja negra" de estos modelos puede oscurecer el razonamiento detrás de sus predicciones, dificultando que los investigadores evalúen su fiabilidad o identifiquen posibles modos de fallo. Una revisión de los métodos de inteligencia artificial explicable en el descubrimiento de fármacos destacó cómo la falta de interpretabilidad en modelos complejos puede socavar la confianza entre los químicos medicinales e impedir la aceptación regulatoria de las decisiones guiadas por inteligencia artificial en el desarrollo farmacéutico. Este desafío es particularmente agudo para las redes neuronales gráficas y los modelos de transformadores que operan con representaciones químicas de alta dimensión, donde la relación entre las características de entrada y las predicciones se vuelve altamente no lineal.
  • Equilibrar la automatización con la experiencia humana: Si bien los sistemas de inteligencia artificial pueden procesar vastos conjuntos de datos e identificar patrones que superan la capacidad cognitiva humana, carecen de la intuición, la creatividad y la comprensión contextual que los científicos experimentados aportan a los problemas de investigación. Esto puede conducir a una generación de científicos que carezcan de habilidades de investigación fundamentales y de comprensión conceptual. Por el contrario, también puede conducir a una “aversión algorítmica” cuando las conclusiones impulsadas por la inteligencia artificial contradicen la intuición.

Modelos de inteligencia artificial y el futuro de la investigación científica

La importancia de la inteligencia artificial para la investigación científica no hará más que aumentar, y sus capacidades revolucionarias ya se están haciendo realidad en campos como la biomedicina y la ciencia de materiales. Como muestra nuestro análisis de la Contenido CAS, constantemente se aplican nuevas aplicaciones, modelos y métodos a problemas de investigación complejos. Podemos esperar que los avances en el descubrimiento de fármacos, el diagnóstico de enfermedades, el desarrollo de materiales y mucho más estén influenciados o totalmente impulsados por tecnologías basadas en inteligencia artificial.  

A medida que la inteligencia artificial pasa de ser una herramienta a un socio científico colaborativo, es probable que también veamos nuevos paradigmas como el diseño inverso y los laboratorios autónomos que redefinen la metodología científica hacia motores de descubrimiento autónomos. Sin embargo, las bajas proporciones de patentes frente a publicaciones indican que gran parte de la investigación permanece en el ámbito académico, particularmente en los campos tradicionales de la ciencia de materiales.  

Una mayor adopción de la inteligencia artificial requiere una calibración de confianza adecuada a través de soluciones técnicas como la cuantificación de la incertidumbre y la transparencia del modelo. La naturaleza de gran alcance del impacto de la inteligencia artificial en la ciencia y el alcance de los desafíos en su implementación significan que la colaboración y la visibilidad serán clave para maximizar sus beneficios para el avance científico.

Para obtener más información, lea nuestro artículo de revista reimpreso, "La revolución de la inteligencia artificial en la química: dando forma al futuro de las ciencias de los materiales y biomédicas."


El uso de nombres de marca y/o cualquier mención de productos o servicios de terceros en este documento es únicamente para fines educativos y no implica la aprobación por parte de CAS o la American Chemical Society, ni la discriminación contra marcas, productos o servicios similares no mencionados.

Descargar el informe

Related CAS Insights

Addressing sustainability of the global patent system: the role of AI in enhancing productivity

AI’s emerging role in natural product drug discovery

Buscadores científicos: por qué diseñarlos requiere arte más ciencia

Gain new perspectives for faster progress directly to your inbox.