Executive Summary
- La calidad de los datos es el factor determinante para la inteligencia artificial en la ciencia.
- La integridad de los datos y la armonización de los datos son disciplinas dirigidas por humanos, no puramente automatizadas.
- Los datos armonizados producen mejoras medibles en el rendimiento de los modelos de inteligencia artificial.
- Los "datos oscuros" representan un recurso significativo sin explotar para la investigación impulsada por inteligencia artificial.
- La adopción de la inteligencia artificial en los campos científicos se está acelerando rápidamente, pero la infraestructura de datos sigue siendo el factor limitante.
No cabe duda de que la inteligencia artificial (IA) ha revolucionado la investigación científica con su capacidad para analizar conjuntos de datos increíblemente vastos. La capacidad de la IA para procesar datos y su velocidad computacional superan lo que los humanos son capaces de hacer, y la tecnología seguirá redefiniendo lo que es posible en el descubrimiento científico.
Sin embargo, tampoco hay duda de que el concepto de "basura entra, basura sale" es cierto: los algoritmos y modelos de IA solo pueden producir resultados tan fiables como los datos que los alimentan. El problema de la calidad de los datos es tan antiguo como la ciencia misma —ninguna hipótesis puede validarse repetidamente si se basa en datos erróneos—, pero el establecimiento de la investigación impulsada por IA, junto con el enorme volumen de datos disponibles hoy en día, hace que este problema sea exponencialmente más difícil.
Una gran parte de la solución es la armonización de datos, que proporciona a los modelos de conjunto, los modelos de lenguaje extensos (LLM) y otros tipos de sistemas de inteligencia artificial datos correctos y coherentes. Los datos de calidad marcan la diferencia, por ejemplo, en casos de uso exitosos de IA en biomedicina y ciencia de materiales. Estos son dos campos donde la complejidad de los datos —en estructuras proteicas, estructuras atómicas, ADN y más— subraya la necesidad de datos limpios y armonizados para los modelos de inteligencia artificial.
Nuestra catalogación de la CAS Content CollectionTMTM, el mayor repositorio de información científica catalogado por humanos, nos proporciona una visión inigualable de las mejores prácticas de armonización de datos. Exploremos cómo funciona y examinemos el papel, a menudo pasado por alto, de la experiencia humana a la hora de impulsar descubrimientos exitosos basados en inteligencia artificial:
Modelos de inteligencia artificial para la química: el panorama actual y lo que está por venir
La inteligencia artificial impulsa un descubrimiento de fármacos más rápido y la identificación de nuevos materiales. Estamos viendo una proliferación de tipos de modelos tanto en biomedicina como en ciencia de materiales, y al realizar un análisis de coocurrencia de conceptos, los investigadores pueden detectar tendencias emergentes en los enfoques de modelado. Este análisis en profundidad de las herramientas y técnicas específicas para aplicar la inteligencia artificial a las ciencias de la vida y a la ciencia de materiales revela dónde está teniendo impacto la tecnología de inteligencia artificial ahora y hacia dónde se dirige:

Integridad y armonización de datos: la base para construir el éxito de la inteligencia artificial
Aprovechar la inteligencia artificial para la investigación científica requiere datos limpios y estandarizados. La corrección de errores y la orquestación del flujo de trabajo son pasos críticos para construir la base de datos necesaria, pero la experiencia humana sigue siendo una parte clave de estos esfuerzos al estandarizar y validar las entradas de datos. Vemos beneficios tangibles en los modelos predictivos y el análisis avanzado cuando se utilizan datos armonizados, un recordatorio de que las personas siguen siendo una parte vital para aprovechar las tecnologías más avanzadas.

Inteligencia artificial en la industria farmacéutica: liderando los esfuerzos en el reposicionamiento de fármacos
Los investigadores farmacéuticos tienen acceso a grandes cantidades de datos sobre formulaciones de fármacos, ensayos clínicos archivados y registros médicos electrónicos, por mencionar solo algunas fuentes. Aprovechar estos datos adecuadamente puede revelar información importante para el reposicionamiento de fármacos existentes, lo cual es una estrategia poderosa para abordar las necesidades de los pacientes. ¿Cómo pueden hacerlo? Con una solución de gestión del conocimiento que resulte en datos limpios y estandarizados para potenciar las herramientas de inteligencia artificial de manera efectiva.
Contar con una gran cantidad de datos diversos puede mejorar significativamente el potencial de la inteligencia artificial en el desarrollo farmacéutico y acelerar su proceso de reposicionamiento. Sin embargo, más datos no significan necesariamente mejores datos.
Modelos predictivos: acelerar el descubrimiento de fármacos con calidad de datos
La predicción de la actividad ligando-objetivo o los perfiles de metabolitos son resultados fundamentales del modelado en el descubrimiento de fármacos, pero obtener resultados fiables requiere una amplia armonización de los datos. Esta conversación entre científicos de CAS explica por qué la curación de datos humana desempeña un papel tan importante en la preparación de la información que impulsa el modelado predictivo. Descubra cuáles son algunos de los desafíos clave en el desarrollo de modelos y cómo CAS aborda el entrenamiento continuo de modelos para mantener nuestras soluciones actualizadas.
Estudio
Cinco estrategias de gestión del conocimiento para su flujo de trabajo de R&D
Los investigadores comprenden la importancia de eliminar los silos de datos y garantizar que la información científica sea limpia y coherente. Pero, ¿cuáles son las mejores prácticas para implementar estos pasos? En este estudio, compartimos cinco consejos de gestión del conocimiento para mejorar los flujos de trabajo de R&D científico. Descargue el estudio hoy mismo:
El futuro de la armonización de datos
Las soluciones basadas en inteligencia artificial, que ya no son una innovación lejana, son hoy una parte central del descubrimiento científico. Los modelos de inteligencia artificial pueden identificar nuevos compuestos y materiales, detectar oportunidades de reutilización de fármacos y analizar la extraordinaria cantidad de datos disponibles en todas las disciplinas científicas. Sin embargo, estos modelos requieren datos limpios y estandarizados para generar información de calidad, y llegar a ese estado depende tanto de la experiencia humana como de la capacidad tecnológica.
Los datos científicos existen en tablas, diagramas y materiales complementarios de publicaciones. Las organizaciones de investigación poseen todo tipo de "datos oscuros" que no están estructurados pero que contienen información valiosa. Al colaborar con expertos en datos y construir una base sólida de datos armonizados, los investigadores pueden utilizar plenamente toda la información que poseen y obtener beneficios significativos de los modelos y algoritmos de inteligencia artificial.
Questions and answers
P: ¿Qué es la armonización de datos?
R: La armonización de datos es el proceso de integrar información de múltiples fuentes y estandarizarla en un marco coherente para que pueda ser analizada, comparada y compartida de forma fiable. En el contexto de la inteligencia artificial, es importante porque los modelos entrenados con datos inconsistentes o fragmentados heredarán esas inconsistencias en sus resultados.
P: ¿Por qué la inteligencia artificial no puede automatizar la armonización de datos?
R: Las herramientas de inteligencia artificial y aprendizaje automático pueden ayudar a procesar grandes volúmenes de datos, pero carecen del rigor científico y el juicio necesarios para resolver los tipos de ambigüedades que a menudo aparecen en notas de laboratorio, artículos de revistas, trabajos académicos y patentes. Si bien los modelos de lenguaje extenso pueden diferenciar conceptos basados en el uso cotidiano, una sola proteína puede ser referenciada usando docenas de nombres, traducciones e identificadores diferentes que solo son evidentes para los expertos en sus respectivos campos.
P: ¿Cómo mejora la armonización de datos los modelos predictivos para la ciencia?
R: Al normalizar los nombres de los objetivos y mejorar la vinculación de sustancias, la precisión de un modelo de prueba mejoró significativamente. Las predicciones se volvieron más coherentes con los resultados experimentales y la capacidad de identificar los candidatos a fármacos más prometedores en las primeras etapas del proceso de selección mejoró en consecuencia.
P: ¿Qué son los "datos oscuros" y cómo afectan a la reutilización de fármacos impulsada por la inteligencia artificial?
Los datos oscuros se refieren a la información no estructurada que las organizaciones acumulan con el tiempo pero que nunca aprovechan de manera efectiva. Cuando los datos oscuros se armonizan adecuadamente y se hacen accesibles, pueden mejorar sustancialmente la diversidad y la fiabilidad de los conjuntos de datos de entrenamiento de inteligencia artificial, mejorando la calidad de las predicciones de reutilización y reduciendo el riesgo de resultados sesgados o engañosos.
P: ¿Qué tipos de modelos de inteligencia artificial se aplican más comúnmente en la investigación científica hoy en día?
R: Los modelos de lenguaje extensos (LLM) se utilizan cada vez más para la extracción de conocimiento, la generación de hipótesis y el diseño generativo. Los métodos clásicos como Random Forest y las máquinas de vectores de soporte siguen siendo comunes para tareas como el descubrimiento de biomarcadores y la identificación de subtipos de cáncer, especialmente cuando los datos de entrenamiento son limitados, aunque el aprendizaje profundo los ha desplazado en entornos con gran cantidad de datos. Las redes neuronales gráficas y los modelos basados en transformadores han aumentado desde 2020: los primeros para la predicción de la estructura e interacción de proteínas, los segundos para la minería de bibliografía biomédica y el análisis de secuencias. En ciencia de materiales, el aprendizaje automático clásico domina la predicción de propiedades, mientras que las CNN se aplican al análisis de imágenes microestructurales y los modelos subrogados basados en redes neuronales respaldan los flujos de trabajo con gran carga de simulación.
P: ¿Por qué los modelos de conjunto superan a los enfoques de modelo único?
R: Ningún modelo único captura la complejidad total de ningún panorama de datos científicos. Los enfoques de conjunto combinan múltiples modelos para generar una "predicción de consenso" que es generalmente más fiable que lo que cualquier modelo individual podría producir por sí solo.
Enlaces
Más recursos
Las organizaciones que se enfrentan a desafíos de armonización de datos, ya sea digitalizando registros heredados, normalizando bibliotecas de compuestos o preparando conjuntos de datos para el modelado de inteligencia artificial, pueden analizar soluciones a medida diseñadas en torno a dominios científicos específicos y la infraestructura existente.
Lecturas adicionales
- Establecimiento de nuevos estándares para la precisión de las predicciones de inteligencia artificial con datos de entrenamiento a medida
- Convierta los datos farmacéuticos sin explotar en R&D.
- Un conjunto de datos de entrenamiento de aprendizaje automático seleccionado a medida acelera la optimización del flujo de trabajo de síntesis orgánica
- Cómo los modelos de inteligencia artificial de conjunto ofrecen mejores resultados científicos
- Seis ejemplos que demuestran cómo la inteligencia artificial ayuda a impulsar la investigación científica de vanguardia




