Imagen abstracta de haces de luz y electricidad que entran y salen de un chip informático.

Integridad de los datos para la investigación científica impulsada por inteligencia artificial

Executive Summary

  • La calidad de los datos es el factor determinante para la inteligencia artificial en la ciencia.
  • La integridad de los datos y la armonización de los datos son disciplinas dirigidas por humanos, no puramente automatizadas.
  • Los datos armonizados producen mejoras medibles en el rendimiento de los modelos de inteligencia artificial.
  • Los "datos oscuros" representan un recurso significativo sin explotar para la investigación impulsada por inteligencia artificial.
  • La adopción de la inteligencia artificial en los campos científicos se está acelerando rápidamente, pero la infraestructura de datos sigue siendo el factor limitante.

No cabe duda de que la inteligencia artificial (IA) ha revolucionado la investigación científica con su capacidad para analizar conjuntos de datos increíblemente vastos. La capacidad de la IA para procesar datos y su velocidad computacional superan lo que los humanos son capaces de hacer, y la tecnología seguirá redefiniendo lo que es posible en el descubrimiento científico.

Sin embargo, tampoco hay duda de que el concepto de "basura entra, basura sale" es cierto: los algoritmos y modelos de IA solo pueden producir resultados tan fiables como los datos que los alimentan. El problema de la calidad de los datos es tan antiguo como la ciencia misma —ninguna hipótesis puede validarse repetidamente si se basa en datos erróneos—, pero el establecimiento de la investigación impulsada por IA, junto con el enorme volumen de datos disponibles hoy en día, hace que este problema sea exponencialmente más difícil.

Una gran parte de la solución es la armonización de datos, que proporciona a los modelos de conjunto, los modelos de lenguaje extensos (LLM) y otros tipos de sistemas de inteligencia artificial datos correctos y coherentes. Los datos de calidad marcan la diferencia, por ejemplo, en casos de uso exitosos de IA en biomedicina y ciencia de materiales. Estos son dos campos donde la complejidad de los datos —en estructuras proteicas, estructuras atómicas, ADN y más— subraya la necesidad de datos limpios y armonizados para los modelos de inteligencia artificial.

Nuestra catalogación de la CAS Content CollectionTMTM, el mayor repositorio de información científica catalogado por humanos, nos proporciona una visión inigualable de las mejores prácticas de armonización de datos. Exploremos cómo funciona y examinemos el papel, a menudo pasado por alto, de la experiencia humana a la hora de impulsar descubrimientos exitosos basados en inteligencia artificial:

Modelos de inteligencia artificial para la química: el panorama actual y lo que está por venir

La inteligencia artificial impulsa un descubrimiento de fármacos más rápido y la identificación de nuevos materiales. Estamos viendo una proliferación de tipos de modelos tanto en biomedicina como en ciencia de materiales, y al realizar un análisis de coocurrencia de conceptos, los investigadores pueden detectar tendencias emergentes en los enfoques de modelado. Este análisis en profundidad de las herramientas y técnicas específicas para aplicar la inteligencia artificial a las ciencias de la vida y a la ciencia de materiales revela dónde está teniendo impacto la tecnología de inteligencia artificial ahora y hacia dónde se dirige:

Un marco que ilustra el papel de la inteligencia artificial en la modernización de los procesos de investigación, desarrollo y operativos en todos los ámbitos científicos.
Leer más

Integridad y armonización de datos: la base para construir el éxito de la inteligencia artificial

Aprovechar la inteligencia artificial para la investigación científica requiere datos limpios y estandarizados. La corrección de errores y la orquestación del flujo de trabajo son pasos críticos para construir la base de datos necesaria, pero la experiencia humana sigue siendo una parte clave de estos esfuerzos al estandarizar y validar las entradas de datos. Vemos beneficios tangibles en los modelos predictivos y el análisis avanzado cuando se utilizan datos armonizados, un recordatorio de que las personas siguen siendo una parte vital para aprovechar las tecnologías más avanzadas.

Un flujo de trabajo de armonización de datos requiere un enfoque estructurado, desde el establecimiento de estándares de nomenclatura de objetivos hasta la garantía de la coherencia de los conjuntos de datos y la optimización de la calidad y fiabilidad de los datos en diversos conjuntos de datos y fuentes.
Leer más

Inteligencia artificial en la industria farmacéutica: liderando los esfuerzos en el reposicionamiento de fármacos

Los investigadores farmacéuticos tienen acceso a grandes cantidades de datos sobre formulaciones de fármacos, ensayos clínicos archivados y registros médicos electrónicos, por mencionar solo algunas fuentes. Aprovechar estos datos adecuadamente puede revelar información importante para el reposicionamiento de fármacos existentes, lo cual es una estrategia poderosa para abordar las necesidades de los pacientes. ¿Cómo pueden hacerlo? Con una solución de gestión del conocimiento que resulte en datos limpios y estandarizados para potenciar las herramientas de inteligencia artificial de manera efectiva.


Contar con una gran cantidad de datos diversos puede mejorar significativamente el potencial de la inteligencia artificial en el desarrollo farmacéutico y acelerar su proceso de reposicionamiento. Sin embargo, más datos no significan necesariamente mejores datos.

Leer más

Modelos predictivos: acelerar el descubrimiento de fármacos con calidad de datos

La predicción de la actividad ligando-objetivo o los perfiles de metabolitos son resultados fundamentales del modelado en el descubrimiento de fármacos, pero obtener resultados fiables requiere una amplia armonización de los datos. Esta conversación entre científicos de CAS explica por qué la curación de datos humana desempeña un papel tan importante en la preparación de la información que impulsa el modelado predictivo. Descubra cuáles son algunos de los desafíos clave en el desarrollo de modelos y cómo CAS aborda el entrenamiento continuo de modelos para mantener nuestras soluciones actualizadas.

Leer más

Estudio

Cinco estrategias de gestión del conocimiento para su flujo de trabajo de R&D

Los investigadores comprenden la importancia de eliminar los silos de datos y garantizar que la información científica sea limpia y coherente. Pero, ¿cuáles son las mejores prácticas para implementar estos pasos? En este estudio, compartimos cinco consejos de gestión del conocimiento para mejorar los flujos de trabajo de R&D científico. Descargue el estudio hoy mismo:

Estudio sobre gestión del conocimiento

El futuro de la armonización de datos 

 Las soluciones basadas en inteligencia artificial, que ya no son una innovación lejana, son hoy una parte central del descubrimiento científico. Los modelos de inteligencia artificial pueden identificar nuevos compuestos y materiales, detectar oportunidades de reutilización de fármacos y analizar la extraordinaria cantidad de datos disponibles en todas las disciplinas científicas. Sin embargo, estos modelos requieren datos limpios y estandarizados para generar información de calidad, y llegar a ese estado depende tanto de la experiencia humana como de la capacidad tecnológica.

Los datos científicos existen en tablas, diagramas y materiales complementarios de publicaciones. Las organizaciones de investigación poseen todo tipo de "datos oscuros" que no están estructurados pero que contienen información valiosa. Al colaborar con expertos en datos y construir una base sólida de datos armonizados, los investigadores pueden utilizar plenamente toda la información que poseen y obtener beneficios significativos de los modelos y algoritmos de inteligencia artificial.

Questions and answers

P: ¿Qué es la armonización de datos?

P: ¿Por qué la inteligencia artificial no puede automatizar la armonización de datos?

P: ¿Cómo mejora la armonización de datos los modelos predictivos para la ciencia?

P: ¿Qué son los "datos oscuros" y cómo afectan a la reutilización de fármacos impulsada por la inteligencia artificial?

P: ¿Qué tipos de modelos de inteligencia artificial se aplican más comúnmente en la investigación científica hoy en día?‍

P: ¿Por qué los modelos de conjunto superan a los enfoques de modelo único?

Enlaces

Related CAS Insights

Addressing sustainability of the global patent system: the role of AI in enhancing productivity

AI’s emerging role in natural product drug discovery

Buscadores científicos: por qué diseñarlos requiere arte más ciencia

Gain new perspectives for faster progress directly to your inbox.