La inteligencia artificial (IA) impulsa la innovación a un ritmo inimaginable hace una década. La IA afecta a casi todos los sectores y empresas, ya que mejora la eficiencia, promueve la toma de decisiones basada en datos y aumenta la seguridad. También revoluciona muchos campos de la investigación científica, como la química y las ciencias de la vida. Los avances en IA de estas dos industrias han dado lugar a nuevas formas de descubrir materiales, han acelerado el descubrimiento de fármacos y han creado modelos predictivos que pueden ejecutar millones de experimentos antes de entrar en el laboratorio.
Dado que la IA afecta a todos los aspectos de nuestra vida cotidiana, es fácil perder de vista qué es lo que la hace tan poderosa y cuáles son sus puntos débiles. Un factor clave es la importancia de la calidad de los datos para cualquier aplicación de IA.
Definición de la calidad de los datos
La calidad de los datos puede significar cosas diferentes para cada persona, pero, en general, consiste en una combinación de cuatro factores principales: precisión, coherencia, integridad y relevancia.
- La precisión garantiza que los datos estén libres de errores e inexactitudes.
- La coherencia significa que los datos se representan de manera uniforme.
- La integridad garantiza que todos los datos necesarios estén presentes.
- La relevancia valida que los datos son aplicables a la tarea en cuestión.
Los conjuntos de datos que cumplen estos factores son vitales para entrenar un algoritmo de IA. Sin embargo, también es importante tener en cuenta las consecuencias de no cumplir estos requisitos.
Precisión
Entrenar modelos con conjuntos de datos inexactos dará lugar a modelos inexactos. Una baja precisión en un conjunto de datos aumenta la probabilidad de una mala generalización. Si un modelo no generaliza bien, tendrá un rendimiento deficiente con los datos que no están incluidos en su conjunto de entrenamiento. El resultado final de una precisión deficiente es que el modelo no será fiable, lo que provocará problemas de confianza difíciles de superar tras su implementación.
Coherencia
Si los datos son incoherentes, incorporar nuevos datos al conjunto de entrenamiento requerirá más esfuerzo. Identificar campos que faltan, cambios en las unidades, duplicaciones y otros tipos de incoherencias es un proceso que requiere largo tiempo. La mayoría de los científicos de datos dedican una parte importante de su tiempo a mejorar la coherencia de los conjuntos de datos. Este tiempo podría dedicarse mejor al desarrollo de algoritmos de IA si se diera prioridad a la coherencia de los datos en una fase anterior del proceso.
Integridad
Sin acceso a un conjunto de datos completo con toda la información pertinente para el propósito previsto del modelo, habrá lagunas en la comprensión del modelo. Estas lagunas pueden manifestarse como sesgos en el modelo. Los modelos sesgados son propensos a predicciones inadecuadas cuando se encuentran con datos que no se parecen a su conjunto de entrenamiento. Los modelos sesgados conllevan muchas preocupaciones éticas y legales, ya que pueden reforzar estereotipos dañinos o generar un impacto social negativo en los usuarios de los modelos.
Relevancia
Si el conjunto de datos no es relevante para la tarea en cuestión, puede que se necesite más tiempo para entrenar un modelo útil. El uso de datos irrelevantes en el entrenamiento confundirá al modelo, ya que intentará tener en cuenta datos que no influyen en su decisión final. Si un modelo necesita más tiempo en su fase de entrenamiento debido a estos datos irrelevantes, habrá que invertir más tiempo, recursos computacionales y dinero en entrenar un modelo útil.
CAS garantiza la calidad de los datos con un toque humano
Las preocupaciones sobre la calidad de los datos existen en todas partes, pero CAS reconoce y da prioridad a la naturaleza crítica de estos factores en relación con los datos científicos. Los datos de química y ciencias de la vida pueden ser muy variados dependiendo de su fuente. Existen varias formas diferentes de representar una estructura molecular en química. Entre ellas se incluyen MDL Molfile (MOL), Structure-Data Format (SDF), Simplified Molecular Input Line Entry System (SMILES) e International Chemical Identifier (InChI). Cada una de estas representaciones moleculares tiene sus pros y sus contras. CAS se basa en tecnologías que mapean todos los formatos moleculares al CAS REGISTRY®. Cuando la tecnología por sí sola no puede determinar una coincidencia exacta, se recurre a los conocimientos humanos para identificar la estructura correcta. Gracias a esta catalogación humana, mantenemos una base de datos de alta calidad tanto de estructuras químicas como de reacciones químicas que se utilizan en muchas aplicaciones diferentes de IA, tanto en CAS como con nuestros socios.
Del mismo modo, CAS ha confiado en la catalogación humana en su reciente expansión hacia los datos de ciencias de la vida. El equipo global de científicos y tecnólogos de CAS revisa datos de ciencias de la vida, como farmacología, biomarcadores y vías de señalización. Este esfuerzo garantiza que nuestros datos sean precisos y coherentes, aspectos clave para disponer de conjuntos de datos de alta calidad. Cuando nuestro conjunto de datos farmacológicos se utilizó para entrenar un modelo existente para predecir la actividad de una molécula frente a una proteína diana, observamos una reducción del 56 % en la diferencia entre los valores experimentales y los previstos en comparación con el modelo de referencia, y una reducción del 23 % en la desviación estándar. Este esfuerzo demuestra la importancia de la calidad de los datos, presente en todos los conjuntos de datos de CAS.
En CAS, creemos en la importancia de la calidad de los datos en las aplicaciones de IA. Con la participación humana, generamos conjuntos de datos de alta precisión y coherentes. Durante nuestros más de 100 años de existencia, hemos adquirido experiencia en la gestión de contenidos y conocimientos. Nuestros científicos se basan en estos conocimientos para juzgar la integridad y la relevancia de un conjunto de datos para una aplicación de IA determinada. Gracias a estos conocimientos, pueden identificar problemas de integridad y relevancia en un conjunto de datos y desarrollar un plan para solucionarlos.
