A importância da qualidade dos dados em aplicações de IA

A inteligência artificial (IA) está impulsionando a inovação em um ritmo inimaginável há uma década. A IA impacta praticamente todos os setores e empresas, melhorando a eficiência, promovendo a tomada de decisões baseada em dados e aprimorando a segurança. Ela está também revolucionando muitos campos da pesquisa científica, incluindo a química e as ciências da vida. Os avanços em IA nesses dois setores levaram a novas formas de descobrir materiais, aceleraram a descoberta de medicamentos e criaram modelos preditivos capazes de executar milhões de experimentos antes mesmo de você entrar no laboratório.

Com a IA impactando todos os aspectos de nossas vidas diárias, é fácil perder de vista o que a torna tão poderosa e onde a tecnologia apresenta falhas. Um fator fundamental é a importância da qualidade dos dados para qualquer aplicação de IA.

Definição da qualidade dos dados

A qualidade dos dados pode significar coisas diferentes para pessoas diferentes, mas, em geral, consiste em uma combinação de quatro fatores principais: precisão, consistência, completude e relevância.

  1. A precisão garante que os dados estejam livres de erros e equívocos.
  2. Consistência significa que os dados são representados de forma uniforme.
  3. A completude garante que todos os dados necessários estejam presentes.
  4. A relevância valida que os dados são aplicáveis à tarefa em questão.

Os conjuntos de dados que aderem a esses fatores são vitais para treinar um algoritmo de IA. No entanto, é importante considerar também as consequências de não atender a esses requisitos.

Precisão

Treinar modelos com conjuntos de dados imprecisos resultará em modelos imprecisos. A baixa precisão em um conjunto de dados aumenta a probabilidade de generalização inadequada. Se um modelo não generaliza bem, ele terá um desempenho ruim em dados que não foram incluídos em seu conjunto de treinamento. No fim das contas, o maior impacto de uma baixa precisão é que o modelo deixa de ser confiável, e isso gera problemas de confiança e credibilidade que, depois que a solução é implementada, são difíceis de reverter.

Consistência

Se seus dados forem inconsistentes, adicionar novos dados ao seu conjunto de treinamento exigirá mais esforço. A necessidade de identificar campos ausentes, mudanças nas unidades, duplicações e outros tipos de inconsistências é um processo demorado. A maioria dos cientistas de dados gasta uma quantidade significativa de tempo melhorando a consistência dos conjuntos de dados. Esse tempo poderia ser melhor gasto no desenvolvimento de algoritmos de IA se a consistência dos dados fosse priorizada mais cedo no pipeline de dados.

Completude

Sem acesso a um conjunto de dados completo de todas as informações relevantes para a finalidade pretendida de um modelo, haverá lacunas na compreensão do modelo. Essas lacunas podem se manifestar como viés no modelo. Os modelos tendenciosos são propensos a fazer previsões inadequadas quando encontram dados que não se assemelham ao conjunto de treinamento. Modelos tendenciosos trazem consigo muitas preocupações éticas e legais, pois podem reforçar estereótipos prejudiciais ou criar um impacto social negativo sobre os usuários dos modelos.

Relevância

Pode ser necessário mais tempo para treinar um modelo útil se o conjunto de dados for irrelevante para a tarefa em questão. Usar dados irrelevantes no treinamento confundirá o modelo, pois ele tentará levar em conta dados que não impactam sua decisão final. Se um modelo precisar de mais tempo na fase de treinamento devido a esses dados irrelevantes, você pode esperar gastar mais tempo, recursos computacionais e dinheiro para treinar um modelo útil.

A CAS garante a qualidade dos dados com um toque humano.

As preocupações com a qualidade dos dados existem em todos os lugares, mas a CAS reconhece e prioriza a natureza crítica desses fatores relacionados aos dados científicos. Os dados de química e ciências da vida podem variar bastante dependendo da sua fonte. Existem diversas maneiras diferentes de representar uma estrutura molecular na química. Entre elas: MDL Molfile (MOL), Formato de dados de estrutura (SDF), Sistema simplificado de entrada molecular de entrada de linha (SMILES) e Identificador químico Internacional (InChI). Existem prós e contras para cada uma dessas representações moleculares. A CAS conta com tecnologias que mapeiam todos os formatos moleculares para o CAS REGISTRY®. Quando a tecnologia sozinha não consegue determinar uma correspondência exata, a experiência humana é usada para identificar a estrutura correta. É por meio dessa curadoria humana que mantemos um banco de dados de alta qualidade de estruturas e reações químicas, que são utilizadas em diversas aplicações de IA, tanto na CAS quanto em parceria com outras instituições.

Da mesma forma, a CAS tem se baseado na curadoria humana em nossa recente expansão para dados de ciências da vida. A equipe global de cientistas e tecnólogos da CAS analisa dados de ciências da vida, como farmacologia, biomarcadores e vias de sinalização. Esse esforço garante que nossos dados sejam precisos e consistentes, que são componentes essenciais para conjuntos de dados de alta qualidade. Quando nosso conjunto de dados farmacológicos foi usado para treinar um modelo existente para prever a atividade de uma molécula contra um alvo proteico, observamos uma redução de 56% na diferença entre os valores experimentais e os previstos em comparação com o modelo de base e uma redução de 23% no desvio padrão. Esse esforço demonstra a importância da qualidade dos dados, que pode ser encontrada em todos os conjuntos de dados da CAS.

Na CAS, acreditamos na importância da qualidade dos dados nas aplicações de IA. Com a intervenção humana, geramos conjuntos de dados consistentes e de alta precisão. Ao longo de nossos mais de 100 anos de existência, desenvolvemos expertise em gestão de conteúdo e conhecimento. Nossos cientistas se baseiam nessa experiência para avaliar a completude e a relevância de um conjunto de dados para uma determinada aplicação de IA. Utilizando essa especialização, eles podem identificar problemas de completude e relevância em um conjunto de dados e desenvolver um plano para solucionar esses problemas.