Treinamento e transparência no mundo da IA

Hexagon shaped overlay

Como explicamos em nosso artigo anterior, a IA sem dados de treinamento completos e de alta qualidade é como um carro sem motor – pode até parecer bonito, mas não vai a lugar nenhum. A transparência em relação à IA é igualmente importante para os nossos usuários, e é por isso que buscamos informá-los com precisão quando e onde a IA é usada, para que possam tomar decisões bem fundamentadas.

Um risco bem conhecido da IA generativa é a "alucinação", um cenário em que o modelo cria dados com aparência realista, às vezes com citações falsas, mas que estão completamente incorretos. Essas alucinações não podem ser toleradas em P&D, portanto, medidas devem ser tomadas para evitá-las.

Neste artigo, discutiremos como a CAS está numa posição única para preencher a lacuna entre a IA e a descoberta científica. Vamos abordar como temos usado a IA estrategicamente, minimizando as alucinações e priorizando dados de treinamento de qualidade, para fornecer aos nossos usuários informações essenciais para impulsionar suas pesquisas.

Dados de Treinamento

Dados precisos são um requisito na P&D científica. Os resultados de um experimento ou teste podem determinar se um medicamento chegará ao mercado ou se toda uma linha de produtos precisará ser reformulada.

Os dados de treinamento são um corpus selecionado que é usado para treinar um modelo de IA. Os dados podem ajudar o modelo a identificar padrões, aprender tarefas ou fazer previsões. Os modelos são tão bons quanto os dados que utilizam; como diz o ditado, "entra lixo, sai lixo".

Há mais de 100 anos, a CAS é a fonte de referência em informações químicas, com cientistas internos que tratam a coleção de dados químicos mais abrangente do mundo. Agora, estamos expandindo nossa expertise em curadoria para desenvolver modelos de IA que auxiliarão nos avanços científicos. Nossos clientes dependem de nós para fornecer dados confiáveis e consistentes. Garantir que os dados de treinamento tratados por especialistas que compilamos sejam igualmente confiáveis ajuda a assegurar que o desempenho seja consistente e esteja alinhado com as expectativas de nossos clientes.

Respostas reais, sem alucinações.

Para muitos de nós, a primeira coisa que vem à mente quando pensamos em IA é que os chatbots geram respostas que podem estar incorretas dependendo da qualidade da sua fonte. E se as respostas já tiverem sido tratadas, verificadas e organizadas por especialistas no assunto? Nesse caso, a IA pode ser usada para explorar e descobrir insights de uma maneira mais simplificada, o que também gera confiança.

Transparência

Ao longo da nossa jornada para reimaginar a busca e a descoberta científica, incorporamos ciclos de feedback dos nossos clientes para orientar nosso planejamento, e um tema fundamental que encontramos nesse feedback foi a confiança. As inovações em IA são animadoras, porém, com resultados que muitas vezes não são reproduzíveis, mudam abruptamente com pequenas modificações nas entradas e funcionam como uma "caixa preta" sem explicação sobre o que foi feito ou como os resultados foram gerados, os usuários não confiam nos resultados científicos produzidos por muitas ferramentas de IA.

Manter a confiança do usuário em nosso conteúdo e soluções é fundamental. Embora possamos tomar medidas para minimizar a falta de confiabilidade na forma como o LLM interage entre o usuário e nossos dados, ele é inerentemente propenso à variabilidade. A hesitação em experimentar recursos aprimorados por IA pode ser atenuada pela transparência sobre onde a IA está sendo usada no produto e pelo fornecimento de alternativas óbvias para que os usuários encontrem as informações que procuram.

SearchSense no CAS SciFinder

E onde entra o CAS SciFinder? Assim como a população em geral, os pesquisadores científicos se beneficiarão com menos tempo gasto analisando grandes quantidades de informações, o que representa uma grande ineficiência para a comunidade científica. Criamos uma série de melhorias de busca com inteligência artificial no CAS SciFinder, que denominamos SearchSense, para facilitar esse processo, simplificando a descoberta de informações enquanto mantém a integridade científica.

Nos últimos 12 meses, a CAS vem construindo o maior mecanismo de busca de informações científicas – completo, confiável e com autoridade – desenvolvido por cientistas, para cientistas. O SearchSense combina nossa coleção de química de referência com IA para entregar respostas mais rápidas aos pesquisadores, sem comprometer a precisão.

Princípios fundamentais

Quando começamos a incorporar IA no CAS SciFinder, havia padrões fundamentais que não queríamos comprometer, portanto, nossas soluções precisariam aderir a estes princípios:

  • Priorizar a precisão na entrega do conteúdo.
  • Manter a velocidade de resposta da busca.
  • Preservar a confidencialidade dos dados do cliente.

Como o SearchSense Funciona

O SearchSense é único porque usa IA para interpretar a intenção da busca em vez de gerar respostas. Ao compreender a intenção da consulta de um usuário, o CAS SciFinder pode direcioná-lo para as respostas relevantes e os dados de apoio que já foram cuidadosamente tratados, seguindo os padrões de confiabilidade e correção da CAS. A precisão da interpretação da intenção depende em grande parte de um corpus de treinamento robusto e de qualidade. Nosso conjunto de dados de treinamento para consultas de pesquisa é baseado em uma coleção de mais de dez mil pontos de dados criados por especialistas da CAS. Ela abrange todas as diferentes disciplinas científicas cobertas pelo nosso conteúdo – um esforço assustador para tentar manter o desempenho em todas as áreas, mas descobrimos que adicionar mais dados, mesmo que algumas centenas de pontos de dados, mostrou um benefício sinérgico na precisão geral.

Arquitetura e Desempenho do Modelo

Os dados de treinamento foram usados para treinar um modelo de IA para determinar a intenção de busca das consultas. A velocidade e a precisão dependem do tamanho do modelo utilizado e, embora os modelos que utilizam mais parâmetros sejam geralmente mais precisos, pesquisas demonstraram que modelos menores com casos de uso específicos e dados de treinamento de qualidade podem produzir uma precisão aceitável¹. Usamos um modelo de 7 bilhões de parâmetros, que é consideravelmente menor do que alguns dos modelos maiores (mais de 1 trilhão de parâmetros). Dados de treinamento de alta qualidade tornaram a precisão do modelo pequeno ainda aceitável e nos permitiram manter um desempenho de pesquisa sólido.

O CAS SciFinder usa um algoritmo de busca poderoso para encontrar os resultados mais relevantes, mas ele foi desenvolvido sob medida e não usa uma linguagem de consulta padrão. Devido à natureza proprietária da nossa arquitetura de busca, precisamos treinar o modelo de IA para produzir uma linguagem que nosso sistema pudesse entender para realizar a busca correspondente. Isso garantiu que pudéssemos atingir o objetivo de combinar a interpretação de consultas habilitada por IA com os resultados complexos do mecanismo de busca proprietário. Isso nos permite apresentar dados relevantes aos usuários com menos tempo e esforço.

Segurança e privacidade dos dados

Entendemos a natureza sensível da pesquisa de nossos clientes, por isso a confidencialidade dos dados é importante para nós. Todos os modelos que desenvolvemos são proprietários e hospedados em nossas instalações, de forma que nenhum dado saia de nossa responsabilidade. Clique aqui para obter mais informações sobre o uso ético da inteligência artificial na CAS.

Conclusão

O CAS SciFinder está empenhado em viabilizar o sucesso da pesquisa e da descoberta científica, enquanto mantém a confiança que nossos clientes valorizam. Com o lançamento do SearchSense no CAS SciFinder, tomamos medidas para garantir que estamos aproveitando as novas e poderosas tecnologias de uma forma mais inteligente. Nossos especialistas, nossa coleção de conteúdo de primeira linha e nossa tecnologia trabalham juntos para trazer mais benefícios aos nossos usuários, abrindo caminho para novos avanços na pesquisa e desenvolvimento científicos.