Como destacamos em nosso artigo anterior, uma IA sem dados de treinamento completos e de alta qualidade é como um carro sem motor: pode parecer bonito, mas não vai a lugar nenhum. A transparência da IA é igualmente importante para nossos usuários, e é por isso que nosso objetivo é informá-los precisamente quando e onde a IA é utilizada, para que possam tomar decisões fundamentadas.
Um risco bem conhecido da IA generativa é a "alucinação", um cenário em que o modelo cria dados que parecem realistas, às vezes até com citações falsificadas, mas que estão completamente incorretos. Essas alucinações não podem ser toleradas em P&D, portanto, medidas devem ser tomadas para evitá-las.
Neste artigo, discutiremos como a CAS está posicionada de forma única para preencher a lacuna entre a IA e a descoberta científica. Abordaremos como aproveitamos estrategicamente a IA, minimizando alucinações e priorizando dados de treinamento de qualidade, para fornecer aos nossos usuários informações críticas que impulsionam suas pesquisas.
Dados de Treinamento
Dados precisos são um requisito em P&D científico. Os resultados de um experimento ou teste podem determinar se um medicamento chegará ao mercado ou se uma linha de produtos inteira precisará ser reformulada.
Dados de treinamento são um corpus curado usado para treinar um modelo de IA. Esses dados podem ajudar o modelo a identificar padrões, aprender tarefas ou fazer previsões. Os modelos são tão bons quanto seus dados; como diz o ditado, "lixo entra, lixo sai".
Por mais de 100 anos, a CAS tem sido a fonte autorizada de informações químicas, com cientistas internos selecionando a coleção de dados químicos mais abrangente do mundo. Agora, estamos expandindo nossa experiência em curadoria para desenvolver modelos de IA que ajudarão nos avanços científicos. Nossos clientes dependem de nós para oferecer dados confiáveis e consistentes. Garantir que os dados de treinamento selecionados por especialistas que compilamos sejam igualmente confiáveis ajuda a assegurar que o desempenho seja consistente e alinhado às expectativas de nossos clientes.
Respostas Reais, Sem Alucinações
Para muitos de nós, a primeira coisa que vem à mente quando pensamos em IA são chatbots gerando respostas que podem estar incorretas com base na qualidade de sua fonte. E se as respostas já tivessem sido selecionadas, verificadas e organizadas por especialistas no assunto? Nesse caso, a IA pode ser usada para explorar e descobrir insights de uma maneira mais simplificada, que também gera confiança.
Transparência
Ao longo de nossa jornada para reimaginar a busca e a descoberta científica, incorporamos ciclos de feedback de nossos clientes para orientar nosso planejamento, e um tema central de feedback que encontramos foi a confiança. As novas inovações com IA são empolgantes, no entanto, com resultados que muitas vezes não são reproduzíveis, mudam abruptamente com pequenas modificações nas entradas e funcionam como uma "caixa preta" sem explicação do que foi feito ou como os resultados foram gerados, os usuários não confiam nos resultados científicos gerados por muitas ferramentas de IA.
Manter a confiança do usuário em nosso conteúdo e soluções é fundamental. Embora possamos tomar medidas para minimizar a falta de confiabilidade na forma como a LLM faz a interface entre o usuário e nossos dados, ela é inerentemente propensa à variabilidade. A hesitação em experimentar recursos aprimorados por IA pode ser mitigada sendo transparente sobre onde a IA está sendo usada no produto e fornecendo caminhos alternativos óbvios para encontrar as informações que os usuários procuram.
SearchSense no CAS SciFinder
Então, onde o CAS SciFinder se encaixa? Assim como a população em geral, os pesquisadores científicos se beneficiarão de menos tempo gasto vasculhando grandes quantidades de informações, o que é uma grande ineficiência para a comunidade científica. Criamos uma variedade de melhorias de busca habilitadas por IA no CAS SciFinder, que chamamos de SearchSense, para aliviar esse fardo, simplificando a descoberta de informações enquanto mantemos a integridade científica.
Nos últimos doze meses, a CAS tem construído o maior mecanismo de busca de informações científicas autorizado, abrangente e confiável – desenvolvido por cientistas, para cientistas. O SearchSense combina nossa coleção de química, líder na categoria, com IA para fornecer aos pesquisadores respostas mais rápidas sem comprometer a precisão.
Princípios Fundamentais
Quando começamos a incorporar IA ao CAS SciFinder, estabelecemos padrões fundamentais dos quais não abriríamos mão, garantindo que nossas soluções seguissem estes princípios:
- Priorizar a precisão na entrega de conteúdo.
- Manter a velocidade da resposta de busca.
- Preservar a confidencialidade dos dados do cliente.
Como o SearchSense funciona
O SearchSense é único porque utiliza IA para interpretar a intenção de busca em vez de gerar respostas. Ao compreender a intenção da consulta do usuário, o CAS SciFinder direciona os usuários para respostas relevantes e dados de suporte já cuidadosamente curados, seguindo os padrões de confiabilidade e correção do CAS. A precisão na interpretação da intenção depende amplamente de um corpus de treinamento robusto e de qualidade. Nosso conjunto de dados de treinamento de consultas baseia-se em mais de dez mil pontos de dados criados por especialistas do CAS. Ele abrange todas as disciplinas científicas presentes em nosso conteúdo — um esforço desafiador para manter o desempenho em todas as áreas, mas descobrimos que adicionar mais dados, mesmo algumas centenas de pontos, trouxe benefícios sinérgicos à precisão geral.
Arquitetura e desempenho do modelo
Os dados de treinamento foram usados para treinar um modelo de IA capaz de determinar a intenção de busca das consultas. A velocidade e a precisão dependem do tamanho do modelo utilizado e, embora modelos com mais parâmetros sejam geralmente mais precisos, pesquisas mostram que modelos menores, com casos de uso específicos e dados de treinamento de qualidade, podem produzir uma precisão aceitável¹. Utilizamos um modelo de 7 bilhões de parâmetros, consideravelmente menor que alguns dos modelos maiores (com mais de 1 trilhão de parâmetros). Dados de treinamento de alta qualidade tornaram a precisão do modelo pequeno aceitável, permitindo-nos manter um desempenho de busca sólido.
O CAS SciFinder utiliza um algoritmo de busca poderoso para encontrar os resultados mais relevantes, mas ele é personalizado e não utiliza linguagem de consulta padrão. Devido à natureza proprietária de nossa arquitetura de busca, precisávamos treinar o modelo de IA para produzir uma linguagem que nosso sistema pudesse entender para realizar a busca correspondente. Isso garantiu que alcançássemos o objetivo de unir a interpretação de consultas habilitada por IA aos resultados complexos do mecanismo de busca proprietário. Isso nos permite apresentar dados relevantes aos usuários com menos tempo e esforço.
Segurança e privacidade de dados
Entendemos a natureza sensível da pesquisa de nossos clientes, por isso a confidencialidade dos dados é fundamental para nós. Todos os modelos que desenvolvemos são proprietários e hospedados localmente, garantindo que nenhum dado saia sob nossos cuidados. Clique aqui para mais informações sobre o uso ético de inteligência artificial no CAS.
Conclusão
O CAS SciFinder está comprometido em viabilizar o sucesso da pesquisa e descoberta científica, mantendo a confiança que nossos clientes valorizam. Com o lançamento do SearchSense no CAS SciFinder, demos passos para garantir que estamos aproveitando novas tecnologias poderosas de forma mais inteligente. Nossos especialistas, nossa coleção de conteúdo de primeira linha e nossa tecnologia trabalham juntos para trazer mais benefícios aos nossos usuários, abrindo caminho para novos avanços na pesquisa e desenvolvimento científico.
