Por que maior nem sempre é melhor com ferramentas de IA e aplicações especializadas
Desde o seu lançamento em 2022, o ChatGPT redefiniu a conversa sobre IA. Ele foi aclamado tanto como um milagre quanto como uma ameaça — desde promessas positivas, como revolucionar o trabalho e revitalizar cidades, até impactos negativos, como a substituição de humanos em seus empregos, diz-se que este grande modelo de linguagem (LLM) é capaz de quase tudo.
Qual é a diferença entre o ChatGPT e o GPT-3/GPT-4?
Existem diferenças importantes entre o ChatGPT e os próprios LLMs, chamados de GPT- seguido de um número (por exemplo, GPT-3 ou GPT-4). Eles são frequentemente confundidos ou usados de forma intercambiável, mas o ChatGPT é o aplicativo de chatbot com interface "fácil de usar" que roda sobre os LLMs mais complexos (GPT-3 ou GPT-4).
GPT-3 e GPT-4 são versões diferentes em uma série de modelos Generative Pre-Trained Transformer. Transformers são um tipo de rede neural conhecida como modelos de linguagem. Esses modelos podem aprender a reconhecer padrões e contextos em dados pouco estruturados, como palavras em frases. Os Transformers são especialmente bons nisso. Um modelo generativo, quando recebe um contexto, pode gerar uma saída arbitrariamente longa a partir de um prompt. Os modelos GPT combinam esses dois tipos de modelos.
Por outro lado, o ChatGPT é o aplicativo que roda sobre LLMs como o GPT-3 ou GPT-4. Ele possui um módulo de memória para continuar conversas anteriores e conta com filtros, classificadores e outros recursos integrados para minimizar respostas tóxicas ou inadequadas.

O que é necessário para construir um LLM?
Os LLMs são impressionantes. O GPT-3 tem 175 bilhões de parâmetros, ou valores que o modelo pode alterar independentemente à medida que aprende. O GPT-4, a versão mais recente da série GPT lançada em 2023, é ainda maior, com 1 trilhão de parâmetros. Como qualquer pessoa que já os utilizou pode confirmar, esses modelos possuem um conhecimento incrivelmente amplo e uma capacidade surpreendentemente boa de produzir informações coerentes.
No entanto, essas capacidades vêm, literalmente, com custos. Treinar esses modelos GPT cada vez maiores e implantar aplicativos como o ChatGPT é um feito de engenharia tremendo. Estima-se que o GPT-3 custou US$ 4,6 milhões para ser construído e pelo menos US$ 87.000 por ano para operar na nuvem. O GPT-4 provavelmente custou impressionantes US$ 100 milhões ou mais para ser desenvolvido.
Além desses números, há os custos significativos de hardware e recursos para mantê-lo operando, garantindo que seus data centers sejam resfriados. Data centers podem usar bilhões de litros de água, e o ar-condicionado consome energia e contribui para as emissões, o que força as organizações a avaliar os custos e benefícios dessas ferramentas poderosas. Devido a esses custos iniciais e contínuos, os LLMs já são proibitivamente caros para a maioria das empresas privadas, instituições acadêmicas e organizações do setor público, e isso continuará à medida que os modelos se tornarem maiores e mais poderosos.
As limitações dos LLMs
Graças a componentes estruturais específicos, os modelos transformer capturam a relação entre diferentes entradas e, graças a uma vasta quantidade de textos de exemplo, os LLMs modernos tornaram-se muito bons em extrair a semântica ampla de um texto e acompanhar as relações entre elementos textuais. Modelos generativos como o GPT-3 foram um passo além e aprenderam a acompanhar essas relações tanto na pergunta quanto na resposta. Os resultados são frequentemente convincentes. Podemos pedir ao ChatGPT um número entre 0 e 100, ou perguntar se o colesterol é um esteroide, e provavelmente obteremos a resposta correta.
Para aplicações especializadas, como a pesquisa científica, no entanto, os grandes modelos de linguagem podem ter dificuldade em ir além da semântica ampla e entender informações específicas e sutis. Por que isso acontece? Primeiro, os LLMs não estão imunes ao problema de "lixo entra, lixo sai". Segundo, mesmo com dados de treinamento de alta qualidade, as informações relevantes podem estar sub-representadas.
Tópicos amplos e frequentemente descritos são bem capturados pelos LLMs, mas tópicos restritos e especializados estão quase sempre sub-representados e tendem a ser menos bem tratados. Por exemplo, um grande modelo de linguagem pode atingir o nível de abstração correto e determinar se algo é uma molécula de esteroide. Ele poderia até reconhecer duas moléculas de esteroide na mesma família, mas não conseguiria reconhecer consistentemente se uma é extremamente tóxica e a outra não. A capacidade do grande modelo de linguagem de fazer essa distinção depende dos dados usados para o treinamento e se a informação correta foi reconhecida e "memorizada". Se ela estava escondida em um mar de informações ruins ou conflitantes, não há como o modelo chegar à resposta correta.
Alguns poderiam argumentar que mais dados, dados mais limpos e modelos maiores resolveriam esse problema. Eles podem estar certos, mas e se pedirmos a um LLM generativo um número aleatório entre 0 e 100? Podemos ter certeza de que o número fornecido é realmente aleatório? Para responder a essa pergunta, precisamos ir além da semântica lexical e de fatos memorizados, além dos LLMs, em direção aos agentes de IA. Nesse caso, o agente construiria um código executável usando procedimentos validados, passaria para outro processo para executá-lo, processaria o resultado e apresentaria a resposta ao usuário.
Desafios específicos com dados científicos
Como meus colegas na CAS sabem, os dados científicos podem ser muito mais complexos do que o texto, e a maioria dos problemas não pode ser expressa em uma ou duas perguntas.
Ao usar ferramentas baseadas em IA para pesquisa científica, devemos nos perguntar: que problema estamos tentando resolver? Muitos problemas envolvem linguagem ou sequências pouco estruturadas, portanto, os modelos de linguagem são ideais. E quanto a dados tabulares, dados categóricos, grafos de conhecimento e séries temporais? Essas formas de dados são necessárias para a pesquisa científica, mas os LLMs nem sempre conseguem aproveitá-las. Isso significa que os LLMs, sozinhos, não podem fornecer o nível de especificidade necessário para uma aplicação como a pesquisa molecular. Em vez disso, da mesma forma que uma orquestra precisa de vários instrumentos para criar um som coeso, a ciência precisa de múltiplas ferramentas em sua caixa de ferramentas de IA para produzir resultados coerentes.
Uma abordagem de sistemas para profundidade e amplitude
Se os LLMs sozinhos não são adequados para a pesquisa científica, o que é? A resposta é uma abordagem de sistemas que utiliza vários tipos de modelos para gerar resultados especializados. Ao combinar modelos de linguagem e redes neurais com ferramentas tradicionais de aprendizado de máquina, grafos de conhecimento, quimioinformática e bioinformática, bem como métodos estatísticos como TF-IDF, os pesquisadores podem incluir informações profundas e detalhadas em seus programas baseados em IA.
Essas ferramentas podem fornecer os resultados específicos necessários para tarefas como o desenvolvimento de novas moléculas de medicamentos ou a invenção de um novo composto. Os grafos de conhecimento são particularmente valiosos porque atuam como uma verdade fundamental, conectando de forma confiável entidades conhecidas: uma molécula, reação, artigo publicado, conceito controlado, etc. Um caso de uso ideal é aproveitar uma rede neural profunda que pode dizer: “Esta é um determinado tipo de substância”, juntamente com um grafo de conhecimento que validará a precisão. É assim que chegamos aos fatos confiáveis necessários na pesquisa científica.
Esse tipo de abordagem de sistemas é essencialmente uma função de verificação de fatos para maior confiabilidade dos dados, e está se mostrando eficaz em aplicações especializadas. Por exemplo, a Nvidia lançou recentemente o Prismer, um modelo de visão e linguagem projetado para responder a perguntas ou fornecer legendas para imagens. Esse modelo usa uma abordagem de “mistura de especialistas” que treina vários submodelos menores. A profundidade de conhecimento desse modelo proporcionou resultados de qualidade sem um treinamento massivo; ele igualou o desempenho de modelos treinados com 10 a 20 vezes mais dados.
O Google também está trabalhando em uma abordagem semelhante, onde o conhecimento é extraído de um modelo de linguagem “professor” de uso geral para modelos “alunos” menores. Os modelos alunos apresentam informações melhores do que o modelo maior devido ao seu conhecimento mais profundo — um modelo aluno treinado com 770 milhões de parâmetros superou seu professor de 540 bilhões de parâmetros em uma tarefa de raciocínio especializado. Embora o modelo menor leve mais tempo para ser treinado, os ganhos contínuos de eficiência são valiosos, pois é mais barato e mais rápido de executar.
Melhorando a pesquisa científica
Outro exemplo de uma abordagem de sistemas bem-sucedida é o PaSE, ou Patent Similarity Engine, desenvolvido por mim e meus colegas na CAS, que impulsiona recursos exclusivos no CAS STNext e no CAS SciFinder. Construímos esse modelo como parte de nossa colaboração com o Instituto Nacional da Propriedade Industrial (INPI) do Brasil. Ele foi projetado para processar grandes quantidades de informações em apenas alguns minutos, para que os pesquisadores pudessem lidar com o acúmulo persistente de patentes.
A solução inclui um modelo de linguagem que usa as mesmas técnicas críticas de aprendizado de máquina da família GPT, mas adiciona outros tipos de aprendizado, incluindo grafos de conhecimento, quimioinformática e métodos estatísticos tradicionais de recuperação de informações. Ao treinar o modelo com a ciência mundial, como as patentes e periódicos em texto completo dentro da CAS Content CollectionTM, o PaSE alcançou a profundidade e a amplitude necessárias para encontrar “estado da técnica” 50% mais rápido do que a pesquisa manual.
Para os escritórios de patentes, provar que algo não existe é extremamente desafiador. Pense no ditado: “A ausência de evidência não é evidência de ausência”. Nossos cientistas de dados treinaram e otimizaram o modelo em conjunto com pesquisadores de patentes especializados, a equipe do INPI brasileiro e uma combinação única de ferramentas de IA que identificaram o estado da técnica com 40% menos pesquisa manual. Devido a esse desempenho e à redução no acúmulo de patentes, ele recebeu o Stu Kaback Business Impact Award do Patent Information Users Group em 2021.
O caminho a seguir para os grandes modelos de linguagem na ciência
Essa experiência mostra que os LLMs continuarão a ter um papel significativo na pesquisa científica daqui para frente, mas, ao contrário da crença popular, essa ferramenta única não é uma panaceia para todos os problemas ou perguntas.
Gosto de pensar nesses modelos em termos de organizar um quarto bagunçado em sua casa, digamos, um armário ou um sótão. Pessoas diferentes podem organizar os itens nesses cômodos de maneiras diferentes. Uma pessoa pode organizar tudo por cor, enquanto outra coloca todos os objetos de valor juntos, e outra pessoa os organiza por função. Nenhuma dessas abordagens está errada, mas pode não ser o tipo de organização que você deseja ou precisa. Esse é essencialmente o problema com os LLMs, que podem organizar as informações de uma determinada maneira, mas não da forma que um cientista ou pesquisador precisa.
Para aplicações especializadas em que um usuário exige um determinado resultado, como sequências de proteínas, informações de patentes ou estruturas químicas, os modelos baseados em IA devem ser treinados para organizar e processar informações de maneiras específicas. Eles precisam organizar os dados, resultados e variáveis da maneira que seus usuários desejam para obter treinamento e previsões ideais.
Para saber mais sobre o impacto desses dados, sua representação e os modelos que estão melhorando as previsões na ciência, confira nossos estudos de caso com a CAS Custom Services. Quer saber mais sobre o cenário emergente da IA e da química? Leia nosso white paper mais recente sobre as oportunidades que a IA oferece para a química ou explore nossos recursos sobre como a IA pode melhorar a produtividade em escritórios de patentes em todo o mundo.




