Resumo executivo

  • As buscas de patentes são diferentes de outros tipos de pesquisa científica porque os dados de patentes não são padronizados, estão dispersos em muitos tipos de documentos e nem sempre usam uma linguagem clara e consistente.
  • Ferramentas de IA padrão e modelos de linguagem grandes têm dificuldade em retornar todos os dados relevantes relacionados a patentes devido à variabilidade nas fontes e na terminologia.
  • Dados estruturados e indexados que normalizam as diferenças semânticas e documentais são o ingrediente chave para tornar a busca de patentes habilitada por IA bem-sucedida.
  • O CAS IP Finder, potencializado pelo STN™, é um exemplo de dados indexados e curados por humanos com recursos de busca de IA de ponta que podem identificar de forma confiável informações relevantes de patentes.

Para concretizar um avanço empolgante ou uma nova inovação, você precisa verificar se uma determinada substância foi patenteada. As informações de patentes estão dispersas em muitas fontes, e o tempo é essencial. Você sabe a pergunta que deseja fazer: “Quais catalisadores na literatura alcançaram >90% de seletividade para a conversão de CO₂ em metanol?” Você deveria inseri-la em um modelo de linguagem grande (LLM) de uso geral e ver o que obtém?

CAS Newton transforms patent and IP searching with intuitive, conversational AI that understands your intent and delivers relevant insights so you can search with confidence, reduce uncertainty, and make IP decisions faster.

‍

Pode parecer contraintuitivo, mas a resposta é não. LLMs padrão podem vasculhar grandes quantidades de publicações rapidamente, mas a busca por informações de patentes e estado da técnica envolve complexidades únicas que as ferramentas baseadas em IA nem sempre estão equipadas para lidar. Isso também não é uma questão simples de “lixo entra, lixo sai”. Para que as buscas de patentes sejam bem-sucedidas, os pesquisadores devem usar dados indexados e estruturados com soluções habilitadas por IA que possam navegar pelas complexidades da literatura de patentes e revelar insights acionáveis.

Por que a busca de patentes é diferente

As patentes são redigidas com um propósito diferente dos artigos de periódicos ou outras publicações científicas: proteger a propriedade intelectual (PI). Em vez de visar a divulgação de seu conteúdo para serem descobertos e citados, como nas publicações de periódicos, os autores de pedidos de patentes buscam fornecer apenas a quantidade de dados absolutamente necessária para obter uma patente com sucesso. Esses pedidos podem manter um certo grau de sigilo ou até mesmo ofuscação sobre avanços inovadores.

Os documentos de patentes também podem conter muito “ruído” em suas seções iniciais, como longas descrições ou listas de materiais ou compostos relacionados que não têm impacto na nova inovação em si. Essas listas extensas geralmente são incluídas para criar posições de reserva ou articular pequenas variações para evitar que pequenas otimizações da invenção sejam posteriormente reivindicadas como inventivas. No entanto, isso pode fazer com que um documento pareça relevante quando ele apenas descreve superficialmente uma substância ou tópico, confundindo os processos de busca.

Além disso, a literatura de patentes carece da padronização da publicação científica. Os documentos são organizados de forma diferente entre jurisdições, requerentes e sistemas de classificação, e sua terminologia muitas vezes reflete jargões organizacionais ou peculiaridades históricas em vez de qualquer convenção compartilhada. Por exemplo, na literatura científica revisada por pares, a palavra “copolímero” significa mais frequentemente qualquer polímero que compreenda dois ou mais monômeros. Na literatura de patentes, ela geralmente significa um polímero com exatamente dois monômeros, enquanto o termo “interpolímero” é usado de forma mais ampla para se referir a polímeros com múltiplos monômeros.

As informações de patentes são, portanto, diluídas, ou seja, espalhadas por um conjunto difuso de documentos, e os pesquisadores devem usar perguntas “diluídas” para pesquisar nesse amplo conjunto com terminologia inconsistente e linguagem geralmente vaga (pense em patentes de plataforma que tentam cobrir amplamente métodos e tecnologias que são a base para soluções futuras). Para voltar ao nosso exemplo anterior com a pergunta sobre catalisadores, vamos compará-la a uma pergunta “concentrada”:

  • Concentrada: Qual é o ponto de ebulição do acetonitrilo?
  • Diluída: Quais catalisadores na literatura alcançaram >90% de seletividade para a conversão de CO₂ em‑metanol?

‍

Como a IA facilita a busca de patentes — e como ela não facilita

Pode parecer que as buscas de patentes são o caso de uso perfeito para IA generativa e LLMs, já que essas ferramentas podem analisar grandes conjuntos de documentos díspares em qualquer banco de dados ou até mesmo em toda a internet. No entanto, a complexidade da literatura de patentes torna difícil para LLMs padrão retornarem resultados de qualidade. Essas plataformas buscam padrões, mas, como discutimos, as patentes nem sempre seguem padrões ou usam a mesma linguagem para descrever a mesma coisa.  

LLMs frequentemente têm dificuldade com perguntas vagas. Eles podem retornar uma resposta robusta, mas os pesquisadores não podem ter total confiança de que o LLM entendeu todos os tipos de fontes a serem verificadas ou que não se confundiu com diferenças semânticas. Para verificar a patenteabilidade, os pesquisadores devem avaliar pedidos de patentes e literatura científica em conjunto. Para isso, é necessária uma harmonização de dados para que as ferramentas de IA, que podem percorrer mais material de origem mais rápido do que um humano, possam revisar todas as informações relevantes.  

O segredo é ter informações indexadas que sejam estruturadas e consistentes para a solução baseada em IA utilizar. Sem a indexação do material que uma ferramenta de IA está pesquisando, essa ferramenta é como alguém sendo deixado em uma biblioteca que não possui sistema de classificação e esperando que encontre livros sobre um tópico específico.

Especialização humana aliada à eficiência tecnológica

Por que dados indexados são cruciais para buscas de patentes baseadas em IA? Dados estruturados e indexados permitem que LLMs e ferramentas de busca de IA distingam mais rapidamente entre reagentes, catalisadores e outros pontos de dados importantes sem desperdiçar tempo ou energia. A integridade dos dados também facilita a busca por informações relevantes em fontes díspares.

Por exemplo, a CAS indexa a CAS Content CollectionTM, o maior repositório de informações científicas com curadoria humana, que cria uma camada de dados unificada para a busca de patentes. Essa camada unificada permite comparações entre patentes e literatura científica ao normalizar diferentes terminologias. A literatura não patenteada frequentemente contém soluções alternativas e métodos que não infringem, os quais os pesquisadores precisam conhecer para comparar sua inovação com patentes existentes. Uma camada de dados unificada também pode revelar conexões entre setores e materiais invalidantes, que são cruciais para a busca de patentes, mas que podem se perder em diferentes fontes ou em suas semânticas.

Ontologias são fundamentais para essa camada de dados unificada porque definem termos canônicos, sinônimos, relacionamentos de domínio e significado contextual. Sem ontologias, cada domínio e até mesmo cada empresa ou organização falaria seu próprio dialeto científico. A IA requer a consistência que as ontologias fornecem para evitar alucinações e reconhecimento incorreto de padrões. No entanto, são necessários humanos para desenvolver ontologias e garantir que os dados sejam limpos, estruturados e consistentes para que as ferramentas de IA possam aproveitar esses dados adequadamente.

É isso que separa os dados da CAS de outros bancos de dados ou mecanismos de busca: aplicar a experiência humana para garantir a integridade dos dados permite que ferramentas tecnológicas poderosas descubram insights precisos mais rapidamente. Por exemplo, o CAS IP Finder™ oferece precisão inigualável em conteúdos altamente estruturados. Além disso, o CAS Newton℠ traz IA conversacional para a busca de patentes e PI, permitindo que você faça perguntas em linguagem simples e obtenha respostas de mais de 100 fontes de literatura de patentes e não patentes, com sugestões inteligentes para os próximos passos.

O futuro da busca de patentes com IA

A capacidade de ferramentas baseadas em IA e LLMs de pesquisar grandes quantidades de dados rapidamente os torna padrão, e até necessários, para a busca de patentes hoje. No entanto, como vimos com a natureza vaga das perguntas na busca de patentes e na própria documentação de patentes, a IA pode ter dificuldade em encontrar todas as informações relevantes e superar diferenças de terminologia. Sem a integridade dos dados por meio de ontologias e outras formas de curadoria, até as ferramentas de IA mais poderosas podem perder o estado da técnica crítico.

A IA continuará a desempenhar um papel em todas as partes do ciclo de vida da patente, desde a busca exploratória e a determinação da liberdade de operação até a realização de análises de infração e identificação de oposições. Para pesquisadores que buscam avançar em suas descobertas agora, dados estruturados que combinam experiência humana com a velocidade da tecnologia de ponta permanecem o catalisador necessário para impulsionar a inovação.

Perguntas e respostas

Por que a busca de patentes é diferente de outras buscas de literatura científica?

Por que a IA tem dificuldade em retornar os resultados de busca adequados para patentes?

Como os pesquisadores podem superar os desafios de dados para usar IA em buscas de patentes?

Insights relacionados do CAS

Túnel digital abstrato com círculos concêntricos em azul e verde brilhantes e partículas de luz.

Transformação Digital na Indústria Farmacêutica: A Base por Trás da IA que Gera Resultados

Cilindros translúcidos em tons de rosa e roxo com fluxos de dados sobre uma grade hexagonal.

O desafio de avaliação no centro da IA científica

Close de um microchip brilhante em uma placa de circuito com feixes de luz coloridos emitidos a partir do centro.

Integridade de dados para pesquisas científicas impulsionadas por IA

Receba novas perspectivas para progredir mais rápido diretamente na sua caixa de entrada.