Executive Summary
- As buscas de patentes são diferentes de outros tipos de pesquisa científica porque os dados de patentes não são padronizados, estão dispersos em muitos tipos de documentos e nem sempre usam uma linguagem clara e consistente.
- As ferramentas de inteligência artificial padrão e os grandes modelos de linguagem têm dificuldade em retornar todos os dados relevantes relacionados a patentes devido à variabilidade nas fontes e na terminologia.
- Dados estruturados e indexados que normalizam as diferenças semânticas e documentais são o ingrediente principal para tornar a busca de patentes habilitada por inteligência artificial bem-sucedida.
- O CAS IP Finder, impulsionado pelo STN™, é um exemplo de dados indexados e tratados por humanos com recursos de busca de inteligência artificial de ponta que podem identificar de forma confiável informações relevantes sobre patentes.
Para realizar uma descoberta importante ou uma nova inovação, você precisa verificar se uma determinada substância foi patenteada. As informações sobre patentes estão dispersas em muitas fontes, e o tempo é essencial. Você sabe a pergunta que deseja fazer: “Quais catalisadores em toda a literatura alcançaram >90% de seletividade para a conversão de CO₂ em metanol?” Você deveria inseri-la em um grande modelo de linguagem (LLM) de uso geral e ver o que obtém?
Pode parecer contraintuitivo, mas a resposta é não. Os LLMs padrão podem vasculhar grandes quantidades de publicações rapidamente, mas a busca por informações de patentes e estado da técnica envolve complexidades únicas que as ferramentas baseadas em inteligência artificial nem sempre estão equipadas para lidar. Isso também não é uma questão simples de “lixo entra, lixo sai”. Para que as buscas de patentes sejam bem-sucedidas, os pesquisadores devem usar dados indexados e estruturados com soluções habilitadas por inteligência artificial que possam navegar pelas complexidades da literatura de patentes e revelar insights acionáveis.
Por que a busca de patentes é diferente
As patentes são redigidas com um propósito diferente dos artigos de periódicos ou outras publicações científicas: proteger a propriedade intelectual (PI). Em vez de buscar divulgar seu conteúdo para serem descobertos e citados, como nas publicações de periódicos, os autores de pedidos de patente buscam fornecer apenas a quantidade de dados absolutamente necessária para receber uma patente com sucesso. Esses pedidos podem manter um certo grau de sigilo ou até mesmo ofuscação de descobertas importantes.
Documentos de patente também podem conter muito "ruído" em suas seções iniciais, como longas descrições ou listas de materiais ou compostos relacionados que não têm impacto na nova inovação em si. Essas listas extensas são geralmente incluídas para criar posições de fallback ou articular pequenas variações para evitar que pequenas otimizações da invenção sejam posteriormente reivindicadas como inventivas. No entanto, isso pode fazer com que um documento pareça relevante quando ele apenas descreve superficialmente uma substância ou tópico, confundindo os processos de busca.
Além disso, a literatura de patentes carece da padronização das publicações científicas. Os documentos são organizados de forma diferente entre jurisdições, requerentes e sistemas de classificação, e sua terminologia frequentemente reflete o jargão organizacional ou peculiaridades históricas em vez de qualquer convenção compartilhada. Por exemplo, na literatura científica revisada por pares, a palavra "copolímero" significa mais frequentemente qualquer polímero que compreenda dois ou mais monômeros. Na literatura de patentes, muitas vezes significa um polímero com exatamente dois monômeros, enquanto o termo "interpolímero" é usado de forma mais ampla para se referir a polímeros com múltiplos monômeros.
As informações de patentes são, portanto, diluídas, ou seja, espalhadas por um conjunto difuso de documentos, e os pesquisadores devem usar perguntas "diluídas" para pesquisar em todo esse amplo conjunto com terminologia inconsistente e linguagem geralmente vaga (pense em patentes de plataforma que tentam cobrir amplamente métodos e tecnologias que são a base para outras soluções). Para voltar ao nosso exemplo anterior com a pergunta sobre catalisadores, vamos compará-lo com uma pergunta "concentrada":
- Concentrada: Qual é o ponto de ebulição do acetonitrilo?
- Diluída: Quais catalisadores em toda a literatura alcançaram >90% de seletividade para a conversão de CO₂ em‑metanol?
Como a inteligência artificial facilita a busca de patentes — e como ela não facilita
Pode parecer que as buscas de patentes são o caso de uso exato para inteligência artificial generativa e LLMs, já que essas ferramentas podem revisar grandes conjuntos de documentos díspares em qualquer banco de dados ou até mesmo em toda a internet. No entanto, a complexidade da literatura de patentes torna difícil para os LLMs padrão retornarem resultados de qualidade. Essas plataformas buscam padrões, mas, como discutimos, as patentes muitas vezes não seguem padrões ou nem mesmo usam a mesma linguagem para descrever a mesma coisa.
Os LLMs frequentemente têm dificuldades com perguntas diluídas. Eles podem retornar uma resposta robusta, mas os pesquisadores não podem ter total confiança de que o LLM entendeu todos os tipos de fontes a serem verificadas ou que ele não se confundiu com diferenças semânticas. Para verificar a patenteabilidade, os pesquisadores devem avaliar os pedidos de patente e a literatura científica em conjunto. Para fazer isso, deve haver harmonização de dados para que as ferramentas de inteligência artificial, que podem percorrer mais material de origem mais rápido do que um humano jamais poderia, possam revisar todas as informações relevantes.
O segredo é ter informações indexadas que sejam estruturadas e consistentes para uso pela solução baseada em inteligência artificial. Sem a indexação do material que uma ferramenta de inteligência artificial está buscando, essa ferramenta é como alguém que é deixado em uma biblioteca sem sistema de classificação decimal e de quem se espera que encontre livros sobre um tópico específico.
Expertise humana aliada à eficiência tecnológica
Por que dados indexados são cruciais para buscas de patentes baseadas em inteligência artificial? Dados estruturados e indexados permitem que LLMs e ferramentas de busca de inteligência artificial distingam mais rapidamente entre reagentes, catalisadores e outros pontos de dados importantes, sem desperdiçar tempo ou energia. A integridade dos dados também facilita a busca por informações relevantes em fontes distintas.
Por exemplo, o CAS indexa a CAS Content CollectionTM, o maior repositório de informações científicas com curadoria humana, que cria uma camada de dados unificada para a busca de patentes. Essa camada unificada permite comparações entre patentes e literatura científica ao normalizar diferentes terminologias. A literatura não patenteada frequentemente contém soluções alternativas e métodos que não infringem patentes, os quais os pesquisadores precisam conhecer para comparar sua inovação com patentes existentes. Uma camada de dados unificada também pode revelar conexões entre setores e materiais invalidantes, que são cruciais para a busca de patentes, mas que podem se perder em diferentes materiais de origem ou em sua semântica.
As ontologias são fundamentais para essa camada de dados unificada, pois definem termos canônicos, sinônimos, relacionamentos de domínio e significado contextual. Sem ontologias, cada domínio e até mesmo cada empresa ou organização falaria seu próprio dialeto científico. A inteligência artificial requer a consistência que as ontologias proporcionam para evitar alucinações e reconhecimento incorreto de padrões. No entanto, é necessário o trabalho humano para desenvolver ontologias e garantir que os dados estejam limpos, estruturados e consistentes, para que as ferramentas de inteligência artificial possam aproveitar esses dados adequadamente.
É isso que diferencia os dados do CAS de outros bancos de dados ou mecanismos de busca: aplicar a expertise humana para garantir a integridade dos dados permite que ferramentas tecnológicas poderosas descubram insights precisos mais rapidamente. Por exemplo, o CAS IP Finder™ oferece precisão incomparável em conteúdos altamente estruturados. Além disso, o CAS Newton℠ traz a inteligência artificial conversacional para a busca de patentes e PI, permitindo que você faça perguntas em linguagem simples e obtenha respostas de mais de 100 fontes de literatura de patentes e não patentes, com sugestões inteligentes para os próximos passos.
O futuro da busca de patentes com inteligência artificial
A capacidade de ferramentas baseadas em inteligência artificial e LLMs de buscar grandes quantidades de dados rapidamente os torna padrão, e até mesmo necessários, para a busca de patentes atualmente. No entanto, como vimos com a natureza diluída das perguntas na busca de patentes e no próprio documento de patente, a inteligência artificial pode ter dificuldade em encontrar todas as informações relevantes e superar as diferenças de terminologia. Sem a integridade dos dados por meio de ontologias e outras formas de curadoria, até mesmo as ferramentas de inteligência artificial mais poderosas podem perder um estado da técnica crítico.
A inteligência artificial continuará a desempenhar um papel em todas as partes do ciclo de vida da patente, desde a busca exploratória e a determinação da liberdade de operação até a realização de análise de infração e identificação de oposições. Para pesquisadores que buscam promover suas descobertas importantes agora, dados estruturados que combinam a experiência humana com a velocidade da tecnologia de ponta permanecem o catalisador de que precisam para impulsionar a inovação.
Questions and answers
Por que a busca de patentes é diferente de outras buscas de literatura científica?
A literatura de patentes pode estar espalhada por milhares de documentos, e a mesma inovação ou ideia pode ser descrita de maneiras diferentes. Às vezes, os requerentes de patentes obscurecem intencionalmente significados importantes e podem usar jargões organizacionais que não são usados em outros documentos. Isso requer uma descoberta ampla e a busca por muitos tipos de documentos e vocabulários, o que pode confundir as buscas humanas e as impulsionadas por computador.
Por que a inteligência artificial tem dificuldade em retornar os resultados de busca adequados para patentes?
Os LLMs padrão têm dificuldade porque dependem da correspondência de padrões na linguagem, e a natureza dispersa e diluída dos dados de patentes e das perguntas de busca de patentes desafia padrões consistentes. Os documentos de patente contêm quantidades significativas de "ruído", ou seja, as seções iniciais criam limites com descrições extensas do estado da técnica e "listas exaustivas" de medicamentos ou condições compatíveis coadministrados que não têm influência na invenção real.
Como os pesquisadores podem superar os desafios de dados para usar a inteligência artificial nas buscas de patentes?
Dados estruturados que possuem uma camada unificada são fundamentais para superar esses desafios. Quando LLMs ou ferramentas habilitadas por inteligência artificial são aplicados a dados estruturados e indexados, eles podem revelar informações que uma busca por palavra-chave perderia. A indexação permite que essas ferramentas realizem geração aumentada por recuperação, busca semântica e agrupamento de conceitos para resultados mais robustos e precisos.





