Cómo la integridad de los datos potencia la inteligencia artificial para la búsqueda de patentes

Cómo la integridad de los datos potencia la inteligencia artificial para la búsqueda de patentes

Executive Summary

  • Las búsquedas de patentes son diferentes de otros tipos de investigación científica porque los datos de patentes no están estandarizados, están dispersos en muchos tipos de documentos y no siempre utilizan un lenguaje claro y coherente.
  • Las herramientas de inteligencia artificial estándar y los modelos de lenguaje grandes tienen dificultades para devolver todos los datos relevantes relacionados con las patentes debido a la variabilidad de las fuentes y la terminología.
  • Los datos estructurados e indexados que normalizan las diferencias semánticas y documentales son el ingrediente clave para que la búsqueda de patentes habilitada por inteligencia artificial sea exitosa.
  • CAS IP Finder, con la tecnología de STN™, es un ejemplo de datos indexados y catalogados por humanos con capacidades de búsqueda de inteligencia artificial de vanguardia que pueden identificar de forma fiable información relevante sobre patentes.

Para lograr un avance emocionante o una nueva innovación, necesita saber si una determinada sustancia ha sido patentada. La información sobre patentes está dispersa en muchas fuentes y el tiempo es esencial. Usted sabe la pregunta que quiere hacer: “¿Qué catalizadores en la bibliografía han logrado una selectividad >90% para la conversión de CO₂ a metanol?”. ¿Debería introducirla en un modelo de lenguaje grande (LLM) de propósito general y ver qué obtiene?

CAS Newton transforms patent and IP searching with intuitive, conversational AI that understands your intent and delivers relevant insights so you can search with confidence, reduce uncertainty, and make IP decisions faster.

Puede parecer contradictorio, pero la respuesta es no. Los LLM estándar pueden rastrear grandes cantidades de publicaciones rápidamente, pero la búsqueda de información sobre patentes y el estado de la técnica implica complejidades únicas que las herramientas basadas en inteligencia artificial no siempre están equipadas para manejar. Tampoco se trata de un simple problema de "entra basura, sale basura". Para que las búsquedas de patentes tengan éxito, los investigadores deben utilizar datos indexados y estructurados con soluciones habilitadas por inteligencia artificial que puedan navegar por las complejidades de la bibliografía de patentes y revelar información procesable.

Por qué la búsqueda de patentes es diferente

Las patentes se redactan con un propósito diferente al de los artículos de revistas u otras publicaciones científicas: proteger la propiedad intelectual (IP). En lugar de intentar dar a conocer su contenido para ser descubiertos y citados, como ocurre en las publicaciones de revistas, los autores de las solicitudes de patentes buscan proporcionar solo la cantidad de datos absolutamente necesaria para recibir una patente con éxito. Estas solicitudes pueden mantener cierto grado de secreto o incluso ofuscación sobre los nuevos avances.

Las patentes también pueden contener mucho "ruido" en sus secciones iniciales, como largas descripciones o listas de materiales o compuestos relacionados que no tienen impacto en la innovación en sí. Estas extensas listas suelen incluirse para crear posiciones de respaldo o articular variaciones menores con el fin de evitar que pequeñas optimizaciones de la invención sean reclamadas posteriormente como inventivas. Sin embargo, esto puede hacer que un documento parezca relevante cuando solo describe superficialmente una sustancia o tema, lo que confunde los procesos de búsqueda.  

Además, la bibliografía de patentes carece de la estandarización de las publicaciones científicas. Los documentos se organizan de forma diferente según las jurisdicciones, los solicitantes y los sistemas de clasificación, y su terminología a menudo refleja la jerga organizativa o peculiaridades históricas en lugar de una convención compartida. Por ejemplo, en la bibliografía científica revisada por pares, la palabra "copolímero" significa con mayor frecuencia cualquier polímero que comprende dos o más monómeros. En la bibliografía de patentes, a menudo significa un polímero con exactamente dos monómeros, mientras que el término "interpolímero" se utiliza de forma más amplia para referirse a polímeros con múltiples monómeros.

Por lo tanto, la información de patentes es diluida, es decir, está dispersa en un conjunto difuso de documentos, y los investigadores deben utilizar preguntas "diluidas" para buscar en ese amplio conjunto con una terminología inconsistente y un lenguaje generalmente vago (piense en las patentes de plataforma que intentan cubrir ampliamente métodos y tecnologías que son la base para futuras soluciones). Para volver a nuestro ejemplo anterior con la pregunta sobre los catalizadores, veamos eso en comparación con una pregunta "concentrada":

  • Concentrada: ¿Cuál es el punto de ebullición del acetonitrilo?
  • Diluida: ¿Qué catalizadores en la bibliografía han logrado una selectividad >90% para la conversión de CO₂ ametanol?

Cómo la inteligencia artificial facilita la búsqueda de patentes, y cómo no lo hace

Puede parecer que las búsquedas de patentes son el caso de uso exacto para la inteligencia artificial generativa y los LLM, ya que estas herramientas pueden revisar enormes conjuntos de documentos dispares en cualquier base de datos o incluso en toda la internet. Sin embargo, la complejidad de la bibliografía de patentes dificulta que los LLM estándar devuelvan resultados de calidad. Estas plataformas buscan patrones, pero como hemos comentado, las patentes a menudo no siguen patrones ni utilizan el mismo lenguaje para describir lo mismo.  

Los LLM a menudo tienen dificultades con las preguntas diluidas. Pueden devolver una respuesta sólida, pero los investigadores no pueden estar completamente seguros de que el LLM haya entendido todos los tipos de fuentes que debe comprobar o que no se haya visto afectado por las diferencias semánticas. Para verificar la patentabilidad, los investigadores deben evaluar conjuntamente las solicitudes de patentes y la bibliografía científica. Para ello, debe haber una armonización de los datos de modo que las herramientas de inteligencia artificial, que pueden recorrer más material de origen más rápido de lo que un humano podría, puedan revisar toda la información relevante.  

La clave reside en disponer de información indexada que sea estructurada y coherente para que la solución basada en inteligencia artificial pueda utilizarla. Sin la indexación del material que una herramienta de inteligencia artificial busca, esta sería como alguien a quien dejan en una biblioteca sin sistema decimal Dewey y de quien se espera que encuentre libros sobre un tema específico.

Experiencia humana y eficiencia tecnológica

¿Por qué son críticos los datos indexados para las búsquedas de patentes basadas en inteligencia artificial? Los datos estructurados e indexados permiten a los modelos de lenguaje (LLM) y a las herramientas de búsqueda de inteligencia artificial distinguir con mayor rapidez entre reactivos, catalizadores y otros puntos de datos clave sin desperdiciar tiempo ni energía. La integridad de los datos también facilita la búsqueda de información relevante en fuentes dispares.

Por ejemplo, CAS indexa la CAS Content CollectionTM, el mayor repositorio de información científica catalogado por humanos, lo que crea una capa de datos unificada para la búsqueda de patentes. Esta capa unificada permite realizar comparaciones entre patentes y bibliografía científica mediante la normalización de diferentes terminologías. La bibliografía no relacionada con patentes a menudo contiene soluciones alternativas y métodos que no infringen derechos, los cuales los investigadores deben conocer para comparar su innovación con las patentes existentes. Una capa de datos unificada también puede revelar conexiones entre industrias y materiales invalidantes, elementos cruciales para la búsqueda de patentes que, de otro modo, podrían perderse debido a la diversidad de las fuentes o su semántica.

Las ontologías son fundamentales para esta capa de datos unificada, ya que definen términos canónicos, sinónimos, relaciones de dominio y significados contextuales. Sin ontologías, cada dominio e incluso cada empresa u organización hablaría su propio dialecto científico. La inteligencia artificial requiere la coherencia que proporcionan las ontologías para evitar alucinaciones y un reconocimiento de patrones incorrecto. Sin embargo, se necesita la intervención humana para desarrollar ontologías y garantizar que los datos estén limpios, estructurados y sean coherentes, de modo que las herramientas de inteligencia artificial puedan aprovechar esa información adecuadamente.

Esto es lo que diferencia a los datos de CAS de otras bases de datos o motores de búsqueda: la aplicación de la experiencia humana para garantizar la integridad de los datos permite que potentes herramientas tecnológicas descubran percepciones precisas con mayor rapidez. Por ejemplo, CAS IP Finder™ ofrece una precisión inigualable en contenidos altamente estructurados. Además, CAS Newton℠ incorpora inteligencia artificial conversacional a la búsqueda de patentes y propiedad intelectual, lo que le permite formular preguntas en lenguaje sencillo y obtener respuestas de más de 100 fuentes de patentes y bibliografía no relacionada con patentes, junto con sugerencias inteligentes para los siguientes pasos.

El futuro de la búsqueda de patentes con inteligencia artificial

La capacidad de las herramientas basadas en inteligencia artificial y los LLM para buscar rápidamente en enormes cantidades de datos los convierte en un estándar, e incluso en una necesidad, para la búsqueda de patentes hoy en día. Sin embargo, como vimos con la naturaleza diluida de las preguntas en la búsqueda de patentes y en la propia documentación de patentes, la inteligencia artificial puede tener dificultades para encontrar toda la información relevante y superar las diferencias terminológicas. Sin la integridad de los datos mediante ontologías y otras formas de curación, incluso las herramientas de inteligencia artificial más potentes pueden pasar por alto el estado de la técnica fundamental.

La inteligencia artificial seguirá desempeñando un papel en todas las partes del ciclo de vida de las patentes, desde la búsqueda exploratoria y la determinación de la libertad de operación hasta la realización de análisis de infracción y la identificación de oposiciones. Para los investigadores que buscan avanzar en sus descubrimientos ahora, los datos estructurados que combinan la experiencia humana con la velocidad de la tecnología de vanguardia siguen siendo el catalizador que necesitan para impulsar la innovación.

Questions and answers

¿Por qué la búsqueda de patentes es diferente a otras búsquedas de bibliografía científica?

¿Por qué la inteligencia artificial tiene dificultades para devolver los resultados de búsqueda adecuados para las patentes?

¿Cómo pueden los investigadores superar los desafíos de los datos para utilizar la inteligencia artificial en las búsquedas de patentes?

Related CAS Insights

Addressing sustainability of the global patent system: the role of AI in enhancing productivity

AI for science: Six trends powering cutting-edge research

AI in Pharma: Data strategies fuel successful drug repurposing

Gain new perspectives for faster progress directly to your inbox.