Resumen ejecutivo
- Las búsquedas de patentes difieren de otros tipos de investigación científica porque los datos de patentes no están estandarizados, se encuentran dispersos en diversos tipos de documentos y no siempre utilizan un lenguaje claro y coherente.
- Las herramientas de IA estándar y los modelos de lenguaje de gran tamaño tienen dificultades para recuperar todos los datos relevantes sobre patentes debido a la variabilidad de las fuentes y la terminología.
- Los datos estructurados e indexados que normalizan las diferencias semánticas y documentales son el ingrediente clave para el éxito de la búsqueda de patentes mediante IA.
- CAS IP Finder, impulsado por STN™, es un ejemplo de datos indexados y seleccionados por expertos con capacidades de búsqueda de IA de vanguardia que pueden identificar de forma fiable información relevante sobre patentes.
Para lograr un avance emocionante o una nueva innovación, es necesario comprobar si una determinada sustancia ha sido patentada. La información sobre patentes está dispersa en muchas fuentes y el tiempo es un factor crítico. Usted sabe la pregunta que quiere hacer: “¿Qué catalizadores en la literatura han logrado una selectividad >90% para la conversión de CO₂ a metanol?”. ¿Debería introducirla en un modelo de lenguaje de gran tamaño (LLM) de propósito general y ver qué obtiene?
Puede parecer contradictorio, pero la respuesta es no. Los LLM estándar pueden rastrear grandes cantidades de publicaciones rápidamente, pero la búsqueda de información sobre patentes y el estado de la técnica implica complejidades únicas que las herramientas basadas en IA no siempre están equipadas para manejar. Tampoco se trata de un simple problema de “basura entra, basura sale”. Para que las búsquedas de patentes tengan éxito, los investigadores deben utilizar datos indexados y estructurados con soluciones basadas en IA que puedan navegar por las complejidades de la literatura de patentes y revelar información práctica.
Por qué la búsqueda de patentes es diferente
Las patentes se redactan con un propósito distinto al de los artículos de revistas u otras publicaciones científicas: proteger la propiedad intelectual (PI). En lugar de intentar dar a conocer su contenido para que sea descubierto y citado, como ocurre en las publicaciones académicas, los autores de las solicitudes de patente buscan proporcionar solo la cantidad de datos estrictamente necesaria para obtener la patente. Estas solicitudes pueden mantener cierto grado de secreto o incluso ofuscación sobre los nuevos avances.
Los documentos de patentes también pueden contener mucho “ruido” en sus secciones iniciales, como largas descripciones o listas de materiales o compuestos relacionados que no tienen impacto en la nueva innovación en sí. Estas extensas listas suelen incluirse para crear posiciones de reserva o articular variaciones menores, evitando que pequeñas optimizaciones de la invención sean reclamadas posteriormente como inventivas. Sin embargo, esto puede hacer que un documento parezca relevante cuando solo describe superficialmente una sustancia o tema, lo que confunde los procesos de búsqueda.
Además, la literatura de patentes carece de la estandarización de las publicaciones científicas. Los documentos se organizan de forma diferente según las jurisdicciones, los solicitantes y los sistemas de clasificación, y su terminología a menudo refleja la jerga organizativa o peculiaridades históricas en lugar de una convención compartida. Por ejemplo, en la literatura científica revisada por pares, la palabra “copolímero” significa con mayor frecuencia cualquier polímero que comprenda dos o más monómeros. En la literatura de patentes, a menudo significa un polímero con exactamente dos monómeros, mientras que el término “interpolímero” se utiliza de forma más amplia para referirse a polímeros con múltiples monómeros.
Por lo tanto, la información sobre patentes es diluida, es decir, está repartida en un conjunto difuso de documentos, y los investigadores deben utilizar preguntas “diluidas” para buscar en ese amplio conjunto con terminología inconsistente y un lenguaje generalmente vago (piense en las patentes de plataforma que intentan cubrir ampliamente métodos y tecnologías que son la base de futuras soluciones). Para volver a nuestro ejemplo anterior con la pregunta sobre los catalizadores, comparémoslo con una pregunta “concentrada”:
- Concentrada: ¿Cuál es el punto de ebullición del acetonitrilo?
- Diluida: ¿Qué catalizadores en la literatura han logrado una selectividad >90% para la conversión de CO₂ a‑metanol?
Cómo facilita la IA la búsqueda de patentes, y cómo no lo hace
Podría parecer que las búsquedas de patentes son el caso de uso perfecto para la IA generativa y los LLM, ya que estas herramientas pueden revisar enormes conjuntos de documentos dispares en cualquier base de datos o incluso en toda la red. Sin embargo, la complejidad de la literatura sobre patentes dificulta que los LLM estándar ofrezcan resultados de calidad. Estas plataformas buscan patrones, pero, como hemos comentado, las patentes no suelen seguir patrones ni utilizan el mismo lenguaje para describir lo mismo.
Los LLM suelen tener dificultades con las preguntas imprecisas. Pueden ofrecer una respuesta sólida, pero los investigadores no pueden estar totalmente seguros de que el LLM haya entendido todos los tipos de fuentes que deben consultarse o que no se haya visto confundido por diferencias semánticas. Para verificar la patentabilidad, los investigadores deben evaluar conjuntamente las solicitudes de patentes y la literatura científica. Para ello, es necesaria una armonización de los datos que permita a las herramientas de IA, capaces de analizar más material de origen más rápido de lo que un humano podría, revisar toda la información relevante.
La clave reside en disponer de información indexada que esté estructurada y sea coherente para que la utilice la solución basada en IA. Sin la indexación del material que busca una herramienta de IA, esta es como alguien a quien dejan en una biblioteca sin sistema decimal Dewey y esperan que encuentre libros sobre un tema específico.
Experiencia humana y eficiencia tecnológica
¿Por qué son fundamentales los datos indexados para las búsquedas de patentes mediante IA? Los datos estructurados e indexados permiten a los LLM y a las herramientas de búsqueda por IA distinguir con mayor rapidez entre reactivos, catalizadores y otros puntos de datos clave sin desperdiciar tiempo ni energía. La integridad de los datos también facilita la búsqueda de información relevante en fuentes dispares.
Por ejemplo, CAS indexa la CAS Content CollectionTM, el mayor repositorio de información científica curado por expertos, que crea una capa de datos unificada para la búsqueda de patentes. Esta capa unificada permite realizar comparaciones entre patentes y literatura científica mediante la normalización de diferentes terminologías. La literatura no relacionada con patentes suele contener soluciones alternativas y métodos que no infringen derechos, que los investigadores deben conocer para comparar su innovación con las patentes existentes. Una capa de datos unificada también puede revelar conexiones intersectoriales y materiales invalidantes, elementos cruciales para la búsqueda de patentes que pueden perderse en diferentes materiales de origen o en su semántica.
Las ontologías son fundamentales para esta capa de datos unificada porque definen términos canónicos, sinónimos, relaciones de dominio y significado contextual. Sin ontologías, cada dominio e incluso cada empresa u organización hablaría su propio dialecto científico. La IA requiere la coherencia que proporcionan las ontologías para evitar alucinaciones y un reconocimiento de patrones incorrecto. Sin embargo, se necesitan humanos para desarrollar ontologías y garantizar que los datos sean limpios, estructurados y coherentes para que las herramientas de IA puedan aprovechar esos datos correctamente.
Esto es lo que diferencia a los datos de CAS de otras bases de datos o motores de búsqueda: la aplicación de la experiencia humana para garantizar la integridad de los datos permite que potentes herramientas tecnológicas descubran información precisa más rápido. Por ejemplo, CAS IP Finder™ ofrece una precisión inigualable en contenidos altamente estructurados. Además, CAS Newton℠ aporta IA conversacional a la búsqueda de patentes y propiedad intelectual, permitiéndole formular preguntas en lenguaje sencillo y extraer respuestas de más de 100 fuentes de literatura de patentes y no relacionadas con patentes, con sugerencias inteligentes para los siguientes pasos.
El futuro de la búsqueda de patentes con IA
La capacidad de las herramientas basadas en IA y los LLM para buscar grandes cantidades de datos rápidamente los convierte en un estándar, incluso en una necesidad, para la búsqueda de patentes hoy en día. Sin embargo, como vimos con la naturaleza imprecisa de las preguntas en la búsqueda de patentes y la propia documentación de las patentes, la IA puede tener dificultades para encontrar toda la información relevante y superar las diferencias terminológicas. Sin la integridad de los datos mediante ontologías y otras formas de curación, incluso las herramientas de IA más potentes pueden pasar por alto información crítica sobre el estado de la técnica.
La IA seguirá desempeñando un papel en todas las etapas del ciclo de vida de las patentes, desde la búsqueda exploratoria y la determinación de la libertad de operación hasta la realización de análisis de infracción y la identificación de oposiciones. Para los investigadores que buscan avanzar en sus descubrimientos ahora, los datos estructurados que combinan la experiencia humana con la velocidad de la tecnología de vanguardia siguen siendo el catalizador que necesitan para impulsar la innovación.
Preguntas y respuestas
¿Por qué la búsqueda de patentes es diferente a otras búsquedas de literatura científica?
La literatura sobre patentes puede estar dispersa en miles de documentos, y la misma innovación o idea puede describirse de diferentes maneras. A veces, los solicitantes de patentes ocultan intencionadamente significados clave y pueden utilizar una jerga organizativa que no se emplea en otros documentos. Esto requiere un descubrimiento amplio y la búsqueda a través de muchos tipos de documentos y terminologías, lo que puede confundir las búsquedas humanas y las realizadas por ordenador.
¿Por qué a la IA le cuesta ofrecer los resultados de búsqueda adecuados para las patentes?
Los LLM estándar tienen dificultades porque se basan en la coincidencia de patrones sobre el lenguaje, y la naturaleza dispersa e imprecisa de los datos de patentes y de las preguntas de búsqueda de patentes desafía los patrones coherentes. Los documentos de patentes contienen cantidades significativas de "ruido"; por ejemplo, las secciones iniciales crean límites con extensas descripciones del estado de la técnica y "listas interminables" de fármacos o afecciones compatibles coadministrados que no influyen en la invención real.
¿Cómo pueden los investigadores superar los desafíos de los datos para utilizar la IA en las búsquedas de patentes?
Los datos estructurados que cuentan con una capa unificada son clave para superar estos desafíos. Cuando se aplican LLM o herramientas habilitadas para IA a datos estructurados e indexados, pueden revelar información que una búsqueda por palabras clave pasaría por alto. La indexación permite a estas herramientas completar la generación aumentada por recuperación, la búsqueda semántica y la agrupación de conceptos para obtener resultados más sólidos y precisos.





