Una conversación con Nicole Stobart, Jeff Wilson y Mark Schmidt de CAS
Las estructuras de autoridad y los identificadores han sido utilizados por CAS en el sector químico durante casi 100 años como piedra angular de nuestra labor de curación e indexación, líder a nivel mundial. Nuestro equipo de ciencias de la vida busca ahora crear las mismas herramientas de indexación para una nueva industria. En este artículo, conversamos con Nicole Stobart, directora de capacidades en ciencias de la vida; el Dr. Jeff Wilson, director sénior de ciencia de datos; y Mark Schmidt, responsable de gestión de datos, sobre cómo están abriendo este nuevo camino mediante el uso de estructuras de autoridad.
CAS: ¿Cómo describiría las estructuras de autoridad?
Jeff: Las estructuras de autoridad, desde nuestra perspectiva, se centran principalmente en la identidad. Dentro de cualquier dominio, ya sean proteínas, sustancias químicas o ácidos nucleicos, es necesario poder identificar las entidades de forma única. Históricamente, en nuestra colección de química, contamos con CAS REGISTRY®, que es nuestra autoridad clásica. Dentro de CAS REGISTRY, queremos describir de forma única diferentes sustancias químicas y asegurarnos de que, cada vez que encontremos lo mismo en nuestra curación, se identifique de esa manera. Un ejemplo sencillo sería el paracetamol. Independientemente de si lo llama acetaminofén, Tylenol o paracetamol, todos se identifican como la misma sustancia química.
CAS: ¿Por qué son tan importantes las estructuras de autoridad para los científicos de la vida?
Nicole: Nuestras estructuras de autoridad actuales funcionan bien para moléculas pequeñas, pero ¿qué ocurre con las proteínas o las enzimas? Sí, existen secuencias que pueden asociarse a ellas, pero ¿es una secuencia con un cambio de un solo aminoácido una entidad diferente? Somos conscientes de que los investigadores tienen dificultades con esto. Hay diferentes empresas y otras organizaciones que han intentado organizarlo, pero nadie ha realizado una organización completamente autorizada de estos productos biológicos. Cuando intentábamos ofrecer información biológica a los clientes, descubrimos que no era posible sin organizarla primero de forma autorizada. No se trata solo de recopilar montones y montones de datos, sino también de organizarlos de manera autorizada y asegurarse de que la forma en que se han organizado sea la que el resto del mundo desea ver.
Mark: En el ámbito de las ciencias de la vida, intentamos identificar todos los elementos importantes y ponernos de acuerdo sobre qué son y cómo llamarlos; eso es realmente una autoridad. En nuestro negocio tradicional, si tengo una sustancia química, puedo consultar nuestra colección y añadir nueva información sobre ella. Estamos intentando hacer lo mismo con las ciencias de la vida, con elementos como proteínas y enzimas, y para ello, primero debemos ponernos de acuerdo sobre sus identidades.
Jeff: Depende del investigador y de dónde se encuentre, pero creo que podemos ser mucho más coherentes y fiables en los datos que presentamos si podemos describir las cosas sin ambigüedades. En el nivel más básico, volvemos a lo que siempre hemos hecho: organizar los datos para la búsqueda, de modo que cuando acceda a nuestras herramientas de búsqueda, como CAS SciFinder, no importe si quiere llamarlo cáncer o sarcoma, conocemos la relación entre esos términos. No le obligamos a buscar con todos estos términos diferentes para encontrar los datos; nosotros nos encargamos de eso en segundo plano y usted puede utilizar solo uno de los términos para encontrarlo todo.
Más allá de la búsqueda y recuperación, una vez que se entra en implementaciones más sofisticadas como los grafos de conocimiento y el descubrimiento de relaciones importantes, es difícil construir un grafo de conocimiento preciso si las entidades están dispersas en diferentes nodos. Si tengo una proteína que me interesa como objetivo, quiero que todos los datos de esa proteína se almacenen en ese único nodo y que otras entidades relacionadas estén en nodos individuales. De lo contrario, se obtiene un grafo de conocimiento increíblemente complejo en el que tienes 15 nodos para esta proteína, 12 para esa enfermedad y 7 para la misma sustancia. Creas este grafo complejo y no puedes distinguir que, básicamente, hay 3 entidades relacionadas de forma predecible, porque estas identidades no se han definido de antemano.
CAS: ¿Cómo definiría la curación en CAS?
Mark: La gente suele utilizar el término curación para referirse a dos cosas distintas. En primer lugar, está la ingesta y agregación de datos, a lo que aquí en CAS no solemos llamar curación. Luego está el tipo de curación con la que CAS tiene una larga trayectoria, donde los científicos analizan las fuentes originales de información y aplican un esfuerzo intelectual para extraer y mejorar esa información, poniéndola a disposición de una forma más estructurada.
Jeff: La mayoría de nuestros científicos se dedican a la curación que describió Mark, donde extraen información clave de fuentes primarias y luego la mejoran, estandarizan y conectan con otros puntos de datos, pero hay otro nivel más allá de eso. Tenemos un grupo independiente de personas que se encarga de curar las colecciones de autoridad analizando la nueva información a medida que llega y decidiendo: ¿Es algo nuevo? ¿No lo es? ¿Cómo lo organizamos? ¿Cómo se relacionan? ¿Qué terminología utilizamos? No dejamos que las personas que extraen la información de la literatura primaria tomen esas decisiones; en su lugar, tenemos personas que curan la colección de autoridad.
Mark: Lo fundamental es que la autoridad nunca está terminada. Siempre se añaden cosas nuevas que se han descubierto recientemente o que resultan interesantes, y también se añaden nuevos sinónimos para mantener su utilidad.
CAS: ¿Cuál diría que es la ventaja de los constructos de autoridad para la curación de contenidos?
Jeff: Una vez que se empiezan a agregar identidades y terminología mediante constructos de autoridad, resulta más sencillo identificar nuevas instancias. Tras recopilar todos los nombres de una entidad, puede crear un constructo de autoridad para realizar búsquedas y coincidencias al instante. Los sinónimos facilitan la curación.
Mark: Los constructos de autoridad ayudan a organizar y agregar toda la información en torno a ellos. Por ejemplo, en el caso de las proteínas, es posible que nosotros no llamemos a una proteína exactamente igual que usted, pero si conocemos tanto su denominación como la nuestra, podemos compilar toda la información bajo una misma identidad, lo que nos permite unificar todos los datos.
CAS: ¿Se puede aprovechar la IA para ayudar a crear constructos de autoridad o para realizar curaciones con ellos?
Nicole: Debemos asegurarnos de haber organizado e identificado de forma autorizada aquello de lo que hablamos para poder habilitar la curación mediante IA. Es muy difícil confiar en cualquier tipo de aprendizaje automático o datos curados por máquinas si no han sido organizados manualmente, o al menos analizados e identificados de manera autorizada.
Jeff: Tenemos una filosofía general sobre la IA y su relación con nuestros datos: aprovechamos la tecnología más avanzada posible para potenciar las capacidades humanas. Contamos con cientos de científicos dedicados a la curación y, si observamos su trabajo actual, es mucho más sofisticado que el de hace 30 años. Cada vez que adoptamos una nueva tecnología, la utilizamos para permitir que los expertos realicen tareas más complejas. Aprovechamos la tecnología de procesamiento de lenguaje natural y aprendizaje automático para ayudar a identificar documentos y conocimientos, pero todo ello se presenta a los humanos, quienes toman la decisión final sobre qué es importante o relevante y cómo debe organizarse.
Una vez creados esos datos estructurados, aplicamos el mismo enfoque con soluciones tecnológicas y de IA en la fase final. Intentamos aprovechar la mejor tecnología para mostrarle lo que ha solicitado y todo lo relacionado con ello. Podemos utilizar tecnología predictiva para ayudarle a planificar síntesis, disponemos de motores de IA que ayudan a predecir el estado de la técnica y puede realizar búsquedas de tipo booleano para localizar información. Por tanto, tomamos nuestros datos altamente estructurados y añadimos una capa de tecnología de IA, sin utilizar la IA para reemplazar a las personas.
CAS: ¿Cómo abordará CAS la definición e identificación de entidades biológicas?
Mark: Aquí es donde empezamos a hablar de semántica de identidad. Es un problema realmente difícil y complejo en las ciencias de la vida, somos plenamente conscientes de ello y lo tratamos caso por caso cada día. Puede que no alcancemos la perfección, pero haremos todo lo posible. Tomaremos decisiones razonables y defendibles que resulten útiles para los profesionales del sector. No podremos satisfacer a todos en cada ocasión, pero seremos predecibles y claros al respecto para que los usuarios puedan utilizar el sistema que ofrecemos con total confianza.
Cuando nos enfrentamos a preguntas como "¿Es una diferencia de un solo nucleótido una nueva identidad o no?", es una elección que debemos hacer. Pero si tres polimorfismos de nucleótido único distintos se convierten en una sola identidad en lugar de tres, debemos describir obligatoriamente esas tres diferencias y vincularlas a la identidad única que presentamos. Así, incluso cuando decidimos que elementos diferentes se agrupan bajo una misma identidad, toda la información sigue siendo localizable, conectada y accesible.
Inicialmente, elegiremos y definiremos nuestra semántica de identidad; después, a medida que llegue nueva información, decidiremos si se trata de una nueva identidad o si se añade a una existente. Queremos utilizar toda la potencia informática posible, pero nuestra fuente de verdad definitiva para esas decisiones serán siempre los humanos que mejor conocen el área temática. Así es como ofreceremos un servicio fiable.
Jeff: Es necesario crear un conjunto de reglas claro, coherente y exhaustivo desde el principio. Para quienes no han intentado definir entidades y agregar información, puede parecer algo arbitrario, pero hemos comprobado que, al organizar la información, es preferible optar por la claridad y la coherencia. Se pueden encontrar matices científicos en casos específicos, pero implementar reglas para todo provoca que la información se disperse y sea más difícil de encontrar y recopilar. Es mejor crear una regla que funcione para el 99% de los casos. En el ámbito de la química, a veces recibimos comentarios de científicos que dicen: "Veo que han descrito esto de esta manera en CAS REGISTRY y es incorrecto; tengo datos que indican que se describe mejor de otra forma". Nuestra respuesta habitual es que nuestro contenido está organizado en torno a la capacidad de descubrimiento. Ese es el objetivo: la curación debe conducir sistemáticamente a los datos que busca, incluso si se omiten algunos matices científicos por el camino.
CAS: ¿Utilizan la estructura o la función para crear estas identidades en las ciencias de la vida?
Mark: Para muchas entidades biológicas, especialmente las proteínas, prima más la función que la estructura, aunque a menudo es una combinación de ambas. En química, podemos crear fácilmente constructos de autoridad basados totalmente en la estructura, pero eso no es igual en las ciencias de la vida. Tenemos varias autoridades diferentes que debemos resolver: proteínas, anticuerpos, organismos, etc. Cada una requerirá un enfoque único. Debemos alejarnos de las identidades basadas únicamente en la estructura al adentrarnos en las ciencias de la vida, algo que no ha sido necesario en el pasado.
CAS: ¿Cómo planean abordar la longevidad de la definición por función, dado que la función biológica cambia con el tiempo y con las nuevas investigaciones?
Jeff: Siempre intentamos preparar las cosas para el futuro. No creo que podamos predecir dónde estarán las ciencias de la vida dentro de diez años, pero, al crear constructos coherentes, incorporaremos flexibilidad y extensibilidad. La clave será reconocer cuándo seguir utilizando el constructo actual y cuándo surge una nueva rama científica que requiere uno nuevo. La gente no dejará de querer describir proteínas, pero podría surgir alguna subcategoría que necesite la creación de nuevos constructos de autoridad.
Mark: Creo que si se hace un buen trabajo estableciendo una semántica de identidad razonable al principio, se prepara el terreno para un futuro en el que lo más probable es que los científicos subdividan una de nuestras identidades en otras más específicas. Si pensamos en la nomenclatura de género-especie de los organismos, ha funcionado durante mucho tiempo. La necesidad de subespecies no invalidó por completo el modelo de género-especie. Creo que podemos establecer constructos que se vuelvan más específicos sobre la identidad que cuando empezamos, pero que no queden totalmente obsoletos.
CAS: ¿Qué hace de CAS la organización adecuada para agregar estos constructos de autoridad fragmentados de las ciencias de la vida?
Jeff: Existe una naturaleza autosostenible una vez que te conviertes en una autoridad mundial en algo. Si observamos las sustancias químicas, nadie cuestiona CAS REGISTRY. Es la referencia autorizada. Existen otras colecciones de sustancias, pero nuestra posición como organización es única. Formamos parte de la American Chemical Society y nuestra misión no es solo ser rentables, sino facilitar la ciencia. Contamos con las personas, la experiencia y el espacio necesarios para abordar estos datos de ciencias de la vida y organizarlos como hicimos con CAS REGISTRY. Creo que cualquier resultado que no nos sitúe como el espacio de referencia para las proteínas cuando este proyecto concluya sería un fracaso por nuestra parte. Eso es lo que vamos a hacer.
Mark: El deseo de llegar a un acuerdo sobre un conjunto significativo de identidades dentro de las ciencias de la vida es bastante universal, y es un problema que ya hemos resuelto en la química de moléculas pequeñas. Los científicos del ámbito biológico buscan un conjunto claro de identidades y la definición de las relaciones entre ellas para poder organizar los datos en torno a esa estructura. Nos adentramos en esa complejidad para poner orden en el caos. Cuando avancemos lo suficiente, la gente aceptará que conocemos todas las proteínas relevantes para la mayoría y que hablamos de ellas de una forma que resulta útil. Cuando no encuentren su proteína en nuestra colección, nos lo harán saber para que podamos añadirla, en lugar de crear su propia base de datos independiente. Ese es nuestro objetivo: no solo tener una colección de constructos de autoridad, sino ser una autoridad dentro del espacio de las ciencias de la vida.
CAS: ¿En qué se diferencia su enfoque de lo que ya se ha hecho?
Mark: Creo que, en muchos ámbitos científicos, los investigadores resuelven problemas de forma local, para sí mismos y sus colegas, de una manera que les resulta funcional. Crean bases de datos con las identidades de los elementos que les interesan, descritos según su propia terminología y con la información pertinente. Mientras tanto, alguien en un área ligeramente distinta, que realiza parte del mismo trabajo y parte de otro diferente, elige otras formas de referirse a esas mismas identidades y recopila información distinta. Entonces, empezamos a ver proyectos que unen algunos de esos espacios reducidos para lograr que todos hablen el mismo idioma y facilitar el descubrimiento a través de esas fronteras. Esto ya ocurre en las ciencias biológicas, pero no ha existido un enfoque que integre una gran cantidad de datos bajo un conjunto unificado de identidades.
El objetivo es llegar a un punto en el que usted pueda introducir su diana proteica sin saber que forma parte de tres o cuatro rutas biológicas, pero que, al encontrar esa identidad dentro de este conjunto de información, pueda visualizar todas esas conexiones. Además, podría descubrir que se utiliza como biomarcador para un estado patológico o un resultado terapéutico. La capacidad de agregar toda la información dispersa en torno a una única identidad, que luego se puede localizar y utilizar, genera un valor que antes no estaba al alcance.
Jeff: Existen muchas organizaciones pequeñas que aportan una pieza del rompecabezas. La ontología de enfermedades existe, Uniprot intenta organizar las proteínas y el NCBI posee una base de datos de organismos. Cada una de ellas es una autoridad en sí misma, pero no están conectadas de forma útil; hay que consultar cada una por separado. Buscamos un conjunto de datos unificado donde se pueda encontrar toda la información de las ciencias biológicas conectada y armonizada. Para ello, debemos tomar la visión de la proteína de Uniprot, de Ensemble y del CAS REGISTRY, y armonizarla en una sola perspectiva y un único conjunto de identidades. A partir de ahí, se tendría acceso a todas esas colecciones menores. El resultado es superior a la suma de las partes, ya que revela conexiones que antes eran imposibles de encontrar.
Nicole: Queremos ser la base de datos de ciencias biológicas más completa del mundo. Deseamos resolver cualquier problema o desafío al que se enfrenten nuestros clientes, y ellos necesitan estructuras de autoridad en las ciencias biológicas.
CAS: ¿Han recibido alguna resistencia por parte de otras bases de datos existentes al adentrarse en este ámbito?
Mark: No se puede contentar a todo el mundo. En algún momento, hay que ejercer cierta autoridad y tomar decisiones. Es difícil discrepar con algo bien establecido y arraigado, y trataremos de evitarlo en la medida de lo posible. No vamos a convencer a todos de que cambien su terminología habitual, pero queremos construir sobre esa base.
El principio es sencillo: nos alinearemos con las bases de datos existentes. Pero, en la práctica, tomar esas decisiones es sin duda más complejo. Si dos bases de datos utilizan términos distintos para lo mismo, podemos elegir uno, el otro, o proponer algo nuevo que mejore ambos. Sé que suena difícil, pero creemos que la complejidad de lograrlo es precisamente el valor que aportaremos al sector y lo que queremos ofrecer a nuestros clientes.
Nicole: Definitivamente, no queremos alienar a quienes utilizan las bases de datos existentes y encuentran valor en ellas. Lo que deseamos es aportar más valor y complementar lo que ya existe. Aún no hemos hablado con otros conservadores de datos, así que su opinión está por ver.
Jeff: En realidad, solo una minoría de científicos se dedica a la curación de datos, por lo que, en cierto modo, no son ellos nuestra principal preocupación, ya que buscamos ayudar a la mayoría. Muchos científicos nos comentan que tienen dificultades para acceder a la información que necesitan.
Nicole: ¡Absolutamente! Hace poco hablaba con un científico que creó una base de datos sobre anticuerpos. Me confesó que lo hizo no porque quisiera organizar esos datos, sino porque los necesitaba para ejecutar sus modelos predictivos. Creo que esta es la situación de muchos científicos: es un obstáculo para la investigación, y eso es lo que planeamos solucionar.
CAS: Si pudiera usar una varita mágica para solucionar un aspecto de las estructuras de autoridad, ¿cuál sería y qué impacto tendría?
Mark: El problema que resolvería sería que todos utilizaran las mismas palabras para referirse a lo mismo. Si lográramos eso, todo sería mucho más sencillo. Gran parte de este ejercicio consiste en tomar los términos que usan los científicos, encontrar la identidad correcta y vincularlos. Si pudiéramos acotar el lenguaje y lograr un consenso, nos ahorraríamos ese paso.
Jeff: Para mí, sería lograr que más personas comprendan las estructuras de autoridad y tengan la visión y la pasión para crearlas de forma útil. Incluso en una organización que lo apoya, paso mucho tiempo explicando por qué son necesarias y cuál es su valor. Aunque es gratificante defender esta causa, me distrae de lo que más me gusta: trabajar con los datos y construir soluciones.






