En el panorama actual de rápido desarrollo del descubrimiento de fármacos, los modelos predictivos han surgido como herramientas esenciales para acelerar los flujos de trabajo mediante la simulación y predicción de la bioactividad, las interacciones fármaco-objetivo y mucho más. La utilidad de estos modelos depende en gran medida de la calidad y la gestión de los datos sobre los que se construyen.
A la vanguardia de esta revolución tecnológica se encuentra CAS, cuya plataforma CAS BioFinder Discovery Platform™ está impulsada por modelos predictivos avanzados. Para comprender cómo la precisión de estos modelos conduce a verdaderos conocimientos para los científicos dedicados al descubrimiento de fármacos, hablamos con Adam Sanford, director de la división de ciencias de la vida, y Orr Ravitz, gerente sénior de productos de CAS BioFinder™, para profundizar en las rigurosas estrategias de gestión de datos que hacen de CAS un líder en el campo.
CAS: Para empezar, ¿podrían hablar sobre el enfoque de CAS respecto a la integración, normalización y armonización de datos al construir sus modelos predictivos?
Adam: Tenemos un par de filosofías fundamentales con respecto a la gestión de datos. La primera es la exhaustividad. Nuestro objetivo es capturar tantas fuentes relevantes como sea posible, lanzando una red amplia para garantizar que nuestros modelos se construyan sobre una base sólida de datos diversos. Pero no se trata solo de recopilar datos; se trata de asegurarse de que esos datos sean utilizables. Aquí es donde entra en juego nuestro proceso de curación y reconciliación humana. Aunque este proceso pueda parecer mundano o excesivo, creemos que es vital para construir modelos que alcancen un grado de precisión inalcanzable solo mediante la extracción impulsada por inteligencia artificial.
Cuando incorporamos datos, nos centramos en tres áreas clave. Primero, nos aseguramos de que, si se trata de un tipo específico de entidad (como una molécula pequeña, una proteína o una vía), los reconciliamos con nuestras estructuras de autoridad. Esto implica resolver las muchas expresiones diferentes de una entidad en un identificador o componente singular. En la bibliografía publicada, es común ver cientos de representaciones diferentes de una proteína o una estructura química. Si no se tiene cuidado, se podría terminar con lo que parecen ser muchas observaciones independientes diferentes, pero que en realidad pueden agruparse porque son la misma entidad. Nuestro proceso reconcilia estas diferentes entidades en un solo grupo.
Orr: La desambiguación de entidades en la bibliografía es clave para que garanticemos la precisión del modelo. Por ejemplo, en biología, una proteína puede denominarse de numerosas maneras, y estas variaciones pueden hacer que los investigadores pierdan grandes segmentos de datos si no se tienen en cuenta todos los nombres y formas. Desafíos similares existen en la química, donde contamos con experiencia especializada. Hemos podido aprovechar la experiencia adquirida a través de nuestra larga trayectoria en el manejo de datos químicos para desambiguar entidades biológicas con alta precisión.
No se trata solo de identificar las entidades correctamente, sino también de capturar el contexto experimental de forma adecuada y garantizar que las mediciones reales, incluidas las unidades o los métodos utilizados, estén armonizadas eficazmente.
Dedicamos mucha energía a crear estas autoridades subyacentes. Por ejemplo, cuando se hace referencia a una proteína en la bibliografía, puede aparecer bajo varios nombres o identificadores dependiendo de la especie o las modificaciones. Nuestro enfoque garantiza que todas estas variaciones se capturen bajo un identificador único y coherente dentro de nuestro sistema. Esto nos permite mantener un alto nivel de precisión en nuestras predicciones, lo cual es crucial para el descubrimiento de fármacos.
Adam: Otro aspecto crítico de nuestro proceso es la normalización de la información. Esta no es una tarea totalmente automatizada; los humanos están profundamente involucrados en este proceso. Por ejemplo, cuando indexamos datos, un científico real analiza una observación realizada en la bibliografía y determina si se trata de una observación numérica, una actividad o algo distinto. A continuación, reconcilia estos datos con un conjunto estándar de unidades. Se trata de un proceso meticuloso que implica una gran cantidad de detalles, lo que garantiza que cada dato sea preciso y coherente con el resto de nuestro contenido.
Este enfoque riguroso de la gestión de datos es lo que distingue a CAS de otros en el campo. Hemos construido toda una infraestructura para manejar esta complejidad, y es esta infraestructura la que permite que nuestros modelos predictivos sean tan eficaces.
CAS: Este enfoque riguroso del manejo de datos debe ser exclusivo de CAS. ¿Cómo ayuda a que sus modelos beneficien a los investigadores de descubrimiento de fármacos?
Orr: Nuestros modelos se basan en unos datos en los que confiamos profundamente, y esta confianza se traduce directamente en predicciones más precisas. Empezamos a probar nuestros modelos con datos disponibles públicamente. Cuando pasamos al contenido catalogado por CAS, observamos un salto significativo en la precisión de nuestras predicciones. También descubrimos que podíamos crear modelos más granulares que pueden ser específicos para cada organismo y centrarse en modos de acción concretos. Esto se debe a que no solo garantizamos que los datos sean precisos, sino que también capturamos el contexto en el que se obtuvieron.
Empleamos modelos basados en informática en CAS BioFinder. Observamos patrones en todos los datos, por lo que la escala es fundamental. Cuantos más datos tenemos, mejor pueden funcionar nuestros modelos. Empezamos con un "triple" (la molécula correcta, el objetivo correcto y la medición correcta) y construimos a partir de ahí. Como somos diligentes con la calidad de estos triples, nuestros modelos son intrínsecamente más fiables.
Adam: CAS BioFinder utiliza un grupo de cinco modelos predictivos diferentes, cada uno con su propia metodología. Algunos modelos están muy basados en la estructura y aprovechan excepcionalmente bien nuestros datos químicos, mientras que otros pueden centrarse en diferentes características de los datos. Mediante un enfoque de conjunto, en el que cada modelo realiza predicciones desde su perspectiva única, podemos combinar estas predicciones para crear un consenso. Este consenso suele proporcionar un mayor nivel de confianza en las predicciones que el que cualquier modelo individual podría lograr por sí solo.
Por ejemplo, las predicciones de actividad ligando-objetivo son el núcleo de lo que hace CAS BioFinder. Tanto si se trata de un compuesto nuevo como de algo que ya existe en nuestra base de datos, nuestros modelos pueden predecir la probabilidad de que un ligando interactúe con un objetivo, incluso si no hay datos experimentales explícitos disponibles. Esta capacidad es increíblemente valiosa para los químicos medicinales que intentan comprender la actividad potencial de nuevos compuestos.
Además, disponemos de modelos que predicen perfiles de metabolitos: cómo es probable que el cuerpo procese un compuesto. Comprender las rutas metabólicas de un fármaco candidato es crucial para evaluar su seguridad y eficacia. Estas predicciones se basan en metabolitos identificados experimentalmente, lo que los hace especialmente fiables.
Orr: También estamos trabajando para permitir que nuestros clientes aumenten sus propios datos propietarios con nuestra recopilación de datos. Muchas empresas farmacéuticas tienen un profundo historial de datos químicos que han desarrollado internamente. Con la incorporación de nuestros datos, pueden crear modelos predictivos muy específicos para sus necesidades. Se trata de una capacidad potente que les permite aprovechar su experiencia y, al mismo tiempo, beneficiarse de la amplitud y profundidad de los datos de CAS.
CAS: Dadas las complejidades de gestionar una cantidad tan vasta de datos, ¿cuáles son algunos de los mayores desafíos a los que se ha enfrentado al desarrollar estos modelos?
Adam: Crear las estructuras de autoridad que mencioné anteriormente es un proceso laborioso que requiere mucha intervención humana. No es algo que pueda automatizarse por completo, especialmente cuando se trata de información química y biológica compleja. Este proceso puede ser extremadamente difícil, sobre todo si se tiene en cuenta la inversión humana necesaria para garantizar que todo sea correcto.
Otro desafío importante es la variabilidad en la forma en que se presentan los datos en la bibliografía. Por ejemplo, en las patentes, los datos pueden estar enterrados en tablas, información complementaria o dispersos por todo el documento. Una máquina por sí sola no puede reunir todas estas piezas correctamente. Los curadores humanos deben intervenir para garantizar que los datos se extraigan y normalicen con precisión. No se trata solo de una tarea puntual, sino de un esfuerzo continuo que requiere una atención constante a los detalles.
Orr: Puedo contar una anécdota de una experiencia reciente que ilustra esta complejidad. Encontré una medición para un fármaco conocido aprobado a finales de la década de 1980. Los datos hacían referencia a un artículo de años anteriores, y me sorprendió ver esta estructura mencionada tan pronto antes de la aprobación del fármaco. Cuando miré más de cerca, me di cuenta de que la publicación contenía varias estructuras, pero ninguna se parecía exactamente al fármaco en cuestión. No fue hasta que examiné el texto referente a varias sustituciones que encontré la estructura correcta. Este nivel de complejidad va más allá de lo que las máquinas actuales pueden manejar, y subraya la importancia de la experiencia humana en nuestros procesos de gestión de datos.
Bromeamos diciendo que hemos construido una "máquina de casos extremos" porque a menudo nos ocupamos de este tipo de complejidades. Aunque estos casos extremos pueden constituir un porcentaje menor de los datos, pueden tener un impacto desproporcionado en la precisión de nuestros modelos. Garantizar que estos casos se manejen correctamente es fundamental para el éxito general de nuestros modelos predictivos.
CAS: Dado que las publicaciones y los datos surgen constantemente, ¿cómo garantiza CAS que estos modelos se mantengan actualizados?
Adam: Inicialmente, al crear nuestros modelos, los actualizábamos en grandes lotes a medida que incorporábamos nuevos datos. Ahora reentrenamos nuestros modelos con mayor frecuencia, en algunos casos cada dos semanas. Esto garantiza que nuestros usuarios trabajen siempre con las predicciones más actualizadas. Hemos establecido flujos de trabajo para integrar nuevos datos, los cuales siguen siendo cada vez más eficientes.
Orr: Esperamos integrar nuevos datos en nuestros modelos pocas semanas después de su publicación. Anteriormente, entrenábamos los modelos cuando se producía un cambio significativo en el panorama de los datos; por ejemplo, cuando un nuevo objetivo finalmente contaba con suficientes datos para construir un modelo predictivo fiable. Las expectativas en torno al modelado de datos y la precisión han cambiado rápidamente, y seguiremos supervisando y reentrenando nuestros modelos con frecuencia para satisfacer las necesidades de los científicos dedicados al descubrimiento de fármacos.
CAS: ¿Hay algo en el horizonte para CAS BioFinder y sus modelos predictivos que les entusiasme especialmente?
Adam: Nuestros datos y soluciones evolucionan constantemente, literalmente cada día. Pero a fecha de octubre de 2024, estamos explorando activamente varias áreas, como formas de incorporar modalidades terapéuticas más avanzadas, como los fármacos a base de proteínas y los PROTAC, en nuestro marco predictivo. Estas áreas aún están en desarrollo y nos entusiasma el potencial para ampliar los límites de lo que nuestros modelos pueden lograr. Esto incluye áreas como los fármacos a base de anticuerpos, que requieren un enfoque de modelado diferente al de las moléculas pequeñas. También estamos estudiando las predicciones de toxicidad, que son cada vez más importantes a medida que la industria avanza hacia modalidades terapéuticas más complejas.
Orr: Otra área apasionante es el uso de grafos de conocimiento para el modelado predictivo. Al ampliar el contexto biológico que proporcionamos (como información sobre rutas o biomarcadores), podemos aprovechar estas relaciones para crear modelos más sofisticados. Esto podría permitirnos predecir nuevas interacciones fármaco-objetivo o identificar nuevos biomarcadores para enfermedades. También estamos experimentando con diferentes métodos para construir estos grafos de conocimiento, lo que nos permitiría ofrecer capacidades predictivas aún más potentes.
CAS: ¿Qué hace que su enfoque del modelado predictivo en el descubrimiento de fármacos sea tan único?
Orr: Una de las cosas que realmente distingue a CAS es nuestro compromiso con la transparencia y la flexibilidad. Entendemos que nuestros usuarios pueden tener diferentes preferencias con respecto a los métodos computacionales, por lo que hemos diseñado la CAS BioFinder Discovery Platform no solo como una aplicación única. Los usuarios pueden descargar datos de nuestro corpus, combinarlos con sus propios datos y utilizarlos con sus métodos preferidos. Esta flexibilidad es crucial para permitir que nuestros clientes aprovechen al máximo nuestro contenido y nuestras capacidades.
Adam: Cada observación en CAS BioFinder está asociada a su procedencia en la bibliografía, lo que significa que los usuarios pueden rastrear los datos hasta su fuente original. Esta transparencia es esencial para generar confianza en nuestros usuarios. No les pedimos simplemente que confíen ciegamente en nuestros modelos; les proporcionamos las herramientas para que verifiquen los datos ellos mismos. Este nivel de transparencia y rigor convierte a CAS en la mejor organización para abordar los desafíos del modelado predictivo para el descubrimiento de fármacos.
CAS: Por último, si tuviera una varita mágica para cambiar algo sobre el estado actual de la gestión de datos y la construcción de modelos, ¿qué cambiaría?
Orr: Sabemos que existe un sesgo en la bibliografía publicada hacia los resultados positivos. Pero los datos negativos (como las moléculas inactivas frente a un objetivo) son igual de valiosos para construir modelos precisos. Nuestros métodos de inteligencia artificial se beneficiarían significativamente si tuviéramos acceso a más datos negativos. Sin embargo, esto sigue siendo un desafío importante en la industria. Sería fantástico que hubiera más incentivos para que el mundo académico y la industria publiquen estos datos.
Adam: Parece que muchos ven la inteligencia artificial y el aprendizaje automático como una solución mágica que resolverá los problemas más difíciles del descubrimiento de fármacos, pero es muy poco probable sin cambios sustanciales. Una y otra vez, estas tecnologías fallan cuando no se basan en una base de datos sólida. Hemos repetido este punto porque es fundamental: concentren su energía donde más importa, en los datos mismos.
Reflexionando sobre mi experiencia pasada en la industria, desearía que hubiera habido un mayor énfasis en la importancia de la estructura de datos subyacente y la gestión del conocimiento. Hoy en día, está ampliamente reconocido que los datos son la base de la experimentación y la predicción exitosas, pero muchas organizaciones aún no están invirtiendo plenamente en esta área. Reconocen que es un problema, pero no siempre comprenden cuánta energía y recursos se necesitan para hacerlo bien. En CAS, estamos diseñados para manejar esta complejidad y hemos visto los beneficios de esa inversión.





