CASO DE ÉXITO
Un conjunto de datos de ML personalizado acelera el flujo de trabajo de síntesis orgánica de Selvita
Sector
CRO Farmacéutica
Solución
CAS Custom Services℠

RESULTADO CLAVE
Más de 600 000
entradas de reacciones seleccionadas entregadas
RESULTADO CLAVE
Días
para la entrega frente a meses de trabajo manual
RESULTADO CLAVE
>1 semana
ahorrada por grupo de reacción frente a un químico sénior
El desafío
Los datos de acceso abierto, dispares e inconsistentes, ralentizan el desarrollo de modelos de aprendizaje automático
Como una de las mayores organizaciones de investigación por contrato (CRO) preclínica de Europa, Selvita perfecciona continuamente sus flujos de trabajo de síntesis orgánica para ofrecer soluciones más rápidas y eficientes a sus socios farmacéuticos. Para aprovechar al máximo el potencial de la robótica y la automatización, los químicos de la empresa buscaron agrupar compuestos a partir de reacciones sintéticas similares, lo que permite el procesamiento en paralelo y aumenta el rendimiento de la producción. Sin embargo, realizar reacciones en paralelo sin comprometer los rendimientos requiere un control preciso de condiciones como la temperatura, los reactivos y la presión.
Reconociendo el papel fundamental de las reacciones de acoplamiento de Suzuki y de amidas tanto en sus flujos de trabajo internos como en la industria farmacéutica en general, los químicos computacionales de Selvita desarrollaron un modelo de aprendizaje automático (ML) para predecir los rendimientos de las reacciones e identificar las condiciones óptimas para agrupar los compuestos. Pero construir un modelo fiable significaba construir primero un conjunto de datos de entrenamiento sólido. El acceso a bases de datos estructuradas y fiables era limitado, y las fuentes de acceso abierto disponibles no estaban verificadas y eran inconsistentes. Limpiar y validar esos datos manualmente habría llevado meses, desviando la atención del equipo de la labor científica a la que debía dedicarse.
«Trabajamos juntos con regularidad durante todo el proceso; fue una colaboración que hizo que el proyecto fuera un éxito».
— Fabrizio Ambrogi, especialista sénior en aprendizaje automático, Selvita
La solución
Un conjunto de datos de entrenamiento de aprendizaje automático personalizado creado en días
Selvita recurrió a los servicios personalizados de CAS para obtener una solución a medida. En colaboración con los químicos computacionales de Selvita, los consultores de CAS definieron primero los requisitos del conjunto de datos y determinaron el formato óptimo para alinearse con los objetivos del equipo. A continuación, los especialistas en datos de CAS buscaron en la colección CAS Content Collection™, curada por expertos, para identificar y extraer la información relevante para cada tipo de reacción objetivo, reduciendo significativamente la carga de limpieza de datos que amenazaba con consumir meses de trabajo.
Para garantizar que el conjunto de datos cumpliera con los estándares de calidad necesarios para un entrenamiento fiable del modelo, los consultores de contenido y los químicos expertos de CAS realizaron un control de calidad en cada entrada utilizando herramientas automatizadas avanzadas. En cuestión de días, CAS entregó un conjunto de datos verificado de 400.000 entradas para reacciones de Suzuki y 200.000 para reacciones de acoplamiento de amidas. Utilizando estos conjuntos de datos curados, Selvita aplicó filtros para categorizar y clasificar reactivos, disolventes y catalizadores comunes, creando los grupos necesarios para la síntesis en paralelo.
El modelo se validó primero frente a conjuntos de prueba reservados. El equipo de Selvita fue más allá y enfrentó al modelo con uno de sus químicos sénior en una serie de reacciones que nunca se habían realizado antes. En pocas horas, el modelo identificó condiciones óptimas que superaron las selecciones del químico, un trabajo que a este le había llevado más de una semana realizar. Estos resultados reales confirmaron la capacidad del modelo para predecir de forma fiable las condiciones de reacción para una síntesis eficiente.
El resultado
Un descubrimiento de fármacos más rápido impulsado por mejores datos
Al asociarse con CAS, Selvita evitó meses de trabajo manual con datos y el costoso proceso de ensayo y error que conlleva el uso de conjuntos de entrenamiento poco fiables. El equipo pasó directamente al desarrollo y validación del modelo, optimizando los flujos de trabajo esenciales de síntesis orgánica y reforzando su capacidad para ofrecer soluciones de descubrimiento de fármacos más rápidas y eficientes a sus socios farmacéuticos. El proyecto demostró el gran impacto de contar con la base de datos adecuada desde el principio.
Programe una consulta gratuita de CAS Custom Services℠
Your privacy is important to CAS. More detail about how we use your information is in our privacy policy.