ESTUDO DE CASO
Conjunto de dados de ML personalizado acelera o fluxo de trabalho de síntese orgânica da Selvita
Setor
CRO Farmacêutica
Solução
CAS Custom Services℠

RESULTADO PRINCIPAL
Mais de 600 mil
entradas de reação curadas entregues
RESULTADO PRINCIPAL
Dias
para entrega, em vez de meses de trabalho manual
RESULTADO PRINCIPAL
>1 semana
economizada por cluster de reação em comparação com um químico sênior
O Desafio
Dados de acesso aberto díspares e inconsistentes atrasam o desenvolvimento de modelos de aprendizado de máquina
Como uma das maiores organizações de pesquisa por contrato pré-clínica da Europa, a Selvita aprimora continuamente seus fluxos de trabalho de síntese orgânica para oferecer soluções mais rápidas e eficientes aos seus parceiros farmacêuticos. Para aproveitar ao máximo o poder da robótica e da automação, os químicos da empresa buscaram agrupar compostos de reações sintéticas semelhantes, permitindo o processamento paralelo e aumentando a produtividade. Realizar reações em paralelo sem comprometer os rendimentos, no entanto, exige um controle preciso sobre condições como temperatura, reagentes e pressão.
Reconhecendo o papel central das reações de acoplamento de Suzuki e de amida tanto em seus fluxos de trabalho internos quanto na indústria farmacêutica em geral, os químicos computacionais da Selvita desenvolveram um modelo de aprendizado de máquina (ML) para prever rendimentos de reação e identificar as condições ideais para agrupar compostos. Mas construir um modelo confiável significava construir primeiro um conjunto de dados de treinamento robusto. O acesso a bancos de dados estruturados e confiáveis era limitado, e as fontes de acesso aberto disponíveis não eram verificadas e eram inconsistentes. Limpar e validar esses dados manualmente teria levado meses, desviando o foco da equipe da ciência que o projeto deveria apoiar.
"Trabalhamos juntos regularmente durante todo o processo; foi uma colaboração que tornou o projeto um sucesso."
— Fabrizio Ambrogi, Especialista Sênior em Aprendizado de Máquina, Selvita
A Solução
Um conjunto de dados personalizado para treinamento de machine learning criado em poucos dias
A Selvita recorreu aos Serviços Personalizados da CAS em busca de uma solução sob medida. Trabalhando em conjunto com os químicos computacionais da Selvita, os consultores da CAS definiram os requisitos do conjunto de dados e determinaram o formato ideal para alinhar aos objetivos da equipe. Em seguida, os especialistas em dados da CAS pesquisaram a CAS Content Collection™, curada por humanos, para identificar e extrair as informações relevantes para cada tipo de reação alvo, reduzindo significativamente a carga de limpeza de dados que ameaçava consumir meses de trabalho.
Para garantir que o conjunto de dados atendesse aos padrões de qualidade necessários para um treinamento de modelo confiável, os consultores de conteúdo e químicos especialistas da CAS realizaram o controle de qualidade de cada entrada usando ferramentas automatizadas avançadas. Em poucos dias, a CAS entregou um conjunto de dados verificado com 400.000 entradas para reações de Suzuki e 200.000 para reações de acoplamento de amida. Usando esses conjuntos de dados curados, a Selvita aplicou filtros para categorizar e classificar reagentes, solventes e catalisadores comuns, criando os clusters necessários para a síntese paralela.
O modelo foi validado inicialmente com conjuntos de teste reservados. A equipe da Selvita foi além, colocando o modelo para competir com um de seus químicos seniores em um conjunto de reações nunca antes realizadas. Em poucas horas, o modelo identificou condições ideais que superaram as escolhas do químico, um trabalho que levou mais de uma semana para ser concluído. Esses resultados reais confirmaram a capacidade do modelo de prever com confiabilidade as condições de reação para uma síntese eficiente.
O Resultado
Descoberta de medicamentos mais rápida impulsionada por dados melhores
Ao fazer parceria com a CAS, a Selvita evitou meses de trabalho manual com dados e as dispendiosas tentativas e erros que acompanham conjuntos de treinamento não confiáveis. A equipe avançou diretamente para o desenvolvimento e validação do modelo, otimizando fluxos de trabalho essenciais de síntese orgânica e fortalecendo sua capacidade de oferecer soluções de descoberta de medicamentos mais rápidas e eficientes aos seus parceiros farmacêuticos. O projeto demonstrou o grande impacto de ter a base de dados correta desde o início.
Agende uma consulta gratuita com os CAS Custom Services℠
Your privacy is important to CAS. More detail about how we use your information is in our privacy policy.