Modelos de aprendizado de máquina que suportam aplicações de planejamento de síntese são amplamente limitados à química observada no treinamento, e a precisão e a diversidade de suas previsões são frequentemente reduzidas em subespaços químicos pouco povoados. Ao medir como diferentes conjuntos de dados afetam o desempenho de modelos treinados, podemos fazer afirmações mais sólidas sobre a cobertura e a novidade esperadas das soluções de planejamento de síntese, e projetar conjuntos de dados que abrirão áreas da ciência anteriormente difíceis.
Neste estudo, cientistas da Bayer demonstram o impacto significativo que as reações selecionadas por especialistas da CAS Content Collection têm no poder preditivo de um modelo de planejamento de síntese. A precisão na previsão de resultados em classes de reações raras aumentou significativamente – um salto de 32 pontos percentuais –, expandindo o conhecimento para uma química nova e útil.





