Formación y transparencia en el mundo de la IA

Científico con bata de laboratorio trabajando ante una pantalla transparente que muestra datos moleculares.

Como señalamos en nuestro artículo anterior, la IA sin datos de entrenamiento completos y de alta calidad es como un coche sin motor: puede parecer atractivo, pero no llegará a ninguna parte. La transparencia de la IA es igual de importante para nuestros usuarios, por lo que nuestro objetivo es informarles con precisión de cuándo y dónde se utiliza la IA para que puedan tomar decisiones fundamentadas.

Un riesgo bien conocido de la IA generativa es la "alucinación", un escenario en el que el modelo crea datos que suenan realistas, a veces incluso con citas falsas, pero que son completamente incorrectos. Estas alucinaciones no pueden tolerarse en I+D, por lo que deben tomarse medidas para evitarlas.

En este artículo, analizaremos cómo CAS ocupa una posición única para cerrar la brecha entre la IA y el descubrimiento científico. Explicaremos cómo hemos aprovechado estratégicamente la IA, minimizando las alucinaciones y priorizando datos de entrenamiento de calidad, para proporcionar a nuestros usuarios información crítica que impulse su investigación.

Datos de entrenamiento

Los datos precisos son un requisito en la I+D científica. Los resultados de un experimento o prueba pueden determinar si un fármaco llega al mercado o si es necesario reformular toda una línea de productos.

Los datos de entrenamiento son un corpus seleccionado que se utiliza para entrenar un modelo de IA. Estos datos pueden ayudar al modelo a identificar patrones, aprender tareas o realizar predicciones. Los modelos son tan buenos como los datos con los que se alimentan; como dice el refrán, "si entra basura, sale basura".

Durante más de 100 años, CAS ha sido la fuente autorizada de información química, con científicos internos que seleccionan la colección de datos químicos más completa del mundo. Ahora, estamos ampliando nuestra experiencia en curación para desarrollar modelos de IA que ayuden al avance científico. Nuestros clientes dependen de nosotros para ofrecer datos fiables y coherentes. Asegurarnos de que los datos de entrenamiento seleccionados por expertos que recopilamos sean igualmente fiables ayuda a garantizar que el rendimiento sea coherente y esté alineado con las expectativas de nuestros clientes.

Respuestas reales, sin alucinaciones

Para muchos de nosotros, lo primero que nos viene a la mente al pensar en IA son los chatbots que generan respuestas que pueden ser incorrectas según la calidad de su fuente. ¿Qué pasaría si las respuestas ya hubieran sido seleccionadas, verificadas y organizadas por expertos en la materia? En este caso, la IA puede utilizarse para explorar y descubrir información de una manera más ágil que, además, genera confianza.

Transparencia

A lo largo de nuestro camino para reimaginar la búsqueda y el descubrimiento científicos, hemos incorporado los comentarios de nuestros clientes para orientar nuestra planificación, y un tema clave que hemos detectado ha sido la confianza. Las nuevas innovaciones con IA son apasionantes; sin embargo, con resultados que a menudo no son reproducibles, cambian bruscamente con pequeñas modificaciones en las entradas y funcionan como una "caja negra" sin explicación de lo que se hizo o cómo se generaron los resultados, los usuarios carecen de confianza en los resultados científicos generados por muchas herramientas de IA.

Mantener la confianza de los usuarios en nuestro contenido y soluciones es primordial. Aunque podemos tomar medidas para minimizar la falta de fiabilidad en la forma en que el LLM interactúa entre el usuario y nuestros datos, es intrínsecamente propenso a la variabilidad. La reticencia a probar funciones mejoradas con IA puede mitigarse siendo transparentes sobre dónde se utiliza la IA en el producto y proporcionando vías alternativas claras para encontrar la información que los usuarios buscan.

SearchSense en CAS SciFinder

Entonces, ¿dónde encaja CAS SciFinder? Al igual que la población general, los investigadores científicos se beneficiarán de dedicar menos tiempo a buscar entre grandes cantidades de información, lo cual supone una gran ineficiencia para la comunidad científica. Hemos creado una serie de mejoras de búsqueda basadas en IA en CAS SciFinder, a las que hemos llamado SearchSense, para aliviar esta carga, agilizando el descubrimiento de información y manteniendo al mismo tiempo la integridad científica.

Durante los últimos doce meses, CAS ha estado construyendo el motor de búsqueda de información científica más autorizado, completo y fiable, desarrollado por científicos para científicos. SearchSense combina nuestra colección de química, líder en su clase, con IA para proporcionar a los investigadores respuestas más rápidas sin comprometer la precisión.

Principios fundamentales

Cuando comenzamos a integrar la IA en CAS SciFinder, establecimos unos estándares fundamentales que no estábamos dispuestos a comprometer, por lo que nuestras soluciones debían cumplir los siguientes principios:

  • Priorizar la precisión en la entrega de contenidos.
  • Mantener la rapidez en la respuesta de búsqueda.
  • Preservar la confidencialidad de los datos de los clientes.

Cómo funciona SearchSense

SearchSense es único porque utiliza la IA para interpretar la intención de búsqueda en lugar de generar respuestas. Al comprender la intención de la consulta del usuario, CAS SciFinder puede dirigir a los usuarios hacia las respuestas relevantes y los datos de respaldo que ya han sido cuidadosamente seleccionados, cumpliendo con los estándares de fiabilidad y corrección de CAS. La precisión en la interpretación de la intención depende en gran medida de un corpus de entrenamiento sólido y de calidad. Nuestro conjunto de datos de entrenamiento para consultas de búsqueda se basa en una colección de más de diez mil puntos de datos creados por expertos de CAS. Abarca todas las disciplinas científicas cubiertas por nuestro contenido; un esfuerzo abrumador para intentar mantener el rendimiento en todas las áreas, pero descubrimos que añadir más datos, incluso unos pocos cientos de puntos, mostraba un beneficio sinérgico en la precisión general.

Arquitectura y rendimiento del modelo

Los datos de entrenamiento se utilizaron para entrenar un modelo de IA capaz de determinar la intención de búsqueda de las consultas. La velocidad y la precisión dependen del tamaño del modelo utilizado y, aunque los modelos con más parámetros suelen ser más precisos, la investigación ha demostrado que los modelos más pequeños con casos de uso específicos y datos de entrenamiento de calidad pueden ofrecer una precisión aceptable¹. Utilizamos un modelo de 7 mil millones de parámetros, considerablemente más pequeño que algunos de los modelos más grandes (de más de 1 billón de parámetros). Los datos de entrenamiento de alta calidad hicieron que la precisión del modelo pequeño fuera aceptable y nos permitieron mantener un rendimiento de búsqueda sólido.

CAS SciFinder utiliza un potente algoritmo de búsqueda para encontrar los resultados más relevantes, pero está diseñado a medida y no utiliza un lenguaje de consulta estándar. Debido a la naturaleza propietaria de nuestra arquitectura de búsqueda, necesitábamos entrenar al modelo de IA para que generara un lenguaje que nuestro sistema pudiera entender para realizar la búsqueda correspondiente. Esto garantizó que pudiéramos lograr el objetivo de combinar la interpretación de consultas mediante IA con los complejos resultados del motor de búsqueda propietario. Esto nos permite presentar datos relevantes a los usuarios con menos tiempo y esfuerzo.

Seguridad y privacidad de los datos

Entendemos la naturaleza sensible de la investigación de nuestros clientes, por lo que la confidencialidad de los datos es importante para nosotros. Todos los modelos que hemos desarrollado son propietarios y están alojados en nuestras instalaciones, de modo que ningún dato sale de nuestro control. Haga clic aquí para obtener más información sobre el uso ético de la inteligencia artificial en CAS.

Conclusión

CAS SciFinder se compromete a facilitar el éxito de la investigación y el descubrimiento científicos, manteniendo al mismo tiempo la confianza que valoran nuestros clientes. Con el lanzamiento de SearchSense en CAS SciFinder, hemos tomado medidas para garantizar que aprovechamos las nuevas y potentes tecnologías de una forma más inteligente. Nuestros expertos, nuestra colección de contenidos de primer nivel y nuestra tecnología trabajan juntos para aportar más beneficios a nuestros usuarios, allanando el camino para seguir avanzando en la investigación y el desarrollo científicos.

‍