Profesor de química experimentado escribiendo en la pizarra

¿Son los grandes modelos de lenguaje adecuados para la investigación científica?

Por qué más grande no siempre es mejor en las herramientas de IA y las aplicaciones especializadas

Desde su lanzamiento en 2022, ChatGPT ha redefinido el debate sobre la IA. Ha sido aclamado tanto como un milagro como una amenaza; desde promesas positivas como la revolución del trabajo y la revitalización de las ciudades, hasta impactos negativos como la sustitución de los seres humanos en sus puestos de trabajo, se dice que este modelo de lenguaje extenso (LLM) es capaz de casi cualquier cosa.

¿Cuál es la diferencia entre ChatGPT y GPT-3/GPT-4?

Existen diferencias importantes entre ChatGPT y los propios LLM, denominados GPT- seguido de un número (por ejemplo, GPT-3 o GPT-4). A menudo se confunden o se utilizan indistintamente, pero ChatGPT es la aplicación de chat con una interfaz «fácil de usar» que funciona sobre los LLM más complejos (GPT-3 o GPT-4).

GPT-3 y GPT-4 son versiones diferentes de una serie de modelos de transformadores generativos preentrenados. Los transformadores son un tipo de red neuronal conocida como modelo de lenguaje. Estos modelos pueden aprender a reconocer patrones y contextos en datos poco estructurados, como las palabras en las frases. Los transformadores son especialmente buenos en esto. Un modelo generativo, cuando recibe un contexto, puede generar una respuesta de longitud arbitraria a partir de una instrucción. Los modelos GPT combinan estos dos tipos de modelos.

Por otro lado, ChatGPT es la aplicación que se ejecuta sobre LLM como GPT-3 o GPT-4. Dispone de un módulo de memoria para continuar conversaciones previas, así como de filtros, clasificadores y otras funciones integradas para minimizar las respuestas tóxicas o inapropiadas.

chat-gpt-LLM

¿Qué se necesita para crear un LLM?

Los LLM son impresionantes. GPT-3 tiene 175 000 millones de parámetros, o valores que el modelo puede cambiar de forma independiente a medida que aprende. GPT-4, la última versión de la serie GPT lanzada en 2023, es aún mayor, con 1 billón de parámetros. Como puede atestiguar cualquiera que los haya utilizado, estos modelos poseen un conocimiento increíblemente amplio y una capacidad sorprendentemente buena para producir información coherente.

Sin embargo, estas capacidades conllevan, literalmente, unos costes. Entrenar estos modelos GPT cada vez más grandes y desplegar aplicaciones como ChatGPT es una proeza de ingeniería tremenda. Se estima que la creación de GPT-3 costó 4,6 millones de dólares y su funcionamiento en la nube al menos 87 000 dólares al año. Es probable que el desarrollo de GPT-4 haya costado la asombrosa cifra de 100 millones de dólares o más.

A estas cifras hay que sumar los importantes costes del hardware y los recursos necesarios para mantenerlo en funcionamiento, garantizando al mismo tiempo la refrigeración de sus centros de datos. Los centros de datos pueden consumir miles de millones de litros de agua, y el aire acondicionado consume energía y contribuye a las emisiones, lo que obliga a las organizaciones a evaluar los costes y beneficios de estas potentes herramientas. Debido a estos costes iniciales y continuos, los LLM ya son prohibitivamente caros para la mayoría de las empresas privadas, el mundo académico y las organizaciones del sector público, y esto seguirá siendo así a medida que los modelos crezcan y sean más potentes.

Las limitaciones de los LLM

Gracias a componentes estructurales específicos, los modelos de transformadores captan la relación entre diferentes entradas y, gracias a una vasta cantidad de textos de muestra, los LLM modernos se han vuelto muy eficaces a la hora de extraer la semántica general de un texto y realizar un seguimiento de las relaciones entre los elementos textuales. Los modelos generativos como GPT-3 han ido un paso más allá y han aprendido a realizar un seguimiento de estas relaciones tanto en la pregunta como en la respuesta. Los resultados suelen ser convincentes. Podemos pedirle a ChatGPT un número entre 0 y 100, o si el colesterol es un esteroide, y es probable que obtengamos la respuesta correcta.

Sin embargo, para aplicaciones especializadas como la investigación científica, los modelos de lenguaje extensos pueden tener dificultades para ir más allá de la semántica general y comprender información matizada y específica. ¿Por qué ocurre esto? En primer lugar, los LLM no son inmunes al problema de «basura entra, basura sale». En segundo lugar, incluso con datos de entrenamiento de alta calidad, la información relevante puede estar infrarrepresentada.

Los temas amplios y descritos con frecuencia están bien captados por los LLM, pero los temas estrechos y especializados están casi siempre infrarrepresentados y, por tanto, es inevitable que se traten peor. Por ejemplo, un modelo de lenguaje extenso puede alcanzar el nivel de abstracción adecuado y determinar si algo es una molécula esteroidea. Incluso podría reconocer dos moléculas esteroideas de la misma familia, pero no podría reconocer sistemáticamente si una es extremadamente tóxica y la otra no. La capacidad del modelo de lenguaje extenso para hacer esa distinción depende de los datos utilizados para el entrenamiento y de si la información correcta fue reconocida y «memorizada». Si estaba oculta en un mar de información errónea o contradictoria, no hay forma de que el modelo llegue a la respuesta correcta.

Algunos podrían argumentar que más datos, datos más limpios y modelos más grandes solucionarían ese problema. Puede que tengan razón, pero ¿qué ocurre si pedimos a un LLM generativo un número aleatorio entre 0 y 100? ¿Podemos estar seguros de que el número proporcionado es realmente aleatorio? Para responder a esa pregunta, debemos ir más allá de la semántica léxica y los hechos memorizados, más allá de los LLM y hacia los agentes de IA. En este caso, el agente construiría un fragmento de código ejecutable utilizando procedimientos validados, lo enviaría a otro proceso para su ejecución, procesaría el resultado y presentaría la respuesta al usuario.

Desafíos específicos con los datos científicos

Como saben mis colegas de CAS, los datos científicos pueden ser mucho más complejos que el texto, y la mayoría de los problemas no pueden expresarse en una o dos preguntas.

Al utilizar herramientas basadas en IA para la investigación científica, debemos preguntarnos: ¿qué problema intentamos resolver? Muchos problemas implican lenguaje o secuencias poco estructuradas, por lo que los modelos de lenguaje son ideales. ¿Qué ocurre con los datos tabulares, los datos categóricos, los grafos de conocimiento y las series temporales? Estas formas de datos son necesarias para la investigación científica, pero los LLM no siempre pueden aprovecharlas. Esto significa que los LLM por sí solos no pueden proporcionar el nivel de especificidad necesario para una aplicación como la investigación molecular. En su lugar, al igual que una orquesta necesita numerosos instrumentos para lograr un sonido cohesivo, la ciencia necesita múltiples herramientas en su caja de herramientas de IA para producir resultados coherentes.

Un enfoque de sistemas para lograr profundidad y amplitud

Si los LLM por sí solos no son adecuados para la investigación científica, ¿qué lo es? La respuesta es un enfoque de sistemas que utiliza múltiples tipos de modelos para generar resultados especializados. Al combinar modelos de lenguaje y redes neuronales con herramientas tradicionales de aprendizaje automático, grafos de conocimiento, quimioinformática y bioinformática, así como métodos estadísticos como TF-IDF, los investigadores pueden incluir información profunda y matizada en sus programas basados en IA.

Estas herramientas pueden proporcionar los resultados específicos necesarios para tareas como el desarrollo de nuevas moléculas farmacológicas o la invención de un nuevo compuesto. Los grafos de conocimiento son especialmente valiosos porque actúan como una verdad fundamental, conectando de forma fiable entidades conocidas: una molécula, una reacción, un artículo publicado, un concepto controlado, etc. Un caso de uso ideal es aprovechar una red neuronal profunda que pueda afirmar: "Este es un tipo determinado de sustancia", junto con un grafo de conocimiento que valide la precisión. Así es como obtenemos los hechos fiables necesarios en la investigación científica.

Este tipo de enfoque de sistemas es esencialmente una función de verificación de hechos para mejorar la fiabilidad de los datos, y está demostrando ser eficaz en aplicaciones especializadas. Por ejemplo, Nvidia lanzó recientemente Prismer, un modelo de lenguaje visual diseñado para responder preguntas sobre imágenes o proporcionar pies de foto. Este modelo utiliza un enfoque de "mezcla de expertos" que entrena múltiples submodelos más pequeños. La profundidad de conocimiento de este modelo ha proporcionado resultados de calidad sin necesidad de un entrenamiento masivo; igualó el rendimiento de modelos entrenados con entre 10 y 20 veces más datos.

Google también está trabajando en un enfoque similar, donde el conocimiento se extrae de un modelo de lenguaje "profesor" de propósito general hacia modelos "estudiante" más pequeños. Los modelos estudiante presentan mejor información que el modelo más grande debido a su conocimiento más profundo: un modelo estudiante entrenado con 770 millones de parámetros superó a su profesor de 540 mil millones de parámetros en una tarea de razonamiento especializado. Aunque el modelo más pequeño tarda más en entrenarse, las ganancias de eficiencia resultantes son valiosas, ya que su ejecución es más barata y rápida.

Mejora de la investigación científica

Otro ejemplo de un enfoque de sistemas exitoso es PaSE, o Patent Similarity Engine, desarrollado por mis colegas y por mí en CAS, que potencia funciones únicas en CAS STNext y CAS SciFinder. Construimos este modelo como parte de nuestra colaboración con el Instituto Nacional de Propiedad Industrial (INPI) de Brasil, su oficina nacional de patentes. Fue diseñado para procesar enormes cantidades de información en solo minutos, de modo que los investigadores pudieran abordar el persistente retraso en la tramitación de patentes.

La solución incluye un modelo de lenguaje que utiliza las mismas técnicas críticas de aprendizaje automático que la familia GPT, pero añade capas de otros tipos de aprendizaje, incluidos grafos de conocimiento, quimioinformática y métodos estadísticos tradicionales de recuperación de información. Al entrenar el modelo con la ciencia mundial, como las patentes y revistas a texto completo dentro de la CAS Content CollectionTM, PaSE logró la profundidad y amplitud necesarias para encontrar "estado de la técnica" un 50% más rápido que mediante búsquedas manuales.

Para las oficinas de patentes, demostrar que algo no existe es extremadamente difícil. Piense en el adagio: "La ausencia de pruebas no es prueba de ausencia". Nuestros científicos de datos entrenaron y optimizaron el modelo junto con expertos buscadores de patentes, el equipo del INPI brasileño y una combinación única de herramientas de IA que identificaron el estado de la técnica con un 40% menos de búsqueda manual. Debido a este rendimiento y a la reducción del retraso en las patentes, fue galardonado con el Stu Kaback Business Impact Award por el Patent Information Users Group en 2021.

El camino a seguir para los grandes modelos de lenguaje en la ciencia

Esta experiencia demuestra que los LLM seguirán desempeñando un papel importante en la investigación científica en el futuro, pero, contrariamente a la creencia popular, esta herramienta no es una panacea para todos los problemas o preguntas.

Me gusta pensar en estos modelos en términos de organizar una habitación desordenada de su casa, por ejemplo, un armario o un desván. Diferentes personas pueden organizar los artículos de esas habitaciones de distintas maneras. Una persona puede organizarlo todo por color, mientras que otra pone todos los objetos de valor juntos, y otra los organiza por función. Ninguno de estos enfoques es incorrecto, pero puede que no sea el tipo de organización que usted desea o necesita. Este es esencialmente el problema con los LLM, que pueden organizar la información de una manera determinada, pero no es la forma en que un científico o investigador necesita.

Para aplicaciones especializadas donde un usuario requiere un resultado determinado, como secuencias de proteínas, información de patentes o estructuras químicas, los modelos basados en IA deben entrenarse para organizar y procesar la información de formas específicas. Necesitan organizar los datos, los resultados y las variables de la forma que sus usuarios desean para obtener un entrenamiento y unas predicciones óptimos.

Para obtener más información sobre el impacto de esos datos, su representación y los modelos que están mejorando las predicciones en la ciencia, consulte nuestros estudios de caso con CAS Custom Services. ¿Desea saber más sobre el panorama emergente de la IA y la química? Lea nuestro último informe técnico sobre las oportunidades que la IA ofrece a la química o explore nuestros recursos sobre cómo la IA puede mejorar la productividad en las oficinas de patentes de todo el mundo.

Información relacionada de CAS

CO₂ supercrítico: un disolvente más ecológico para su uso en farmacia, generación de energía y otros sectores

Diseño generativo a escala genómica: qué escribió un modelo de lenguaje de IA y por qué funcionó 

Filas de filamentos de polímero azul brillante dispuestos en una cuadrícula oscura.

Polymer Frontiers: Un nuevo informe explora las innovaciones emergentes

Obtenga nuevas perspectivas para avanzar más rápido directamente en su bandeja de entrada.