人工智能世界的训练与透明性

Hexagon shaped overlay

正如我们上一篇文章所述,没有完整高质量训练数据的 AI 就像没有引擎的汽车,看起来不错,但无法行驶。AI 的透明性对我们的用户同样重要,这就是为什么我们致力于明确告知他们 AI 在何时何地被使用,以便他们做出明智的决策。

生成式 AI 一个众所周知的风险是“幻觉”,即模型生成听起来真实的数据,有时甚至附带伪造的引用,但内容完全错误。在研发中,这种幻觉是不能被容忍的,因此必须采取措施加以避免。

在本文中,我们将讨论 CAS 如何独特地处于 AI 与科学发现之间的桥梁地位。我们将介绍 CAS 如何战略性地利用 AI,最大限度地减少幻觉并优先使用高质量训练数据,为用户提供推动科研所需的关键信息。

训练数据

精确的数据是科学研发的必要条件。实验或测试的结果可能决定一款药物能否上市,或整个产品线是否必须重新配方。

训练数据是用于训练 AI 模型的整理语料。这些数据可以帮助模型识别模式、学习任务或进行预测。确实,“输入垃圾,输出垃圾”这种说法非常正确,模型的质量完全取决于其训练数据。

一个多世纪以来,CAS 始终是化学信息的权威来源,我们的内部科学家团队持续收录全球最全面的化学数据集合。如今,我们正将专业收录能力拓展至人工智能模型开发,以助力科学进步。客户依赖我们提供可靠、一致的数据。确保由专家收录的训练数据同样可靠,有助于保障模型性能的稳定性,并符合客户预期。

真实答案,拒绝幻觉

对许多人来说,一提到 AI,首先想到的就是聊天机器人根据数据来源质量生成可能并不准确的答案。但如果这些答案已经由领域专家进行收录、验证并按主题组织过呢?在这种情况下,AI 就可以以更高效的方式进行探索和挖掘洞察,同时也能建立起使用者的信心。

透明度

在我们重塑科学检索与发现方式的进程中,客户的反馈循环始终指引着我们的规划。其中,信任成为一个核心议题。尽管人工智能的新突破令人振奋,但其输出常具不可复现性,微小的输入改动便可能导致结果骤变,且其运作如同无法解释过程与生成逻辑的“黑箱”,这使用户对众多AI工具产出的科学结果缺乏信任。

维护用户对我们内容与解决方案的信任至关重要。虽然我们已采取措施尽可能降低大型语言模型在用户与数据间交互的不稳定性,但变异性仍难以完全避免。通过在产品中明确标示人工智能的应用环节,并为用户提供获取信息的清晰替代路径,我们能够有效缓解用户对尝试 AI 增强功能的顾虑。

CAS SciFinder 中的 SearchSense

那么 CAS SciFinder 在其中扮演什么角色?与普通人群一样,科研人员也将受益于减少在浩瀚信息中筛选的时间,这对科学界而言是一项重大的效率提升。我们在 CAS SciFinder 中推出了一系列由 AI 驱动的检索增强功能,统称为 SearchSense,用以减轻这一负担,在保持科学严谨性的同时简化信息发现流程。

在过去的十二个月里,CAS 一直在打造全球规模最大、最权威、最全面、最可信的科学信息检索引擎,由科学家为科学家而开发。SearchSense 将我们业界领先的化学数据资源与 AI 相结合,在不牺牲准确性的前提下,为研究人员提供更快速的答案。

核心原则

当我们开始将 AI 引入 CAS SciFinder 时,有一些我们绝不妥协的基本标准,因此我们的解决方案必须遵循以下原则:

  • 优先保证内容交付的准确性。
  • 保持检索响应速度。
  • 保护客户数据的机密性。

SearchSense的工作原理

SearchSense 的独特之处在于,它使用 AI 来理解检索意图,而不是直接生成答案。通过理解用户查询的意图,CAS SciFinder 可以将用户指向已经经过精心收录的相关答案和支撑数据,遵循 CAS 在可信性和正确性方面的标准。检索意图解读的准确性在很大程度上取决于强大而高质量的训练语料。我们的检索查询训练数据集基于 CAS 专家创建的上万条数据点集合。覆盖了内容所涉及的所有科学学科领域,要在所有领域保持性能是一项艰巨的工作,但我们发现,即使只增加几百条数据点,也能在整体准确性上产生协同提升效果。

模型架构和性能

训练数据被用于训练 AI 模型,以确定查询的检索意图。检索的速度和准确性取决于所使用模型的规模,虽然使用更多参数的模型通常更准确,但研究表明,对于特定用例并配备高质量训练数据的小型模型,也能产生可接受的准确性¹。我们使用了一个 70 亿参数的模型,这比一些大型模型(超过 1 万亿参数)要小得多。高质量的训练数据使得小模型的准确性仍然可接受,同时也让我们能够保持稳健的检索性能。

CAS SciFinder 使用强大的检索算法来寻找最相关的结果,但它是定制构建的,并不使用标准查询语言。由于我们检索架构的专有性质,我们需要训练 AI 模型生成系统能够理解的语言,以执行相应的检索。这确保了我们能够实现 AI 驱动的查询意图解读与专有搜索引擎复杂结果的结合。这样,我们就能以更少的时间和精力,将相关数据呈现给用户。

数据安全与隐私

我们理解客户研究的敏感性,因此数据保密对我们至关重要。我们开发的所有模型都是专有的,并且部署在本地服务器上,确保数据不会离开我们的管理范围。点击此处了解更多关于 CAS 人工智能伦理使用的信息。

结论

CAS SciFinder 致力于推动科学研究与发现的成功,同时保持客户所重视的信任。随着 CAS SciFinder 中 SearchSense 的推出,我们已经采取措施,确保以更智能的方式利用强大的新技术。我们的专家、业界领先的内容资源以及技术共同协作,为用户带来更多收益,为科学研究与开发的进一步进步铺平道路。