人工智能 (AI) 正在以十年前难以想象的速度推动创新。人工智能通过提升效率、推动数据驱动决策和增强安全性,触及几乎所有行业和企业。它还正在革新许多科学研究领域,包括化学和生命科学。这两个行业中 AI 的进步催生了新的材料发现方法,加速了药物研发,并创建了预测模型,使得在您进入实验室之前就能运行数百万次实验。
随着 AI 影响我们日常生活的方方面面,人们很容易忽略 AI 的强大之处以及这项技术的局限所在。一个关键因素是数据质量对任何 AI 应用的重要性。
定义数据质量
数据质量对不同的人可能有不同的含义,但通常由四个主要因素组成:准确性、一致性、完整性和相关性。
- 准确性确保数据没有错误和疏漏。
- 一致性 意味着数据以统一的方式呈现。
- 完整性 确保所有必需的数据都已存在。
- 相关性 验证数据是否适用于当前任务。
遵循这些因素的数据集对于训练 AI 算法至关重要。然而,同样重要的是要考虑未能满足这些要求所带来的后果。
准确性
使用不准确的数据集训练模型将导致模型本身不准确。数据集的低准确性会增加模型泛化能力不足的可能性。如果模型泛化能力差,它在训练集中未包含的数据上表现就会不佳。准确性不足的最终结果是模型无法可靠运行,从而引发信任和信心问题,而这些问题在模型部署后很难克服。
一致性
如果数据存在不一致性,将新数据纳入训练集时需要付出更多努力。识别缺失字段、单位变化、重复数据以及其他类型的不一致是一个耗时的过程。大多数数据科学家会将大量时间花在提升数据集一致性上。如果在数据管道的早期阶段就优先保证数据一致性,这部分时间本可以更好地用于 AI 算法开发。
完整性
若无法获取模型预期用途所需的完整数据集,模型的理解便会出现断层。这些断层可能表现为模型的偏差。带有偏差的模型在遇到与训练集不相似的数据时,容易做出不当预测。偏差模型还会带来诸多伦理和法律问题,因为它们可能强化有害的刻板印象,或对模型的使用者产生负面社会影响。。
相关性
如果数据集与当前任务无关,训练一个有用的模型可能需要更多时间。在训练中使用无关数据会让模型产生混淆,因为模型会试图考虑那些不会影响最终决策的数据。如果由于这些无关数据,模型在训练阶段需要更长时间,那么训练一个有用模型所需的时间、计算资源和资金也会相应增加。
CAS 以人工干预确保数据质量
数据质量问题普遍存在,但 CAS 深知科学数据相关因素的重要性,并将其置于优先地位。化学和生命科学数据可能因来源不同而高度多样化。在化学中,分子结构有多种表示方式,包括 MDL Molfile (MOL)、结构数据格式 (SDF)、简化分子输入线性表示法 (SMILES) 以及国际化学标识符 (InChI)。每种分子表示方式都有其优缺点。CAS 依靠技术将所有分子格式映射到 CAS REGISTRY®。当仅靠技术无法确定精确匹配时,会运用人工专业知识来识别正确的结构。正是通过这种人工收录,我们维持了高质量的化学结构和化学反应数据库,这些数据库被广泛应用于 CAS 自身以及合作伙伴的多种 AI 应用中。
同样地,在近期向生命科学数据领域的拓展中,CAS 始终坚持引入人工专业收录。CAS 全球团队的科学家和技术专家会审查生命科学数据,如药理学、生物标志物和信号通路。这一工作确保了数据的准确性和一致性,而这正是高质量数据集的关键组成部分。当我们的药理学数据集被用于训练一个预测分子对蛋白靶标活性的现有模型时,相较于基线模型,实验值与预测值的差异减少了 56%,标准差减少了 23%。这一成果展示了数据质量的重要性,而高质量的数据可以在所有 CAS 数据集中找到。
在 CAS,我们坚信数据质量在 AI 应用中的重要性。通过人工参与,我们生成高准确性且一致性的数据集。在百余年的发展历程中,我们积累了内容和知识管理的专业经验。我们的科学家依靠这些专业知识来判断数据集对于特定 AI 应用的完整性和相关性。借助这些专业能力,他们能够识别数据集中的完整性和相关性问题,并制定解决这些问题的计划。
