科学发现始终依赖于优质、纯净的数据。糟糕的数据会导致结果无法复现、解决方案存在问题,并最终不得不重新审视和获取更好的数据。如今,随着人工智能驱动的预测模型在早期药物研究工作流程中日益普及,确保整个研究工作流程中数据准确且一致的重要性从未如此凸显。
杂乱的数据仍然是现代药物研究中持续存在的挑战,导致科学家花费大量时间解决实体命名不一致的问题、发现不匹配的数据库格式并纠正错误。机器难以处理复杂数据集的细微差别,因为它们缺乏解释歧义和不一致性所需的背景理解。人类科学家经常需要识别并纠正隐藏在数据中、而现有技术尚无法充分解决的问题。
对于药物研究团队而言,杂乱的数据会产生连锁反应,导致研究人员基于错误的假设或不完整的信息来设计实验和构建模型,最终浪费宝贵的资源。正因如此,数据清洗和数据整合这两个相辅相成的过程在优化工作流程中发挥着关键作用,它们各自解决了不同但相互关联的挑战。
- 数据清洗:由专家识别并纠正错误、填补缺失值并删除无关信息,以确保单个数据集内准确性和可靠性的过程
- 数据整合:人工整合来自多个来源的信息,将其标准化并统一为一个连贯的框架,从而实现无缝分析、可比性和协作的过程
成功进行清洗和整合的关键在于人工收录。
数据清洗,至关重要的第一步
在科学家整合数据之前,必须先对其进行清洗。通过消除因数据录入、计算错误、传感器故障或系统故障而产生的错误,科学家可以构建 数据基础 ,这是进行整合的必要条件。依赖于经过妥善清洗的数据,团队可以获得:
- 更高的准确性, 确保从这些数据中得出的研究结果可靠且可重复,从而获得高质量的候选药物。
- 提高效率, 减少因错误而耗费在故障排除和重新分析上的时间。
- 加强协作, 通过消除数据集之间的差异,促进团队、机构和行业之间更好的合作。
- 优化预测能力,利用形成的清晰数据为预测模型奠定基础,从而准确预测药物与靶点的相互作用、疾病关联等。
如果没有适当的数据清洗,整合就像在流沙上盖楼——脆弱且不可持续。当科学家对数据进行清洗时,他们能确保只有最相关、最可靠的信息被纳入下游流程,从而提供准确的研究布局视图和坚实的数据基础。
实现成功数据整合的结构化方法
数据整合(图 1)始于建立 权威结构 和命名标准。例如,这项细致的工作确保了蛋白质等实体在所有来源和数据集中都能被统一命名和分类,从而为药物开发目的实现靶点识别。
整合的下一阶段是物质链接,科学家在此过程中识别并关联不同数据集或数据库中指向同一化学物质的文献。这一过程将不同的物质表述、同义词和标识符统一为一个单一、一致的实体。这项工作对于药理学和药物发现至关重要,因为不同来源的惯例差异往往会导致同一种化合物被以不同的方式描述。

在协调流程的后续阶段,数据科学家会识别并管理精确及相关的文献,防止数据重复,并确保仅保留最相关的信息。最后一步侧重于确保跨数据集的数据定义一致性,这对于构建基于多源数据的统一基础至关重要。
药物研究团队通过实施由人工收录驱动的协调工作流程,能够自信地驾驭复杂的数据布局,从而获得适用于高级分析和预测建模的可靠数据集。这种系统性方法最大限度地减少了错误,并确保后续的所有研究都建立在坚实、清晰的数据基础之上。
协调后的数据可提高预测模型的准确性
数据协调最显著的益处之一在于其 对预测模型的影响。为了证明其对预测准确性的积极影响,CAS 科学家使用了一个新协调的数据集,对一个用于预测配体-靶点对活性的现有集成模型进行了重新训练。
重新训练后的模型在准确性方面表现出显著提升,预测结果与实验结果之间的标准差降低了 23%,预测的配体-靶点相互作用与实验结果之间的差异降低了 56%(图 2)。通过规范化靶点名称并改进物质链接,科学家们增强了数据,从而更一致、更准确地描述了物质与其靶点之间的关系。

这种预测建模凸显了人工数据协调在优化模型性能方面的核心作用。通过在筛选过程的早期识别并聚焦于最有希望的候选药物,团队可以更快地完成从命中到先导化合物的阶段,并推进后续的开发与试验。
协调后的数据助力高级分析
数据协调还优化了预测模型以及知识图谱和相互作用网络等高级分析工具,从而推动了创新的药物研究工作流程(图 3)。这些工具帮助研究人员探索靶点、物质和生物通路之间的关系,以识别疾病关联和新的治疗模式。


统一的人工收录数据基础使科学家能够追踪跨越不同生物层面的复杂相互作用(如基因表达、蛋白质相互作用和代谢通路),从而提供碎片化数据源所掩盖的见解。这种方法提高了药物研究的精确度,并加速了潜在药物重定位机会的识别,因为它揭示了已知化合物与新兴治疗靶点之间隐藏的联系。
人工收录构成了创新的基础
由于缺乏对语境细微差别的理解能力,机器难以妥善处理生物数据集固有的歧义和不一致性。专业人员通过识别细微差异、纠正错误并整合数据,在确保数据的准确性和相关性方面发挥着自动化系统无法替代的关键作用。这一过程对于从事科学研究的人员及提供相关服务的机构至关重要。例如,数百名 CAS 科学家对数据进行清洗、协调和收录, 用于构建 CAS Content Collection™,这是全球最大的经人工收录的科学知识合集。
这一努力提高了下游分析的可靠性,并加速了潜在药物靶点和有效疾病疗法的发现。
当经人工收录和协调的数据应用于预测模型及网络图等高级工具时,将推动生命科学及其他领域的突破。随着各机构在研究中持续优先考虑数据清洗,他们能够确保研究结果的质量并加速创新。
.avif)



