인공지능(AI)은 불과 10년 전만 해도 상상하기 어려웠던 속도로 혁신을 이끌고 있습니다. AI는 효율성을 높이고, 데이터 기반 의사 결정을 촉진하며, 보안을 강화함으로써 거의 모든 산업과 비즈니스 전반에 영향을 미치고 있습니다. 또한 화학과 생명과학을 포함한 다양한 과학 연구 분야에서도 혁신을 주도하고 있습니다. 이 두 산업에서의 AI 발전은 새로운 소재를 발견하는 방식에 변화를 가져왔고, 신약 개발 속도를 가속화했으며, 연구자가 실험실에 들어가기 전 수백만 건의 실험을 수행할 수 있는 예측 모델을 가능하게 했습니다.
AI가 우리의 일상생활 전반에 영향을 미치고 있는 지금, AI를 이처럼 강력하게 만드는 요소가 무엇인지, 그리고 기술이 한계를 드러내는 지점은 어디인지 놓치기 쉽습니다. 그 핵심 요인 중 하나가 바로 모든 AI 애플리케이션에서 데이터 품질이 갖는 중요성입니다.
데이터 품질의 정의
데이터 품질은 사람마다 의미가 다를 수 있지만, 일반적으로 정확성, 일관성, 완전성, 연관성이라는 네 가지 핵심 요소의 조합으로 구성됩니다.
- 정확성은 데이터에 오류나 실수가 없음을 보장합니다.
- 일관성은 데이터가 균일한 방식으로 표현되었음을 의미합니다.
- 완전성은 필요한 모든 데이터가 빠짐없이 포함되어 있음을 확인합니다.
- 연관성은 해당 데이터가 수행하려는 작업에 적합한지 여부를 검증합니다.
이러한 요소를 충족하는 데이터 세트는 AI 알고리즘을 학습시키는 데 필수적입니다. 다만, 이러한 요건을 충족하지 못했을 때 발생할 수 있는 결과 또한 함께 고려하는 것이 중요합니다.
정확도
부정확한 데이터 세트로 모델을 학습시키면, 그 결과로 생성되는 모델 역시 부정확해질 수밖에 없습니다. 데이터 세트의 정확성이 낮을수록 일반화 성능이 저하될 가능성은 커집니다. 모델이 충분히 일반화되지 못하면, 학습에 포함되지 않은 데이터에 대해 제대로 작동하지 않습니다. 정확성이 부족할 경우의 궁극적인 결과는 모델의 신뢰성이 떨어진다는 점이며, 이는 배포 이후에 신뢰와 확신의 문제로 이어져 극복하기 어려운 상황을 초래할 수 있습니다.
일관성
데이터에 일관성이 부족하면 새로운 데이터를 학습 데이터 세트에 추가하는 데 더 많은 노력이 필요합니다. 누락된 필드, 단위 변경, 중복 데이터, 기타 불일치 요소를 식별해야 하며, 이러한 작업은 많은 시간이 소요됩니다. 대부분의 데이터 과학자들은 데이터 세트의 일관성을 개선하는 데 상당한 시간을 투자합니다. 데이터 파이프라인 초기 단계에서 일관성을 우선적으로 확보한다면, 이 시간을 AI 알고리즘 개발에 더 효과적으로 활용할 수 있습니다.
완전성
모델의 의도된 목적을 달성하기 위해 필요한 모든 관련 정보를 포함하는 완전한 데이터 세트에 접근하지 못하면 모델의 이해에 공백이 발생하게 됩니다. 이러한 공백은 모델의 편향으로 나타날 수 있습니다. 편향된 모델은 학습 데이터와 유사하지 않은 데이터를 접했을 때 부적절한 예측을 내릴 가능성이 큽니다. 또한 편향된 모델은 유해한 고정 관념을 강화하거나 모델 사용자에게 부정적인 사회적 영향을 미칠 수 있으므로 다양한 윤리적, 법적 문제를 야기합니다.
연관성
데이터 세트가 수행하려는 작업과 연관성이 낮다면, 유용한 모델을 학습시키는 데 더 많은 시간이 필요할 수 있습니다. 연관성이 없는 데이터를 학습에 사용하면 모델은 최종 결정에 영향을 미치지 않는 데이터까지 고려하려 하면서 혼란을 겪게 됩니다. 이처럼 관련 없는 데이터로 인해 학습 단계에 더 많은 시간이 소요되는 경우, 유용한 모델을 학습시키기 위해서는 더 많은 시간, 컴퓨팅 리소스, 비용이 투입될 것으로 예상할 수 있습니다.
CAS는 사람의 전문성을 더해 데이터 품질을 보장합니다
데이터 품질에 대한 우려는 어디에나 존재하지만, CAS는 과학 데이터와 관련된 이러한 요소들이 지니는 중요한 특성을 인식하고 이를 최우선으로 고려합니다. 화학 및 생명과학 데이터는 출처에 따라 매우 다양한 형태를 띨 수 있습니다. 화학 분야에서는 하나의 분자 구조를 여러 방식으로 표현할 수 있습니다. 여기에는 MDL 몰파일(MOL), 구조-데이터 형식(SDF), 단순화된 분자입력 라인입력 시스템(SMILES), 국제 화학 식별자(INChi) 등이 있습니다. 분자 표현 방식에는 장단점이 존재합니다. CAS는 이러한 모든 분자 형식을 CAS REGISTRY®에 매핑하는 기술을 활용합니다. 기술만으로 정확한 일치 여부를 판단할 수 없는 경우에는 사람의 전문 지식을 활용해 올바른 구조를 식별합니다. 이러한 사람 중심의 엄선 작업을 통해 CAS는 화학 구조와 화학 반응에 대한 고품질 데이터베이스를 유지하고 있으며, 이 데이터는 CAS 내부는 물론 파트너와 함께 사용하는 다양한 AI 애플리케이션에서 활용되고 있습니다.
마찬가지로, CAS는 최근 생명과학 데이터 영역으로 확장하는 과정에서도 사람의 엄선 작업에 의존해 왔습니다. CAS의 글로벌 과학자 및 기술자 팀은 약리학, 바이오마커, 신호 경로와 같은 생명과학 데이터를 검토합니다. 이러한 노력은 데이터의 정확성과 일관성을 보장하며, 이는 고품질 데이터 세트의 핵심 요소입니다. CAS의 약리학 데이터 세트를 기존 모델에 적용해 특정 단백질 표적에 대한 분자의 활성을 예측하도록 학습시킨 결과, 기준 모델 대비 실험값과 예측값 간 차이가 56% 감소했으며, 표준편차 또한 23% 감소하는 성과를 확인했습니다. 이 사례는 모든 CAS 데이터 세트 전반에서 확인할 수 있는 데이터 품질의 중요성을 보여줍니다.
CAS는 AI 애플리케이션에서 데이터 품질이 갖는 중요성을 믿고 있습니다. 사람의 개입을 통해 CAS는 높은 정확성과 일관성을 갖춘 데이터 세트를 생성합니다. 100년이 넘는 시간 동안 CAS는 컨텐츠 및 지식 관리 분야에서 전문성을 축적해 왔습니다. CAS의 과학자들은 이러한 전문성을 바탕으로 특정 AI 애플리케이션에 대해 데이터 세트의 완전성과 연관성을 판단합니다. 또한 이를 통해 데이터 세트 내의 완전성 및 연관성 문제를 식별하고, 이러한 문제를 해결하기 위한 계획을 수립할 수 있습니다.
