요약
- 데이터 품질은 과학 분야 AI의 성패를 결정짓는 핵심 요소입니다.
- 데이터 무결성과 데이터 조화는 단순 자동화가 아닌 인간 주도의 영역입니다.
- 조화된 데이터는 AI 모델 성능을 측정 가능한 수준으로 향상시킵니다.
- "다크 데이터(Dark data)"는 AI 기반 연구를 위한 잠재력이 큰 미개척 자원입니다.
- 과학 분야 전반에서 AI 도입이 급격히 가속화되고 있지만, 데이터 인프라가 여전히 한계 요인으로 작용하고 있습니다.
인공지능(AI)이 방대한 데이터셋을 분석하는 능력을 바탕으로 과학적 탐구 방식을 혁신했다는 점에는 의문의 여지가 없습니다. 데이터 처리 능력과 연산 속도 면에서 인간의 역량을 뛰어넘는 AI 기술은 과학적 발견의 가능성을 끊임없이 재정의하고 있습니다.
하지만 "쓰레기가 들어가면 쓰레기가 나온다(Garbage in, garbage out)"는 격언처럼, AI 알고리즘과 모델의 결과물은 그 기반이 되는 데이터만큼만 신뢰할 수 있다는 사실 또한 분명합니다. 데이터 품질 문제는 과학의 역사만큼이나 오래된 과제입니다. 잘못된 데이터에 기반한 가설은 반복적으로 검증될 수 없기 때문입니다. 오늘날 AI 기반 연구가 정착되고 데이터의 양이 폭발적으로 증가함에 따라 이 문제는 더욱 복잡하고 해결하기 어려워졌습니다.
이 문제에 대한 중요한 해결책 중 하나는 데이터 조화(data harmonization)입니다. 이는 앙상블 모델, 거대 언어 모델(LLM) 및 기타 AI 시스템에 정확하고 일관된 데이터를 제공합니다. 예를 들어, 생물의학 및 재료 과학 분야에서 AI가 성공적으로 활용되는 데에는 고품질 데이터가 결정적인 역할을 합니다. 단백질 구조, 원자 구조, DNA 등 데이터 복잡성이 높은 이 두 분야에서는 AI 모델을 위해 깨끗하고 조화된 데이터가 필수적입니다.
인간이 직접 큐레이션한 최대 규모의 과학 정보 저장소인 CAS Content CollectionTM을 운영하며 얻은 경험을 통해, 당사는 데이터 조화 모범 사례에 대한 독보적인 통찰력을 보유하고 있습니다. 데이터 조화의 작동 원리를 살펴보고, 성공적인 AI 기반 발견을 이끄는 데 있어 종종 간과되는 인간 전문성의 역할을 확인해 보겠습니다.
화학 분야의 AI 모델: 현재 현황과 향후 전망
AI는 신약 개발과 신소재 발굴을 가속화하고 있습니다. 생물의학 및 재료 과학 분야 모두에서 다양한 모델 유형이 급증하고 있으며, 연구자들은 개념 동시 발생 분석(concept co-occurrence analysis)을 통해 모델링 접근 방식의 최신 트렌드를 파악할 수 있습니다. 생명 과학과 재료 과학에 AI를 적용하기 위한 구체적인 도구와 기술을 심층적으로 분석함으로써, 현재 AI 기술이 어디에 영향을 미치고 있으며 앞으로 어떤 방향으로 나아갈지 알아봅니다.

데이터 무결성과 조화: AI 성공을 위한 기반 구축
AI를 활용한 과학적 탐구에는 깨끗하고 표준화된 데이터가 필수적입니다. 오류 수정과 워크플로우 오케스트레이션은 필요한 데이터 기반을 구축하는 데 중요한 단계이지만, 데이터를 표준화하고 검증하는 과정에서 인간의 전문성은 여전히 핵심적인 역할을 합니다. 조화된 데이터를 사용할 때 예측 모델과 고급 분석에서 실질적인 이점을 확인할 수 있으며, 이는 가장 진보된 기술을 활용하는 데 있어 여전히 사람이 중요한 요소임을 상기시켜 줍니다.

제약 분야의 AI: 약물 재창출을 선도하는 노력
제약 연구원들은 약물 제형, 보관된 임상 시험, 전자 건강 기록 등 방대한 양의 데이터에 접근할 수 있습니다. 이러한 데이터를 적절히 활용하면 기존 약물의 용도 변경을 위한 중요한 통찰력을 얻을 수 있으며, 이는 환자의 요구를 해결하는 강력한 전략이 됩니다. 이를 어떻게 실현할 수 있을까요? AI 도구를 효과적으로 구동할 수 있도록 데이터를 정제하고 표준화하는 지식 관리 솔루션을 통해 가능합니다.
다양하고 풍부한 데이터를 보유하는 것은 제약 개발 분야에서 AI의 잠재력을 크게 높이고 약물 용도 변경 파이프라인을 가속화할 수 있습니다. 하지만 데이터의 양이 많다고 해서 반드시 데이터의 질이 좋은 것은 아닙니다.
예측 모델: 데이터 품질을 통한 신약 개발 가속화
리간드-표적 활성 또는 대사체 프로파일 예측은 신약 개발 모델링의 핵심 결과물이지만, 신뢰할 수 있는 결과를 얻으려면 광범위한 데이터 조화 작업이 필요합니다. CAS 과학자들의 대담을 통해 예측 모델링을 구동하는 정보를 준비하는 데 있어 인간의 데이터 큐레이션이 왜 중요한 역할을 하는지 확인해 보십시오. 모델 개발의 주요 과제는 무엇이며, CAS가 솔루션을 최신 상태로 유지하기 위해 어떻게 지속적인 모델 학습을 수행하는지 알아보시기 바랍니다.
백서
R&D 워크플로를 위한 5가지 지식 관리 전략
연구원들은 데이터 사일로를 허물고 과학 정보를 깨끗하고 일관되게 유지하는 것이 얼마나 중요한지 잘 알고 있습니다. 그렇다면 이러한 단계를 구현하기 위한 모범 사례는 무엇일까요? 본 백서에서는 과학 R&D 워크플로를 개선하기 위한 5가지 지식 관리 팁을 공유합니다. 지금 백서를 다운로드하십시오:
데이터 조화의 미래
AI 기반 솔루션은 더 이상 먼 미래의 혁신이 아니라 오늘날 과학적 발견의 핵심 요소입니다. AI 모델은 새로운 화합물과 물질을 식별하고, 약물 용도 변경 기회를 포착하며, 과학 분야 전반에 걸쳐 존재하는 방대한 데이터를 분석할 수 있습니다. 그러나 이러한 모델이 양질의 통찰력을 생성하려면 깨끗하고 표준화된 데이터가 필요하며, 이를 달성하는 것은 기술적 역량만큼이나 인간의 전문성에 달려 있습니다.
과학 데이터는 출판물의 표, 다이어그램, 보충 자료 등에 존재합니다. 연구 기관은 비정형화되어 있지만 귀중한 통찰력을 담고 있는 온갖 종류의 "다크 데이터"를 보유하고 있습니다. 데이터 전문가와 협력하고 조화된 데이터의 강력한 기반을 구축함으로써 연구원들은 보유한 모든 정보를 최대한 활용하고 AI 모델과 알고리즘으로부터 의미 있는 혜택을 얻을 수 있습니다.
링크
추가 리소스
레거시 기록의 디지털화, 화합물 라이브러리 정규화, AI 모델링을 위한 데이터셋 준비 등 데이터 통합 문제에 직면한 조직은 특정 과학 분야와 기존 인프라에 맞춰 설계된 맞춤형 데이터 솔루션을 상담받을 수 있습니다.
추가 읽기 자료
질의응답
Q: 데이터 조화란 무엇입니까?
A: 데이터 조화는 여러 소스의 정보를 통합하고 이를 일관된 프레임워크로 표준화하여 신뢰성 있게 분석, 비교 및 공유할 수 있도록 만드는 과정입니다. AI의 맥락에서 데이터 조화가 중요한 이유는 일관성이 없거나 파편화된 데이터로 학습된 모델은 그 불일치를 결과물에 그대로 반영하기 때문입니다.
Q: AI는 왜 데이터 조화를 자동화할 수 없습니까?
A: AI 및 머신러닝 도구는 대량의 데이터를 처리하는 데 도움을 줄 수 있지만, 실험 노트, 저널 기사, 학술 논문 및 특허에 자주 나타나는 모호함을 해결하는 데 필요한 과학적 엄밀함과 판단력이 부족합니다. 대규모 언어 모델은 일상적인 사용을 기반으로 개념을 구분할 수 있지만, 단일 단백질이라도 해당 분야의 전문가만이 알 수 있는 수십 가지의 다른 이름, 번역 및 식별자로 참조될 수 있기 때문입니다.
Q: 데이터 조화는 과학을 위한 예측 모델을 어떻게 개선합니까?
A: 표적 이름을 정규화하고 물질 연결성을 개선함으로써 테스트 모델의 정확도가 크게 향상되었습니다. 예측 결과가 실험 결과와 더 일치하게 되었으며, 스크리닝 과정 초기에 가장 유망한 약물 후보를 식별하는 능력도 그에 따라 향상되었습니다.
Q: "다크 데이터"란 무엇이며, AI 기반 약물 용도 변경에 어떤 영향을 미칩니까?
A: 다크 데이터는 조직이 시간이 지남에 따라 축적하지만 효과적으로 활용하지 못하는 비정형 정보를 의미합니다. 다크 데이터가 적절히 조화되어 접근 가능해지면 AI 학습 데이터 세트의 다양성과 신뢰성을 크게 높일 수 있으며, 이를 통해 용도 변경 예측의 품질을 개선하고 편향되거나 오해의 소지가 있는 결과의 위험을 줄일 수 있습니다.
Q: 오늘날 과학 연구에 가장 일반적으로 적용되는 AI 모델 유형은 무엇입니까?
거대 언어 모델(LLM)은 지식 추출, 가설 생성 및 생성적 설계 분야에서 활용도가 높아지고 있습니다. 랜덤 포레스트나 서포트 벡터 머신과 같은 고전적 방법론은 학습 데이터가 제한적인 경우 바이오마커 발굴이나 암 아형 식별 작업에 여전히 널리 쓰이지만, 데이터가 방대한 환경에서는 딥러닝이 이를 대체하고 있습니다. 2020년 이후에는 그래프 신경망과 트랜스포머 기반 모델이 급부상했는데, 전자는 단백질 구조 및 상호작용 예측에, 후자는 생물의학 문헌 마이닝 및 서열 분석에 주로 사용됩니다. 재료 과학 분야에서는 고전적 머신러닝이 물성 예측을 주도하는 한편, CNN은 미세구조 이미지 분석에 적용되고 신경망 기반 대리 모델은 시뮬레이션 중심의 워크플로우를 지원합니다.
Q: 앙상블 모델이 단일 모델 방식보다 성능이 뛰어난 이유는 무엇인가요?
A: 어떤 단일 모델도 과학 데이터 환경의 복잡성을 완벽하게 포착할 수는 없습니다. 앙상블 방식은 여러 모델을 결합하여 개별 모델이 단독으로 도출할 수 있는 결과보다 일반적으로 더 신뢰할 수 있는 '합의 예측'을 생성합니다.




